This initiative involves the review and annotation of the multilingual Kallama dataset, a project published by Orange. The work is being carried out by IA Hub Senegal, in collaboration with CLAD.
# Réannotation des Transcriptions Non Vérifiées
## Description du Projet
Ce projet a été réalisé en collaboration entre **AI Hub Sénégal** et **CLAD** dans le cadre de la réannotation de transcriptions audio du corpus Kallama. L'objectif est de traiter et de réannoter les portions du corpus qui n'ont pas encore été validées par des experts linguistes.
## Contexte
### Corpus Existant
Le dossier `raw/` contient **l'intégralité du corpus collecté** via Kallama pour trois langues sénégalaises :
- **Pulaar** (code ISO : fuc)
- **Sereer** (code ISO : srr)
- **Wolof** (code ISO : wol)
### Objectif de la Réannotation
Notre objectif est de **réannoter les parties non vérifiées (unchecked)** du corpus - c'est-à-dire les transcriptions qui n'ont pas encore été validées par des experts linguistes. Cette validation et correction sont effectuées par les linguistes experts de **CLAD**.
## Source des Données Audio
**Note importante :** L'ensemble des fichiers audio correspondant aux transcriptions sont disponibles sur **OpenSLR** (Open Speech and Language Resources).
### Téléchargement des Datasets Audio
Les datasets audio peuvent être téléchargés depuis OpenSLR aux URLs suivantes :
```bash
# Téléchargement du dataset Wolof
wget openslr.org
# Téléchargement du dataset Pulaar
wget openslr.org
# Téléchargement du dataset Sereer
wget openslr.org
```
### Ressource OpenSLR
- **Référence** : OpenSLR Resource #151
- **Lien** : Kallaama dataset
## Workflow de Réannotation
Le processus de réannotation suit les étapes suivantes :
```
Corpus raw (unchecked) → Extraction → Lots de 5h → Google Colab → GCP → Label Studio → Validation CLAD
```
### 1. Extraction des Données Non Vérifiées
À partir du corpus complet dans `raw/`, nous avons extrait les transcriptions non vérifiées pour les trois langues.
### 2. Organi …