Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

khadija23/ai_hub_kallama_review

Domaine:

natural language processing

Type de record:

datasetproject
Créateur:
kha
Hôte:
This initiative involves the review and annotation of the multilingual Kallama dataset, a project published by Orange. The work is being carried out by IA Hub Senegal, in collaboration with CLAD. # Réannotation des Transcriptions Non Vérifiées ## Description du Projet Ce projet a été réalisé en collaboration entre **AI Hub Sénégal** et **CLAD** dans le cadre de la réannotation de transcriptions audio du corpus Kallama. L'objectif est de traiter et de réannoter les portions du corpus qui n'ont pas encore été validées par des experts linguistes. ## Contexte ### Corpus Existant Le dossier `raw/` contient **l'intégralité du corpus collecté** via Kallama pour trois langues sénégalaises : - **Pulaar** (code ISO : fuc) - **Sereer** (code ISO : srr) - **Wolof** (code ISO : wol) ### Objectif de la Réannotation Notre objectif est de **réannoter les parties non vérifiées (unchecked)** du corpus - c'est-à-dire les transcriptions qui n'ont pas encore été validées par des experts linguistes. Cette validation et correction sont effectuées par les linguistes experts de **CLAD**. ## Source des Données Audio **Note importante :** L'ensemble des fichiers audio correspondant aux transcriptions sont disponibles sur **OpenSLR** (Open Speech and Language Resources). ### Téléchargement des Datasets Audio Les datasets audio peuvent être téléchargés depuis OpenSLR aux URLs suivantes : ```bash # Téléchargement du dataset Wolof wget openslr.org # Téléchargement du dataset Pulaar wget openslr.org # Téléchargement du dataset Sereer wget openslr.org ``` ### Ressource OpenSLR - **Référence** : OpenSLR Resource #151 - **Lien** : Kallaama dataset ## Workflow de Réannotation Le processus de réannotation suit les étapes suivantes : ``` Corpus raw (unchecked) → Extraction → Lots de 5h → Google Colab → GCP → Label Studio → Validation CLAD ``` ### 1. Extraction des Données Non Vérifiées À partir du corpus complet dans `raw/`, nous avons extrait les transcriptions non vérifiées pour les trois langues. ### 2. Organi …

Visit

github.com

Tasks

speech processing

Languages

PulaarSerer-SineWolof

Similaires

khadija23/asr_wolof

khadija23/asr_wolof

Fintuning whisper on wolof dataset # asr_wolof Fintuning whisper on wolof dataset