Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

Damasoumana1/audio_dioula_project_to_Fr_En_T_dataset

Domaine:

natural language processingeducation

Type de record:

dataset
Créateur:
Dam
Hôte:
Audio data processing pipeline for the Dioula (Dyula) language. This project extracts, cleans, and structures audio corpora and their transcriptions (Dioula to French/English) for training Artificial Intelligence models # Projet Audio Dioula - Assistant IA Éducatif 🇧🇫 Ce projet vise à préparer le corpus de parole Dioula pour l'entraînement de modèles de reconnaissance vocale (Whisper) et de synthèse vocale, dans le cadre d'un assistant IA multilingue (Français, Moore, Dioula) pour le système éducatif au Burkina Faso. ## 📚 Source du Dataset Le dataset utilisé est **Koumankan4Dyula**, fourni par l'**UVCI (Université Virtuelle de Côte d'Ivoire)**. - **Lien Hugging Face** : uvci/koumankan4dyula - **Contenu** : ~15 heures de parole, 10 929 enregistrements. - **Langues** : Dioula (parlé), aligné avec Français et Anglais (écrit). ## 📁 Structure du Projet Le projet suit une architecture stricte pour la gestion des données : - `data/audio/wav/` : Fichiers audio extraits et convertis. - `data/transcripts/` : Transcriptions organisées par langue (Dioula, Français, Anglais). - `data/processed/` : Fichiers CSV contenant toutes les métadonnées (ID, genre, âge, pays). - `src/` : Scripts de traitement et d'extraction. ## 🚀 Utilisation 1. **Installation** : `pip install -r requirements.txt` 2. **Extraction** : `python main.py` 3. **Statistiques** : `python src/statistics.py` ## 🎯 Objectifs du Projet - Réduire la barrière linguistique dans l'éducation au Burkina Faso. - Permettre aux enfants (6-15 ans) d'apprendre dans leur langue maternelle. - Développer un assistant capable de fonctionner hors-ligne. --- *Projet réalisé dans le cadre de mon Master sur le cours Intelligence Artificielle Appliquée au Contexte Africain (- Section Education).* ## 👨‍💻 Auteur **Soumana Dama** (Ingénieur d'extraction du projet) - 💼 LinkedIn : Soumana Dama - 🌐 Portfolio : soumanadama.netlify.app ## 📜 Licence Ce projet est sous licence **MIT** (Open Source), dans la continuité de l'aspect open source du dataset d'origine. Voir le fichier `LICENSE` pour plus de détails.

Visit

github.com

Languages

DamaJula

Licenses

MIT

Similaires

Damasoumana1/backend_professeur_ia_multilingueDamasoumana1/Conflict_monitoring_datasetDamasoumana1/frontend_professeur_ia_multilingue-Damasoumana1/fr-dioula-dataset

Damasoumana1/backend_professeur_ia_multilingue

"Backend API (FastAPI) pour le Professeur IA multilingue (Français, Mooré, Dioula). Système expert h

Damasoumana1/Conflict_monitoring_dataset

🌍 Academic project — Automated collection and preprocessing of conflict event data in West Africa us

Damasoumana1/frontend_professeur_ia_multilingue-

"A multilingual AI-powered educational application built with React Native (Expo). It features an in

Damasoumana1/fr-dioula-dataset

Corpus et scripts de prétraitement pour un jeu de données français-dioula, avec export CSV, statisti