Fine-tuning de Whisper-small pour la reconnaissance vocale du dialecte hassaniya - Projet NLP Dialects M1 IA UNA 2026
# 🎤 Hassaniya Speech-to-Text — Fine-tuning Whisper
> Projet NLP Dialects — Master 1 Intelligence Artificielle | Filière AI_NLP&CMV
> Université de Nouakchott (U.N.A.) — Juin 2026
---
## 👩💻 Auteures
| Nom | Matricule |
|---|---|
| Mariem Mohamed EL Bechir | C34606 |
| Zahra Yeslek Boubecar | C34645 |
---
## 📌 Description
Ce projet implémente un système de **reconnaissance vocale automatique (Speech-to-Text)** pour le dialecte **hassaniya**, l'arabe parlé en Mauritanie et dans la région sahélienne.
L'approche repose sur le **transfer learning** : fine-tuning du modèle Whisper-small d'OpenAI (244M paramètres, pré-entraîné sur 680 000 heures d'audio multilingue) sur un corpus de **294 clips audio hassaniya (~10 minutes)**.
---
## 📊 Résultats
| Métrique | Avant fine-tuning | Après fine-tuning | Amélioration |
|---|---|---|---|
| **WER** | 117,86 % | 70,24 % | −40 % relatif |
| **CER** | 75,00 % | 26,57 % | **−65 % relatif** |
- ✅ Élimination complète des hallucinations (boucles de répétition)
- ✅ Le modèle reste ancré en hassaniya (ne traduit plus en arabe standard)
- ✅ Apprentissage du caractère dialectal **گ** (kaf persan)
---
## 🗂️ Structure du projet
```
hassaniya-stt-whisper/
├── Hassaniya_STT.ipynb # Notebook Colab complet (pipeline end-to-end)
├── preprocess_hassaniya_stt.py # Preprocessing : parquet → format HuggingFace
├── hassaniya_orthographic_correction.py # Corrections orthographiques hassaniya (گ)
├── verify_dataset.py # Vérification du dataset avant entraînement
├── rapport_hassaniya_stt.pdf # Rapport académique complet
├── presentation_hassaniya.html # Présentation interactive (10 slides)
└── README.md
```
---
## 🚀 Reproduire le projet
### 1. Prérequis
```bash
pip install transformers datasets accelerate evaluate jiwer
pip install librosa soundfile gradio pandas pyarrow
```
### 2. Preprocessing
```bash
# Placer audios_dataset.parquet dans le dossier
python …