intelligence tools for Ngemba
# 🎤 Ngemba Whisper Fine-tuning Project
Créer un modèle Whisper fine-tuné pour la reconnaissance vocale en Ngemba, intégrable dans l'application Handy.
## 📋 Prérequis
- Données audio Ngemba (~500+ heures) avec transcriptions annotées
- Google Drive (pour stockage persistent sur Colab)
- Google Colab account (gratuit, avec GPU T4)
- Les fichiers de ce projet
## 🚀 Démarrage Rapide
### 1. Préparation Dataset
```
data/
├── raw/ # Audio brut (wav, mp3)
├── processed/ # Audio traité (16kHz, mono)
├── annotations/
│ ├── train.json # Transcriptions train
│ ├── val.json # Transcriptions val
│ └── test.json # Transcriptions test
└── splits/
├── train/ # Audio entraînement
├── val/ # Audio validation
└── test/ # Audio test
```
#### Format JSON annotations:
```json
[
{
"audio_file": "ngemba_001.wav",
"text": "transcription ngemba complète"
},
...
]
```
### 2. Google Colab Setup
1. Ouvrir Google Colab:
colab.research.google.com
2. Charger notebook: `notebooks/01_colab_finetune.ipynb`
3. Exécuter cellules dans l'ordre:
- ✅ Monter Google Drive
- ✅ Installer dépendances
- ✅ Configurer hyperparamètres
- ✅ Charger dataset
- 🚀 Démarrer entraînement
### 3. Entraînement avec Checkpoints
**Caractéristiques automatiques:**
- ✅ Checkpoint tous les 10 epochs
- ✅ Sauvegarde locale (cache rapide)
- ✅ Copie Google Drive (persistent)
- ✅ Reprise automatique si timeout
- ✅ Nettoyage anciens checkpoints
**Exemple flux:**
```
Epoch 1-10: Train → Checkpoint sauvegardé
Epoch 11-20: Train → Checkpoint sauvegardé
...
Session timeout? → Relancer notebook → Reprendre epoch N
```
### 4. Post-Entraînement
- Évaluation sur test set (WER, CER)
- Export en format GGML (pour Handy)
- Packaging pour distribution
## 📁 Structure Projet
```
ngemba-whisper-app/
├── 📂 data/
│ ├── raw/ # Audio brut
│ ├── processed/ # Audio traité
│ ├── annotations/ # …