intelligence tools for Ngemba
# đ€ Ngemba Whisper Fine-tuning Project
Créer un modÚle Whisper fine-tuné pour la reconnaissance vocale en Ngemba, intégrable dans l'application Handy.
## đ PrĂ©requis
- Données audio Ngemba (~500+ heures) avec transcriptions annotées
- Google Drive (pour stockage persistent sur Colab)
- Google Colab account (gratuit, avec GPU T4)
- Les fichiers de ce projet
## đ DĂ©marrage Rapide
### 1. Préparation Dataset
```
data/
âââ raw/ # Audio brut (wav, mp3)
âââ processed/ # Audio traitĂ© (16kHz, mono)
âââ annotations/
â âââ train.json # Transcriptions train
â âââ val.json # Transcriptions val
â âââ test.json # Transcriptions test
âââ splits/
âââ train/ # Audio entraĂźnement
âââ val/ # Audio validation
âââ test/ # Audio test
```
#### Format JSON annotations:
```json
[
{
"audio_file": "ngemba_001.wav",
"text": "transcription ngemba complĂšte"
},
...
]
```
### 2. Google Colab Setup
1. Ouvrir Google Colab:
colab.research.google.com
2. Charger notebook: `notebooks/01_colab_finetune.ipynb`
3. Exécuter cellules dans l'ordre:
- â
Monter Google Drive
- â
Installer dépendances
- â
Configurer hyperparamĂštres
- â
Charger dataset
- đ DĂ©marrer entraĂźnement
### 3. EntraĂźnement avec Checkpoints
**Caractéristiques automatiques:**
- â
Checkpoint tous les 10 epochs
- â
Sauvegarde locale (cache rapide)
- â
Copie Google Drive (persistent)
- â
Reprise automatique si timeout
- â
Nettoyage anciens checkpoints
**Exemple flux:**
```
Epoch 1-10: Train â Checkpoint sauvegardĂ©
Epoch 11-20: Train â Checkpoint sauvegardĂ©
...
Session timeout? â Relancer notebook â Reprendre epoch N
```
### 4. Post-EntraĂźnement
- Ăvaluation sur test set (WER, CER)
- Export en format GGML (pour Handy)
- Packaging pour distribution
## đ Structure Projet
```
ngemba-whisper-app/
âââ đ data/
â âââ raw/ # Audio brut
â âââ processed/ # Audio traitĂ©
â âââ annotations/ # âŠ