Logo Lanfrica

fokouarnaud/nge-whisper

Domaine:

natural language processing

Type de record:

project
Créateur:
fok
Hôte:
intelligence tools for Ngemba # 🎤 Ngemba Whisper Fine-tuning Project Créer un modèle Whisper fine-tuné pour la reconnaissance vocale en Ngemba, intégrable dans l'application Handy. ## 📋 Prérequis - Données audio Ngemba (~500+ heures) avec transcriptions annotées - Google Drive (pour stockage persistent sur Colab) - Google Colab account (gratuit, avec GPU T4) - Les fichiers de ce projet ## 🚀 Démarrage Rapide ### 1. Préparation Dataset ``` data/ ├── raw/ # Audio brut (wav, mp3) ├── processed/ # Audio traité (16kHz, mono) ├── annotations/ │ ├── train.json # Transcriptions train │ ├── val.json # Transcriptions val │ └── test.json # Transcriptions test └── splits/ ├── train/ # Audio entraînement ├── val/ # Audio validation └── test/ # Audio test ``` #### Format JSON annotations: ```json [ { "audio_file": "ngemba_001.wav", "text": "transcription ngemba complète" }, ... ] ``` ### 2. Google Colab Setup 1. Ouvrir Google Colab: colab.research.google.com 2. Charger notebook: `notebooks/01_colab_finetune.ipynb` 3. Exécuter cellules dans l'ordre: - ✅ Monter Google Drive - ✅ Installer dépendances - ✅ Configurer hyperparamètres - ✅ Charger dataset - 🚀 Démarrer entraînement ### 3. Entraînement avec Checkpoints **Caractéristiques automatiques:** - ✅ Checkpoint tous les 10 epochs - ✅ Sauvegarde locale (cache rapide) - ✅ Copie Google Drive (persistent) - ✅ Reprise automatique si timeout - ✅ Nettoyage anciens checkpoints **Exemple flux:** ``` Epoch 1-10: Train → Checkpoint sauvegardé Epoch 11-20: Train → Checkpoint sauvegardé ... Session timeout? → Relancer notebook → Reprendre epoch N ``` ### 4. Post-Entraînement - Évaluation sur test set (WER, CER) - Export en format GGML (pour Handy) - Packaging pour distribution ## 📁 Structure Projet ``` ngemba-whisper-app/ ├── 📂 data/ │ ├── raw/ # Audio brut │ ├── processed/ # Audio traité │ ├── annotations/ # …