Logo Lanfrica

terravidhal/duala_digit_classifier

Domaine:

natural language processing

Type de record:

softwaremodel
Créateur:
ter
Hôte:
# Duala Digit Classifier 🔊🎙️ Reconnaissance automatique des chiffres en langue **Duala** (0–10) à partir d'audios. Ce projet utilise : - **Librosa** pour extraire les MFCC - **SVM (Scikit-Learn)** pour la classification - Conversion automatique **M4A → WAV** via FFmpeg - Un dossier propre `model/` pour stocker les modèles entraînés --- ## 📁 Structure du projet duala_digit_classifier/ │ ├── dataset/ │ ├── 0/ │ ├── 1/ │ ├── ... │ └── 10/ │ ├── model/ │ ├── model.pkl │ ├── scaler.pkl │ ├── convert_all.py ├── train.py ├── test_audio.py ├── README.md └── requirements.txt --- ## 🛠️ Installation ### 1. Cloner le projet ```sh git clone github.com cd duala_digit_classifier Créer un environnement virtuel (recommandé) python -m venv venv 3. Activer le venv Windows : venv\Scripts\activate ou source ./venv/Scripts/activate Mac/Linux : source venv/bin/activate 4. Installer les dépendances pip install -r requirements.txt 🎧 Convertir les fichiers M4A → WAV Placez vos fichiers .m4a dans : dataset/0 dataset/1 ... dataset/10 Puis lancez la conversion : python convert_all.py Fmpeg doit être installé Téléchargement : gyan.dev 🎓 Entraîner le modèle python train.py À la fin, les fichiers suivants seront générés dans model/ : model.pkl scaler.pkl 🧪 Tester un audio Modifiez dans test_audio.py : audio_path = "dataset/2/2V1.wav" audio_path = "dataset/2/2V1.wav" Puis lancez : python test_audio.py Vous obtiendrez : 🎤 AUDIO : dataset/2/2V1.wav ➡ Prédiction : 2 ➡ Probabilités : [...] 📦 Export du modèle Tu peux utiliser les fichiers : model/model.pkl model/scaler.pkl …dans une API (FastAPI), une app mobile, ou une interface web. 📝 Notes Le dataset doit contenir une structure 0–10. Les WAV sont automatiquement écrasés s'ils existent. Tous les modèles sont sauvegardés dans model/. 🙌 Auteur Projet Duala Speech ML — Vidhal Élamé