Fine-tuning Whisper for Chichewa (Nyanja) - Automatic Speech Recognition for Low-Resource African Languages
# Chichewa ASR Fine-tuning 🎙️
Fine-tuning OpenAI Whisper for **Chichewa (Nyanja)** — a low-resource Bantu language
spoken in Malawi.
## 🎯 Project Goal
Build an accurate Automatic Speech Recognition (ASR) system for Chichewa
using transfer learning and fine-tuning on limited labeled data.
## 🏗️ Approach
- **Base model:** OpenAI Whisper (small / medium)
- **Technique:** Fine-tuning with CTC + Cross-Entropy loss
- **Dataset:** collected Chichewa speech data
- **Evaluation:** Word Error Rate (WER) and Character Error Rate (CER)
## 🚀 Getting Started
## 📊 Results
| Model | Dataset | WER | CER |
|-------|---------|-----|-----|
| Whisper-small (baseline) | Common Voice Chichewa | - | - |
| Whisper-small (fine-tuned) | Common Voice Chichewa | - | - |
*(Results will be updated as experiments progress)*
## 👥 Team
- **Researcher:** Ngongbi Laison Chiabi
- **Supervisor:** Dr. Dunstan Matekenya
- **Tutor:** Tutor Lizette
## 📚 References
- OpenAI Whisper Paper
- Mozilla Common Voice
- Hugging Face Whisper Fine-tuning Guide
## 📄 License
MIT License — see LICENSE for details.
EOF