AfriLingua : LLM pour langues africaines avec XLM-RoBERTa, fine-tuning sur 15 langues (Swahili, Hausa, Yoruba, Zulu, Amharic) pour MLM, Causal LM et traduction
# AfriLingua - LLM pour Langues Africaines
**Stack :** XLM-RoBERTa, Transformers, HuggingFace, FastAPI, PyTorch | **Langues :** 15 langues africaines | **Taches :** MLM, Causal LM, Traduction
## Comprendre le projet
### Contexte
Les langues africaines sont largement sous-representees dans les grands modeles de langage. AfriLingua propose une solution de fine-tuning multimodal (Swahili, Hausa, Yoruba, Zulu, Amharic, etc.) en utilisant des modeles multilingues pre-entraines comme XLM-RoBERTa, avec une API de generation et d'evaluation.
## 1. Presentation & Specifications Metier
AfriLingua supporte 3 taches principales :
- **MLM (Masked Language Model)** : pre-entrainement/specialisation sur corpus africains
- **Causal LM** : generation de texte libre en langues africaines
- **Traduction** : alignement phrase-a-phrase vers le francais ou l'anglais
Les cas d'usage incluent la generation de contenu en langues locales, la traduction automatique, l'analyse de sentiments, et l'education numerique.
## 2. Architecture Technique
```
[Dataset]
15 langues ──► Tokenizer (XLM-R) ──► DataLoader
│ │
▼ ▼
┌──────────────────────────────────────────────────┐
│ Fine-Tuning Pipeline │
│ XLM-RoBERTa ──► HuggingFace Trainer │
│ Taches : MLM / Causal LM / Translation │
│ Stratégies : freeze, LoRA, full fine-tune │
└──────────────────────┬───────────────────────────┘
│
▼
┌──────────────────────────────────────────────────┐
│ Inference API │
│ POST /generate : generation de texte │
│ POST /fill-mask : prediction de masque │
│ GET /health : statut du modele │
│ GET /languages : langues supportees │
└──────────────────────────────────────────────────┘
```
L'entrainement utilise la librairie HuggingFace Transformers avec un Trainer standard. Le modele de base est …