# DIOULA AI — Fine-tuning LLM pour la langue Dioula
Modèle LLaMA 3.1 8B fine-tuné sur le Dioula de Côte d'Ivoire (Julakan).
Traduction français ↔ dioula, grammaire, assistance linguistique.
---
## Structure du projet
```
LLMA DIOULA MODEL/
├── finetune_dioula.py — Fine-tuning QLoRA (Mac/AWS)
├── test_dioula.py — Tests automatiques + chat interactif
├── requirements.txt — Dépendances Python
├── deploy.sh — Script de déploiement AWS automatique
├── .env.example — Template de configuration
├── Data/
│ ├── dioula_dataset_v3_final.json — Dataset complet (24 règles + 210 mots + 169 paires)
│ ├── dioula_alpaca_v3_finetune.json — Format Alpaca pour fine-tuning
│ └── ...
├── api/
│ └── main.py — API FastAPI pour servir le modèle
├── models/ — Modèle fine-tuné (ignoré par git)
├── notebooks/ — Expérimentations Jupyter
└── logs/ — Logs d'entraînement (ignoré par git)
```
---
## Déploiement AWS (GPU)
### 1. Lancer une instance
Recommandé : `g4dn.xlarge` (T4 16GB, ~0.50$/h) ou `g5.xlarge` (A10G 24GB, ~1.00$/h)
AMI : **Ubuntu 22.04** ou **AWS Deep Learning AMI**
### 2. Déploiement automatique
```bash
# Sur l'instance AWS (après connexion SSH)
curl -O
raw.githubusercontent.com
bash deploy.sh
```
### 3. Configuration
```bash
nano .env # Ajouter HF_TOKEN et ajuster les paramètres
```
### 4. Fine-tuning
```bash
source env/bin/activate
python finetune_dioula.py --epochs 5
```
### 5. Ajouter un nouveau dataset (après le 1er entraînement)
```bash
# Copier le nouveau fichier dans Data/
scp nouveau_dataset.json ubuntu@INSTANCE_IP:~/llma-dioula-model/Data/
# Réentraîner depuis le modèle de base (meilleure qualité)
python finetune_dioula.py --dataset Data/nouveau_dataset.json --epochs 3
# OU continuer depuis le checkpoint …