Générateur automatisé de datasets bilingues Français-Fongbe pour l'entraînement de modèles de langue (LLM).
# 🌍 Fon-Dataset-Generator 🚀
> **"Préserver la langue, cultiver le futur."** — Un outil haute performance pour générer des datasets de traduction Français-Fon de qualité industrielle grâce à l'IA.
---
## 📊 Accès Rapide aux Données
Le dataset est disponible sous deux formats pour s'adapter à vos besoins :
* **🌐 Visualisation** : Consulter sur Google Sheets (Idéal pour la relecture humaine).
* **📂 Format Brut (JSONL)** : Accéder au fichier `data/dataset_fr_fon.jsonl` (Prêt pour l'entraînement d'IA / Fine-tuning).
---
## 🌟 Pourquoi ce projet ?
La langue **Fon** (Fongbe) est l'une des langues les plus parlées au Bénin. Pour construire des modèles d'IA (LLM) performants pour notre culture, nous avons besoin de données massives et de qualité.
**Fon-Dataset-Generator** permet de :
- 🧠 **Générer des phrases naturelles** couvrant tous les aspects de la vie quotidienne (santé, commerce, émotions, proverbes).
- 🔄 **Automatiser la traduction** via des APIs modernes.
- 📂 **Exporter en JSONL**, prêt pour le fine-tuning (format OpenAI/DeepSeek).
---
## 🛠️ Deux manières de contribuer
Le projet offre deux approches selon vos besoins :
### 1. Mode Expert (Python Async) ⚡
Idéal pour la génération massive à haute vitesse.
- **Localisation** : `core/generator.py`
- **Avantages** : Asynchrone, multithreadé, gestion des doublons en mémoire.
### 2. Mode Cloud (Google Apps Script) ☁️
Idéal pour ceux qui préfèrent une interface visuelle via Google Sheets.
- **Localisation** : `cloud/GoogleAppsScript.gs`
- **Avantages** : Pas d'installation, sauvegarde directe dans Google Drive, notifications Gmail.
- **Accès direct au Dataset** : Consulter la version Google Sheets
---
## 🚀 Installation & Configuration
### Prérequis (Version Python)
1. Clonez le dépôt :
```bash
git clone
github.com
cd Fon-Dataset-Generator
```
2. Installez les dépendances :
```bash
pip install -r requirements.txt
```
3. Configurez vos clés API :
- Renommez `.env …