Corpus et scripts de prétraitement pour un jeu de données français-dioula, avec export CSV, statistiques et notebook d’exploration.
# Mini Projet Dioula
Ce projet vise à extraire et préparer un dataset bilingue français ↔ dioula depuis Hugging Face, en suivant le schéma de répertoire défini pour l'analyse et l'export des données.
## Contenu
- `data/raw/hf_fr_dioula_full/` : dataset brut téléchargé depuis Hugging Face
- `data/processed/` : fichiers CSV de train/validation/test et dataset nettoyé
- `data/samples/sample_sentences.txt` : exemples de phrases de démonstration
- `notebooks/exploration.ipynb` : notebook d'exploration
- `src/` : scripts Python du pipeline
- `outputs/` : rapports et vocabulaire générés
- `main.py` : point d'entrée du pipeline
- `requirements.txt` : dépendances Python
## Utilisation
1. Installe les dépendances :
```bash
python -m pip install -r requirements.txt
```
2. Lance le pipeline :
```bash
python main.py
```
Le pipeline va :
- charger le dataset `fvdel05/hf_fr_dioula_full` depuis Hugging Face
- prétraiter et nettoyer les textes
- exporter `train.csv`, `validation.csv`, `test.csv` et `cleaned_dataset.csv`
- générer `stats_report.txt` et `vocabulary.txt`
## Dataset source
Le dataset utilisé est `fvdel05/hf_fr_dioula_full` (via MyFindora), un dataset de traduction Français ↔ Dioula très complet. Il intègre plus de 25 000 paires de traduction proprement segmentées pour l'entraînement, la validation et les tests de modèles.
Source : fvdel05/hf_fr_dioula_full
## Architecture
Le pipeline est structuré autour de modules :
- `src/load_dataset.py` : chargement depuis Hugging Face
- `src/preprocess.py` : transformation et nettoyage
- `src/export_csv.py` : export CSV
- `src/statistics.py` : statistiques et vocabulaire
- `src/utils.py` : utilitaires
## Licence
Le code du projet est distribué sous licence MIT.
> Les scripts et le code source sont sous MIT. Le dataset et les données brutes peuvent être soumis à des conditions de licence distinctes, donc vérifie la licence originale du dataset Hugging Face avant toute redistribution …