Logo Lanfrica

Damasoumana1/fr-dioula-dataset

Domain:

natural language processing

Record type:

dataset
Creator:
Dam
Host:
Corpus et scripts de prétraitement pour un jeu de données français-dioula, avec export CSV, statistiques et notebook d’exploration. # Mini Projet Dioula Ce projet vise à extraire et préparer un dataset bilingue français ↔ dioula depuis Hugging Face, en suivant le schéma de répertoire défini pour l'analyse et l'export des données. ## Contenu - `data/raw/hf_fr_dioula_full/` : dataset brut téléchargé depuis Hugging Face - `data/processed/` : fichiers CSV de train/validation/test et dataset nettoyé - `data/samples/sample_sentences.txt` : exemples de phrases de démonstration - `notebooks/exploration.ipynb` : notebook d'exploration - `src/` : scripts Python du pipeline - `outputs/` : rapports et vocabulaire générés - `main.py` : point d'entrée du pipeline - `requirements.txt` : dépendances Python ## Utilisation 1. Installe les dépendances : ```bash python -m pip install -r requirements.txt ``` 2. Lance le pipeline : ```bash python main.py ``` Le pipeline va : - charger le dataset `fvdel05/hf_fr_dioula_full` depuis Hugging Face - prétraiter et nettoyer les textes - exporter `train.csv`, `validation.csv`, `test.csv` et `cleaned_dataset.csv` - générer `stats_report.txt` et `vocabulary.txt` ## Dataset source Le dataset utilisé est `fvdel05/hf_fr_dioula_full` (via MyFindora), un dataset de traduction Français ↔ Dioula très complet. Il intègre plus de 25 000 paires de traduction proprement segmentées pour l'entraînement, la validation et les tests de modèles. Source : fvdel05/hf_fr_dioula_full ## Architecture Le pipeline est structuré autour de modules : - `src/load_dataset.py` : chargement depuis Hugging Face - `src/preprocess.py` : transformation et nettoyage - `src/export_csv.py` : export CSV - `src/statistics.py` : statistiques et vocabulaire - `src/utils.py` : utilitaires ## Licence Le code du projet est distribué sous licence MIT. > Les scripts et le code source sont sous MIT. Le dataset et les données brutes peuvent être soumis à des conditions de licence distinctes, donc vérifie la licence originale du dataset Hugging Face avant toute redistribution …

Languages

Licenses