Building a (French->Bambara) MT model with OpenNMT
# nko
Building a (French->Bambara) MT model with OpenNMT
# But du projet
Le projet nko se base sur le developpement d'une intelligence artificielle pour traduire du français au bambara.
# Structure du projet
Le projet est organisé comme suit:
Le document Data contient les données qu'on exploite(des textes en bambara ainsi que leurs traductions)
Le document Scripts contient plusieurs scripts utilisés dans le cadre du projet nko. Chaque script remplit un rôle spécifique dans le processus de prétraitement des données et d'entraînement des modèles pour faciliter la traduction entre le français et le bambara.
## Utilisation des scripts
- bpe.py # Script pour entraîner des modèles SentencePiece en utilisant l'algorithme BPE
- desubword.py # Script pour décoder les prédictions de traduction
- filter.py # Script pour filtrer et nettoyer les jeux de données parallèles
- preprocess.py # Script pour préparer les données avant le sous-motage
- subword.py # Script pour effectuer le sous-motage des fichiers source et cible
# Outils requis
- Python 3.
- Bibliothèque SentencePiece
- OPENNMT (& ses dépendances)
- KAGGLE (comme environement de developement)
- Bibliothèque Pandas
- Bibliothèque Numpy
## Contribution
Nous pouvons travailler ensemble pour faire avancer ce projet. Si vous avez des problèmes, des idées d'implémentations ou des suggestions, n'hésitez pas à ouvrir une issue. Améliorez et faites avancer le projet !
Envoyer un email à farancoulibaly314@gmail.com ou hadjaratamaiga01@gmail.com pour plus d'informations.