Notre projet pour cet hackathon était de faire la transcription de la langue YEMBA à partir des fichiers audios qui nous avez été fourni par les organisateurs de la compétition.
### Finetuning des modèles multilingues auto supervisés pour la transcription de la parole en langue camerounaise.
Datasets :
YembaEGRA : YembaEGRA
YembaTones : data.mendeley.com
Modèles pré-entraînés :
huggingface.cohuggingface.cohuggingface.cohuggingface.cohuggingface.colucio/wav2vec2-large-xlsr-k…Akashpb13/Swahili_xlsrhuggingface.co
Références
Y. Yomie, P. Melatagia, B. Lecouteux, Application of the multilingual acoustic representation model XLSR for the transcription of Ewondo, ARIMA J. 42 (2024)
M.S. Kenfack , P. Melatagia, E. Sandembouo,YembaTones: A syllable-tone annotated dataset for speech recognition and prosodic analysis of the Yemba language, Data in Brief, Volume 52 (2024)