Afrivoice is a robust audio processing pipeline designed to transcribe speech from African languages, translate it (via English), and synthesize the translated text back into audio. It integrates a wide range of ASR and TTS models to support African linguistic diversity.
# multilingual-african-speech-translation
Afrivoice is a robust audio processing pipeline designed to transcribe speech from African languages, translate it (via English), and synthesize the translated text back into audio. It integrates a wide range of ASR and TTS models to support African linguistic diversity.
Features
ποΈ Automatic Speech Recognition (ASR) for over 20 African languages using models from SpeechBrain, HuggingFace, and Whisper.
π Translation via Microsoft Azure or Google Translate APIs (configurable).
π Text-to-Speech (TTS) for supported languages using VITS models.
π End-to-End Pipeline: Input speech in one language β Transcription β Translation β Synthesized audio in another language.
Supported Languages
Language Code Language ASR Support TTS Support
kin Kinyarwanda β
β
lug Luganda β
β
swh Swahili β
β
am Amharic β
β
ha Hausa β
π«*
yo Yoruba β
β
ig Igbo β
π«*
xho Xhosa β
β
zul Zulu β
β
tir Tigrinya β
β
so Somali β
β
ach, nyn, teo, lgg Sunbird languages (Acholi, Runyankole, Ateso, Lugbara) β
β