This dataset release is part of the data and modeling effort described in: The Thiomi Dataset: A Large-Scale Multimodal Corpus for Low-Resource African Languages
The broader Thiomi work focuses on building high-quality multimodal resources for
African languages and enabling ASR/MT/TTS research and deployment.
Per language config (eng_Latn, kik_Latn, kam_Latn, luo_Latn, mer_Latn, som_Latn):