This dataset contains high-quality Somali speech recordings with corresponding transcriptions.It is designed for training Text-to-Speech (TTS) models such as Coqui XTTS v2, FastSpeech, or VITS for the Somali language.
Format: .wav audio + metadata.csv (tab-separated: wav_path, transcription)
Language: Somali
Total Samples: ~20,000 clips
Sampling Rate: 22050 Hz
To train with Coqui TTS: