YodaLingua is a high-quality speech dataset designed for training text-to-speech (TTS) systems, ASR models, and any application requiring clean, well-aligned audio–text pairs.This release contains the Swahili portion of the multilingual YodaLingua collection.
Property
Value
Total clips
5,144 audio–transcription pairs
Total duration
15 hours
Speakers
443 distinct speakers
Audio format