A cleaned, validated Kenyan-Swahili ASR corpus prepared for fine-tuning streaming ASR
models (e.g. NVIDIA Nemotron 3.5 ASR). This is an initial ~30h subset for
pipeline validation; a larger version will follow.
Audio: 16 kHz mono WAV (embedded).
text: cased + punctuated transcript.
target_lang: sw-KE · source, dialect, duration columns included.
Source & license