This dataset contains Kikuyu speech audio with transcriptions, sourced and adapted from the ANV Data KE dataset.It includes both scripted and unscripted recordings, across different domains.
We provide two configurations for different use cases.
all: Full dataset (all durations, unscripted only).
new_duration_30s: Audio samples ≤ 30 seconds (scripted + unscripted).
Features