Logo Lanfrica
  • Home
  • Atlas
  • Insights
  • Docs
  • Sign in

© 2026 Lanfrica. All rights reserved. All copyrights of the resources shown on the Lanfrica website belong to the original copyright holders, unless explicitly stated otherwise.

SpeedyKom Turkana Speech Dataset

Domain:

natural language processing

Record type:

dataset
Creator:
spe
Host:
Speech dataset for Turkana (tuv) — Eastern Nilotic language, ~1M speakers, Kenya. Property Value Format WAV, 16 kHz, mono / UTF-8 transcripts Clips 5,151 segments Splits Train: 3,090 (60%) · Validation: 1,030 (20%) · Test: 1,031 (20%) — seed 42 Source GRN Bible narratives (Global Recordings Network, LLL series 1–8), segmented via silence detection Transcription Auto-generated via facebook/mms-1b-all(Teso adapter)

Visit

huggingface.co

Tasks

automatic speech recognitionspeech processing

Languages

Turkana

Tags

turkanaatekerniloticafricakenyammsvits

Licenses

cc-by-nc-4.0

Similar

SpeedyKom Ng'akarimojong Speech DatasetSpeedykom Pokoot-east Speech Dataset

SpeedyKom Ng'akarimojong Speech Dataset

Speech dataset for Ng'akarimojong (kdj) — Eastern Nilotic language, ~370,000 speakers, Karamoja, NE

Speedykom Pokoot-east Speech Dataset

Speech dataset for Pokoot East — a Southern Nilotic (Kalenjin) language spoken in Kenya. Property V