Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

SpeedyKom Turkana Speech Dataset

Domaine:

natural language processing

Type de record:

dataset
Créateur:
spe
Hôte:
Speech dataset for Turkana (tuv) — Eastern Nilotic language, ~1M speakers, Kenya. Property Value Format WAV, 16 kHz, mono / UTF-8 transcripts Clips 5,151 segments Splits Train: 3,090 (60%) · Validation: 1,030 (20%) · Test: 1,031 (20%) — seed 42 Source GRN Bible narratives (Global Recordings Network, LLL series 1–8), segmented via silence detection Transcription Auto-generated via facebook/mms-1b-all(Teso adapter)

Visit

huggingface.co

Tasks

automatic speech recognitionspeech processing

Languages

Turkana

Tags

turkanaatekerniloticafricakenyammsvits

Licenses

cc-by-nc-4.0

Similaires

SpeedyKom Ng'akarimojong Speech DatasetSpeedykom Pokoot-east Speech Dataset

SpeedyKom Ng'akarimojong Speech Dataset

Speech dataset for Ng'akarimojong (kdj) — Eastern Nilotic language, ~370,000 speakers, Karamoja, NE

Speedykom Pokoot-east Speech Dataset

Speech dataset for Pokoot East — a Southern Nilotic (Kalenjin) language spoken in Kenya. Property V