Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

Kenyan Swahili ASR (clean, Nemotron-ready)

Domaine:

natural language processing

Type de record:

dataset
Créateur:
Ton
Hôte:
A cleaned, validated Kenyan-Swahili ASR corpus prepared for fine-tuning streaming ASR models (e.g. NVIDIA Nemotron 3.5 ASR). This is an initial ~30h subset for pipeline validation; a larger version will follow. Audio: 16 kHz mono WAV (embedded). text: cased + punctuated transcript. target_lang: sw-KE · source, dialect, duration columns included. Source & license

Visit

huggingface.co

Tasks

automatic speech recognitionspeech processing

Languages

Swahili

Tags

swahilikenyan-swahilispeechasr

Licenses

cc-by-4.0

Similaires

afyfbadreddine77/darija-asr-cleanFrom a Multilingual Streaming ASR Backbone to Kenyan-Language Systems: Data-Centric Adaptation of Nemotron 3.5 for Kikuyu, Dholuo, and KalenjinPanga-Azazia/mb-TTS-ASR-ready-2Swahili Small Clean Corpus (Demo)Swahili-ASRElvisGitau/swahili-ASR

afyfbadreddine77/darija-asr-clean

From a Multilingual Streaming ASR Backbone to Kenyan-Language Systems: Data-Centric Adaptation of Nemotron 3.5 for Kikuyu, Dholuo, and Kalenjin

Automatic speech recognition (ASR) for African languages is constrained by orthographic inconsistenc

Panga-Azazia/mb-TTS-ASR-ready-2

Swahili Small Clean Corpus (Demo)

One-line summaryA small high-quality Swahili text corpus (≈58k documents, ~52.8 MB) extracted from S

Swahili-ASR

Swahili-ASR is a 600-hour conversational Swahili speech corpus with fully human-generated verbatim t

ElvisGitau/swahili-ASR