Logo Lanfrica
  • Home
  • Atlas
  • Insights
  • Docs
  • Sign in

© 2026 Lanfrica. All rights reserved. All copyrights of the resources shown on the Lanfrica website belong to the original copyright holders, unless explicitly stated otherwise.

isiNdebele ASR Dataset

Domain:

natural language processing

Record type:

dataset
Creator:
zio
Host:
This dataset contains speech recordings and transcriptions for isiNdebele, one of South Africa's official languages. The dataset has been optimized for use with OpenAI's Whisper ASR models. Number of samples: 742 Language: isiNdebele (Nbl) Audio format: WAV, 16kHz, mono, 16-bit Maximum duration: 30 seconds (truncated for Whisper compatibility)

Visit

huggingface.co

Tasks

automatic speech recognitionspeech processing

Languages

NdebeleNdebeleSetswanaSotho, NorthernSotho, SouthernSwatiTsongaVendaXhosaZulu

Licenses

mit

Similar

Lwazi isiNdebele ASR corpusisiXhosa ASR DatasetDarija ASR DatasetDarija ASR DatasetBulu-ASR-DatasetBasaa-ASR-Dataset

Lwazi isiNdebele ASR corpus

Complete audio recordings and orthographic transcriptions used for Lwazi speech recognition systems.

isiXhosa ASR Dataset

This dataset contains speech recordings and transcriptions for isiXhosa, one of South Africa's offic

Darija ASR Dataset

Dataset de reconnaissance automatique de la parole en Darija marocaine. Langue: Darija marocaine (a

Darija ASR Dataset

Dataset de reconnaissance automatique de la parole en Darija marocaine. Langue: Darija marocaine (a

Bulu-ASR-Dataset

Bulu-ASR-Dataset is a scripted speech dataset dedicated to the documentation and technological devel

Basaa-ASR-Dataset

Basaa-ASR-Dataset is a curated speech dataset dedicated to the documentation and technological devel