Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

Vuk'uzenzele isiXhosa Speech Dataset (ViXSD)

Domaine:

natural language processing

Type de record:

dataset
Créateur:
Lelapa AIVukosi Marivate

Vuk'uzenzele isiXhosa Speech Dataset (ViXSD) contains scripted narration of the Vuk’uzenzele South African Multilingual Corpus. ViXSD contains read speech from native speakers accompanied with rich metadata on speaker demographic and linguistic distribution.

ViXSD consists of 395 stereo audio recordings and corresponding transcriptions derived from the Vuk’uzenzele South African Multilingual Corpus.

It contains a total of 10 hours of narrated speech isiXhosa narrated by 8 speakers (4 male, 4 female) with approximately 39,000 words. We split the data into train, dev and test split for ease of use.

Visit

huggingface.copress release

Connected records

paperdataset

Tasks

speech processingautomatic speech recognition

Languages

Xhosa

Tags

vixsdlelapa aiway with words

Licenses

esethu license

Similaires

Vuk'uzenzele isiXhosa Speech Dataset (ViXSD)

Vuk'uzenzele isiXhosa Speech Dataset (ViXSD)

Vuk'uzenzele isiXhosa Speech Dataset (ViXSD) contains scripted narration of the Vuk’uzenzele South A