Logo Lanfrica
  • Home
  • Atlas
  • Insights
  • Docs
  • Sign in

© 2026 Lanfrica. All rights reserved. All copyrights of the resources shown on the Lanfrica website belong to the original copyright holders, unless explicitly stated otherwise.

AnonXx/Pidgin_ASR_Dataset_Combined

Domain:

natural language processing

Record type:

dataset
Creator:
Ano
Host:
A Foundational Automatic Speech Recognition Corpus for Nigerian Pidgin (Naija, PCM) Naija-ASR-Corpus (NAC-v1.0) is a speech dataset derived from the Universal Dependencies Naija Spoken Corpus (UD_Naija-NSC). The NAC Team processed the original long-form recordings by: Segmenting the audio into sentence-level clips. Transcribing/Aligning the text to create paired audio-text data suitable for ASR training.

Visit

huggingface.co

Tasks

automatic speech recognitionspeech processing

Languages

Pidgin, Nigerian

Tags

audiospeechnaijapidgin

Licenses

cc-by-sa-4.0

Similar

timniel/Pidgin_ASR_Dataset_Combined

timniel/Pidgin_ASR_Dataset_Combined

A Foundational Automatic Speech Recognition Corpus for Nigerian Pidgin (Naija, PCM) Naija-ASR-Corpu