Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

Dexterity Pidgin Voice Dataset — Sample v2

Domaine:

natural language processing

Type de record:

dataset
Créateur:
Dex
Hôte:
Dexterity Pidgin Voice Dataset — Sample v2 Creator: Dexterity Learn. Dataset Description 49 human-created Nigerian Pidgin English (Naija) utterances with aligned home studio audio, covering 8 domains: faith, wisdom, money, business, relationships, community, social commentary, and everyday conversation. Three utterances (U20–U22) address consent and anti-harassment themes, included for social good NLP use.

Visit

huggingface.co

Languages

Ghanaian Pidgin EnglishPidgin, Nigerian

Tags

naijalow-resourcepidginafricanafrican-languagesaudioparallel-corpusnigeria

Licenses

cc-by-4.0

Similaires

🎙️ Silencio Voice AI Sample Dataset🎙️ Silencio Voice AI Sample DatasetTWB Voice Hausa TTS Dataset 1.0 - Sample SetCommon Voice 24.0 — Ethiopian Languages (v2)Common Voice 17.0 (Swahili, Kenyan Sample)Common Voice Scripted Speech 26.0 - Cameroon Pidgin

🎙️ Silencio Voice AI Sample Dataset

📊 This is a sample. The full Silencio corpus contains 100,000+ hours across 170+ countries and 100+

🎙️ Silencio Voice AI Sample Dataset

📊 This is a sample. The full Silencio corpus contains 100,000+ hours across 170+ countries and 100+

TWB Voice Hausa TTS Dataset 1.0 - Sample Set

TWB Voice Hausa TTS 1.0 Sample Set is a high-quality text-to-speech corpus containing read speech data in Hausa, recorded by a single female speaker under acoustically optimal conditions. This dataset represents 10% of the complete Hausa TTS dataset collected as

Common Voice 24.0 — Ethiopian Languages (v2)

This is a cleaned and restructured version of hadamard-2/common-voice-24-ethiopian, which is a verba

Common Voice 17.0 (Swahili, Kenyan Sample)

This dataset is a filtered sample of the Mozilla Common Voice 17.0 corpus, focusing on Swahili (sw)

Common Voice Scripted Speech 26.0 - Cameroon Pidgin

A collection of read speech recordings in Cameroon Pidgin (wes).