Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

ddd-kenya-somali-68hrs-asr-part1

Domaine:

natural language processing

Type de record:

dataset
Créateur:
Dig
Hôte:
This dataset, curated by Digital Divide Data (DDD), provides high-quality audio recordings and corresponding text transcriptions for the Somali (som) language. The collection includes thousands of unique utterances per language to support diverse acoustic modeling. All transcriptions have undergone a manual verification process to ensure high linguistic accuracy. Recordings feature a balanced mix of genders and various age groups to minimize bias in downstream AI models. This data is specifically designed for training Automatic Speech Recognition (ASR) systems, Text-to-Speech (TTS) synthesis, and general linguistic research for underrepresented African languages.

Visit

mozilladatacollective.com

Tasks

automatic speech recognitionspeech processingtext to speech

Languages

Somali

Tags

mdcmozilla data collectiveASRWAVTSV

Licenses

Creative Commons Attribution 4.0 International (CC-BY-4.0)

Similaires

ddd-kenya-somali-68hrs-asr-part3ddd-kenya-somali-68hrs-asr-part2Odhuso/ddd-kenya-somali-asr-v1DDD-Kenya/Somali-ASR-Subset-68H

ddd-kenya-somali-68hrs-asr-part3

This dataset, curated by Digital Divide Data (DDD), provides high-quality audio recordings and corre

ddd-kenya-somali-68hrs-asr-part2

This dataset, curated by Digital Divide Data (DDD), provides high-quality audio recordings and corre

Odhuso/ddd-kenya-somali-asr-v1

DDD-Kenya/Somali-ASR-Subset-68H