Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

Somali ASR Synthetic YouTube Dataset

Domaine:

natural language processing

Type de record:

dataset
Créateur:
Ibr
Hôte:
A Somali-language speech dataset derived from YouTube audio, intended for training and evaluating automatic speech recognition (ASR) and speech-to-text (STT) models. Transcriptions were generated synthetically (silver-standard) via ASR bootstrapping. Split Samples train ~4,393 validation 200 test 100 Total ~4,693 Language: Somali (so) Audio format: WAV, 16 kHz, mono, 16-bit PCM

Visit

huggingface.co

Tasks

automatic speech recognitionspeech processing

Languages

Somali

Tags

somaliasrspeechsyntheticyoutubelow-resource

Licenses

cc-by-4.0

Similaires

somali-asr-synthetic-youtubeCLEAR-Global/Chichewa-Synthetic-ASR-DatasetCLEAR-Global/Luo-Synthetic-ASR-DatasetCLEAR-Global/Hausa-Synthetic-ASR-Dataset-XTTSCLEAR-Global/Hausa-Synthetic-ASR-Dataset-YourTTS

somali-asr-synthetic-youtube

CLEAR-Global/Chichewa-Synthetic-ASR-Dataset

Synthetic Chichewa ASR dataset generated using a fine-tuned version of the YourTTS model. Sample ra

CLEAR-Global/Luo-Synthetic-ASR-Dataset

Synthetic Dholuo ASR dataset generated using a fine-tuned version of the YourTTS model. Sample rate

CLEAR-Global/Hausa-Synthetic-ASR-Dataset-XTTS

Synthetic Hausa ASR dataset generated using a fine-tuned version of the XTTS-v2 model. Sample rate:

CLEAR-Global/Hausa-Synthetic-ASR-Dataset-YourTTS

Synthetic Hausa ASR dataset generated using a fine-tuned version of the YourTTS model. Sample rate: