Logo Lanfrica
  • Home
  • Atlas
  • Insights
  • Docs
  • Sign in

© 2026 Lanfrica. All rights reserved. All copyrights of the resources shown on the Lanfrica website belong to the original copyright holders, unless explicitly stated otherwise.

Somali ASR Synthetic YouTube Dataset

Domain:

natural language processing

Record type:

dataset
Creator:
Ibr
Host:
A Somali-language speech dataset derived from YouTube audio, intended for training and evaluating automatic speech recognition (ASR) and speech-to-text (STT) models. Transcriptions were generated synthetically (silver-standard) via ASR bootstrapping. Split Samples train ~4,393 validation 200 test 100 Total ~4,693 Language: Somali (so) Audio format: WAV, 16 kHz, mono, 16-bit PCM

Visit

huggingface.co

Tasks

automatic speech recognitionspeech processing

Languages

Somali

Tags

somaliasrspeechsyntheticyoutubelow-resource

Licenses

cc-by-4.0

Similar

somali-asr-synthetic-youtubeCLEAR-Global/Chichewa-Synthetic-ASR-DatasetCLEAR-Global/Luo-Synthetic-ASR-DatasetCLEAR-Global/Hausa-Synthetic-ASR-Dataset-XTTSCLEAR-Global/Hausa-Synthetic-ASR-Dataset-YourTTS

somali-asr-synthetic-youtube

CLEAR-Global/Chichewa-Synthetic-ASR-Dataset

Synthetic Chichewa ASR dataset generated using a fine-tuned version of the YourTTS model. Sample ra

CLEAR-Global/Luo-Synthetic-ASR-Dataset

Synthetic Dholuo ASR dataset generated using a fine-tuned version of the YourTTS model. Sample rate

CLEAR-Global/Hausa-Synthetic-ASR-Dataset-XTTS

Synthetic Hausa ASR dataset generated using a fine-tuned version of the XTTS-v2 model. Sample rate:

CLEAR-Global/Hausa-Synthetic-ASR-Dataset-YourTTS

Synthetic Hausa ASR dataset generated using a fine-tuned version of the YourTTS model. Sample rate: