Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

Swahili Words Speech-Text Parallel Dataset

Domaine:

natural language processing

Type de record:

dataset
Créateur:
mic
Hôte:
This dataset contains 411048 parallel speech-text pairs for Swahili, a widely spoken language in East Africa. The dataset consists of audio recordings paired with corresponding text transcriptions, making it suitable for automatic speech recognition (ASR) and text-to-speech (TTS) tasks. Language: Swahili - sw Task: Speech Recognition, Text-to-Speech

Visit

huggingface.co

Tasks

automatic speech recognitionspeech processingtext to speech

Languages

Swahili

Tags

speechswahilieast-africaafrican-languageslow-resourceparallel-corpus

Licenses

cc-by-4.0

Similaires

Twi Words Speech-Text Parallel DatasetKasem Speech-Text Parallel DatasetVai Speech-Text Parallel DatasetGa Speech-Text Parallel DatasetDeg Speech-Text Parallel DatasetVagla Speech-Text Parallel Dataset

Twi Words Speech-Text Parallel Dataset

This dataset contains 413463 parallel speech-text pairs for Twi (Akan), a language spoken primarily

Kasem Speech-Text Parallel Dataset

This dataset contains 75990 parallel speech-text pairs for Kasem, a language spoken primarily in Gha

Vai Speech-Text Parallel Dataset

This dataset contains 23286 parallel speech-text pairs for Vai, a language spoken primarily in Ghana

Ga Speech-Text Parallel Dataset

This dataset is made available because of Ghana NLP's volunteer driven research work. Please conside

Deg Speech-Text Parallel Dataset

This dataset contains 125958 parallel speech-text pairs for Deg, a language spoken primarily in Ghan

Vagla Speech-Text Parallel Dataset

This dataset contains 48605 parallel speech-text pairs for Vagla, a language spoken primarily in Gha