Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

CMU Wilderness Multilingual Speech Dataset

Domaine:

natural language processing

Type de record:

dataset
A dataset of over 700 different languages providing audio, aligned text and word pronunciations. On average each language provides around 20 hours of sentence-lengthed transcriptions. Data is mined from read New Testaments from bible.is

Visit

github.com

Connected records

paper

Tasks

speech translation

Languages

AbidjiAcholiAdeleAdioukrouAkaAkebuAkooseAlurAmazighAnufo+236

Tags

speech alignment

Licenses