Logo Lanfrica
  • Home
  • Atlas
  • Insights
  • Docs
  • Sign in

© 2026 Lanfrica. All rights reserved. All copyrights of the resources shown on the Lanfrica website belong to the original copyright holders, unless explicitly stated otherwise.

neh7777/Pretraining-V1

Domain:

natural language processing

Record type:

dataset
Creator:
neh
Host:
A large-scale, unified collection of speech data for text-to-speech (TTS) and speech research. This dataset consolidates 17 distinct source datasets into a single, schema-normalized resource covering Indian / South Asian languages, plus major European, African, MENA, and Central Asian languages, with over 13.7 million utterances and 26,000+ hours of audio.

Visit

huggingface.co

Tasks

speech processingtext to speech

Tags

indicindian-languagesttsspeechaudiomultilingualuyghurarabiceuropean-languages

Licenses

cc-by-4.0

Similar

Amharic Pretraining CorpusLyte/darija-pretraining-corpusChallengerSpaceShuttle/zulu-pretraining-datasetTigrinya Raw Pretraining SourcesMoroccan Darija Pretraining Corpus for NanochatAhmedH005/Al-Atlas-Moroccan-Darija-Pretraining

Amharic Pretraining Corpus

Amharic Pretraining Corpus is a large-scale dataset (~103M) for general amharic language pretraining

Lyte/darija-pretraining-corpus

ChallengerSpaceShuttle/zulu-pretraining-dataset

This is IsiZulu Pretraining Dataset. The dataset was used to pre-train BafoGPT-3B Books: Zulu-Englis

Tigrinya Raw Pretraining Sources

This repository contains raw files collected from publicly available Tigrinya datasets. These files

Moroccan Darija Pretraining Corpus for Nanochat

Parquet shards prepared for nanochat pretraining. 83 train shards 1 validation shard 82,738,910 tra

AhmedH005/Al-Atlas-Moroccan-Darija-Pretraining

Pretraining code and dataset analysis for the Al-Atlas family of open-source LLMs trained on authent