Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

Swahili Large Corpus (v1)

Domaine:

natural language processing

Type de record:

dataset
Créateur:
Ale
Hôte:
The Swahili Large Corpus (v1) is one of the largest and most diverse open pretraining datasets for the Swahili language. It was engineered for training compute-optimal large language models (LLMs), combining multiple high-quality Swahili and multilingual sources into a single, rigorously deduplicated Parquet dataset. Following Chinchilla scaling laws (D = 20N), this corpus is ideally suited for training

Visit

huggingface.co

Tasks

language modeling

Languages

Swahili

Tags

swahilipretrainingnlpafrican-languages

Licenses

other

Similaires

Swahili Large Corpus MiniSomali Web Corpus V1codeshujaaa/swahili-model-V1Swahili Translation Exposure v1datawise-africa/sheria-corpus-v1dialectra-hausa-speech-corpus-v1

Swahili Large Corpus Mini

This dataset contains high quality Swahili conversations from active Swahili forums. The discussions

Somali Web Corpus V1

This dataset consists of clean, structured, and filtered Somali language text compiled from various

codeshujaaa/swahili-model-V1

Swahili Translation Exposure v1

nileagi/swahili-translation-exposure-v1 This dataset contains aligned English-Swahili sentence pair

datawise-africa/sheria-corpus-v1

The Sheria Corpus v1 is a curated collection of Kenyan legal case summaries from both the High Court

dialectra-hausa-speech-corpus-v1

This dataset card aims to be a base template for new datasets. It has been generated using this raw