Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

LughaGen Multilingual African Language Corpus

Domaine:

natural language processing

Type de record:

dataset
Créateur:
Lug
Hôte:
LughaGen is a curated multilingual corpus for four Kenyan and East African languages: Swahili (sw), Kikuyu (ki), Kamba (kam), and Luo/Dholuo (luo). It was developed as part of the LughaGen research initiative under JHUB Africa, funded by NVIDIA, with the goal of building large language models for low-resource African languages.

Visit

huggingface.co

Tasks

language modeling

Languages

DholuoGikuyuKambaSwahili

Tags

african-languageslow-resourcekenyapretrainingcorpuslughaGenjhub-africanvidia-funded

Licenses

cc-by-sa-4.0

Similaires

WAXAL: A Large-Scale Multilingual African Language Speech CorpusAfrican Multilingual Text CorpusThe Vuk'uzenzele South African Multilingual CorpusThe Vuk'uzenzele South African Multilingual CorpusThe Gov South African Multilingual CorpusThe Vuk'uzenzele South African Multilingual Corpus

WAXAL: A Large-Scale Multilingual African Language Speech Corpus

The advancement of speech technology has predominantly favored high-resource languages, creating a significant digital divide for speakers of most Sub-Saharan African languages. To address this gap, we introduce WAXAL, a large-scale, openly accessible speech datase

African Multilingual Text Corpus

NLP model training, translation Notes / challenges: Unequal language representation

The Vuk'uzenzele South African Multilingual Corpus

The dataset contains editions from the South African government magazine Vuk'uzenzele. Data was scraped from PDFs that have been placed in the data/raw folder. The PDFS were obtatined from the Vuk'uzenzele website (https://www.vukuzenzele.gov.za/). The datasets co

The Vuk'uzenzele South African Multilingual Corpus

Github: https://github.com/dsfsi/vukuzenzele-nlp/ Zenodo: Arxiv Preprint: Give Feedback 📑: DSFSI Res

The Gov South African Multilingual Corpus

The data set contains cabinet statements from the South African government, maintained by the Govern

The Vuk'uzenzele South African Multilingual Corpus

Give Feedback 📑: DSFSI Resource Feedback Form The dataset was obtained from the South African gover