Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

Africa Corpus

Domaine:

natural language processing

Type de record:

dataset
Créateur:
mic
Hôte:
Verse-aligned text for 792+ African languages, plus several world languages, for building parallel and monolingual corpora. Every language is aligned on a shared verse key, so any two languages can be joined into a parallel corpus: African ↔ English (English is the default pair) African ↔ African (e.g. Twi ↔ Yoruba, Hausa ↔ Amharic) African ↔ other language (French, Arabic, Chinese, Portuguese) Monolingual corpus for any single language

Visit

huggingface.co

Tasks

machine translation

Languages

AfrikaansAmharicChichewaGandaHausaIgboKinyarwandaLingalaMalagasyOromo+12

Tags

africaafrican-languageslow-resourceparallel-corpusmachine-translationbible

Licenses

other