Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

anrilombard/mzansi-text

Domaine:

natural language processing

Type de record:

dataset
Créateur:
anr
Hôte:
MzansiText is a curated multilingual pretraining corpus for all eleven official South African languages. Languages: af, en, nso, sot, ssw, tsn, tso, ven, xho, zul, nbl Schema: { "text": "string", "lang": "string" } This repository contains the raw train, validation, and test text splits used for the MzansiLM pretraining release. The token distribution table below matches the paper-reported corpus statistics.

Visit

huggingface.co

Tasks

language modeling

Languages

AfrikaansNdebeleSetswanaSotho, NorthernSotho, SouthernSwatiTsongaVendaXhosaZulu

Tags

pretrainingsouth-african-languagesmultilingualmzansitextlarge datasets from Lanfrica Insights

Licenses

apache-2.0

Similaires

anrilombard/mzansi-text-tokenized

anrilombard/mzansi-text-tokenized

Ready-to-train tokenized version of MzansiText, chunked to a context length of 2048 tokens. Tokeniz