Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

anrilombard/mzansi-text-tokenized

Domaine:

natural language processing

Type de record:

dataset
Créateur:
anr
Hôte:
Ready-to-train tokenized version of MzansiText, chunked to a context length of 2048 tokens. Tokenizer: custom BPE, 65536 vocabulary Chunking: 2048 tokens per example with EOS separators between documentsSchema: { "input_ids": ["int"], "lang": "string" } Split Examples Train 3,943,584 Validation 19,379 Test 19,341 from datasets importload_dataset

Visit

huggingface.co

Tasks

language modeling

Languages

AfrikaansNdebeleSetswanaSotho, NorthernSotho, SouthernSwatiTsongaVendaXhosaZulu

Tags

pretrainingtokenizedsouth-african-languagesmultilingualmzansitext

Licenses

apache-2.0

Similaires

anrilombard/mzansi-text

anrilombard/mzansi-text

MzansiText is a curated multilingual pretraining corpus for all eleven official South African langua