Logo Lanfrica
  • Home
  • Atlas
  • Insights
  • Docs
  • Sign in

© 2026 Lanfrica. All rights reserved. All copyrights of the resources shown on the Lanfrica website belong to the original copyright holders, unless explicitly stated otherwise.

anrilombard/mzansi-text-tokenized

Domain:

natural language processing

Record type:

dataset
Creator:
anr
Host:
Ready-to-train tokenized version of MzansiText, chunked to a context length of 2048 tokens. Tokenizer: custom BPE, 65536 vocabulary Chunking: 2048 tokens per example with EOS separators between documentsSchema: { "input_ids": ["int"], "lang": "string" } Split Examples Train 3,943,584 Validation 19,379 Test 19,341 from datasets importload_dataset

Visit

huggingface.co

Tasks

language modeling

Languages

AfrikaansNdebeleSetswanaSotho, NorthernSotho, SouthernSwatiTsongaVendaXhosaZulu

Tags

pretrainingtokenizedsouth-african-languagesmultilingualmzansitext

Licenses

apache-2.0

Similar

anrilombard/mzansi-text

anrilombard/mzansi-text

MzansiText is a curated multilingual pretraining corpus for all eleven official South African langua