Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

Autshumato Monolingual Siswati Corpus

Domaine:

natural language processing

Type de record:

dataset
Créateur:
McKellar, Cindy
Éditeur:
North-West University - Centre for Text Technology (CTexT)
Hôte:avatar
Monolingual corpus for SiSwati. The data is given as a single UTF-8 text file, with each segment on a newline. The dataset contains existing data sourced for the DSAC funded Autshumato project as well as new data sourced for the SADiLaR: Parallel corpora for English into SiSwati project. The data comprises a total of 138, 651 segments with 1,536, 356 SiSwati words.

Visit

hdl.handle.net

Tasks

language modeling

Languages

Swati

Tags

SiSwati, monolingual

Licenses

Creative Commons Attribution 4.0 International

Similaires

Autshumato Monolingual isiXhosa Monolingual corpusMonolingual Siswati CorpusAutshumato Monolingual Xitsonga CorpusAutshumato Monolingual Afrikaans CorpusAutshumato Monolingual isiZulu CorpusAutshumato Monolingual Sepedi Corpus

Autshumato Monolingual isiXhosa Monolingual corpus

Monolingual corpus for isiXhosa. The data is given as a single UTF-8 text file, with each segment on

Monolingual Siswati Corpus

Monolingual corpus for SiSwati. The data is given as a single UTF-8 text file, with each segment on

Autshumato Monolingual Xitsonga Corpus

Monolingual corpus for Xitsonga. The data is given as a single UTF-8 text file, with each segment on

Autshumato Monolingual Afrikaans Corpus

Monolingual corpus for Afrikaans. The data is given as a single UTF-8 text file, with each segment o

Autshumato Monolingual isiZulu Corpus

Monolingual corpus for isiZulu. The data is given as a single UTF-8 text file, with each segment on

Autshumato Monolingual Sepedi Corpus

Monolingual corpus for Sepedi. The data is given as a single UTF-8 text file, with each segment on a