Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

Autshumato Xitsonga Monolingual Corpora

Domaine:

natural language processing

Type de record:

dataset
Créateur:
Wikus PienaarWildrich FourieCindy McKellar
Éditeur:
North-West UniversityCentre for Text Technology (CTexT)
Hôte:avatar
Xitsonga monolingual corpus as deliverable of the Autshumato project. The data is given as a UTF-8 text file; with each sentence on a newline. NOTE: There is a newer version for an English-Xitsonga Monolingual Corpus. See Autshumato Monolingual Xits…

Visit

hdl.handle.net

Languages

Tsonga

Licenses

Creative Commons Attribution 2.5 South Africa License: http://creativecommons.org/licenses/by/2.5/za/legalcode

Similaires

Autshumato Monolingual Xitsonga CorpusAutshumato Setswana Monolingual CorporaAutshumato English-Xitsonga Parallel CorporaAutshumato English-Xitsonga Manually Translated Parallel CorporaAutshumato Monolingual isiXhosa Monolingual corpusAutshumato Monolingual Sepedi Corpus

Autshumato Monolingual Xitsonga Corpus

Monolingual corpus for Xitsonga. The data is given as a single UTF-8 text file, with each segment on

Autshumato Setswana Monolingual Corpora

Setswana monolingual corpus as a deliverable of the Autshumato project. The data is given as a UTF-8

Autshumato English-Xitsonga Parallel Corpora

Aligned English-Xitsonga parallel corpus. The data is given as two seperate UTF-8 text files; with e

Autshumato English-Xitsonga Manually Translated Parallel Corpora

Aligned English-Xitsonga parallel corpus. The data is given as two seperate UTF-8 text files; with e

Autshumato Monolingual isiXhosa Monolingual corpus

Monolingual corpus for isiXhosa. The data is given as a single UTF-8 text file, with each segment on

Autshumato Monolingual Sepedi Corpus

Monolingual corpus for Sepedi. The data is given as a single UTF-8 text file, with each segment on a