Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

Autshumato Monolingual Sepedi Corpus

Domaine:

natural language processing

Type de record:

dataset
Créateur:
McKellar, Cindy
Éditeur:
Gaustad Van Zaanen, TanjaPuttkammer, MartinGent, Sunny
Éditeur:
CTexT® (Centre for Text Technology, North-West University)
Hôte:avatar
Monolingual corpus for Sepedi. The data is given as a single UTF-8 text file, with each segment on a newline. The data was specifically selected and formatted for use in the training of machine translation systems. Further clean-up and processing might be required depending on the task the data is reused for.

Visit

hdl.handle.net

Tasks

machine translation

Languages

Sotho, Northern

Tags

AutshumatoSepedi

Licenses

Creative Commons Attribution 4.0 International

Similaires

Autshumato Monolingual isiXhosa Monolingual corpusAutshumato Monolingual isiNdebele CorpusAutshumato Monolingual English CorpusAutshumato Monolingual Tshivenḓa CorpusAutshumato Monolingual Sesotho CorpusAutshumato Monolingual isiZulu Corpus

Autshumato Monolingual isiXhosa Monolingual corpus

Monolingual corpus for isiXhosa. The data is given as a single UTF-8 text file, with each segment on

Autshumato Monolingual isiNdebele Corpus

Monolingual corpus for isiNdebele. The data is given as a single UTF-8 text file, with each segment

Autshumato Monolingual English Corpus

Monolingual corpus for South African English. The data is given as a single UTF-8 text file, with ea

Autshumato Monolingual Tshivenḓa Corpus

Monolingual corpus for Tshivenḓa. The data is given as a single UTF-8 text file, with each segment o

Autshumato Monolingual Sesotho Corpus

Monolingual corpus for Sesotho. The data is given as a single UTF-8 text file, with each segment on

Autshumato Monolingual isiZulu Corpus

Monolingual corpus for isiZulu. The data is given as a single UTF-8 text file, with each segment on