Logo Lanfrica
  • Home
  • Atlas
  • Insights
  • Docs
  • Sign in

© 2026 Lanfrica. All rights reserved. All copyrights of the resources shown on the Lanfrica website belong to the original copyright holders, unless explicitly stated otherwise.

Autshumato Monolingual isiXhosa Monolingual corpus

Domain:

natural language processing

Record type:

dataset
Creator:
McKellar, Cindy
Publisher:
North-West University - Centre for Text Technology (CTexT)
Host:avatar
Monolingual corpus for isiXhosa. The data is given as a single UTF-8 text file, with each segment on a newline. The dataset contains existing data sourced for the DAC funded Autshumato project as well as new data sourced for the SADiLaR: Parallel corpora for English into isiXhosa project. NOTE: Version 2.0 has been processed in the same way as the other Autshumato resources. Content: 341,330 Segments; 4,328,245 XH Words

Visit

hdl.handle.net

Languages

Xhosa

Tags

monolingual corpora, isiXhosa, Machine translation

Licenses

Creative Commons Attribution 4.0 International: http://creativecommons.org/licenses/by/4.0/

Similar

Autshumato Monolingual English CorpusAutshumato Monolingual Tshivenḓa CorpusAutshumato Monolingual Afrikaans CorpusAutshumato Monolingual isiNdebele CorpusAutshumato Monolingual isiZulu CorpusAutshumato Monolingual Sesotho Corpus

Autshumato Monolingual English Corpus

Monolingual corpus for South African English. The data is given as a single UTF-8 text file, with ea

Autshumato Monolingual Tshivenḓa Corpus

Monolingual corpus for Tshivenḓa. The data is given as a single UTF-8 text file, with each segment o

Autshumato Monolingual Afrikaans Corpus

Monolingual corpus for Afrikaans. The data is given as a single UTF-8 text file, with each segment o

Autshumato Monolingual isiNdebele Corpus

Monolingual corpus for isiNdebele. The data is given as a single UTF-8 text file, with each segment

Autshumato Monolingual isiZulu Corpus

Monolingual corpus for isiZulu. The data is given as a single UTF-8 text file, with each segment on

Autshumato Monolingual Sesotho Corpus

Monolingual corpus for Sesotho. The data is given as a single UTF-8 text file, with each segment on