Logo Lanfrica
  • Home
  • Atlas
  • Insights
  • Docs
  • Sign in

© 2026 Lanfrica. All rights reserved. All copyrights of the resources shown on the Lanfrica website belong to the original copyright holders, unless explicitly stated otherwise.

Autshumato Monolingual English Corpus

Domain:

natural language processing

Record type:

dataset
Creator:
McKeller, Cindy
Editor:
Gaustad Van Zaanen, TanjaPuttkammer, MartinGent, Sunny
Publisher:
CTexT® (Centre for Text Technology, North-West University)
Host:avatar
Monolingual corpus for South African English. The data is given as a single UTF-8 text file, with each segment on a newline. The data was specifically selected and formatted for use in the training of machine translation systems. Further clean-up and processing might be required depending on the task the data is reused for.

Visit

hdl.handle.net

Tasks

machine translation

Tags

Autshumato;English

Licenses

Creative Commons Attribution 4.0 International (CC-BY 4.0): https://www.creativecommons.org/licenses/by/4.0/

Similar

Autshumato Monolingual isiXhosa Monolingual corpusAutshumato Monolingual Tshivenḓa CorpusAutshumato Monolingual Sesotho CorpusAutshumato Monolingual Sepedi CorpusAutshumato Monolingual isiZulu CorpusAutshumato Monolingual Setswana Corpus

Autshumato Monolingual isiXhosa Monolingual corpus

Monolingual corpus for isiXhosa. The data is given as a single UTF-8 text file, with each segment on

Autshumato Monolingual Tshivenḓa Corpus

Monolingual corpus for Tshivenḓa. The data is given as a single UTF-8 text file, with each segment o

Autshumato Monolingual Sesotho Corpus

Monolingual corpus for Sesotho. The data is given as a single UTF-8 text file, with each segment on

Autshumato Monolingual Sepedi Corpus

Monolingual corpus for Sepedi. The data is given as a single UTF-8 text file, with each segment on a

Autshumato Monolingual isiZulu Corpus

Monolingual corpus for isiZulu. The data is given as a single UTF-8 text file, with each segment on

Autshumato Monolingual Setswana Corpus

Monolingual corpus for Setswana. The data is given as a single UTF-8 text file, with each segment on