Logo Lanfrica
  • Home
  • Atlas
  • Insights
  • Docs
  • Sign in

© 2026 Lanfrica. All rights reserved. All copyrights of the resources shown on the Lanfrica website belong to the original copyright holders, unless explicitly stated otherwise.

Zomi Monolingual Corpus v1.0

Domain:

natural language processing

Record type:

dataset
Creator:
Hon
Publisher:
Zenodo
Host:avatar
A reviewed monolingual corpus of 363,401 Zomi (Tedim Chin, ISO 639-3 ctd) sentences with permanent identifiers and provenance, topic, region, permission, and review metadata. The release contains 354,042 retained sentences from Zomi Daily and 9,359 from Agape Digest Magazine. Written reuse permission and completed review were confirmed by corpus owner Biak Hong on 2026-08-26. Canonical CSV SHA-256: 7c84b835e45fdb26aef8822367dbc698988c5a28bdfd7d992cc50bed011353fd.

Visit

doi.org

Tags

ZomiTedim Chinctdmonolingual corpuslow-resource languagenatural language processing

Licenses

Creative Commons Attribution 4.0 Internationalhttps://creativecommons.org/licenses/by/4.0/legalcodeCopyright (c) 2026 Biak Hong and acknowledged source contributors.http://rightsstatements.org/vocab/InC/1.0/

Similar

Autshumato Monolingual isiXhosa Monolingual corpusAcoli Monolingual CorpusKiswahili Monolingual CorpusLuganda Monolingual CorpusMonolingual isiXhosa corpusMonolingual Siswati Corpus

Autshumato Monolingual isiXhosa Monolingual corpus

Monolingual corpus for isiXhosa. The data is given as a single UTF-8 text file, with each segment on

Acoli Monolingual Corpus

Acoli is a very low-resourced language spoken in parts of Northern Uganda. This dataset contains 40,

Kiswahili Monolingual Corpus

This dataset contains 100,000 Kiswahili sentences. For more information on how the dataset

Luganda Monolingual Corpus

This dataset contains 100,000 Luganda sentences. For more information on how the dataset wa

Monolingual isiXhosa corpus

Monolingual corpus for isiXhosa. The data is given as a single UTF-8 text file, with each segment on

Monolingual Siswati Corpus

Monolingual corpus for SiSwati. The data is given as a single UTF-8 text file, with each segment on