Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

Zomi Monolingual Corpus v1.0

Domaine:

natural language processing

Type de record:

dataset
Créateur:
Hon
Éditeur:
Zenodo
Hôte:avatar
A reviewed monolingual corpus of 363,401 Zomi (Tedim Chin, ISO 639-3 ctd) sentences with permanent identifiers and provenance, topic, region, permission, and review metadata. The release contains 354,042 retained sentences from Zomi Daily and 9,359 from Agape Digest Magazine. Written reuse permission and completed review were confirmed by corpus owner Biak Hong on 2026-08-26. Canonical CSV SHA-256: 7c84b835e45fdb26aef8822367dbc698988c5a28bdfd7d992cc50bed011353fd.

Visit

doi.org

Tags

ZomiTedim Chinctdmonolingual corpuslow-resource languagenatural language processing

Licenses

Creative Commons Attribution 4.0 Internationalhttps://creativecommons.org/licenses/by/4.0/legalcodeCopyright (c) 2026 Biak Hong and acknowledged source contributors.http://rightsstatements.org/vocab/InC/1.0/

Similaires

Autshumato Monolingual isiXhosa Monolingual corpusAcoli Monolingual CorpusKiswahili Monolingual CorpusLuganda Monolingual CorpusMonolingual isiXhosa corpusMonolingual Siswati Corpus

Autshumato Monolingual isiXhosa Monolingual corpus

Monolingual corpus for isiXhosa. The data is given as a single UTF-8 text file, with each segment on

Acoli Monolingual Corpus

Acoli is a very low-resourced language spoken in parts of Northern Uganda. This dataset contains 40,

Kiswahili Monolingual Corpus

This dataset contains 100,000 Kiswahili sentences. For more information on how the dataset

Luganda Monolingual Corpus

This dataset contains 100,000 Luganda sentences. For more information on how the dataset wa

Monolingual isiXhosa corpus

Monolingual corpus for isiXhosa. The data is given as a single UTF-8 text file, with each segment on

Monolingual Siswati Corpus

Monolingual corpus for SiSwati. The data is given as a single UTF-8 text file, with each segment on