Logo Lanfrica
  • Home
  • Atlas
  • Insights
  • Docs
  • Sign in

© 2026 Lanfrica. All rights reserved. All copyrights of the resources shown on the Lanfrica website belong to the original copyright holders, unless explicitly stated otherwise.

Kiswahili Monolingual Corpus

Domain:

natural language processing

Record type:

dataset
Creator:
Tusubira, JeremyBabirye, ClaireMukiibi, JonathanBateesa, Tobias
Publisher:
Zenodo
Host:avatar

This dataset contains 100,000 Kiswahili sentences. For more information on how the dataset was created, please check out our paper published at AfricaNLP. We want to thank the team at the Makerere AI and Marconi Labs at Makerere University, TAVODET Youth Development (TYD) Innovation Incubator, Ai Kenya, Maseno University, United States International University-Africa (USIU-Africa), and Kabarak University who have worked tirelessly and collaboratively to source, create and prepare this Kiswahili monolingual dataset. This dataset was created with support from Lacuna Fund, an initiative cofounded by The Rockefeller Foundation, Google.org, and Canada’s International Development Research Centre; Deutsche Gesellschaft fur Internationale ¨ Zusammenarbeit (GIZ) and Mozilla.

Visit

doi.org

Tasks

language modeling

Languages

SwahiliSwahili, CoastalSwahili, Congo

Tags

SwahiliKiswahili

Licenses

info:eu-repo/semantics/openAccessCreative Commons Attribution 4.0 Internationalhttps://creativecommons.org/licenses/by/4.0/legalcode

Similar

Autshumato Monolingual isiXhosa Monolingual corpusMonolingual isiXhosa corpusAcoli Monolingual CorpusLumasaba Monolingual CorpusMonolingual Siswati CorpusLuganda Monolingual Corpus

Autshumato Monolingual isiXhosa Monolingual corpus

Monolingual corpus for isiXhosa. The data is given as a single UTF-8 text file, with each segment on

Monolingual isiXhosa corpus

Monolingual corpus for isiXhosa. The data is given as a single UTF-8 text file, with each segment on

Acoli Monolingual Corpus

Acoli is a very low-resourced language spoken in parts of Northern Uganda. This dataset contains 40,

Lumasaba Monolingual Corpus

Lumasaba sometimes known as Lugisu is a Bantu language spoken in the Eastern part of Uganda. This da

Monolingual Siswati Corpus

Monolingual corpus for SiSwati. The data is given as a single UTF-8 text file, with each segment on

Luganda Monolingual Corpus

This dataset contains 100,000 Luganda sentences. For more information on how the dataset wa