Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

Kiswahili Monolingual Corpus

Domaine:

natural language processing

Type de record:

dataset
Créateur:
Tusubira, JeremyBabirye, ClaireMukiibi, JonathanBateesa, Tobias
Éditeur:
Zenodo
Hôte:avatar

This dataset contains 100,000 Kiswahili sentences. For more information on how the dataset was created, please check out our paper published at AfricaNLP. We want to thank the team at the Makerere AI and Marconi Labs at Makerere University, TAVODET Youth Development (TYD) Innovation Incubator, Ai Kenya, Maseno University, United States International University-Africa (USIU-Africa), and Kabarak University who have worked tirelessly and collaboratively to source, create and prepare this Kiswahili monolingual dataset. This dataset was created with support from Lacuna Fund, an initiative cofounded by The Rockefeller Foundation, Google.org, and Canada’s International Development Research Centre; Deutsche Gesellschaft fur Internationale ¨ Zusammenarbeit (GIZ) and Mozilla.

Visit

doi.org

Tasks

language modeling

Languages

SwahiliSwahili, CoastalSwahili, Congo

Tags

SwahiliKiswahili

Licenses

info:eu-repo/semantics/openAccessCreative Commons Attribution 4.0 Internationalhttps://creativecommons.org/licenses/by/4.0/legalcode

Similaires

Autshumato Monolingual isiXhosa Monolingual corpusMonolingual isiXhosa corpusAcoli Monolingual CorpusLumasaba Monolingual CorpusMonolingual Siswati CorpusLuganda Monolingual Corpus

Autshumato Monolingual isiXhosa Monolingual corpus

Monolingual corpus for isiXhosa. The data is given as a single UTF-8 text file, with each segment on

Monolingual isiXhosa corpus

Monolingual corpus for isiXhosa. The data is given as a single UTF-8 text file, with each segment on

Acoli Monolingual Corpus

Acoli is a very low-resourced language spoken in parts of Northern Uganda. This dataset contains 40,

Lumasaba Monolingual Corpus

Lumasaba sometimes known as Lugisu is a Bantu language spoken in the Eastern part of Uganda. This da

Monolingual Siswati Corpus

Monolingual corpus for SiSwati. The data is given as a single UTF-8 text file, with each segment on

Luganda Monolingual Corpus

This dataset contains 100,000 Luganda sentences. For more information on how the dataset wa