Logo Lanfrica
  • Home
  • Atlas
  • Insights
  • Docs
  • Sign in

© 2026 Lanfrica. All rights reserved. All copyrights of the resources shown on the Lanfrica website belong to the original copyright holders, unless explicitly stated otherwise.

Swahili Corpus

Domain:

natural language processing

Record type:

dataset
Creator:
Mas
Editor:
Mas
Publisher:
Men
Host:avatar
The repository contains several text files each corresponding to categories of Swahili textual contents. The categories are Health (AFYA), Education (ELIMU), Government (SERIKALI), Parliament (BUNGE), Religion (DINI), Non-Governmental Organizations (NGOs) (MASHIRIKA YA KIRAIA), Social Media (MITANDAO YA KIJAMII), and Politics (SIASA).

Visit

doi.orgdata.mendeley.com

Languages

Swahili

Tags

Natural Language ProcessingMachine LearningSwahili LanguageText ProcessingCorpus Analysis

Licenses

info:eu-repo/semantics/openAccessCreative Commons Attribution 4.0 Internationalhttps://creativecommons.org/licenses/by/4.0/legalcode

Similar

Swahili CorpusSwahili CorpusSwahili News CorpusSwahili Corpus DatasetSwahili Corpus Datasetnavilindo/swahili-corpus

Swahili Corpus

This is a Swahili corpus obtained from CC-100: Monolingual Datasets from Web Crawl Data

Swahili Corpus

Swahili News Corpus

Language modeling, topic classification, AI training for Swahili NLP, digital literacy tools Notes

Swahili Corpus Dataset

Swahili Corpus Dataset

A large-scale Swahili text corpus for language model pretraining and NLP research. The Swahili Corpu

navilindo/swahili-corpus