Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

Swahili Corpus

Domaine:

natural language processing

Type de record:

dataset
Créateur:
Mas
Éditeur:
Mas
Éditeur:
Men
Hôte:avatar
The repository contains several text files each corresponding to categories of Swahili textual contents. The categories are Health (AFYA), Education (ELIMU), Government (SERIKALI), Parliament (BUNGE), Religion (DINI), Non-Governmental Organizations (NGOs) (MASHIRIKA YA KIRAIA), Social Media (MITANDAO YA KIJAMII), and Politics (SIASA).

Visit

doi.orgdata.mendeley.com

Languages

Swahili

Tags

Natural Language ProcessingMachine LearningSwahili LanguageText ProcessingCorpus Analysis

Licenses

info:eu-repo/semantics/openAccessCreative Commons Attribution 4.0 Internationalhttps://creativecommons.org/licenses/by/4.0/legalcode

Similaires

Swahili CorpusSwahili CorpusSwahili News CorpusSwahili Corpus DatasetSwahili Corpus Datasetnavilindo/swahili-corpus

Swahili Corpus

This is a Swahili corpus obtained from CC-100: Monolingual Datasets from Web Crawl Data

Swahili Corpus

Swahili News Corpus

Language modeling, topic classification, AI training for Swahili NLP, digital literacy tools Notes

Swahili Corpus Dataset

Swahili Corpus Dataset

A large-scale Swahili text corpus for language model pretraining and NLP research. The Swahili Corpu

navilindo/swahili-corpus