Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

Swahili Corpus Dataset

Domaine:

natural language processing

Type de record:

dataset
Créateur:
ngu
Hôte:
A large-scale Swahili text corpus for language model pretraining and NLP research. The Swahili Corpus Dataset is a large-scale collection of Swahili (Kiswahili) text designed to support Natural Language Processing (NLP) research and the development of large language models (LLMs) for a low-resource African language.

Visit

huggingface.co

Tasks

language modeling

Languages

SwahiliSwahili, CoastalSwahili, Congo

Tags

swahilikiswahiliafricalow-resource-languagellm-pretrainingtext-corpus

Licenses

apache-2.0

Similaires

Swahili Corpus DatasetSwahili CorpusSwahili CorpusSwahili CorpusSwahili News Corpusnavilindo/swahili-corpus

Swahili Corpus Dataset

Swahili Corpus

The repository contains several text files each corresponding to categories of Swahili textual conte

Swahili Corpus

This is a Swahili corpus obtained from CC-100: Monolingual Datasets from Web Crawl Data

Swahili Corpus

Swahili News Corpus

Language modeling, topic classification, AI training for Swahili NLP, digital literacy tools Notes

navilindo/swahili-corpus