Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

Maneno Yetu: Dynamic Corpus Construction and Pretraining for Swahili NLP

Type de record:

datasetpaper
Créateur:
ChaAlfDiaJum
Éditeur:
ACM
Hôte:

Visit

doi.org

Tasks

language modeling

Languages

Swahili

Similaires

Maneno-Yetu-Project/slfmMollel/Maneno-SwahiliMkulima: A Domain-Specific Swahili Corpus for Agricultural NLP and Information RetrievalMoroccan Darija Pretraining Corpus for NanochatAmharic Pretraining CorpusLyte/darija-pretraining-corpus

Maneno-Yetu-Project/slfm

Swahili Language Foundation Model # slfm Swahili Language Foundation Model

Mollel/Maneno-Swahili

Mkulima: A Domain-Specific Swahili Corpus for Agricultural NLP and Information Retrieval

Mkulima (Swahili for "farmer") is the first large-scale domain-specific Swahili corpus for agricultu

Moroccan Darija Pretraining Corpus for Nanochat

Parquet shards prepared for nanochat pretraining. 83 train shards 1 validation shard 82,738,910 tra

Amharic Pretraining Corpus

Amharic Pretraining Corpus is a large-scale dataset (~103M) for general amharic language pretraining

Lyte/darija-pretraining-corpus