Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

SimbaMaw1547/south-african-monolingual-corpora-jsonl

Domaine:

natural language processing

Type de record:

dataset
Créateur:
Sim
Hôte:
This dataset contains pretraining text data for 9 South African languages, compiled from multiple sources including CC100, Glot500, mC4, ParaCrawl, and various corpora collections. The datasets were gathered as part of the University of Cape Town's SALLM project. Where data was gathered from multiple sources, extensive filtering and deduplication was conducted to ensure dataset integrity Languages Included

Visit

huggingface.co

Tasks

language modeling

Similaires

SimbaMaw1547/south-african-finetuningAutshumato Setswana Monolingual CorporaAutshumato Xitsonga Monolingual Corpora11_Corpus_Contenu_BurkinaFaso405.jsonlOn Using Monolingual Corpora in Neural Machine TranslationUnsupervised Cross-Lingual Part-of-Speech Tagging with Monolingual Corpora Only

SimbaMaw1547/south-african-finetuning

This dataset collection contains various NLP tasks for South African languages, organized by task an

Autshumato Setswana Monolingual Corpora

Setswana monolingual corpus as a deliverable of the Autshumato project. The data is given as a UTF-8

Autshumato Xitsonga Monolingual Corpora

Xitsonga monolingual corpus as deliverable of the Autshumato project. The data is given as a UTF-8 t

11_Corpus_Contenu_BurkinaFaso405.jsonl

Contenu des articles de presse ('texte'), y compris leurs titres, et l’identifiant unique ('id') cor

On Using Monolingual Corpora in Neural Machine Translation

Recent work on end-to-end neural network-based architectures for machine translation has shown promi

Unsupervised Cross-Lingual Part-of-Speech Tagging with Monolingual Corpora Only

Due to the scarcity of part-of-speech annotated data, existing studies on low-resource languages typ