Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

castorini/wura

Domaine:

natural language processing

Type de record:

dataset
Créateur:
cas
Hôte:
WURA is a document-level dataset covering 16 African Languages and 4 high-resource languages widely spoken in Africa (English, French, Arabic and Portuguese). This dataset was created by auditing mC4 and crawling additional verified news sources. It was first used to train AfriTeVa V2. >>> from datasets import load_dataset

Visit

huggingface.co

Languages

AfrikaansAmharicArabic, Egyptian SpokenChichewaHausaIgboKinyarwandaMalagasyOromoShona+7

Tags

large datasets from Lanfrica Insights

Licenses

apache-2.0

Similaires

llama-lang-adapt/wuracastorini/africlirmatrixcastorini/afribertacastorini/afritevacastorini/africlirmatrixcastorini/afriberta-corpus

llama-lang-adapt/wura

A copy of the WURA dataset (V2 Passages). langs = { "Afrikaans": "af", "Amharic": "am", "Egyptian Ar

castorini/africlirmatrix

AfriCLIRMatrix is a test collection for cross-lingual information retrieval research in 15 diverse A

castorini/afriberta

AfriBERTa: Exploring the Viability of Pretrained Multilingual Language Models for Low-resourced Lang

castorini/afriteva

Text - 2 - Text for African languages # AfriTeVa: Extending “Small Data” Pretraining Approaches to

castorini/africlirmatrix

AfriCLIRMatrix is a test collection for cross-lingual information retrieval research in 15 diverse A

castorini/afriberta-corpus

Corpus used for training AfriBERTa models