Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

akahana/wikipedia-full

Domaine:

natural language processing

Type de record:

dataset
Créateur:
aka
Hôte:
Wikipedia dataset containing cleaned articles of all languages. The dataset is built from the Wikipedia dumps (Wikipedia) with one subset per language, each containing a single train split. Each example contains the content of one full Wikipedia article with cleaning to strip markdown and unwanted sections (references, etc.).

Visit

huggingface.co

Languages

AfrikaansAmazighAmharicArabic, Egyptian SpokenArabic, Moroccan SpokenBamanankanChichewaDagaare, SouthernDagbaniÉwé+38

Licenses

cc-by-sa-3.0gfdl

Similaires

AFRICAN LANGUAGES IN WIKIPEDIA – A GLASS HALF FULL OR HALF EMPTY?Wikipedia: wikipedia-af (Afrikaans)Somaliska Wikipedia Somali WikipediaWikipediaWikipediaWikipedia

AFRICAN LANGUAGES IN WIKIPEDIA – A GLASS HALF FULL OR HALF EMPTY?

Wikipedia: wikipedia-af (Afrikaans)

Wikipedia is a multilingual, web-based, free-content encyclopedia project supported by the Wikimedia

Somaliska Wikipedia Somali Wikipedia

Korpus av somaliska Wikipedia Corpus of Somali Wikipedia

Wikipedia

Wikipedia dataset containing cleaned articles of all languages. The datasets are built from the Wikipedia dump (https://dumps.wikimedia.org/) with one split per language. Each example contains the content of one full Wikipedia article with cleaning to strip markdow

Wikipedia

Wikipedia dataset containing cleaned articles of all languages. The datasets are built from the Wiki

Wikipedia

Wikipedia dataset containing cleaned articles of all languages. The datasets are built from the Wiki