Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

BabyLM-community/babylm-afr

Domaine:

natural language processing

Type de record:

dataset
Créateur:
Bab
Hôte:
This dataset is part of the BabyLM multilingual collection. Language: afr Script: Latin Number of Documents: 96599 Total Tokens: 9314216 child-books: 153914 tokens child-directed-speech: 240864 tokens educational: 116380 tokens padding-wikipedia: 7487317 tokens qed: 464009 tokens subtitles: 851732 tokens text: The document text

Visit

huggingface.co

Tasks

language modeling

Languages

Afrikaans

Licenses

unknown

Similaires

BabyLM-community/babylm-zulBabyLM-community/babylm-xhoBabyLM-community/babylm-sotBabyLM-community/babylm-nsoBabyLM-community/babylm-af-subtitles

BabyLM-community/babylm-zul

This dataset is part of the BabyLM multilingual collection. Language: zul Script: Latin Number of D

BabyLM-community/babylm-xho

This dataset is part of the BabyLM multilingual collection. Language: xho Script: Latin Number of D

BabyLM-community/babylm-sot

This dataset is part of the BabyLM multilingual collection. Language: sot Script: Latin Number of D

BabyLM-community/babylm-nso

This dataset is part of the BabyLM multilingual collection. Language: nso Script: Latin Number of D

BabyLM-community/babylm-af-subtitles

This dataset is part of the BabyLM multilingual collection. Language: af Script: Latin Category: su