Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

afri-fertility: African Language Tokenization Measurement Results

Domaine:

natural language processing

Type de record:

dataset
Créateur:
Cip
Hôte:
Measurement dataset for The African Language Tax — the first systematic audit of the subword tokenization penalty imposed on African languages by frontier large language models. Every row is one (language, tokenizer, corpus) triple, with fertility, English-relative premium, and confidence intervals computed from a parallel corpus using sum-then-divide aggregation. Property Value

Visit

huggingface.co

Tasks

language modeling

Languages

AfrikaansAkanAmharicBamanankanGandaHausaIgboKinyarwandaLingalaN’ko+10

Tags

tokenizationafrican-languagesnlpsubword-fertilityllmmultilingualai-equity

Licenses

apache-2.0