Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

Awal Tamazight Dataset

Domaine:

natural language processing

Type de record:

dataset
Hôte:
This dataset is a compilation of Tamazight (zgh) language resources created by CIEMEN as part of the Awal project (awaldigital.org), with funding from the Municipality of Barcelona and the Government of Catalonia. It includes 1,002 monolingual sentences from a Tamazight language learning material, and over 417,000 parallel sentence pairs spanning multiple language pairs: English–Tamazight, French–Tamazight, Catalan–Tamazight, Spanish–Tamazight, and Arabic–Tamazight. Parallel data comes from community contributions to the Awal platform, Tatoeba sentence pairs transliterated into Tifinagh script, Tamazight proverbs, web localization strings (Mozilla Common Voice, Awal platform), and segmented document translations. The dataset totals approximately 4.6 million words across all files.

Visit

mozilladatacollective.com

Tasks

machine translation

Languages

AmazighBerberGhomaraSenhaja BerberTamazight, Central AtlasTamazight, Standard MoroccanTarifit

Tags

mdcmozilla data collectiveLMTSVJSONTXT

Licenses

Creative Commons Attribution 4.0 International (CC-BY-4.0)