Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

Tunisian Arabic ↔ MSA Parallel Corpus

Domaine:

natural language processing

Type de record:

dataset
Créateur:
tun
Hôte:
This is an ambitious project to create a high-quality, reproducible parallel corpus for Modern Standard Arabic (MSA) and Tunisian Arabic (aeb) through a sophisticated synthetic data generation pipeline. The dataset is being developed by the Tunisia.AI community to address the scarcity of high-quality dialectal data for training and evaluating language models.

Visit

huggingface.co

Tasks

machine translation

Languages

Arabic, Tunisian Spoken

Licenses

cc-by-4.0

Similaires

Tunisian Arabic → MSA Synthetic Parallel CorpusTunisian Arabic → MSA Synthetic Parallel CorpusBouajilaHamza/Tunisia-msa-parallel-corpusEgyptian Arabic-English Parallel Corpusmbaye930/wolof-arabic-parallel-corpus

Tunisian Arabic → MSA Synthetic Parallel Corpus

This dataset is a synthetic parallel corpus of Tunisian Arabic (aeb) and Modern Standard Arabic (arb

Tunisian Arabic → MSA Synthetic Parallel Corpus

This dataset is a synthetic parallel corpus of Tunisian Arabic (aeb) and Modern Standard Arabic (arb

BouajilaHamza/Tunisia-msa-parallel-corpus

### Dataset Description This is an ambitious project to create a high-quality, reproducible paralle

Egyptian Arabic-English Parallel Corpus

This dataset is a cleaned and filtered merge of multiple Egyptian Arabic - English parallel corpora,

mbaye930/wolof-arabic-parallel-corpus