Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

Tunisian Arabic → MSA Synthetic Parallel Corpus

Domaine:

natural language processing

Type de record:

dataset
Créateur:
tun
Hôte:
This dataset is a synthetic parallel corpus of Tunisian Arabic (aeb) and Modern Standard Arabic (arb). It was created with a rigorous multi-stage pipeline to maximize quality and reproducibility, addressing the scarcity of high-quality resources for Tunisian Arabic NLP. The primary goals are to support: Machine translation between Tunisian Arabic and MSA. Research in dialectal-aware text generation and evaluation.

Visit

huggingface.co

Tasks

machine translation

Languages

Arabic, Tunisian Spoken

Tags

translationtunisianarabic

Licenses

cc-by-4.0