A curated benchmark dataset for Arabic dialect identification, with special focus on Sudanese Arabic (ARS) — an under-represented variety in NLP research.
This dataset enables evaluation of:
Dialect identification models
Cross-dialectal transfer learning
Low-resource language modeling
Arabic NLP robustness testing
Task
Description