Logo Lanfrica

Arabic Dialect Corpus (Egyptian & Saudi)

Domaine:

natural language processing

Type de record:

dataset
Créateur:
yrr
Hôte:
This dataset contains 150K+ natural, informal Arabic text samples scraped from high-engagement YouTube discussions. It specifically targets Egyptian (EG) and Saudi (SA) dialects, filling a critical gap in resources for training LLMs on colloquial Arabic (Ammiya) rather than just Modern Standard Arabic (MSA). Primary Dialects: