Logo Lanfrica

Arabic Dialect Corpus

Domaine:

natural language processing

Type de record:

dataset
Créateur:
dat
Hôte:
A comprehensive collection of Arabic dialectal text, standardized for Natural Language Processing (NLP) model training, evaluation, and linguistic analysis. This corpus has been meticulously processed to ensure high-quality tokenization and consistent metadata. Metric Value Total Records 127,180 Total Tokens 5,802,324 Average Tokens per Record 45.62 Dialect Categories 5