Logo Lanfrica

Algerian Darja Corpus: A 33-Million-Word Long-Form Conversational Dataset for Dialectal Language Modeling

Domaine:

natural language processing

Type de record:

dataset
Créateur:
tou
Éditeur:
Zenodo
Hôte:avatar
The Algerian Darja Corpus is a large-scale, long-form conversational text dataset specifically curated for pre-training and adapting decoder-based language models (SLMs and LLMs) to the Algerian Arabic dialect (Darija). Unlike existing dialectal datasets that primarily aggregate short social media comments, this corpus provides sustained narrative continuity and discourse-level cohesion extracted from Algerian podcasts, talk shows, local interviews, and cultural programs. Key Specifications:- 10,022 curated long-form documents- 32,946,140 clean words (178,368,189 characters / ~40M tokens)- Natural trilingual code-switching across Algerian Arabic, French, and Arabizi- Filtered via a 15-stage NLP preprocessing pipeline: multi-scale n-gram deduplication (n <= 30), ASR paralinguistic tag removal (, , , etc.), 100% SRT timestamp stripping, and morphological preservation (e.g., Shaddah). Hugging Face Repository: huggingface.co