Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

awras/lahja-dataset-v1

Domaine:

natural language processing

Type de record:

dataset
Créateur:
awr
Hôte:
An extensively cleaned and deduplicated text corpus specifically curated for the Algerian dialect (Darja), combining code-switching patterns between Arabic and French. Noise, duplicate entries, and excessively short sentences have been systematically filtered out to optimize the corpus for training and evaluating language models on low-resource Algerian African dialects. Total Rows: 1,641,779 Train Split: 1,477,601 rows

Visit

huggingface.co

Tasks

code switchinglanguage modeling

Languages

Arabic, Algerian SpokenTachawit

Tags

algerian-darijaalgerian-dialect

Licenses

cc-by-4.0

Similaires

awras/lahja-it-dataset-v1

awras/lahja-it-dataset-v1

lahja-it-dataset-v1 is an open-source instruction-tuning dataset for Algerian Darija. It contains ar