Logo Lanfrica
  • Home
  • Atlas
  • Insights
  • Docs
  • Sign in

© 2026 Lanfrica. All rights reserved. All copyrights of the resources shown on the Lanfrica website belong to the original copyright holders, unless explicitly stated otherwise.

awras/lahja-dataset-v1

Domain:

natural language processing

Record type:

dataset
Creator:
awr
Host:
An extensively cleaned and deduplicated text corpus specifically curated for the Algerian dialect (Darja), combining code-switching patterns between Arabic and French. Noise, duplicate entries, and excessively short sentences have been systematically filtered out to optimize the corpus for training and evaluating language models on low-resource Algerian African dialects. Total Rows: 1,641,779 Train Split: 1,477,601 rows

Visit

huggingface.co

Tasks

code switchinglanguage modeling

Languages

Arabic, Algerian SpokenTachawit

Tags

algerian-darijaalgerian-dialect

Licenses

cc-by-4.0

Similar

awras/lahja-it-dataset-v1

awras/lahja-it-dataset-v1

lahja-it-dataset-v1 is an open-source instruction-tuning dataset for Algerian Darija. It contains ar