Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

atlasia/DODa-audio-dataset

Domaine:

natural language processing

Type de record:

dataset
Créateur:
atl
Hôte:
This dataset consists of 12,743 parallel text and speech samples for Moroccan Darija, including its transcription in both Latin and Arabic scripts and English translations. It was created to support speech recognition, language modeling, and NLP tasks for Moroccan Darija. The dataset was originally sourced from this repository, where it was available as a CSV file containing three columns:

Visit

huggingface.co

Tasks

automatic speech recognitionspeech processing

Languages

Arabic, Algerian SpokenArabic, Moroccan Spoken

Licenses

mit

Similaires

atlasia/Moroccan-Darija-Wiki-Audio-Datasetatlasia/scoop-datasetatlasia/Ghibli-style-morocco-datasetatlasia/Moroccan-Darija-Wiki-Datasetdoda-b/africa-urea-trackerhaninebou/whisper-mixed-doda-algerian

atlasia/Moroccan-Darija-Wiki-Audio-Dataset

The Moroccan Darija Wiki Audio Dataset consists of 551 parallel text and speech samples of Moroccan

atlasia/scoop-dataset

Language: Arabic (ar) Darija Number of Files: 12 (original sections), Total Number of Rows (Merged):

atlasia/Ghibli-style-morocco-dataset

This dataset contains 10 carefully curated image-text pairs designed to capture Moroccan cultural el

atlasia/Moroccan-Darija-Wiki-Dataset

The Moroccan Darija Wiki Dataset consists of 10,044 parallel text samples of Moroccan Darija sourced

doda-b/africa-urea-tracker

# africa-urea-tracker Automated pipeline that fetches urea (HS 310210) import and export data for a

haninebou/whisper-mixed-doda-algerian