The Moroccan Darija Wiki Dataset consists of 10,044 parallel text samples of Moroccan Darija sourced from Darija Wikipedia. This dataset was created to support language modeling and various NLP tasks for Moroccan Darija.
The data was scraped from Wikipedia (ary) using the WikiScraper tool.
Data Preprocessing