This dataset consists of more than 5k public posts from Facebook. Each post contains text content, metadata.
This dataset containt more than 400K darija tokens.
Curated by: @abdeljalilELmajjodi
Language(s) (NLP): Multiple (primarily Moroccon Arabic)
This dataset could be used for:
Training and testing language models on social media content