Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

MohamedNassih/NLP-for-Darija-Enrichissement-de-traduction_darija.json

Domaine:

natural language processing

Type de record:

software
Créateur:
Moh
Hôte:
Pipeline Python pour enrichir un dataset Arabe (MSA) → Darija (MA) depuis livres PDF & transcriptions YouTube ; normalisation, segmentation par tokens, génération (OpenAI ou règles) et export JSON. Projet de stage d’application chez YaneCode Digital. # NLP for Darija — Enrichissement de `traduction_darija.json` Projet extrait et industrialisé à partir du notebook **`Darija_Arabe.ipynb`**. L’objectif est de construire un **pipeline reproductible** pour enrichir un dataset parallèle **Arabe (MSA) → Darija marocaine** (écriture arabe) en s’appuyant sur : * des **livres** (38 PDF) placés dans `BOOK_DATA/` ; * des **transcriptions YouTube** décrites par `data/videos_youtube_info.xlsx` ; * une **génération** de propositions darija (OpenAI optionnel + fallback par règles) ; * une **fusion traçable** dans `traduction_darija.json`. > **Python**: 3.12.8 --- ## Arborescence ``` nlp-darija/ ├─ BOOK_DATA/ # (existe déjà) 38 livres PDF ├─ data/ │ └─ videos_youtube_info.xlsx # (existe) feuille YouTube ├─ artifacts/ # sorties intermédiaires (.jsonl/.json) ├─ src/ │ ├─ config.py │ ├─ cli.py │ ├─ utils/ │ │ ├─ logging_utils.py │ │ └─ textnorm.py │ ├─ text/ │ │ ├─ tokens.py │ │ └─ segment.py │ ├─ io/ │ │ ├─ pdf_reader.py │ │ ├─ ocr.py │ │ └─ youtube.py │ ├─ dataset/ │ │ ├─ build.py │ │ ├─ export.py │ │ └─ stats.py │ ├─ estimation/ │ │ └─ costs.py │ └─ generation/ │ └─ openai_gen.py ├─ traduction_darija.json # fichier final (enrichi) ├─ README.md ├─ requirements.txt ├─ LICENSE └─ .gitignore ``` --- ## Installation rapide 1. **Créer l’environnement** (recommandé) ```bash python -m venv .venv # Windows PowerShell . .venv\Scripts\Activate.ps1 # Mac/Linux source .venv/bin/activate ``` 2. **Installer les dépendances** ```bash pip install -r requirements.txt ``` 3. **(Optionnel) Configurer les outils système** * **Tesseract OCR** (pour `src/io/ocr.py`) — nécessaire si vos PDF sont scannés. * **Poppler** (pour `pdf2image`). Configurer via variables d’environnement (Windows surtout) : ```powershell $env:TESSERACT_CMD = "C:\\Program Files\\Tesseract-OCR\\tesseract.exe" $env:POPPLER_PATH = "C:\\Program Files\\poppler-24.08.0\\Library\\bi …

Visit

github.com

Tasks

machine translation

Languages

Arabic, Algerian Spoken

Tags

arabiccorpusdarijamachine-learningnlpocropenaisegmentationtext-normalizationtokenization+2

Similaires

Nasmaleg/NLP-darijaikramnaser/NLP-darijaSalmaneSossey/darija-health-nlpCHAYBI500/darija-nlp-projectTahamahir/darija-nlp-airflowmyriamlmiii/darija-word2vec-nlp

Nasmaleg/NLP-darija

# Darija Sentiment Analysis Projet de traitement automatique du langage naturel (NLP) pour la class

ikramnaser/NLP-darija

Designing NLP solutions for an underrepresented language: Moroccan Darija, focusing on idioms and sa

SalmaneSossey/darija-health-nlp

NLP-based medical triage system for Moroccan patient messages in Darija, Arabic, and French using Fa

CHAYBI500/darija-nlp-project

Projet de Deep Learning et NLP dédié à la classification des sentiments en Darija marocain. Cette so

Tahamahir/darija-nlp-airflow

# Darija Comment Monitoring Pipeline Ce projet met en place un pipeline complet pour scraper, netto

myriamlmiii/darija-word2vec-nlp

Word2Vec Skip-gram embeddings for Moroccan Darija trained on 3M sentences - advancing NLP for low-re