# Analyse de Sentiment en Darja Algérienne 🇩🇿
Projet de NLP (traitement du langage naturel) : classifier le sentiment (positif,
négatif, neutre) de phrases écrites en darja algérienne (arabizi), avec une interface
web pour tester le modèle en direct.
## Objectif
Peu d'outils de NLP existent pour le dialecte algérien. Ce projet m'a permis
d'apprendre les bases du traitement de texte appliqué à une langue peu dotée en
ressources : constitution d'un dataset, nettoyage adapté aux spécificités de
l'arabizi, vectorisation et classification.
## Étapes réalisées
1. **Constitution du dataset** : 149 phrases en darja (arabizi) écrites et
labellisées manuellement (positive / negative / neutral), équilibrées entre
les 3 classes
2. **Nettoyage du texte** : suppression de la ponctuation, mise en minuscules,
suppression des nombres isolés — en préservant les chiffres arabizi (3, 7, 9)
utilisés pour transcrire des sons arabes (ex: "3andi", "7abitha")
3. **Vectorisation TF-IDF** : transformation du texte en représentation numérique
4. **Split train/test stratifié** (80/20) pour garder l'équilibre des classes
5. **Entraînement d'un modèle Logistic Regression**
6. **Évaluation** avec accuracy et classification report
7. **Déploiement** via une API Flask avec interface web
## Résultat
**Accuracy : 0.70** sur le jeu de test, avec une bonne précision sur la classe
positive (0.88). Résultat correct compte tenu de la petite taille du dataset
(149 phrases faites Ă la main).
## Limites et pistes d'amélioration
- Dataset petit et fait main : plus de données réelles (commentaires
Facebook/YouTube algériens) amélioreraient la généralisation
- Pas de gestion des fautes de frappe ou variantes orthographiques de l'arabizi
- Piste future : passer à un modèle pré-entraîné multilingue (ex: AraBERT ou un
modèle darja) pour de meilleures performances
## Comment lancer l'appli en local
1. Cloner ce repo
2. Installer les dépendances :
pip install flask joblib scikit-learn
3. Lancer le serveur :
p …