Twiiter scrapping between 2021 2023
# NLP Wolof - Pipeline de Prétraitement
Ce projet met en place un pipeline simple pour préparer un dataset de tweets (abusif vs non abusif).
---
## 🚀 Pipeline de prétraitement
1. **Correction d'encodage**
- Corrige les caractères mal formés.
2. **Normalisation du texte**
- Mise en minuscule
- Suppression des espaces multiples
3. **Nettoyage du contenu**
- Suppression des URLs, hashtags, mentions
- Suppression des emojis
- Réduction de la ponctuation excessive
4. **Filtrage des colonnes**
- Conservation uniquement de :
- `Tweet` → texte nettoyé
- `Class` → label (0 = non abusif, 1 = abusif)
5. **Export final**
- Génération d’un fichier `final_dataset.csv` prêt pour l’entraînement NLP.
---
## 📌 Étapes suivantes possibles
- Analyse exploratoire (EDA)
- Tokenisation adaptée au wolof (BPE, SentencePiece)
- Entraînement d’un modèle de classification (SVM, BERT, etc.)
- Équilibrage des classes si nécessaire
---
## 📦 Installation
1. Cloner le projet et se placer dans le dossier :
```bash
git clone
github.com
cd twitter-scrapping
```
2. Créer un environnement virtuel et installer les dépendances :
```bash
python -m venv venv
source venv/bin/activate # Linux/Mac
venv\Scripts\activate # Windows
```
3. Installer les dépendances
```bash
pip install -r requirements.txt
```
## I. Correction d'encodage et Normalisation du texte
Le fichier `python extract_tweey_class.py` est utilisé pour cela
## NB : L'analyse
Le fichier `analyse.py` sert une premiere analyse sur la composition du datset le resultat révéle qui y'a la presence de 2510 tweets Non abusif et 1000 qui le sont.
---
👨🏽💻 Auteur : Omar DIOP
📅 Projet 2025