Logo Lanfrica

npl-wolof/twitter-scrapping

Domain:

natural language processing

Record type:

software
Creator:
npl
Host:
Twiiter scrapping between 2021 2023 # NLP Wolof - Pipeline de Prétraitement Ce projet met en place un pipeline simple pour préparer un dataset de tweets (abusif vs non abusif). --- ## 🚀 Pipeline de prétraitement 1. **Correction d'encodage** - Corrige les caractères mal formés. 2. **Normalisation du texte** - Mise en minuscule - Suppression des espaces multiples 3. **Nettoyage du contenu** - Suppression des URLs, hashtags, mentions - Suppression des emojis - Réduction de la ponctuation excessive 4. **Filtrage des colonnes** - Conservation uniquement de : - `Tweet` → texte nettoyé - `Class` → label (0 = non abusif, 1 = abusif) 5. **Export final** - Génération d’un fichier `final_dataset.csv` prêt pour l’entraînement NLP. --- ## 📌 Étapes suivantes possibles - Analyse exploratoire (EDA) - Tokenisation adaptée au wolof (BPE, SentencePiece) - Entraînement d’un modèle de classification (SVM, BERT, etc.) - Équilibrage des classes si nécessaire --- ## 📦 Installation 1. Cloner le projet et se placer dans le dossier : ```bash git clone github.com cd twitter-scrapping ``` 2. Créer un environnement virtuel et installer les dépendances : ```bash python -m venv venv source venv/bin/activate # Linux/Mac venv\Scripts\activate # Windows ``` 3. Installer les dépendances ```bash pip install -r requirements.txt ``` ## I. Correction d'encodage et Normalisation du texte Le fichier `python extract_tweey_class.py` est utilisé pour cela ## NB : L'analyse Le fichier `analyse.py` sert une premiere analyse sur la composition du datset le resultat révéle qui y'a la presence de 2510 tweets Non abusif et 1000 qui le sont. --- 👨🏽‍💻 Auteur : Omar DIOP 📅 Projet 2025