Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

npl-wolof/twitter-scrapping

Domaine:

natural language processing

Type de record:

software
Créateur:
npl
Hôte:
Twiiter scrapping between 2021 2023 # NLP Wolof - Pipeline de Prétraitement Ce projet met en place un pipeline simple pour préparer un dataset de tweets (abusif vs non abusif). --- ## 🚀 Pipeline de prétraitement 1. **Correction d'encodage** - Corrige les caractères mal formés. 2. **Normalisation du texte** - Mise en minuscule - Suppression des espaces multiples 3. **Nettoyage du contenu** - Suppression des URLs, hashtags, mentions - Suppression des emojis - Réduction de la ponctuation excessive 4. **Filtrage des colonnes** - Conservation uniquement de : - `Tweet` → texte nettoyé - `Class` → label (0 = non abusif, 1 = abusif) 5. **Export final** - Génération d’un fichier `final_dataset.csv` prêt pour l’entraînement NLP. --- ## 📌 Étapes suivantes possibles - Analyse exploratoire (EDA) - Tokenisation adaptée au wolof (BPE, SentencePiece) - Entraînement d’un modèle de classification (SVM, BERT, etc.) - Équilibrage des classes si nécessaire --- ## 📦 Installation 1. Cloner le projet et se placer dans le dossier : ```bash git clone github.com cd twitter-scrapping ``` 2. Créer un environnement virtuel et installer les dépendances : ```bash python -m venv venv source venv/bin/activate # Linux/Mac venv\Scripts\activate # Windows ``` 3. Installer les dépendances ```bash pip install -r requirements.txt ``` ## I. Correction d'encodage et Normalisation du texte Le fichier `python extract_tweey_class.py` est utilisé pour cela ## NB : L'analyse Le fichier `analyse.py` sert une premiere analyse sur la composition du datset le resultat révéle qui y'a la presence de 2510 tweets Non abusif et 1000 qui le sont. --- 👨🏽‍💻 Auteur : Omar DIOP 📅 Projet 2025

Visit

github.com

Tasks

hate speech detectiontext classification

Languages

Wolof

Similaires

npl-wolof/wiki-scrappingnpl-wolof/kaggle-scrappingDayoDak/Twitter-web-scrapping

npl-wolof/wiki-scrapping

wiki scrapping # Corpus Wolof – Scraping Wikipédia pour NLP Ce projet a pour objectif de **constit

npl-wolof/kaggle-scrapping

Kaggle Scrapping 📌 Projet NLP en Wolof Ce projet vise à explorer et préparer un dataset en Wolof a

DayoDak/Twitter-web-scrapping

Twitter Text Analysis on the three presidential candidates of the Major three political parties in