Logo Lanfrica
  • Home
  • Atlas
  • Insights
  • Docs
  • Sign in

© 2026 Lanfrica. All rights reserved. All copyrights of the resources shown on the Lanfrica website belong to the original copyright holders, unless explicitly stated otherwise.

Benchol/hate-speech-detection-malagasy

Domain:

natural language processing

Record type:

software
Creator:
Ben
Host:
# 🧠 Détection de discours haineux en malgache Ce projet a pour objectif la détection automatique de discours haineux en langue malgache à partir de données textuelles. Il utilise à la fois des modèles multilingues pré-entraînés (mT5, mBERT) et des approches classiques basées sur TF-IDF. --- ## 🔍 Objectifs - Étudier l’efficacité de **modèles multilingues pré-entraînés** (mT5, mBERT) pour la classification de textes haineux en malgache. - Évaluer des **méthodes classiques** de machine learning (TF-IDF + XGBoost / Naive Bayes). - Construire un **corpus annoté** de discours malgaches provenant de traductions et de données sociales réelles. - Comparer différentes stratégies de fine-tuning et de gestion du déséquilibre des classes. --- ## 🧾 Données Le corpus est composé de deux sources : 1. ✅ **Données traduites** : Traduction en malgache de datasets publics (HateXplain, DGHD, slur-corpus, HateCheck, OLID, SWAD, Labeled_data, twitter_sexism, twitter_racism) via MadLab-7B-MT-BT. 2. 🗣️ **Données Facebook Malagasy** : Scrappées manuellement sur des publications ciblées, nettoyées et annotées manuellement. Statistiques des données récupérées sur Facebook: - ~25,000 exemples - ≈32.5% de discours haineux --- ## 🧠 Modèles fine-tunés ### 🔷 mT5-small - Encoder de mT5 avec **Mean Pooling** - Classifieur 512 → 256 → 2 - Utilise la **Focal Loss** pour gérer le déséquilibre - Apprentissage supervisé sur données combinées 📂 Dossier : `models/mT5` --- ### 🔶 mBERT (bert-base-multilingual-cased) - [CLS] token → Classifieur 768 → 256 → 2 - Utilise la **CrossEntropyLoss standard** - Fine-tuning classique sur les mêmes données 📂 Dossier : `models/mBERT` --- ### 🟡 TF-IDF + XGBoost / Naive Bayes - Vectorisation avec **TF-IDF** (n-grammes 1 à 4) - Deux modèles : - `XGBoostClassifier` avec `scale_pos_weight` - `MultinomialNB` avec suréchantillonnage SMOTE - Augmentation des textes avec répétition pondérée des mots-clés haineux - Courbes ROC, matrice de confusion, tests inte …

Visit

github.com

Tasks

hate speech detectiontext classification

Languages

MalagasyMalagasy, Merina

Similar

Lusanji/Hate-Speech-DetectionLuckilyeee/Hate-Speech-Detectionshama-llama/hate-speech-detectionAllanOtieno254/Kiswahili-Hate-Speech-Detectionmelezele/Hate-Speech-Detection-Toolzakaria-lagouader/hate-speech-detection

Lusanji/Hate-Speech-Detection

Hate speech detection in audio for English and Kiswahili languages # Automatic hate speech detectio

Luckilyeee/Hate-Speech-Detection

Achieving Hate Speech Detection in a Low Resource Setting # Achieving Hate Speech Detection in a Lo

shama-llama/hate-speech-detection

Adversarial and hierarchical transformer for Amharic hate speech detection # Hate Speech Detection

AllanOtieno254/Kiswahili-Hate-Speech-Detection

A comprehensive project for detecting hate speech in Kiswahili text using machine learning technique

melezele/Hate-Speech-Detection-Tool

The tool will detect hate speech in Amharic text

zakaria-lagouader/hate-speech-detection

a python app for detection hate speech in darija # Hate Speech Detection using NLP Created by: