Datasets for toxic comments moderation in Senegal
# SayTu-DataSets
Datasets for toxic comments moderation in Senegal
Description :
Ce jeu de données a été conçu pour faciliter la recherche, le développement et l’évaluation de systèmes de modération automatique de commentaires toxiques dans le contexte sénégalais. Il contient des commentaires collectés depuis diverses plateformes en ligne (réseaux sociaux, forums, vidéos YouTube locales, etc.), et annotés manuellement selon différents niveaux de toxicité : insulte, discours haineux, racisme, sexisme, tribalismes, obscénité, et incitation à la haine.
Les textes sont principalement en français, avec des occurrences en wolof, sérère, peulh et d'autres langues locales, souvent mêlées de langage familier ou SMS. Cette diversité linguistique reflète les usages numériques au Sénégal et permet de développer des modèles de traitement du langage naturel (NLP) mieux adaptés aux réalités du pays.
Contenu du dataset :
commentaire : le texte brut du commentaire
toxicité : étiquette binaire (0 = non toxique, 1 = toxique)
catégorie : type de toxicité (insulte, racisme, etc.)
langue : langue principale du commentaire
plateforme_source : origine du commentaire (ex. YouTube, Facebook, etc.)
date : date de publication du commentaire
Utilisations possibles :
Entraînement de modèles de classification de texte
Détection multilingue de toxicité
Études sociolinguistiques sur la violence verbale en ligne
Développement de systèmes de modération automatisés pour les plateformes locales
Licence : Usage académique et non-commercial uniquement. Toute réutilisation doit respecter l’anonymat des données.
Avertissement : Ce jeu de données contient du contenu potentiellement choquant. Il est destiné à la recherche dans le domaine de la modération des contenus et ne doit pas être utilisé à d'autres fins.