Logo Lanfrica

Edouard-Ngor/SayTu-DataSets

Domaine:

natural language processing

Type de record:

dataset
Créateur:
Edo
Hôte:
Datasets for toxic comments moderation in Senegal # SayTu-DataSets Datasets for toxic comments moderation in Senegal Description : Ce jeu de données a été conçu pour faciliter la recherche, le développement et l’évaluation de systèmes de modération automatique de commentaires toxiques dans le contexte sénégalais. Il contient des commentaires collectés depuis diverses plateformes en ligne (réseaux sociaux, forums, vidéos YouTube locales, etc.), et annotés manuellement selon différents niveaux de toxicité : insulte, discours haineux, racisme, sexisme, tribalismes, obscénité, et incitation à la haine. Les textes sont principalement en français, avec des occurrences en wolof, sérère, peulh et d'autres langues locales, souvent mêlées de langage familier ou SMS. Cette diversité linguistique reflète les usages numériques au Sénégal et permet de développer des modèles de traitement du langage naturel (NLP) mieux adaptés aux réalités du pays. Contenu du dataset : commentaire : le texte brut du commentaire toxicité : étiquette binaire (0 = non toxique, 1 = toxique) catégorie : type de toxicité (insulte, racisme, etc.) langue : langue principale du commentaire plateforme_source : origine du commentaire (ex. YouTube, Facebook, etc.) date : date de publication du commentaire Utilisations possibles : Entraînement de modèles de classification de texte Détection multilingue de toxicité Études sociolinguistiques sur la violence verbale en ligne Développement de systèmes de modération automatisés pour les plateformes locales Licence : Usage académique et non-commercial uniquement. Toute réutilisation doit respecter l’anonymat des données. Avertissement : Ce jeu de données contient du contenu potentiellement choquant. Il est destiné à la recherche dans le domaine de la modération des contenus et ne doit pas être utilisé à d'autres fins.