Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

{S}tereo{S}et: Measuring stereotypical bias in pretrained language models

Domaine:

natural language processing

Type de record:

paper
A stereotype is an over-generalized belief about a particular group of people, e.g., Asians are good at math or African Americans are athletic. Such beliefs (biases) are known to hurt target groups. Since pretrained language models are trained on large real-world data, they are known to capture stereotypical biases. It is important to quantify to what extent these biases are present in them. Although this is a rapidly growing area of research, existing literature lacks in two important aspects: 1) they mainly evaluate bias of pretrained language models on a small set of artificial sentences, even though these models are trained on natural data 2) current evaluations focus on measuring bias without considering the language modeling ability of a model, which could lead to misleading trust on a model even if it is a poor language model. We address both these problems. We present StereoSet, a large-scale natural English dataset to measure stereotypical biases in four domains: gender, profession, race, and religion. We contrast both stereotypical bias and language modeling ability of popular models like BERT, GPT-2, RoBERTa, and XLnet. We show that these models exhibit strong stereotypical biases.

Visit

aclanthology.orgstereoset.mit.edu

Tasks

language modeling

Tags

aclStereoSet

Similaires

AfriStereo: A Culturally Grounded Dataset for Evaluating Stereotypical Bias in Large Language ModelsAraRegBias: Evaluating Dialectal and Stereotypical Bias in Arabic Large Language Models via Multi-Component Metrics‫الت‬ ّ ‫والتمث‬ ‫والصمم‬ ‫اللغات‬ Deaf in Morocco: Language(s), Deafness, and Representation(s) L’enseignement pour les sourds au Maroc : langue(s), surdité et représentation(s)Diasporisations sociolinguistiques et précarités Diasporisations sociolinguistiques et précarités: Discrimination(s) et mobilité(s)Mutation diglossique en Angola et enseignement / apprentissage des langues-cultures : quelle(s) didactique(s) et quel(s) transfert(s) méthodologique(s) en contexte plurilingue à dominance lusophone ?Tamazgha: espace(s), langue(s) et communauté(s) en construction au Nord de l’Afrique

AfriStereo: A Culturally Grounded Dataset for Evaluating Stereotypical Bias in Large Language Models

Existing AI bias evaluation benchmarks largely reflect Western perspectives, leaving African context

AraRegBias: Evaluating Dialectal and Stereotypical Bias in Arabic Large Language Models via Multi-Component Metrics

Abstract Large Language Models (LLMs) have achieved strong multilingual capabiliti

‫الت‬ ّ ‫والتمث‬ ‫والصمم‬ ‫اللغات‬ Deaf in Morocco: Language(s), Deafness, and Representation(s) L’enseignement pour les sourds au Maroc : langue(s), surdité et représentation(s)

International audience تطمح هذه المساهمة إلى تقديم الحقائق السوسيولغوية لوضع تعليم ال

Diasporisations sociolinguistiques et précarités Diasporisations sociolinguistiques et précarités: Discrimination(s) et mobilité(s)

International audience What are the correlations between sociolinguistic processes an

Mutation diglossique en Angola et enseignement / apprentissage des langues-cultures : quelle(s) didactique(s) et quel(s) transfert(s) méthodologique(s) en contexte plurilingue à dominance lusophone ?

International audience

Tamazgha: espace(s), langue(s) et communauté(s) en construction au Nord de l’Afrique

International audience Ce texte revient sur mes usages scientifiques de Tamazgha/Amaz