VIGNETTE: Socially Grounded Bias Evaluation for Vision-Language Models

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Raj, Chahat, Wei, Bowen, Caliskan, Aylin, Anastasopoulos, Antonios, Zhu, Ziwei
Natura: Preprint
Pubblicazione: 2025
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
_version_ 1866908999192936448
author Raj, Chahat
Wei, Bowen
Caliskan, Aylin
Anastasopoulos, Antonios
Zhu, Ziwei
author_facet Raj, Chahat
Wei, Bowen
Caliskan, Aylin
Anastasopoulos, Antonios
Zhu, Ziwei
contents While bias in large language models (LLMs) is well-studied, similar concerns in vision-language models (VLMs) have received comparatively less attention. Existing VLM bias studies often focus on portrait-style images and gender-occupation associations, overlooking broader and more complex social stereotypes and their implied harm. This work introduces VIGNETTE, a large-scale VQA benchmark with 30M+ images for evaluating bias in VLMs through a question-answering framework spanning four directions: factuality, perception, stereotyping, and decision making. Beyond narrowly-centered studies, we assess how VLMs interpret identities in contextualized settings, revealing how models make trait and capability assumptions and exhibit patterns of discrimination. Drawing from social psychology, we examine how VLMs connect visual identity cues to trait and role-based inferences, encoding social hierarchies, through biased selections. Our findings uncover subtle, multifaceted, and surprising stereotypical patterns, offering insights into how VLMs construct social meaning from inputs.
format Preprint
id arxiv_https___arxiv_org_abs_2505_22897
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle VIGNETTE: Socially Grounded Bias Evaluation for Vision-Language Models
Raj, Chahat
Wei, Bowen
Caliskan, Aylin
Anastasopoulos, Antonios
Zhu, Ziwei
Computation and Language
While bias in large language models (LLMs) is well-studied, similar concerns in vision-language models (VLMs) have received comparatively less attention. Existing VLM bias studies often focus on portrait-style images and gender-occupation associations, overlooking broader and more complex social stereotypes and their implied harm. This work introduces VIGNETTE, a large-scale VQA benchmark with 30M+ images for evaluating bias in VLMs through a question-answering framework spanning four directions: factuality, perception, stereotyping, and decision making. Beyond narrowly-centered studies, we assess how VLMs interpret identities in contextualized settings, revealing how models make trait and capability assumptions and exhibit patterns of discrimination. Drawing from social psychology, we examine how VLMs connect visual identity cues to trait and role-based inferences, encoding social hierarchies, through biased selections. Our findings uncover subtle, multifaceted, and surprising stereotypical patterns, offering insights into how VLMs construct social meaning from inputs.
title VIGNETTE: Socially Grounded Bias Evaluation for Vision-Language Models
topic Computation and Language
url https://arxiv.org/abs/2505.22897