Uncovering Cultural Representation Disparities in Vision-Language Models

Fuente: arXiv
Gespeichert in:
Bibliographische Detailangaben
Hauptverfasser: Kadiyala, Ram Mohan Rao, Gupta, Siddhant, Purbey, Jebish, Yadav, Srishti, Debnath, Suman, Salamanca, Alejandro, Elliott, Desmond
Format: Preprint
Veröffentlicht: 2025
Schlagworte:
Online-Zugang:
Tags: Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
_version_ 1866915417981714432
author Kadiyala, Ram Mohan Rao
Gupta, Siddhant
Purbey, Jebish
Yadav, Srishti
Debnath, Suman
Salamanca, Alejandro
Elliott, Desmond
author_facet Kadiyala, Ram Mohan Rao
Gupta, Siddhant
Purbey, Jebish
Yadav, Srishti
Debnath, Suman
Salamanca, Alejandro
Elliott, Desmond
contents Vision-Language Models (VLMs) have demonstrated impressive capabilities across a range of tasks, yet concerns about their potential biases exist. This work investigates the extent to which prominent VLMs exhibit cultural biases by evaluating their performance on an image-based country identification task at a country level. Utilizing the geographically diverse Country211 dataset, we probe several large vision language models (VLMs) under various prompting strategies: open-ended questions, multiple-choice questions (MCQs) including challenging setups like multilingual and adversarial settings. Our analysis aims to uncover disparities in model accuracy across different countries and question formats, providing insights into how training data distribution and evaluation methodologies might influence cultural biases in VLMs. The findings highlight significant variations in performance, suggesting that while VLMs possess considerable visual understanding, they inherit biases from their pre-training data and scale that impact their ability to generalize uniformly across diverse global contexts.
format Preprint
id arxiv_https___arxiv_org_abs_2505_14729
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle Uncovering Cultural Representation Disparities in Vision-Language Models
Kadiyala, Ram Mohan Rao
Gupta, Siddhant
Purbey, Jebish
Yadav, Srishti
Debnath, Suman
Salamanca, Alejandro
Elliott, Desmond
Computer Vision and Pattern Recognition
Vision-Language Models (VLMs) have demonstrated impressive capabilities across a range of tasks, yet concerns about their potential biases exist. This work investigates the extent to which prominent VLMs exhibit cultural biases by evaluating their performance on an image-based country identification task at a country level. Utilizing the geographically diverse Country211 dataset, we probe several large vision language models (VLMs) under various prompting strategies: open-ended questions, multiple-choice questions (MCQs) including challenging setups like multilingual and adversarial settings. Our analysis aims to uncover disparities in model accuracy across different countries and question formats, providing insights into how training data distribution and evaluation methodologies might influence cultural biases in VLMs. The findings highlight significant variations in performance, suggesting that while VLMs possess considerable visual understanding, they inherit biases from their pre-training data and scale that impact their ability to generalize uniformly across diverse global contexts.
title Uncovering Cultural Representation Disparities in Vision-Language Models
topic Computer Vision and Pattern Recognition
url https://arxiv.org/abs/2505.14729