Measuring Social Bias in Vision-Language Models with Face-Only Counterfactuals from Real Photos
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Haodong, Huang, Qiang, Zhao, Jiaqi, Jiang, Qiuping, Chang, Xiaojun, Yu, Jun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
VisBias: Measuring Explicit and Implicit Social Biases in Vision Language Models
por: Huang, Jen-tse, et al.
Publicado: (2025)
por: Huang, Jen-tse, et al.
Publicado: (2025)
Why Only Text: Empowering Vision-and-Language Navigation with Multi-modal Prompts
por: Hong, Haodong, et al.
Publicado: (2024)
por: Hong, Haodong, et al.
Publicado: (2024)
Chartographer: Counterfactual Chart Generation for Evaluating Vision-Language Models
por: Jiang, Yifan, et al.
Publicado: (2026)
por: Jiang, Yifan, et al.
Publicado: (2026)
Beyond the Vision Encoder: Identifying and Mitigating Spatial Bias in Large Vision-Language Models
por: Zhu, Yingjie, et al.
Publicado: (2025)
por: Zhu, Yingjie, et al.
Publicado: (2025)
Navigating Beyond Instructions: Vision-and-Language Navigation in Obstructed Environments
por: Hong, Haodong, et al.
Publicado: (2024)
por: Hong, Haodong, et al.
Publicado: (2024)
Think Visually, Reason Textually: Vision-Language Synergy in ARC
por: Zhang, Beichen, et al.
Publicado: (2025)
por: Zhang, Beichen, et al.
Publicado: (2025)
Scale Can't Overcome Pragmatics: The Impact of Reporting Bias on Vision-Language Reasoning
por: Kamath, Amita, et al.
Publicado: (2026)
por: Kamath, Amita, et al.
Publicado: (2026)
Investigating Spatial Attention Bias in Vision-Language Models
por: Chaudhary, Aryan, et al.
Publicado: (2025)
por: Chaudhary, Aryan, et al.
Publicado: (2025)
ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention
por: Liu, Wenjie, et al.
Publicado: (2026)
por: Liu, Wenjie, et al.
Publicado: (2026)
debiaSAE: Benchmarking and Mitigating Vision-Language Model Bias
por: Sasse, Kuleen, et al.
Publicado: (2024)
por: Sasse, Kuleen, et al.
Publicado: (2024)
VisOnlyQA: Large Vision Language Models Still Struggle with Visual Perception of Geometric Information
por: Kamoi, Ryo, et al.
Publicado: (2024)
por: Kamoi, Ryo, et al.
Publicado: (2024)
General Scene Adaptation for Vision-and-Language Navigation
por: Hong, Haodong, et al.
Publicado: (2025)
por: Hong, Haodong, et al.
Publicado: (2025)
NavCoT: Boosting LLM-Based Vision-and-Language Navigation via Learning Disentangled Reasoning
por: Lin, Bingqian, et al.
Publicado: (2024)
por: Lin, Bingqian, et al.
Publicado: (2024)
Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate
por: Huang, Qidong, et al.
Publicado: (2024)
por: Huang, Qidong, et al.
Publicado: (2024)
The Hard Positive Truth about Vision-Language Compositionality
por: Kamath, Amita, et al.
Publicado: (2024)
por: Kamath, Amita, et al.
Publicado: (2024)
LoMo: Local Modality Substitution for Deeper Vision-Language Fusion
por: Han, Feng, et al.
Publicado: (2026)
por: Han, Feng, et al.
Publicado: (2026)
Bridging the Missing-Modality Gap: Improving Text-Only Calibration of Vision Language Models
por: Kim, Mingyeong, et al.
Publicado: (2026)
por: Kim, Mingyeong, et al.
Publicado: (2026)
On Asymmetric Optimization of Reasoning and Perception in Vision-Language Model Post-Training
por: Wu, Xueqing, et al.
Publicado: (2026)
por: Wu, Xueqing, et al.
Publicado: (2026)
Allegory of the Cave: Measurement-Grounded Vision-Language Learning
por: Xu, Kepeng, et al.
Publicado: (2026)
por: Xu, Kepeng, et al.
Publicado: (2026)
How Does Vision-Language Adaptation Impact the Safety of Vision Language Models?
por: Lee, Seongyun, et al.
Publicado: (2024)
por: Lee, Seongyun, et al.
Publicado: (2024)
A Unified Framework and Dataset for Assessing Societal Bias in Vision-Language Models
por: Sathe, Ashutosh, et al.
Publicado: (2024)
por: Sathe, Ashutosh, et al.
Publicado: (2024)
Uncovering Bias in Large Vision-Language Models at Scale with Counterfactuals
por: Howard, Phillip, et al.
Publicado: (2024)
por: Howard, Phillip, et al.
Publicado: (2024)
CrossGET: Cross-Guided Ensemble of Tokens for Accelerating Vision-Language Transformers
por: Shi, Dachuan, et al.
Publicado: (2023)
por: Shi, Dachuan, et al.
Publicado: (2023)
HiMo-CLIP: Modeling Semantic Hierarchy and Monotonicity in Vision-Language Alignment
por: Wu, Ruijia, et al.
Publicado: (2025)
por: Wu, Ruijia, et al.
Publicado: (2025)
VLKEB: A Large Vision-Language Model Knowledge Editing Benchmark
por: Huang, Han, et al.
Publicado: (2024)
por: Huang, Han, et al.
Publicado: (2024)
Diving into Mitigating Hallucinations from a Vision Perspective for Large Vision-Language Models
por: Wang, Weihang, et al.
Publicado: (2025)
por: Wang, Weihang, et al.
Publicado: (2025)
InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model
por: Dong, Xiaoyi, et al.
Publicado: (2024)
por: Dong, Xiaoyi, et al.
Publicado: (2024)
IdealGPT: Iteratively Decomposing Vision and Language Reasoning via Large Language Models
por: You, Haoxuan, et al.
Publicado: (2023)
por: You, Haoxuan, et al.
Publicado: (2023)
When are Lemons Purple? The Concept Association Bias of Vision-Language Models
por: Yamada, Yutaro, et al.
Publicado: (2022)
por: Yamada, Yutaro, et al.
Publicado: (2022)
BabyVision: Visual Reasoning Beyond Language
por: Chen, Liang, et al.
Publicado: (2026)
por: Chen, Liang, et al.
Publicado: (2026)
Instruction-Following Evaluation of Large Vision-Language Models
por: Shiono, Daiki, et al.
Publicado: (2025)
por: Shiono, Daiki, et al.
Publicado: (2025)
Model Merging to Maintain Language-Only Performance in Developmentally Plausible Multimodal Models
por: Takmaz, Ece, et al.
Publicado: (2025)
por: Takmaz, Ece, et al.
Publicado: (2025)
Benchmarking and Improving Large Vision-Language Models for Fundamental Visual Graph Understanding and Reasoning
por: Zhu, Yingjie, et al.
Publicado: (2024)
por: Zhu, Yingjie, et al.
Publicado: (2024)
Modality-Specialized Synergizers for Interleaved Vision-Language Generalists
por: Xu, Zhiyang, et al.
Publicado: (2024)
por: Xu, Zhiyang, et al.
Publicado: (2024)
Cerberus: Real-Time Video Anomaly Detection via Cascaded Vision-Language Models
por: Zheng, Yue, et al.
Publicado: (2025)
por: Zheng, Yue, et al.
Publicado: (2025)
Looking Beyond Text: Reducing Language bias in Large Vision-Language Models via Multimodal Dual-Attention and Soft-Image Guidance
por: Zhao, Haozhe, et al.
Publicado: (2024)
por: Zhao, Haozhe, et al.
Publicado: (2024)
Leopard: A Vision Language Model For Text-Rich Multi-Image Tasks
por: Jia, Mengzhao, et al.
Publicado: (2024)
por: Jia, Mengzhao, et al.
Publicado: (2024)
PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction
por: Xing, Long, et al.
Publicado: (2024)
por: Xing, Long, et al.
Publicado: (2024)
Inference Compute-Optimal Video Vision Language Models
por: Wang, Peiqi, et al.
Publicado: (2025)
por: Wang, Peiqi, et al.
Publicado: (2025)
Negative Object Presence Evaluation (NOPE) to Measure Object Hallucination in Vision-Language Models
por: Lovenia, Holy, et al.
Publicado: (2023)
por: Lovenia, Holy, et al.
Publicado: (2023)
Ejemplares similares
-
VisBias: Measuring Explicit and Implicit Social Biases in Vision Language Models
por: Huang, Jen-tse, et al.
Publicado: (2025) -
Why Only Text: Empowering Vision-and-Language Navigation with Multi-modal Prompts
por: Hong, Haodong, et al.
Publicado: (2024) -
Chartographer: Counterfactual Chart Generation for Evaluating Vision-Language Models
por: Jiang, Yifan, et al.
Publicado: (2026) -
Beyond the Vision Encoder: Identifying and Mitigating Spatial Bias in Large Vision-Language Models
por: Zhu, Yingjie, et al.
Publicado: (2025) -
Navigating Beyond Instructions: Vision-and-Language Navigation in Obstructed Environments
por: Hong, Haodong, et al.
Publicado: (2024)