Egocentric Bias in Vision-Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Maijunxian, Li, Yijiang, Wang, Bingyang, Zhao, Tianwei, Ji, Ran, Gao, Qingying, Liu, Emmy, Deng, Hokin, Luo, Dezhi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Vision-Language Models Mistake Head Orientation for Gaze Direction: Nonverbal Conversation Cues
por: Zhang, Zory, et al.
Publicado: (2025)
por: Zhang, Zory, et al.
Publicado: (2025)
Core Knowledge Deficits in Multi-Modal Language Models
por: Li, Yijiang, et al.
Publicado: (2024)
por: Li, Yijiang, et al.
Publicado: (2024)
Probing Perceptual Constancy in Large Vision-Language Models
por: Sun, Haoran, et al.
Publicado: (2025)
por: Sun, Haoran, et al.
Publicado: (2025)
Vision Language Models Cannot Reason About Physical Transformation
por: Luo, Dezhi, et al.
Publicado: (2026)
por: Luo, Dezhi, et al.
Publicado: (2026)
Probing Mechanical Reasoning in Large Vision Language Models
por: Sun, Haoran, et al.
Publicado: (2024)
por: Sun, Haoran, et al.
Publicado: (2024)
Video Models Start to Solve Chess, Maze, Sudoku, Mental Rotation, and Raven' Matrices
por: Deng, Hokin
Publicado: (2025)
por: Deng, Hokin
Publicado: (2025)
Vision Language Models See What You Want but not What You See
por: Gao, Qingying, et al.
Publicado: (2024)
por: Gao, Qingying, et al.
Publicado: (2024)
Vision Language Models Know Law of Conservation without Understanding More-or-Less
por: Luo, Dezhi, et al.
Publicado: (2024)
por: Luo, Dezhi, et al.
Publicado: (2024)
Increasing Computation Resolves Conflicts in Vision Language Models
por: Wang, Bingyang, et al.
Publicado: (2025)
por: Wang, Bingyang, et al.
Publicado: (2025)
Demystifying Video Reasoning
por: Wang, Ruisi, et al.
Publicado: (2026)
por: Wang, Ruisi, et al.
Publicado: (2026)
The Philosophical Foundations of Growing AI Like A Child
por: Luo, Dezhi, et al.
Publicado: (2025)
por: Luo, Dezhi, et al.
Publicado: (2025)
SQAP-VLA: A Synergistic Quantization-Aware Pruning Framework for High-Performance Vision-Language-Action Models
por: Fang, Hengyu, et al.
Publicado: (2025)
por: Fang, Hengyu, et al.
Publicado: (2025)
Object-Centric Vision Token Pruning for Vision Language Models
por: Li, Guangyuan, et al.
Publicado: (2025)
por: Li, Guangyuan, et al.
Publicado: (2025)
Think Before You Act: A Two-Stage Framework for Mitigating Gender Bias Towards Vision-Language Tasks
por: Zhang, Yunqi, et al.
Publicado: (2024)
por: Zhang, Yunqi, et al.
Publicado: (2024)
VLBiasBench: A Comprehensive Benchmark for Evaluating Bias in Large Vision-Language Model
por: Wang, Sibo, et al.
Publicado: (2024)
por: Wang, Sibo, et al.
Publicado: (2024)
Rethinking the Simulation vs. Rendering Dichotomy: No Free Lunch in Spatial World Modelling
por: Luo, Dezhi, et al.
Publicado: (2025)
por: Luo, Dezhi, et al.
Publicado: (2025)
Physical Prompt Injection Attacks on Large Vision-Language Models
por: Ling, Chen, et al.
Publicado: (2026)
por: Ling, Chen, et al.
Publicado: (2026)
Challenges and Trends in Egocentric Vision: A Survey
por: Li, Xiang, et al.
Publicado: (2025)
por: Li, Xiang, et al.
Publicado: (2025)
EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos
por: Yang, Ruihan, et al.
Publicado: (2025)
por: Yang, Ruihan, et al.
Publicado: (2025)
GenderBias-\emph{VL}: Benchmarking Gender Bias in Vision Language Models via Counterfactual Probing
por: Xiao, Yisong, et al.
Publicado: (2024)
por: Xiao, Yisong, et al.
Publicado: (2024)
Visible Yet Unreadable: A Systematic Blind Spot of Vision Language Models Across Writing Systems
por: Zhang, Jie, et al.
Publicado: (2025)
por: Zhang, Jie, et al.
Publicado: (2025)
Uncovering Bias in Large Vision-Language Models with Counterfactuals
por: Howard, Phillip, et al.
Publicado: (2024)
por: Howard, Phillip, et al.
Publicado: (2024)
EgoSim: Egocentric World Simulator for Embodied Interaction Generation
por: Hao, Jinkun, et al.
Publicado: (2026)
por: Hao, Jinkun, et al.
Publicado: (2026)
Adversarial Prompt Distillation for Vision-Language Models
por: Luo, Lin, et al.
Publicado: (2024)
por: Luo, Lin, et al.
Publicado: (2024)
On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression
por: Zhang, Xinwei, et al.
Publicado: (2026)
por: Zhang, Xinwei, et al.
Publicado: (2026)
Cognitively-Inspired Tokens Overcome Egocentric Bias in Multimodal Models
por: Leonard, Bridget, et al.
Publicado: (2026)
por: Leonard, Bridget, et al.
Publicado: (2026)
FAIntbench: A Holistic and Precise Benchmark for Bias Evaluation in Text-to-Image Models
por: Luo, Hanjun, et al.
Publicado: (2024)
por: Luo, Hanjun, et al.
Publicado: (2024)
EchoBench: Benchmarking Sycophancy in Medical Large Vision-Language Models
por: Yuan, Botai, et al.
Publicado: (2025)
por: Yuan, Botai, et al.
Publicado: (2025)
ENACT: Evaluating Embodied Cognition with World Modeling of Egocentric Interaction
por: Wang, Qineng, et al.
Publicado: (2025)
por: Wang, Qineng, et al.
Publicado: (2025)
Freeze and Reveal: Exposing Modality Bias in Vision-Language Models
por: Kavuri, Vivek Hruday, et al.
Publicado: (2025)
por: Kavuri, Vivek Hruday, et al.
Publicado: (2025)
VLADriver-RAG: Retrieval-Augmented Vision-Language-Action Models for Autonomous Driving
por: Zhao, Rui, et al.
Publicado: (2026)
por: Zhao, Rui, et al.
Publicado: (2026)
The Point, the Vision and the Text: Does Point Cloud Boost Spatial Reasoning of Large Language Models? A Bias-Controlled Study
por: Zhang, Weichen, et al.
Publicado: (2025)
por: Zhang, Weichen, et al.
Publicado: (2025)
Can 3D Vision-Language Models Truly Understand Natural Language?
por: Deng, Weipeng, et al.
Publicado: (2024)
por: Deng, Weipeng, et al.
Publicado: (2024)
MOSABench: Multi-Object Sentiment Analysis Benchmark for Evaluating Multimodal Large Language Models Understanding of Complex Image
por: Song, Shezheng, et al.
Publicado: (2024)
por: Song, Shezheng, et al.
Publicado: (2024)
Text-driven Affordance Learning from Egocentric Vision
por: Yoshida, Tomoya, et al.
Publicado: (2024)
por: Yoshida, Tomoya, et al.
Publicado: (2024)
BiasICL: In-Context Learning and Demographic Biases of Vision Language Models
por: Xu, Sonnet, et al.
Publicado: (2025)
por: Xu, Sonnet, et al.
Publicado: (2025)
Holmes: Towards Effective and Harmless Model Ownership Verification to Personalized Large Vision Models via Decoupling Common Features
por: Zhu, Linghui, et al.
Publicado: (2025)
por: Zhu, Linghui, et al.
Publicado: (2025)
Benchmarking Egocentric Clinical Intent Understanding Capability for Medical Multimodal Large Language Models
por: Liu, Shaonan, et al.
Publicado: (2026)
por: Liu, Shaonan, et al.
Publicado: (2026)
GeoWorld-VLM: Geometry from World Models for Vision-Language Models
por: Gu, Renjie, et al.
Publicado: (2026)
por: Gu, Renjie, et al.
Publicado: (2026)
Training-Free Unsupervised Prompt for Vision-Language Models
por: Long, Sifan, et al.
Publicado: (2024)
por: Long, Sifan, et al.
Publicado: (2024)
Ejemplares similares
-
Vision-Language Models Mistake Head Orientation for Gaze Direction: Nonverbal Conversation Cues
por: Zhang, Zory, et al.
Publicado: (2025) -
Core Knowledge Deficits in Multi-Modal Language Models
por: Li, Yijiang, et al.
Publicado: (2024) -
Probing Perceptual Constancy in Large Vision-Language Models
por: Sun, Haoran, et al.
Publicado: (2025) -
Vision Language Models Cannot Reason About Physical Transformation
por: Luo, Dezhi, et al.
Publicado: (2026) -
Probing Mechanical Reasoning in Large Vision Language Models
por: Sun, Haoran, et al.
Publicado: (2024)