Egocentric Bias in Vision-Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Maijunxian, Li, Yijiang, Wang, Bingyang, Zhao, Tianwei, Ji, Ran, Gao, Qingying, Liu, Emmy, Deng, Hokin, Luo, Dezhi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Vision-Language Models Mistake Head Orientation for Gaze Direction: Nonverbal Conversation Cues
di: Zhang, Zory, et al.
Pubblicazione: (2025)
di: Zhang, Zory, et al.
Pubblicazione: (2025)
Core Knowledge Deficits in Multi-Modal Language Models
di: Li, Yijiang, et al.
Pubblicazione: (2024)
di: Li, Yijiang, et al.
Pubblicazione: (2024)
Probing Perceptual Constancy in Large Vision-Language Models
di: Sun, Haoran, et al.
Pubblicazione: (2025)
di: Sun, Haoran, et al.
Pubblicazione: (2025)
Vision Language Models Cannot Reason About Physical Transformation
di: Luo, Dezhi, et al.
Pubblicazione: (2026)
di: Luo, Dezhi, et al.
Pubblicazione: (2026)
Probing Mechanical Reasoning in Large Vision Language Models
di: Sun, Haoran, et al.
Pubblicazione: (2024)
di: Sun, Haoran, et al.
Pubblicazione: (2024)
Video Models Start to Solve Chess, Maze, Sudoku, Mental Rotation, and Raven' Matrices
di: Deng, Hokin
Pubblicazione: (2025)
di: Deng, Hokin
Pubblicazione: (2025)
Vision Language Models See What You Want but not What You See
di: Gao, Qingying, et al.
Pubblicazione: (2024)
di: Gao, Qingying, et al.
Pubblicazione: (2024)
Vision Language Models Know Law of Conservation without Understanding More-or-Less
di: Luo, Dezhi, et al.
Pubblicazione: (2024)
di: Luo, Dezhi, et al.
Pubblicazione: (2024)
Increasing Computation Resolves Conflicts in Vision Language Models
di: Wang, Bingyang, et al.
Pubblicazione: (2025)
di: Wang, Bingyang, et al.
Pubblicazione: (2025)
Demystifying Video Reasoning
di: Wang, Ruisi, et al.
Pubblicazione: (2026)
di: Wang, Ruisi, et al.
Pubblicazione: (2026)
The Philosophical Foundations of Growing AI Like A Child
di: Luo, Dezhi, et al.
Pubblicazione: (2025)
di: Luo, Dezhi, et al.
Pubblicazione: (2025)
SQAP-VLA: A Synergistic Quantization-Aware Pruning Framework for High-Performance Vision-Language-Action Models
di: Fang, Hengyu, et al.
Pubblicazione: (2025)
di: Fang, Hengyu, et al.
Pubblicazione: (2025)
Object-Centric Vision Token Pruning for Vision Language Models
di: Li, Guangyuan, et al.
Pubblicazione: (2025)
di: Li, Guangyuan, et al.
Pubblicazione: (2025)
Think Before You Act: A Two-Stage Framework for Mitigating Gender Bias Towards Vision-Language Tasks
di: Zhang, Yunqi, et al.
Pubblicazione: (2024)
di: Zhang, Yunqi, et al.
Pubblicazione: (2024)
VLBiasBench: A Comprehensive Benchmark for Evaluating Bias in Large Vision-Language Model
di: Wang, Sibo, et al.
Pubblicazione: (2024)
di: Wang, Sibo, et al.
Pubblicazione: (2024)
Rethinking the Simulation vs. Rendering Dichotomy: No Free Lunch in Spatial World Modelling
di: Luo, Dezhi, et al.
Pubblicazione: (2025)
di: Luo, Dezhi, et al.
Pubblicazione: (2025)
Physical Prompt Injection Attacks on Large Vision-Language Models
di: Ling, Chen, et al.
Pubblicazione: (2026)
di: Ling, Chen, et al.
Pubblicazione: (2026)
Challenges and Trends in Egocentric Vision: A Survey
di: Li, Xiang, et al.
Pubblicazione: (2025)
di: Li, Xiang, et al.
Pubblicazione: (2025)
EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos
di: Yang, Ruihan, et al.
Pubblicazione: (2025)
di: Yang, Ruihan, et al.
Pubblicazione: (2025)
GenderBias-\emph{VL}: Benchmarking Gender Bias in Vision Language Models via Counterfactual Probing
di: Xiao, Yisong, et al.
Pubblicazione: (2024)
di: Xiao, Yisong, et al.
Pubblicazione: (2024)
Visible Yet Unreadable: A Systematic Blind Spot of Vision Language Models Across Writing Systems
di: Zhang, Jie, et al.
Pubblicazione: (2025)
di: Zhang, Jie, et al.
Pubblicazione: (2025)
Uncovering Bias in Large Vision-Language Models with Counterfactuals
di: Howard, Phillip, et al.
Pubblicazione: (2024)
di: Howard, Phillip, et al.
Pubblicazione: (2024)
EgoSim: Egocentric World Simulator for Embodied Interaction Generation
di: Hao, Jinkun, et al.
Pubblicazione: (2026)
di: Hao, Jinkun, et al.
Pubblicazione: (2026)
Adversarial Prompt Distillation for Vision-Language Models
di: Luo, Lin, et al.
Pubblicazione: (2024)
di: Luo, Lin, et al.
Pubblicazione: (2024)
On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression
di: Zhang, Xinwei, et al.
Pubblicazione: (2026)
di: Zhang, Xinwei, et al.
Pubblicazione: (2026)
Cognitively-Inspired Tokens Overcome Egocentric Bias in Multimodal Models
di: Leonard, Bridget, et al.
Pubblicazione: (2026)
di: Leonard, Bridget, et al.
Pubblicazione: (2026)
FAIntbench: A Holistic and Precise Benchmark for Bias Evaluation in Text-to-Image Models
di: Luo, Hanjun, et al.
Pubblicazione: (2024)
di: Luo, Hanjun, et al.
Pubblicazione: (2024)
EchoBench: Benchmarking Sycophancy in Medical Large Vision-Language Models
di: Yuan, Botai, et al.
Pubblicazione: (2025)
di: Yuan, Botai, et al.
Pubblicazione: (2025)
ENACT: Evaluating Embodied Cognition with World Modeling of Egocentric Interaction
di: Wang, Qineng, et al.
Pubblicazione: (2025)
di: Wang, Qineng, et al.
Pubblicazione: (2025)
Freeze and Reveal: Exposing Modality Bias in Vision-Language Models
di: Kavuri, Vivek Hruday, et al.
Pubblicazione: (2025)
di: Kavuri, Vivek Hruday, et al.
Pubblicazione: (2025)
VLADriver-RAG: Retrieval-Augmented Vision-Language-Action Models for Autonomous Driving
di: Zhao, Rui, et al.
Pubblicazione: (2026)
di: Zhao, Rui, et al.
Pubblicazione: (2026)
The Point, the Vision and the Text: Does Point Cloud Boost Spatial Reasoning of Large Language Models? A Bias-Controlled Study
di: Zhang, Weichen, et al.
Pubblicazione: (2025)
di: Zhang, Weichen, et al.
Pubblicazione: (2025)
Can 3D Vision-Language Models Truly Understand Natural Language?
di: Deng, Weipeng, et al.
Pubblicazione: (2024)
di: Deng, Weipeng, et al.
Pubblicazione: (2024)
MOSABench: Multi-Object Sentiment Analysis Benchmark for Evaluating Multimodal Large Language Models Understanding of Complex Image
di: Song, Shezheng, et al.
Pubblicazione: (2024)
di: Song, Shezheng, et al.
Pubblicazione: (2024)
Text-driven Affordance Learning from Egocentric Vision
di: Yoshida, Tomoya, et al.
Pubblicazione: (2024)
di: Yoshida, Tomoya, et al.
Pubblicazione: (2024)
BiasICL: In-Context Learning and Demographic Biases of Vision Language Models
di: Xu, Sonnet, et al.
Pubblicazione: (2025)
di: Xu, Sonnet, et al.
Pubblicazione: (2025)
Holmes: Towards Effective and Harmless Model Ownership Verification to Personalized Large Vision Models via Decoupling Common Features
di: Zhu, Linghui, et al.
Pubblicazione: (2025)
di: Zhu, Linghui, et al.
Pubblicazione: (2025)
Benchmarking Egocentric Clinical Intent Understanding Capability for Medical Multimodal Large Language Models
di: Liu, Shaonan, et al.
Pubblicazione: (2026)
di: Liu, Shaonan, et al.
Pubblicazione: (2026)
GeoWorld-VLM: Geometry from World Models for Vision-Language Models
di: Gu, Renjie, et al.
Pubblicazione: (2026)
di: Gu, Renjie, et al.
Pubblicazione: (2026)
Training-Free Unsupervised Prompt for Vision-Language Models
di: Long, Sifan, et al.
Pubblicazione: (2024)
di: Long, Sifan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Vision-Language Models Mistake Head Orientation for Gaze Direction: Nonverbal Conversation Cues
di: Zhang, Zory, et al.
Pubblicazione: (2025) -
Core Knowledge Deficits in Multi-Modal Language Models
di: Li, Yijiang, et al.
Pubblicazione: (2024) -
Probing Perceptual Constancy in Large Vision-Language Models
di: Sun, Haoran, et al.
Pubblicazione: (2025) -
Vision Language Models Cannot Reason About Physical Transformation
di: Luo, Dezhi, et al.
Pubblicazione: (2026) -
Probing Mechanical Reasoning in Large Vision Language Models
di: Sun, Haoran, et al.
Pubblicazione: (2024)