Seeing Isn't Knowing: Do VLMs Know When Not to Answer Spatial Questions (and Why)?
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Yue, Wang, Zun, Lin, Han, Bitton, Yonatan, Szpektor, Idan, Bansal, Mohit |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Error-Driven Scene Editing for 3D Grounding in Large Language Models
par: Zhang, Yue, et autres
Publié: (2025)
par: Zhang, Yue, et autres
Publié: (2025)
Knowing the Answer Isn't Enough: Fixing Reasoning Path Failures in LVLMs
par: Wang, Chaoyang, et autres
Publié: (2025)
par: Wang, Chaoyang, et autres
Publié: (2025)
Bridging the Visual Gap: Fine-Tuning Multimodal Models with Knowledge-Adapted Captions
par: Yanuka, Moran, et autres
Publié: (2024)
par: Yanuka, Moran, et autres
Publié: (2024)
Mismatch Quest: Visual and Textual Feedback for Image-Text Misalignment
par: Gordon, Brian, et autres
Publié: (2023)
par: Gordon, Brian, et autres
Publié: (2023)
Unblocking Fine-Grained Evaluation of Detailed Captions: An Explaining AutoRater and Critic-and-Revise Pipeline
par: Gordon, Brian, et autres
Publié: (2025)
par: Gordon, Brian, et autres
Publié: (2025)
Visual Riddles: a Commonsense and World Knowledge Challenge for Large Vision and Language Models
par: Bitton-Guetta, Nitzan, et autres
Publié: (2024)
par: Bitton-Guetta, Nitzan, et autres
Publié: (2024)
Seeing Isn't Believing: Uncovering Blind Spots in Evaluator Vision-Language Models
par: Khan, Mohammed Safi Ur Rahman, et autres
Publié: (2026)
par: Khan, Mohammed Safi Ur Rahman, et autres
Publié: (2026)
Knowing When Not to Answer: Evaluating Abstention in Multimodal Reasoning Systems
par: Madhusudhan, Nishanth, et autres
Publié: (2026)
par: Madhusudhan, Nishanth, et autres
Publié: (2026)
Contrastive Sequential-Diffusion Learning: Non-linear and Multi-Scene Instructional Video Synthesis
par: Ramos, Vasco, et autres
Publié: (2024)
par: Ramos, Vasco, et autres
Publié: (2024)
When and How Much to Imagine: Adaptive Test-Time Scaling with World Models for Visual Spatial Reasoning
par: Yu, Shoubin, et autres
Publié: (2026)
par: Yu, Shoubin, et autres
Publié: (2026)
TALC: Time-Aligned Captions for Multi-Scene Text-to-Video Generation
par: Bansal, Hritik, et autres
Publié: (2024)
par: Bansal, Hritik, et autres
Publié: (2024)
3DLLM-Mem: Long-Term Spatial-Temporal Memory for Embodied 3D Large Language Model
par: Hu, Wenbo, et autres
Publié: (2025)
par: Hu, Wenbo, et autres
Publié: (2025)
DreamRunner: Fine-Grained Compositional Story-to-Video Generation with Retrieval-Augmented Motion Adaptation
par: Wang, Zun, et autres
Publié: (2024)
par: Wang, Zun, et autres
Publié: (2024)
Video-STaR: Self-Training Enables Video Instruction Tuning with Any Supervision
par: Zohar, Orr, et autres
Publié: (2024)
par: Zohar, Orr, et autres
Publié: (2024)
Beyond Words: Multimodal LLM Knows When to Speak
par: Liao, Zikai, et autres
Publié: (2025)
par: Liao, Zikai, et autres
Publié: (2025)
GrAInS: Gradient-based Attribution for Inference-Time Steering of LLMs and VLMs
par: Nguyen, Duy, et autres
Publié: (2025)
par: Nguyen, Duy, et autres
Publié: (2025)
Planning with Sketch-Guided Verification for Physics-Aware Video Generation
par: Huang, Yidong, et autres
Publié: (2025)
par: Huang, Yidong, et autres
Publié: (2025)
AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
par: Wang, Zun, et autres
Publié: (2026)
par: Wang, Zun, et autres
Publié: (2026)
RefVNLI: Towards Scalable Evaluation of Subject-driven Text-to-image Generation
par: Slobodkin, Aviv, et autres
Publié: (2025)
par: Slobodkin, Aviv, et autres
Publié: (2025)
Seeing Isn't Orienting: A Cognitively Grounded Benchmark Reveals Systematic Orientation Failures in MLLMs
par: Tasnim, Nazia, et autres
Publié: (2025)
par: Tasnim, Nazia, et autres
Publié: (2025)
Generating Coherent Sequences of Visual Illustrations for Real-World Manual Tasks
par: Bordalo, João, et autres
Publié: (2024)
par: Bordalo, João, et autres
Publié: (2024)
Vision-and-Language Navigation Today and Tomorrow: A Survey in the Era of Foundation Models
par: Zhang, Yue, et autres
Publié: (2024)
par: Zhang, Yue, et autres
Publié: (2024)
Seeing Isn't Orienting: A Cognitively Grounded Benchmark Reveals Systematic Orientation Failures in MLLMs Supplementary
par: Tasnim, Nazia, et autres
Publié: (2026)
par: Tasnim, Nazia, et autres
Publié: (2026)
Seeing Isn't Believing: Context-Aware Adversarial Patch Synthesis via Conditional GAN
par: Kazoom, Roie, et autres
Publié: (2025)
par: Kazoom, Roie, et autres
Publié: (2025)
See It from My Perspective: How Language Affects Cultural Bias in Image Understanding
par: Ananthram, Amith, et autres
Publié: (2024)
par: Ananthram, Amith, et autres
Publié: (2024)
VideoLLM Knows When to Speak: Enhancing Time-Sensitive Video Comprehension with Video-Text Duet Interaction Format
par: Wang, Yueqian, et autres
Publié: (2024)
par: Wang, Yueqian, et autres
Publié: (2024)
When Pretty Isn't Useful: Investigating Why Modern Text-to-Image Models Fail as Reliable Training Data Generators
par: Adamkiewicz, Krzysztof, et autres
Publié: (2026)
par: Adamkiewicz, Krzysztof, et autres
Publié: (2026)
Are VLMs Seeing or Just Saying? Uncovering the Illusion of Visual Re-examination
par: Shi, Chufan, et autres
Publié: (2026)
par: Shi, Chufan, et autres
Publié: (2026)
LLMs Know More Than They Show: On the Intrinsic Representation of LLM Hallucinations
par: Orgad, Hadas, et autres
Publié: (2024)
par: Orgad, Hadas, et autres
Publié: (2024)
Seeing Isn't Always Believing: Analysis of Grad-CAM Faithfulness and Localization Reliability in Lung Cancer CT Classification
par: Panboonyuen, Teerapong
Publié: (2026)
par: Panboonyuen, Teerapong
Publié: (2026)
Inverse Scaling: When Bigger Isn't Better
par: McKenzie, Ian R., et autres
Publié: (2023)
par: McKenzie, Ian R., et autres
Publié: (2023)
Rephrase, Augment, Reason: Visual Grounding of Questions for Vision-Language Models
par: Prasad, Archiki, et autres
Publié: (2023)
par: Prasad, Archiki, et autres
Publié: (2023)
"I Know It When I See It": Mood Spaces for Connecting and Expressing Visual Concepts
par: Yang, Huzheng, et autres
Publié: (2025)
par: Yang, Huzheng, et autres
Publié: (2025)
Reasmory: 3D Reconstruction as Explicit Memory for VLMs Spatial Reasoning
par: He, Jixuan, et autres
Publié: (2026)
par: He, Jixuan, et autres
Publié: (2026)
Decompose and Compare Consistency: Measuring VLMs' Answer Reliability via Task-Decomposition Consistency Comparison
par: Yang, Qian, et autres
Publié: (2024)
par: Yang, Qian, et autres
Publié: (2024)
When One Moment Isn't Enough: Multi-Moment Retrieval with Cross-Moment Interactions
par: Cao, Zhuo, et autres
Publié: (2025)
par: Cao, Zhuo, et autres
Publié: (2025)
Right this way: Can VLMs Guide Us to See More to Answer Questions?
par: Liu, Li, et autres
Publié: (2024)
par: Liu, Li, et autres
Publié: (2024)
CAPTURe: Evaluating Spatial Reasoning in Vision Language Models via Occluded Object Counting
par: Pothiraj, Atin, et autres
Publié: (2025)
par: Pothiraj, Atin, et autres
Publié: (2025)
When Seeing Overrides Knowing: Disentangling Knowledge Conflicts in Vision-Language Models
par: Ortu, Francesco, et autres
Publié: (2025)
par: Ortu, Francesco, et autres
Publié: (2025)
SAME: Learning Generic Language-Guided Visual Navigation with State-Adaptive Mixture of Experts
par: Zhou, Gengze, et autres
Publié: (2024)
par: Zhou, Gengze, et autres
Publié: (2024)
Documents similaires
-
Error-Driven Scene Editing for 3D Grounding in Large Language Models
par: Zhang, Yue, et autres
Publié: (2025) -
Knowing the Answer Isn't Enough: Fixing Reasoning Path Failures in LVLMs
par: Wang, Chaoyang, et autres
Publié: (2025) -
Bridging the Visual Gap: Fine-Tuning Multimodal Models with Knowledge-Adapted Captions
par: Yanuka, Moran, et autres
Publié: (2024) -
Mismatch Quest: Visual and Textual Feedback for Image-Text Misalignment
par: Gordon, Brian, et autres
Publié: (2023) -
Unblocking Fine-Grained Evaluation of Detailed Captions: An Explaining AutoRater and Critic-and-Revise Pipeline
par: Gordon, Brian, et autres
Publié: (2025)