Can Vision Language Models Learn from Visual Demonstrations of Ambiguous Spatial Reasoning?
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhao, Bowen, Dirac, Leo Parker, Varshavskaya, Paulina |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Reinforcing VLMs to Use Tools for Detailed Visual Reasoning Under Resource Constraints
di: Kumar, Sunil, et al.
Pubblicazione: (2025)
di: Kumar, Sunil, et al.
Pubblicazione: (2025)
Fine-tuning Vision Classifiers On A Budget
di: Kumar, Sunil, et al.
Pubblicazione: (2024)
di: Kumar, Sunil, et al.
Pubblicazione: (2024)
ChartMuseum: Testing Visual Reasoning Capabilities of Large Vision-Language Models
di: Tang, Liyan, et al.
Pubblicazione: (2025)
di: Tang, Liyan, et al.
Pubblicazione: (2025)
Sparkle: Mastering Basic Spatial Capabilities in Vision Language Models Elicits Generalization to Spatial Reasoning
di: Tang, Yihong, et al.
Pubblicazione: (2024)
di: Tang, Yihong, et al.
Pubblicazione: (2024)
Mind the Gap: Benchmarking Spatial Reasoning in Vision-Language Models
di: Stogiannidis, Ilias, et al.
Pubblicazione: (2025)
di: Stogiannidis, Ilias, et al.
Pubblicazione: (2025)
Towards Grounded Visual Spatial Reasoning in Multi-Modal Vision Language Models
di: Rajabi, Navid, et al.
Pubblicazione: (2023)
di: Rajabi, Navid, et al.
Pubblicazione: (2023)
Learning GUI Grounding with Spatial Reasoning from Visual Feedback
di: Zhao, Yu, et al.
Pubblicazione: (2025)
di: Zhao, Yu, et al.
Pubblicazione: (2025)
VAGUE: Visual Contexts Clarify Ambiguous Expressions
di: Nam, Heejeong, et al.
Pubblicazione: (2024)
di: Nam, Heejeong, et al.
Pubblicazione: (2024)
BabyVision: Visual Reasoning Beyond Language
di: Chen, Liang, et al.
Pubblicazione: (2026)
di: Chen, Liang, et al.
Pubblicazione: (2026)
Reasoning Paths with Reference Objects Elicit Quantitative Spatial Reasoning in Large Vision-Language Models
di: Liao, Yuan-Hong, et al.
Pubblicazione: (2024)
di: Liao, Yuan-Hong, et al.
Pubblicazione: (2024)
SpatialLadder: Progressive Training for Spatial Reasoning in Vision-Language Models
di: Li, Hongxing, et al.
Pubblicazione: (2025)
di: Li, Hongxing, et al.
Pubblicazione: (2025)
Rethinking Visual Dependency in Long-Context Reasoning for Large Vision-Language Models
di: Zhou, Yucheng, et al.
Pubblicazione: (2024)
di: Zhou, Yucheng, et al.
Pubblicazione: (2024)
Visual Program Distillation: Distilling Tools and Programmatic Reasoning into Vision-Language Models
di: Hu, Yushi, et al.
Pubblicazione: (2023)
di: Hu, Yushi, et al.
Pubblicazione: (2023)
Visual In-Context Learning for Large Vision-Language Models
di: Zhou, Yucheng, et al.
Pubblicazione: (2024)
di: Zhou, Yucheng, et al.
Pubblicazione: (2024)
3ViewSense: Spatial and Mental Perspective Reasoning from Orthographic Views in Vision-Language Models
di: Zhan, Shaoxiong, et al.
Pubblicazione: (2026)
di: Zhan, Shaoxiong, et al.
Pubblicazione: (2026)
Judging the Judges: Can Large Vision-Language Models Fairly Evaluate Chart Comprehension and Reasoning?
di: Laskar, Md Tahmid Rahman, et al.
Pubblicazione: (2025)
di: Laskar, Md Tahmid Rahman, et al.
Pubblicazione: (2025)
OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models
di: Jia, Mengdi, et al.
Pubblicazione: (2025)
di: Jia, Mengdi, et al.
Pubblicazione: (2025)
Benchmarking and Improving Large Vision-Language Models for Fundamental Visual Graph Understanding and Reasoning
di: Zhu, Yingjie, et al.
Pubblicazione: (2024)
di: Zhu, Yingjie, et al.
Pubblicazione: (2024)
Can Vision-Language Models Solve Visual Math Equations?
di: Choudhury, Monjoy Narayan, et al.
Pubblicazione: (2025)
di: Choudhury, Monjoy Narayan, et al.
Pubblicazione: (2025)
SpatiaLab: Can Vision-Language Models Perform Spatial Reasoning in the Wild?
di: Wasi, Azmine Toushik, et al.
Pubblicazione: (2026)
di: Wasi, Azmine Toushik, et al.
Pubblicazione: (2026)
Scale Can't Overcome Pragmatics: The Impact of Reporting Bias on Vision-Language Reasoning
di: Kamath, Amita, et al.
Pubblicazione: (2026)
di: Kamath, Amita, et al.
Pubblicazione: (2026)
Can We Predict Performance of Large Models across Vision-Language Tasks?
di: Zhao, Qinyu, et al.
Pubblicazione: (2024)
di: Zhao, Qinyu, et al.
Pubblicazione: (2024)
SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities
di: Chen, Boyuan, et al.
Pubblicazione: (2024)
di: Chen, Boyuan, et al.
Pubblicazione: (2024)
Can Vision-Language Models Solve the Shell Game?
di: Liu, Tiedong, et al.
Pubblicazione: (2026)
di: Liu, Tiedong, et al.
Pubblicazione: (2026)
Can Vision-Language Models Evaluate Handwritten Math?
di: Nath, Oikantik, et al.
Pubblicazione: (2025)
di: Nath, Oikantik, et al.
Pubblicazione: (2025)
End-to-End Navigation with Vision Language Models: Transforming Spatial Reasoning into Question-Answering
di: Goetting, Dylan, et al.
Pubblicazione: (2024)
di: Goetting, Dylan, et al.
Pubblicazione: (2024)
Investigating Spatial Attention Bias in Vision-Language Models
di: Chaudhary, Aryan, et al.
Pubblicazione: (2025)
di: Chaudhary, Aryan, et al.
Pubblicazione: (2025)
Open Vision Reasoner: Transferring Linguistic Cognitive Behavior for Visual Reasoning
di: Wei, Yana, et al.
Pubblicazione: (2025)
di: Wei, Yana, et al.
Pubblicazione: (2025)
A Gaze-grounded Visual Question Answering Dataset for Clarifying Ambiguous Japanese Questions
di: Inadumi, Shun, et al.
Pubblicazione: (2024)
di: Inadumi, Shun, et al.
Pubblicazione: (2024)
Decomposed On-Policy Distillation for Vision-Language Reasoning: Steering Gradients for Visual Grounding
di: Yoon, Hee Suk, et al.
Pubblicazione: (2026)
di: Yoon, Hee Suk, et al.
Pubblicazione: (2026)
Can Large Vision-Language Models Understand Multimodal Sarcasm?
di: Wang, Xinyu, et al.
Pubblicazione: (2025)
di: Wang, Xinyu, et al.
Pubblicazione: (2025)
Do Vision-Language Models Really Understand Visual Language?
di: Hou, Yifan, et al.
Pubblicazione: (2024)
di: Hou, Yifan, et al.
Pubblicazione: (2024)
TopViewRS: Vision-Language Models as Top-View Spatial Reasoners
di: Li, Chengzu, et al.
Pubblicazione: (2024)
di: Li, Chengzu, et al.
Pubblicazione: (2024)
Mechanistic Diagnostics of Spatial Lexical Bias in Multimodal Large Language Model Spatial Reasoning
di: Ma, Chuang, et al.
Pubblicazione: (2026)
di: Ma, Chuang, et al.
Pubblicazione: (2026)
STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models
di: Liang, Yiming, et al.
Pubblicazione: (2026)
di: Liang, Yiming, et al.
Pubblicazione: (2026)
Vision-Language Models Suppress Female Representations Under Ambiguous Input
di: Marin-Llobet, Arnau, et al.
Pubblicazione: (2026)
di: Marin-Llobet, Arnau, et al.
Pubblicazione: (2026)
PROGRESSLM: Towards Progress Reasoning in Vision-Language Models
di: Zhang, Jianshu, et al.
Pubblicazione: (2026)
di: Zhang, Jianshu, et al.
Pubblicazione: (2026)
Advancing Multimodal In-Context Learning in Large Vision-Language Models with Task-aware Demonstrations
di: Li, Yanshu
Pubblicazione: (2025)
di: Li, Yanshu
Pubblicazione: (2025)
On Efficient Language and Vision Assistants for Visually-Situated Natural Language Understanding: What Matters in Reading and Reasoning
di: Kim, Geewook, et al.
Pubblicazione: (2024)
di: Kim, Geewook, et al.
Pubblicazione: (2024)
Mechanistic Finetuning of Vision-Language-Action Models via Few-Shot Demonstrations
di: Mitra, Chancharik, et al.
Pubblicazione: (2025)
di: Mitra, Chancharik, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Reinforcing VLMs to Use Tools for Detailed Visual Reasoning Under Resource Constraints
di: Kumar, Sunil, et al.
Pubblicazione: (2025) -
Fine-tuning Vision Classifiers On A Budget
di: Kumar, Sunil, et al.
Pubblicazione: (2024) -
ChartMuseum: Testing Visual Reasoning Capabilities of Large Vision-Language Models
di: Tang, Liyan, et al.
Pubblicazione: (2025) -
Sparkle: Mastering Basic Spatial Capabilities in Vision Language Models Elicits Generalization to Spatial Reasoning
di: Tang, Yihong, et al.
Pubblicazione: (2024) -
Mind the Gap: Benchmarking Spatial Reasoning in Vision-Language Models
di: Stogiannidis, Ilias, et al.
Pubblicazione: (2025)