Beyond Accuracy: Evaluating Visual Grounding In Multimodal Medical Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Zafar, Anas, Murali, Leema Krishna, Vashist, Ashish |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Towards Responsible Multimodal Medical Reasoning via Context-Aligned Vision-Language Models
di: Khan, Sumra, et al.
Pubblicazione: (2026)
di: Khan, Sumra, et al.
Pubblicazione: (2026)
Beyond Accuracy: Evaluating Grounded Visual Evidence in Thinking with Images
di: Li, Xuchen, et al.
Pubblicazione: (2026)
di: Li, Xuchen, et al.
Pubblicazione: (2026)
Spatial Reasoning is Not a Free Lunch: A Controlled Study on LLaVA
di: Alam, Nahid, et al.
Pubblicazione: (2026)
di: Alam, Nahid, et al.
Pubblicazione: (2026)
Where Do Vision-Language Models Fail? World Scale Analysis for Image Geolocalization
di: Bharadwaj, Siddhant, et al.
Pubblicazione: (2026)
di: Bharadwaj, Siddhant, et al.
Pubblicazione: (2026)
MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning
di: Wu, Chengfei, et al.
Pubblicazione: (2025)
di: Wu, Chengfei, et al.
Pubblicazione: (2025)
ImageNet-Think-250K: A Large-Scale Synthetic Dataset for Multimodal Reasoning for Vision Language Models
di: Chitty-Venkata, Krishna Teja, et al.
Pubblicazione: (2025)
di: Chitty-Venkata, Krishna Teja, et al.
Pubblicazione: (2025)
The Spatial Blindspot of Vision-Language Models
di: Alam, Nahid, et al.
Pubblicazione: (2026)
di: Alam, Nahid, et al.
Pubblicazione: (2026)
Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning
di: Ni, Minheng, et al.
Pubblicazione: (2025)
di: Ni, Minheng, et al.
Pubblicazione: (2025)
FOD-S2R: A FOD Dataset for Sim2Real Transfer Learning based Object Detection
di: Vashist, Ashish, et al.
Pubblicazione: (2025)
di: Vashist, Ashish, et al.
Pubblicazione: (2025)
Fleming-VL: Towards Universal Medical Visual Reasoning with Multimodal LLMs
di: Shu, Yan, et al.
Pubblicazione: (2025)
di: Shu, Yan, et al.
Pubblicazione: (2025)
v1: Learning to Point Visual Tokens for Multimodal Grounded Reasoning
di: Chung, Jiwan, et al.
Pubblicazione: (2025)
di: Chung, Jiwan, et al.
Pubblicazione: (2025)
Localizing Before Answering: A Hallucination Evaluation Benchmark for Grounded Medical Multimodal LLMs
di: Nguyen, Dung, et al.
Pubblicazione: (2025)
di: Nguyen, Dung, et al.
Pubblicazione: (2025)
MOTOR: Multimodal Optimal Transport via Grounded Retrieval in Medical Visual Question Answering
di: Shaaban, Mai A., et al.
Pubblicazione: (2025)
di: Shaaban, Mai A., et al.
Pubblicazione: (2025)
Grounded Reinforcement Learning for Visual Reasoning
di: Sarch, Gabriel, et al.
Pubblicazione: (2025)
di: Sarch, Gabriel, et al.
Pubblicazione: (2025)
See It, Say It, Sorted: An Iterative Training-Free Framework for Visually-Grounded Multimodal Reasoning in LVLMs
di: Zhang, Yongchang, et al.
Pubblicazione: (2026)
di: Zhang, Yongchang, et al.
Pubblicazione: (2026)
Parameter-Efficient Fine-Tuning Medical Multimodal Large Language Models for Medical Visual Grounding
di: He, Jinlong, et al.
Pubblicazione: (2024)
di: He, Jinlong, et al.
Pubblicazione: (2024)
Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations
di: Li, Linjie, et al.
Pubblicazione: (2025)
di: Li, Linjie, et al.
Pubblicazione: (2025)
Clinically-Grounded Counterfactual Reasoning for Medical Video Diagnosis
di: Gao, Jianzhe, et al.
Pubblicazione: (2026)
di: Gao, Jianzhe, et al.
Pubblicazione: (2026)
Beyond Accuracy: Benchmarking Cross-Task Consistency in Unified Multimodal Models
di: Wang, Weixing, et al.
Pubblicazione: (2026)
di: Wang, Weixing, et al.
Pubblicazione: (2026)
RegionReasoner: Region-Grounded Multi-Round Visual Reasoning
di: Sun, Wenfang, et al.
Pubblicazione: (2026)
di: Sun, Wenfang, et al.
Pubblicazione: (2026)
Visual Reasoning Tracer: Object-Level Grounded Reasoning Benchmark
di: Yuan, Haobo, et al.
Pubblicazione: (2025)
di: Yuan, Haobo, et al.
Pubblicazione: (2025)
Beyond Anatomy: Explainable ASD Classification from rs-fMRI via Functional Parcellation and Graph Attention Networks
di: Madani, Syeda Hareem, et al.
Pubblicazione: (2026)
di: Madani, Syeda Hareem, et al.
Pubblicazione: (2026)
Beyond Referring Expressions: Scenario Comprehension Visual Grounding
di: He, Ruozhen, et al.
Pubblicazione: (2026)
di: He, Ruozhen, et al.
Pubblicazione: (2026)
Beyond Quantity: Distribution-Aware Labeling for Visual Grounding
di: Zhang, Yichi, et al.
Pubblicazione: (2025)
di: Zhang, Yichi, et al.
Pubblicazione: (2025)
REVEAL: Reference-Grounded Reasoning for Multimodal Manipulation Detection
di: Zhou, Jun, et al.
Pubblicazione: (2026)
di: Zhou, Jun, et al.
Pubblicazione: (2026)
Unveiling Fine-Grained Visual Traces: Evaluating Multimodal Interleaved Reasoning Chains in Multimodal STEM Tasks
di: Jin, Jing, et al.
Pubblicazione: (2026)
di: Jin, Jing, et al.
Pubblicazione: (2026)
RGBT-Ground Benchmark: Visual Grounding Beyond RGB in Complex Real-World Scenarios
di: Zhao, Tianyi, et al.
Pubblicazione: (2025)
di: Zhao, Tianyi, et al.
Pubblicazione: (2025)
Generate to Ground: Multimodal Text Conditioning Boosts Phrase Grounding in Medical Vision-Language Models
di: Nützel, Felix, et al.
Pubblicazione: (2025)
di: Nützel, Felix, et al.
Pubblicazione: (2025)
Ground-R1: Incentivizing Grounded Visual Reasoning via Reinforcement Learning
di: Cao, Meng, et al.
Pubblicazione: (2025)
di: Cao, Meng, et al.
Pubblicazione: (2025)
Multimodal Reference Visual Grounding
di: Lu, Yangxiao, et al.
Pubblicazione: (2025)
di: Lu, Yangxiao, et al.
Pubblicazione: (2025)
Evaluating Reasoning Faithfulness in Medical Vision-Language Models using Multimodal Perturbations
di: Moll, Johannes, et al.
Pubblicazione: (2025)
di: Moll, Johannes, et al.
Pubblicazione: (2025)
Beyond Accuracy: Metrics that Uncover What Makes a 'Good' Visual Descriptor
di: Lin, Ethan, et al.
Pubblicazione: (2025)
di: Lin, Ethan, et al.
Pubblicazione: (2025)
Beyond Medical Diagnostics: How Medical Multimodal Large Language Models Think in Space
di: Trinh, Quoc-Huy, et al.
Pubblicazione: (2026)
di: Trinh, Quoc-Huy, et al.
Pubblicazione: (2026)
MedVLThinker: Simple Baselines for Multimodal Medical Reasoning
di: Huang, Xiaoke, et al.
Pubblicazione: (2025)
di: Huang, Xiaoke, et al.
Pubblicazione: (2025)
Traceable Evidence Enhanced Visual Grounded Reasoning: Evaluation and Methodology
di: Wang, Haochen, et al.
Pubblicazione: (2025)
di: Wang, Haochen, et al.
Pubblicazione: (2025)
Adversarial Robustness for Visual Grounding of Multimodal Large Language Models
di: Gao, Kuofeng, et al.
Pubblicazione: (2024)
di: Gao, Kuofeng, et al.
Pubblicazione: (2024)
Prototype-Aware Multimodal Alignment for Open-Vocabulary Visual Grounding
di: Xie, Jiangnan, et al.
Pubblicazione: (2025)
di: Xie, Jiangnan, et al.
Pubblicazione: (2025)
Thinking Diffusion: Penalize and Guide Visual-Grounded Reasoning in Diffusion Multimodal Language Models
di: Kim, Keuntae, et al.
Pubblicazione: (2026)
di: Kim, Keuntae, et al.
Pubblicazione: (2026)
Enhancing Medical Visual Grounding via Knowledge-guided Spatial Prompts
di: Gao, Yifan, et al.
Pubblicazione: (2026)
di: Gao, Yifan, et al.
Pubblicazione: (2026)
GroundVTS: Visual Token Sampling in Multimodal Large Language Models for Video Temporal Grounding
di: Fan, Rong, et al.
Pubblicazione: (2026)
di: Fan, Rong, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Towards Responsible Multimodal Medical Reasoning via Context-Aligned Vision-Language Models
di: Khan, Sumra, et al.
Pubblicazione: (2026) -
Beyond Accuracy: Evaluating Grounded Visual Evidence in Thinking with Images
di: Li, Xuchen, et al.
Pubblicazione: (2026) -
Spatial Reasoning is Not a Free Lunch: A Controlled Study on LLaVA
di: Alam, Nahid, et al.
Pubblicazione: (2026) -
Where Do Vision-Language Models Fail? World Scale Analysis for Image Geolocalization
di: Bharadwaj, Siddhant, et al.
Pubblicazione: (2026) -
MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning
di: Wu, Chengfei, et al.
Pubblicazione: (2025)