MedGround: Bridging the Evidence Gap in Medical Vision-Language Models with Verified Grounding Data
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Mengmeng, Wu, Xiaoping, Luo, Hao, Wang, Fan, Lv, Yisheng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MedGround-R1: Advancing Medical Image Grounding via Spatial-Semantic Rewarded Group Relative Policy Optimization
por: Xu, Huihui, et al.
Publicado: (2025)
por: Xu, Huihui, et al.
Publicado: (2025)
Med-R2: An Adversarial Benchmark for Evidence-Grounded Reasoning in Medical VLMs
por: Ma, Wen, et al.
Publicado: (2026)
por: Ma, Wen, et al.
Publicado: (2026)
VividMed: Vision Language Model with Versatile Visual Grounding for Medicine
por: Luo, Lingxiao, et al.
Publicado: (2024)
por: Luo, Lingxiao, et al.
Publicado: (2024)
MedMO: Grounding and Understanding Multimodal Large Language Model for Medical Images
por: Deria, Ankan, et al.
Publicado: (2026)
por: Deria, Ankan, et al.
Publicado: (2026)
Generate to Ground: Multimodal Text Conditioning Boosts Phrase Grounding in Medical Vision-Language Models
por: Nützel, Felix, et al.
Publicado: (2025)
por: Nützel, Felix, et al.
Publicado: (2025)
AgriChain Visually Grounded Expert Verified Reasoning for Interpretable Agricultural Vision Language Models
por: Mahmood, Hazza, et al.
Publicado: (2026)
por: Mahmood, Hazza, et al.
Publicado: (2026)
MedSG-Bench: A Benchmark for Medical Image Sequences Grounding
por: Yue, Jingkun, et al.
Publicado: (2025)
por: Yue, Jingkun, et al.
Publicado: (2025)
Visual Alignment of Medical Vision-Language Models for Grounded Radiology Report Generation
por: Bose, Sarosij, et al.
Publicado: (2025)
por: Bose, Sarosij, et al.
Publicado: (2025)
3DReasonKnee: Advancing Grounded Reasoning in Medical Vision Language Models
por: Sambara, Sraavya, et al.
Publicado: (2025)
por: Sambara, Sraavya, et al.
Publicado: (2025)
RoboGround: Robotic Manipulation with Grounded Vision-Language Priors
por: Huang, Haifeng, et al.
Publicado: (2025)
por: Huang, Haifeng, et al.
Publicado: (2025)
OpenCOOD-Air: Prompting Heterogeneous Ground-Air Collaborative Perception with Spatial Conversion and Offset Prediction
por: Wu, Xianke, et al.
Publicado: (2026)
por: Wu, Xianke, et al.
Publicado: (2026)
Hulu-Med: A Transparent Generalist Model towards Holistic Medical Vision-Language Understanding
por: Jiang, Songtao, et al.
Publicado: (2025)
por: Jiang, Songtao, et al.
Publicado: (2025)
To Agree or To Be Right? The Grounding-Sycophancy Tradeoff in Medical Vision-Language Models
por: Aranya, OFM Riaz Rahman, et al.
Publicado: (2026)
por: Aranya, OFM Riaz Rahman, et al.
Publicado: (2026)
GroundingME: Exposing the Visual Grounding Gap in MLLMs through Multi-Dimensional Evaluation
por: Li, Rang, et al.
Publicado: (2025)
por: Li, Rang, et al.
Publicado: (2025)
Bridging Modality Gap for Visual Grounding with Effecitve Cross-modal Distillation
por: Wang, Jiaxi, et al.
Publicado: (2023)
por: Wang, Jiaxi, et al.
Publicado: (2023)
Med-GLIP: Advancing Medical Language-Image Pre-training with Large-scale Grounded Dataset
por: Deng, Ziye, et al.
Publicado: (2025)
por: Deng, Ziye, et al.
Publicado: (2025)
Are Large Vision Language Models Truly Grounded in Medical Images? Evidence from Italian Clinical Visual Question Answering
por: Felizzi, Federico, et al.
Publicado: (2025)
por: Felizzi, Federico, et al.
Publicado: (2025)
Instruction-Evidence Contrastive Dual-Stream Decoding for Grounded Vision-Language Reasoning
por: Bangde, Yashwant Pravinrao, et al.
Publicado: (2026)
por: Bangde, Yashwant Pravinrao, et al.
Publicado: (2026)
Semantically Grounded QFormer for Efficient Vision Language Understanding
por: Choraria, Moulik, et al.
Publicado: (2023)
por: Choraria, Moulik, et al.
Publicado: (2023)
Bridging Vision Language Models and Symbolic Grounding for Video Question Answering
por: Ma, Haodi, et al.
Publicado: (2025)
por: Ma, Haodi, et al.
Publicado: (2025)
GeoGround: A Unified Large Vision-Language Model for Remote Sensing Visual Grounding
por: Zhou, Yue, et al.
Publicado: (2024)
por: Zhou, Yue, et al.
Publicado: (2024)
Entropy-Gradient Grounding: Training-Free Evidence Retrieval in Vision-Language Models
por: Gröpl, Marcel, et al.
Publicado: (2026)
por: Gröpl, Marcel, et al.
Publicado: (2026)
DenseGrounding: Improving Dense Language-Vision Semantics for Ego-Centric 3D Visual Grounding
por: Zheng, Henry, et al.
Publicado: (2025)
por: Zheng, Henry, et al.
Publicado: (2025)
Bridging Time and Space: Decoupled Spatio-Temporal Alignment for Video Grounding
por: Tu, Xuezhen, et al.
Publicado: (2026)
por: Tu, Xuezhen, et al.
Publicado: (2026)
MASS: Motion-Aware Spatial-Temporal Grounding for Physics Reasoning and Comprehension in Vision-Language Models
por: Wu, Xiyang, et al.
Publicado: (2025)
por: Wu, Xiyang, et al.
Publicado: (2025)
Bridging Visual Representation and Reinforcement Learning from Verifiable Rewards in Large Vision-Language Models
por: Han, Yuhang, et al.
Publicado: (2026)
por: Han, Yuhang, et al.
Publicado: (2026)
MedTri: A Platform for Structured Medical Report Normalization to Enhance Vision-Language Pretraining
por: Chu, Yuetan, et al.
Publicado: (2026)
por: Chu, Yuetan, et al.
Publicado: (2026)
MedKCO: Medical Vision-Language Pretraining via Knowledge-Driven Cognitive Orchestration
por: Zhang, Chenran, et al.
Publicado: (2026)
por: Zhang, Chenran, et al.
Publicado: (2026)
Learning Visual Grounding from Generative Vision and Language Model
por: Wang, Shijie, et al.
Publicado: (2024)
por: Wang, Shijie, et al.
Publicado: (2024)
SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models
por: Cheng, An-Chieh, et al.
Publicado: (2024)
por: Cheng, An-Chieh, et al.
Publicado: (2024)
Grounded 3D-Aware Spatial Vision-Language Modeling
por: Cheng, An-Chieh, et al.
Publicado: (2026)
por: Cheng, An-Chieh, et al.
Publicado: (2026)
Grounding Synthetic Data Generation With Vision and Language Models
por: Çağlar, Ümit Mert, et al.
Publicado: (2026)
por: Çağlar, Ümit Mert, et al.
Publicado: (2026)
Med-R1: Reinforcement Learning for Generalizable Medical Reasoning in Vision-Language Models
por: Lai, Yuxiang, et al.
Publicado: (2025)
por: Lai, Yuxiang, et al.
Publicado: (2025)
Envisioning MedCLIP: A Deep Dive into Explainability for Medical Vision-Language Models
por: Hashmi, Anees Ur Rehman, et al.
Publicado: (2024)
por: Hashmi, Anees Ur Rehman, et al.
Publicado: (2024)
GroundVTS: Visual Token Sampling in Multimodal Large Language Models for Video Temporal Grounding
por: Fan, Rong, et al.
Publicado: (2026)
por: Fan, Rong, et al.
Publicado: (2026)
PolarVLM: Bridging the Semantic-Physical Gap in Vision-Language Models
por: Li, Yuliang, et al.
Publicado: (2026)
por: Li, Yuliang, et al.
Publicado: (2026)
GroundCount: Grounding Vision-Language Models with Object Detection for Mitigating Counting Hallucinations
por: Chen, Boyuan, et al.
Publicado: (2026)
por: Chen, Boyuan, et al.
Publicado: (2026)
MedLoc-R1: Performance-Aware Curriculum Reward Scheduling for GRPO-Based Medical Visual Grounding
por: Yang, Guangjing, et al.
Publicado: (2026)
por: Yang, Guangjing, et al.
Publicado: (2026)
Unlocking the Potential of Grounding DINO in Videos: Parameter-Efficient Adaptation for Limited-Data Spatial-Temporal Localization
por: Wang, Zanyi, et al.
Publicado: (2026)
por: Wang, Zanyi, et al.
Publicado: (2026)
Physically Grounded Vision-Language Models for Robotic Manipulation
por: Gao, Jensen, et al.
Publicado: (2023)
por: Gao, Jensen, et al.
Publicado: (2023)
Ejemplares similares
-
MedGround-R1: Advancing Medical Image Grounding via Spatial-Semantic Rewarded Group Relative Policy Optimization
por: Xu, Huihui, et al.
Publicado: (2025) -
Med-R2: An Adversarial Benchmark for Evidence-Grounded Reasoning in Medical VLMs
por: Ma, Wen, et al.
Publicado: (2026) -
VividMed: Vision Language Model with Versatile Visual Grounding for Medicine
por: Luo, Lingxiao, et al.
Publicado: (2024) -
MedMO: Grounding and Understanding Multimodal Large Language Model for Medical Images
por: Deria, Ankan, et al.
Publicado: (2026) -
Generate to Ground: Multimodal Text Conditioning Boosts Phrase Grounding in Medical Vision-Language Models
por: Nützel, Felix, et al.
Publicado: (2025)