Towards Clinically Interpretable Ophthalmic VQA via Spatially-Grounded Lesion Evidence
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Xingyue, Liu, Bo, Wang, Meng, Zhang, Zhixuan, Zhu, Chengcheng, Fu, Huazhu, Liu, Jiang |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
GEMeX-RMCoT: An Enhanced Med-VQA Dataset for Region-Aware Multimodal Chain-of-Thought Reasoning
par: Liu, Bo, et autres
Publié: (2025)
par: Liu, Bo, et autres
Publié: (2025)
CORE-Seg: Reasoning-Driven Segmentation for Complex Lesions via Reinforcement Learning
par: Xie, Yuxin, et autres
Publié: (2026)
par: Xie, Yuxin, et autres
Publié: (2026)
GEMeX: A Large-Scale, Groundable, and Explainable Medical VQA Benchmark for Chest X-ray Diagnosis
par: Liu, Bo, et autres
Publié: (2024)
par: Liu, Bo, et autres
Publié: (2024)
FusionFM: Fusing Eye-specific Foundational Models for Optimized Ophthalmic Diagnosis
par: Zou, Ke, et autres
Publié: (2025)
par: Zou, Ke, et autres
Publié: (2025)
Robust Multimodal Learning for Ophthalmic Disease Grading via Disentangled Representation
par: Wang, Xinkun, et autres
Publié: (2025)
par: Wang, Xinkun, et autres
Publié: (2025)
A Clinician-Friendly Platform for Ophthalmic Image Analysis Without Technical Barriers
par: Wang, Meng, et autres
Publié: (2025)
par: Wang, Meng, et autres
Publié: (2025)
EH-Benchmark Ophthalmic Hallucination Benchmark and Agent-Driven Top-Down Traceable Reasoning Workflow
par: Pan, Xiaoyu, et autres
Publié: (2025)
par: Pan, Xiaoyu, et autres
Publié: (2025)
Unsupervised Domain Adaptation via Style-Aware Self-intermediate Domain
par: Wang, Lianyu, et autres
Publié: (2022)
par: Wang, Lianyu, et autres
Publié: (2022)
Enhancing Medical Visual Grounding via Knowledge-guided Spatial Prompts
par: Gao, Yifan, et autres
Publié: (2026)
par: Gao, Yifan, et autres
Publié: (2026)
Vision-Language Model IP Protection via Prompt-based Learning
par: Wang, Lianyu, et autres
Publié: (2025)
par: Wang, Lianyu, et autres
Publié: (2025)
MM-UNet: A Mixed MLP Architecture for Improved Ophthalmic Image Segmentation
par: Xiao, Zunjie, et autres
Publié: (2024)
par: Xiao, Zunjie, et autres
Publié: (2024)
Deep Expert Injection for Anchoring Retinal VLMs with Domain-Specific Knowledge
par: Lu, Shuai, et autres
Publié: (2026)
par: Lu, Shuai, et autres
Publié: (2026)
WSI-VQA: Interpreting Whole Slide Images by Generative Visual Question Answering
par: Chen, Pingyi, et autres
Publié: (2024)
par: Chen, Pingyi, et autres
Publié: (2024)
Clinical Inspired MRI Lesion Segmentation
par: Yan, Lijun, et autres
Publié: (2025)
par: Yan, Lijun, et autres
Publié: (2025)
CLEAR-Mamba:Towards Accurate, Adaptive and Trustworthy Multi-Sequence Ophthalmic Angiography Classification
par: Wang, Zhuonan, et autres
Publié: (2026)
par: Wang, Zhuonan, et autres
Publié: (2026)
Constructing Ophthalmic MLLM for Positioning-diagnosis Collaboration Through Clinical Cognitive Chain Reasoning
par: Liu, Xinyao, et autres
Publié: (2025)
par: Liu, Xinyao, et autres
Publié: (2025)
R^3-VQA: "Read the Room" by Video Social Reasoning
par: Niu, Lixing, et autres
Publié: (2025)
par: Niu, Lixing, et autres
Publié: (2025)
Prompting Lipschitz-constrained network for multiple-in-one sparse-view CT reconstruction
par: Shi, Baoshun, et autres
Publié: (2025)
par: Shi, Baoshun, et autres
Publié: (2025)
Towards Accurate and Interpretable Neuroblastoma Diagnosis via Contrastive Multi-scale Pathological Image Analysis
par: Zhu, Zhu, et autres
Publié: (2025)
par: Zhu, Zhu, et autres
Publié: (2025)
Visual Grounding Methods for VQA are Working for the Wrong Reasons!
par: Shrestha, Robik, et autres
Publié: (2020)
par: Shrestha, Robik, et autres
Publié: (2020)
Towards Faithful Reasoning in Remote Sensing: A Perceptually-Grounded GeoSpatial Chain-of-Thought for Vision-Language Models
par: Liu, Jiaqi, et autres
Publié: (2025)
par: Liu, Jiaqi, et autres
Publié: (2025)
An Evaluation of GPT-4V and Gemini in Online VQA
par: Liu, Mengchen, et autres
Publié: (2023)
par: Liu, Mengchen, et autres
Publié: (2023)
VTAgent: Agentic Keyframe Anchoring for Evidence-Aware Video TextVQA
par: He, Haibin, et autres
Publié: (2026)
par: He, Haibin, et autres
Publié: (2026)
TimeScope: Towards Task-Oriented Temporal Grounding In Long Videos
par: Liu, Xiangrui, et autres
Publié: (2025)
par: Liu, Xiangrui, et autres
Publié: (2025)
Box-QAymo: Box-Referring VQA Dataset for Autonomous Driving
par: Etchegaray, Djamahl, et autres
Publié: (2025)
par: Etchegaray, Djamahl, et autres
Publié: (2025)
EyeFound: A Multimodal Generalist Foundation Model for Ophthalmic Imaging
par: Shi, Danli, et autres
Publié: (2024)
par: Shi, Danli, et autres
Publié: (2024)
Look-Closer-Then-Diagnose: Confidence-Aware Ultrasound VQA via Active Zooming
par: Zhou, Yue, et autres
Publié: (2026)
par: Zhou, Yue, et autres
Publié: (2026)
PanoWorld: Towards Spatial Supersensing in 360$^\circ$ Panorama World
par: Wang, Changpeng, et autres
Publié: (2026)
par: Wang, Changpeng, et autres
Publié: (2026)
Unifying VLM-Guided Flow Matching and Spectral Anomaly Detection for Interpretable Veterinary Diagnosis
par: Wang, Pu, et autres
Publié: (2026)
par: Wang, Pu, et autres
Publié: (2026)
RieMind: Geometry-Grounded Spatial Agent for Scene Understanding
par: Ropero, Fernando, et autres
Publié: (2026)
par: Ropero, Fernando, et autres
Publié: (2026)
Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models
par: Zhu, Wenhui, et autres
Publié: (2025)
par: Zhu, Wenhui, et autres
Publié: (2025)
Large Language Model with Region-guided Referring and Grounding for CT Report Generation
par: Chen, Zhixuan, et autres
Publié: (2024)
par: Chen, Zhixuan, et autres
Publié: (2024)
Med-GLIP: Advancing Medical Language-Image Pre-training with Large-scale Grounded Dataset
par: Deng, Ziye, et autres
Publié: (2025)
par: Deng, Ziye, et autres
Publié: (2025)
Spatial Policy: Guiding Visuomotor Robotic Manipulation with Spatial-Aware Modeling and Reasoning
par: Liu, Yijun, et autres
Publié: (2025)
par: Liu, Yijun, et autres
Publié: (2025)
Is ChatGPT-5 Ready for Mammogram VQA?
par: Li, Qiang, et autres
Publié: (2025)
par: Li, Qiang, et autres
Publié: (2025)
Uncertainty-aware Medical Diagnostic Phrase Identification and Grounding
par: Zou, Ke, et autres
Publié: (2024)
par: Zou, Ke, et autres
Publié: (2024)
FundusGAN: A Hierarchical Feature-Aware Generative Framework for High-Fidelity Fundus Image Generation
par: Hou, Qingshan, et autres
Publié: (2025)
par: Hou, Qingshan, et autres
Publié: (2025)
On the Role of Visual Grounding in VQA
par: Reich, Daniel, et autres
Publié: (2024)
par: Reich, Daniel, et autres
Publié: (2024)
Interpretable and Reliable Detection of AI-Generated Images via Grounded Reasoning in MLLMs
par: Ji, Yikun, et autres
Publié: (2025)
par: Ji, Yikun, et autres
Publié: (2025)
Gold-YOLO: Efficient Object Detector via Gather-and-Distribute Mechanism
par: Wang, Chengcheng, et autres
Publié: (2023)
par: Wang, Chengcheng, et autres
Publié: (2023)
Documents similaires
-
GEMeX-RMCoT: An Enhanced Med-VQA Dataset for Region-Aware Multimodal Chain-of-Thought Reasoning
par: Liu, Bo, et autres
Publié: (2025) -
CORE-Seg: Reasoning-Driven Segmentation for Complex Lesions via Reinforcement Learning
par: Xie, Yuxin, et autres
Publié: (2026) -
GEMeX: A Large-Scale, Groundable, and Explainable Medical VQA Benchmark for Chest X-ray Diagnosis
par: Liu, Bo, et autres
Publié: (2024) -
FusionFM: Fusing Eye-specific Foundational Models for Optimized Ophthalmic Diagnosis
par: Zou, Ke, et autres
Publié: (2025) -
Robust Multimodal Learning for Ophthalmic Disease Grading via Disentangled Representation
par: Wang, Xinkun, et autres
Publié: (2025)