MedMO: Grounding and Understanding Multimodal Large Language Model for Medical Images
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Deria, Ankan, Kumar, Komal, Dukre, Adinath Madhavrao, Segal, Eran, Khan, Salman, Razzak, Imran |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Robust Atypical Mitosis Classification with DenseNet121: Stain-Aware Augmentation and Hybrid Loss for Domain Generalization
par: Dukre, Adinath, et autres
Publié: (2025)
par: Dukre, Adinath, et autres
Publié: (2025)
See Fair, Speak Truth: Equitable Attention Improves Grounding and Reduces Hallucination in Vision-Language Alignment
par: Azeez, Mohammad Anas, et autres
Publié: (2026)
par: Azeez, Mohammad Anas, et autres
Publié: (2026)
VGS-Decoding: Visual Grounding Score Guided Decoding for Hallucination Mitigation in Medical VLMs
par: Kolli, Govinda, et autres
Publié: (2026)
par: Kolli, Govinda, et autres
Publié: (2026)
Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning
par: Deria, Ankan, et autres
Publié: (2025)
par: Deria, Ankan, et autres
Publié: (2025)
CoME-VL: Scaling Complementary Multi-Encoder Vision-Language Learning
par: Deria, Ankan, et autres
Publié: (2026)
par: Deria, Ankan, et autres
Publié: (2026)
TuLaBM: Tumor-Biased Latent Bridge Matching for Contrast-Enhanced MRI Synthesis
par: Rege, Atharva, et autres
Publié: (2026)
par: Rege, Atharva, et autres
Publié: (2026)
SafeDiffusion-R1: Online Reward Steering for Safe Diffusion Post-Training
par: Kumar, Komal, et autres
Publié: (2026)
par: Kumar, Komal, et autres
Publié: (2026)
COMPRER: A Multimodal Multi-Objective Pretraining Framework for Enhanced Medical Image Representation
par: Lutsker, Guy, et autres
Publié: (2024)
par: Lutsker, Guy, et autres
Publié: (2024)
UniMed-CLIP: Towards a Unified Image-Text Pretraining Paradigm for Diverse Medical Imaging Modalities
par: Khattak, Muhammad Uzair, et autres
Publié: (2024)
par: Khattak, Muhammad Uzair, et autres
Publié: (2024)
GeoPixel: Pixel Grounding Large Multimodal Model in Remote Sensing
par: Shabbir, Akashah, et autres
Publié: (2025)
par: Shabbir, Akashah, et autres
Publié: (2025)
MedSeg-R: Reasoning Segmentation in Medical Images with Multimodal Large Language Models
par: Huang, Yu, et autres
Publié: (2025)
par: Huang, Yu, et autres
Publié: (2025)
Video-R2: Reinforcing Consistent and Grounded Reasoning in Multimodal Language Models
par: Maaz, Muhammad, et autres
Publié: (2025)
par: Maaz, Muhammad, et autres
Publié: (2025)
Advancing Medical Image Segmentation with Mini-Net: A Lightweight Solution Tailored for Efficient Segmentation of Medical Images
par: Javed, Syed, et autres
Publié: (2024)
par: Javed, Syed, et autres
Publié: (2024)
MedContext: Learning Contextual Cues for Efficient Volumetric Medical Segmentation
par: Gani, Hanan, et autres
Publié: (2024)
par: Gani, Hanan, et autres
Publié: (2024)
Language Guided Domain Generalized Medical Image Segmentation
par: Kunhimon, Shahina, et autres
Publié: (2024)
par: Kunhimon, Shahina, et autres
Publié: (2024)
DocAtlas: Multilingual Document Understanding Across 80+ Languages
par: Heakl, Ahmed, et autres
Publié: (2026)
par: Heakl, Ahmed, et autres
Publié: (2026)
Med-GLIP: Advancing Medical Language-Image Pre-training with Large-scale Grounded Dataset
par: Deng, Ziye, et autres
Publié: (2025)
par: Deng, Ziye, et autres
Publié: (2025)
DEFT: Decompositional Efficient Fine-Tuning for Text-to-Image Models
par: Kumar, Komal, et autres
Publié: (2025)
par: Kumar, Komal, et autres
Publié: (2025)
MuGa-VTON: Multi-Garment Virtual Try-On via Diffusion Transformers with Prompt Customization
par: Deria, Ankan, et autres
Publié: (2025)
par: Deria, Ankan, et autres
Publié: (2025)
The Role of AI in Early Detection of Life-Threatening Diseases: A Retinal Imaging Perspective
par: Khan, Tariq M, et autres
Publié: (2025)
par: Khan, Tariq M, et autres
Publié: (2025)
MedROV: Towards Real-Time Open-Vocabulary Detection Across Diverse Medical Imaging Modalities
par: Sheikh, Tooba Tehreem, et autres
Publié: (2025)
par: Sheikh, Tooba Tehreem, et autres
Publié: (2025)
Focal Modulation and Bidirectional Feature Fusion Network for Medical Image Segmentation
par: Safdar, Moin, et autres
Publié: (2025)
par: Safdar, Moin, et autres
Publié: (2025)
Tracking Meets Large Multimodal Models for Driving Scenario Understanding
par: Ishaq, Ayesha, et autres
Publié: (2025)
par: Ishaq, Ayesha, et autres
Publié: (2025)
MedSG-Bench: A Benchmark for Medical Image Sequences Grounding
par: Yue, Jingkun, et autres
Publié: (2025)
par: Yue, Jingkun, et autres
Publié: (2025)
CrossMed: A Multimodal Cross-Task Benchmark for Compositional Generalization in Medical Imaging
par: Singh, Pooja, et autres
Publié: (2025)
par: Singh, Pooja, et autres
Publié: (2025)
Med-Evo: Test-time Self-evolution for Medical Multimodal Large Language Models
par: Xu, Dunyuan, et autres
Publié: (2026)
par: Xu, Dunyuan, et autres
Publié: (2026)
The Eye as a Window to Systemic Health: A Survey of Retinal Imaging from Classical Techniques to Oculomics
par: Inamullah, et autres
Publié: (2025)
par: Inamullah, et autres
Publié: (2025)
Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models
par: Maaz, Muhammad, et autres
Publié: (2023)
par: Maaz, Muhammad, et autres
Publié: (2023)
VideoGLaMM: A Large Multimodal Model for Pixel-Level Visual Grounding in Videos
par: Munasinghe, Shehan, et autres
Publié: (2024)
par: Munasinghe, Shehan, et autres
Publié: (2024)
Med3DInsight: Enhancing 3D Medical Image Understanding with 2D Multi-Modal Large Language Models
par: Chen, Qiuhui, et autres
Publié: (2024)
par: Chen, Qiuhui, et autres
Publié: (2024)
MedPromptX: Grounded Multimodal Prompting for Chest X-ray Diagnosis
par: Shaaban, Mai A., et autres
Publié: (2024)
par: Shaaban, Mai A., et autres
Publié: (2024)
VideoGPT+: Integrating Image and Video Encoders for Enhanced Video Understanding
par: Maaz, Muhammad, et autres
Publié: (2024)
par: Maaz, Muhammad, et autres
Publié: (2024)
GLaMM: Pixel Grounding Large Multimodal Model
par: Rasheed, Hanoona, et autres
Publié: (2023)
par: Rasheed, Hanoona, et autres
Publié: (2023)
SynerMedGen: Synergizing Medical Multimodal Understanding with Generation via Task Alignment
par: Zhao, Weiren, et autres
Publié: (2026)
par: Zhao, Weiren, et autres
Publié: (2026)
MultiMed: Massively Multimodal and Multitask Medical Understanding
par: Mo, Shentong, et autres
Publié: (2024)
par: Mo, Shentong, et autres
Publié: (2024)
MedXChat: A Unified Multimodal Large Language Model Framework towards CXRs Understanding and Generation
par: Yang, Ling, et autres
Publié: (2023)
par: Yang, Ling, et autres
Publié: (2023)
DuwatBench: Bridging Language and Visual Heritage through an Arabic Calligraphy Benchmark for Multimodal Understanding
par: Patle, Shubham, et autres
Publié: (2026)
par: Patle, Shubham, et autres
Publié: (2026)
Retinal Lipidomics Associations as Candidate Biomarkers for Cardiovascular Health
par: Inamullah, et autres
Publié: (2025)
par: Inamullah, et autres
Publié: (2025)
LLaDA-MedV: Exploring Large Language Diffusion Models for Biomedical Image Understanding
par: Dong, Xuanzhao, et autres
Publié: (2025)
par: Dong, Xuanzhao, et autres
Publié: (2025)
LATA: Laplacian-Assisted Transductive Adaptation for Conformal Uncertainty in Medical VLMs
par: Bozorgtabar, Behzad, et autres
Publié: (2026)
par: Bozorgtabar, Behzad, et autres
Publié: (2026)
Documents similaires
-
Robust Atypical Mitosis Classification with DenseNet121: Stain-Aware Augmentation and Hybrid Loss for Domain Generalization
par: Dukre, Adinath, et autres
Publié: (2025) -
See Fair, Speak Truth: Equitable Attention Improves Grounding and Reduces Hallucination in Vision-Language Alignment
par: Azeez, Mohammad Anas, et autres
Publié: (2026) -
VGS-Decoding: Visual Grounding Score Guided Decoding for Hallucination Mitigation in Medical VLMs
par: Kolli, Govinda, et autres
Publié: (2026) -
Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning
par: Deria, Ankan, et autres
Publié: (2025) -
CoME-VL: Scaling Complementary Multi-Encoder Vision-Language Learning
par: Deria, Ankan, et autres
Publié: (2026)