Lost in the Hype: Revealing and Dissecting the Performance Degradation of Medical Multimodal Large Language Models in Image Classification
Fuente:
arXiv
Saved in:
| Main Authors: | Zhu, Xun, Mo, Fanbin, Chen, Xi, Zheng, Kaili, Yang, Shaoshuai, Shi, Yiming, Gao, Jian, Li, Miao, Wu, Ji |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Enhancing Multi-task Learning Capability of Medical Generalist Foundation Model via Image-centric Multi-annotation Data
by: Zhu, Xun, et al.
Published: (2025)
by: Zhu, Xun, et al.
Published: (2025)
Uni-Med: A Unified Medical Generalist Foundation Model For Multi-Task Learning Via Connector-MoE
by: Zhu, Xun, et al.
Published: (2024)
by: Zhu, Xun, et al.
Published: (2024)
MedM-VL: What Makes a Good Medical LVLM?
by: Shi, Yiming, et al.
Published: (2025)
by: Shi, Yiming, et al.
Published: (2025)
Connector-S: A Survey of Connectors in Multi-modal Large Language Models
by: Zhu, Xun, et al.
Published: (2025)
by: Zhu, Xun, et al.
Published: (2025)
Med-2E3: A 2D-Enhanced 3D Medical Multimodal Large Language Model
by: Shi, Yiming, et al.
Published: (2024)
by: Shi, Yiming, et al.
Published: (2024)
Case-Aware Medical Image Classification with Multimodal Knowledge Graphs and Reliability-Guided Refinement
by: Xu, Yiming, et al.
Published: (2026)
by: Xu, Yiming, et al.
Published: (2026)
Degradation-Robust Fusion: An Efficient Degradation-Aware Diffusion Framework for Multimodal Image Fusion in Arbitrary Degradation Scenarios
by: Shi, Yu, et al.
Published: (2026)
by: Shi, Yu, et al.
Published: (2026)
Towards Metric-Aware Multi-Person Mesh Recovery by Jointly Optimizing Human Crowd in Camera Space
by: Wang, Kaiwen, et al.
Published: (2025)
by: Wang, Kaiwen, et al.
Published: (2025)
InterMesh: Explicit Interaction-Aware End-to-End Multi-Person Human Mesh Recovery
by: Zheng, Kaili, et al.
Published: (2026)
by: Zheng, Kaili, et al.
Published: (2026)
VN-Net: Vision-Numerical Fusion Graph Convolutional Network for Sparse Spatio-Temporal Meteorological Forecasting
by: Xiong, Yutong, et al.
Published: (2024)
by: Xiong, Yutong, et al.
Published: (2024)
BoxComm: Benchmarking Category-Aware Commentary Generation and Narration Rhythm in Boxing
by: Wang, Kaiwen, et al.
Published: (2026)
by: Wang, Kaiwen, et al.
Published: (2026)
Revolution or Hype? Seeking the Limits of Large Models in Hardware Design
by: Xu, Qiang, et al.
Published: (2025)
by: Xu, Qiang, et al.
Published: (2025)
Multimodal Imaging and Clinical Features of Aortic Dissection in a Cat
by: Yewon Ji, et al.
Published: (2025)
by: Yewon Ji, et al.
Published: (2025)
Embedding Radiomics into Vision Transformers for Multimodal Medical Image Classification
by: Yang, Zhenyu, et al.
Published: (2025)
by: Yang, Zhenyu, et al.
Published: (2025)
Mamba? Catch The Hype Or Rethink What Really Helps for Image Registration
by: Jian, Bailiang, et al.
Published: (2024)
by: Jian, Bailiang, et al.
Published: (2024)
Coupled Degradation Modeling and Fusion: A VLM-Guided Degradation-Coupled Network for Degradation-Aware Infrared and Visible Image Fusion
by: Zhang, Tianpei, et al.
Published: (2025)
by: Zhang, Tianpei, et al.
Published: (2025)
MIPS: a Multimodal Infinite Polymer Sequence Pre-training Framework for Polymer Property Prediction
by: Wang, Jiaxi, et al.
Published: (2025)
by: Wang, Jiaxi, et al.
Published: (2025)
TinyLLaVA Factory: A Modularized Codebase for Small-scale Large Multimodal Models
by: Jia, Junlong, et al.
Published: (2024)
by: Jia, Junlong, et al.
Published: (2024)
Dissecting Role Cognition in Medical LLMs via Neuronal Ablation
by: Liang, Xun, et al.
Published: (2025)
by: Liang, Xun, et al.
Published: (2025)
LKA: Large Kernel Adapter for Enhanced Medical Image Classification
by: Zhu, Ziquan, et al.
Published: (2025)
by: Zhu, Ziquan, et al.
Published: (2025)
Dissecting Failure Dynamics in Large Language Model Reasoning
by: Zhu, Wei, et al.
Published: (2026)
by: Zhu, Wei, et al.
Published: (2026)
Dissecting Dissonance: Benchmarking Large Multimodal Models Against Self-Contradictory Instructions
by: Gao, Jin, et al.
Published: (2024)
by: Gao, Jin, et al.
Published: (2024)
Beyond the Hype: Embeddings vs. Prompting for Multiclass Classification Tasks
by: Kokkodis, Marios, et al.
Published: (2025)
by: Kokkodis, Marios, et al.
Published: (2025)
Dissecting Performance Degradation in Audio Source Separation under Sampling Frequency Mismatch
by: Imamura, Kanami, et al.
Published: (2026)
by: Imamura, Kanami, et al.
Published: (2026)
Hypeful worlds
by: Tom Neumark
Published: (2024)
by: Tom Neumark
Published: (2024)
Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation
by: Ning, Zhenhua, et al.
Published: (2025)
by: Ning, Zhenhua, et al.
Published: (2025)
HypeMed: Enhancing Medication Recommendations with Hypergraph-Based Patient Relationships
by: Zhang, Xiangxu, et al.
Published: (2026)
by: Zhang, Xiangxu, et al.
Published: (2026)
VP-Hype: A Hybrid Mamba-Transformer Framework with Visual-Textual Prompting for Hyperspectral Image Classification
by: Sellam, Abdellah Zakaria, et al.
Published: (2026)
by: Sellam, Abdellah Zakaria, et al.
Published: (2026)
Harnessing the Power of Natural Products for Targeted Protein Degradation
by: Bo Zhu, et al.
Published: (2025)
by: Bo Zhu, et al.
Published: (2025)
Decoding Visual Neural Representations by Multimodal with Dynamic Balancing
by: sun, Kaili, et al.
Published: (2025)
by: sun, Kaili, et al.
Published: (2025)
Lost in Multilinguality: Dissecting Cross-lingual Factual Inconsistency in Transformer Language Models
by: Wang, Mingyang, et al.
Published: (2025)
by: Wang, Mingyang, et al.
Published: (2025)
Nexus-INR: Diverse Knowledge-guided Arbitrary-Scale Multimodal Medical Image Super-Resolution
by: Zhang, Bo, et al.
Published: (2025)
by: Zhang, Bo, et al.
Published: (2025)
COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings
by: Zhu, Yonggang, et al.
Published: (2026)
by: Zhu, Yonggang, et al.
Published: (2026)
Foundation Models in Biomedical Imaging: Turning Hype into Reality
by: Muneer, Amgad, et al.
Published: (2025)
by: Muneer, Amgad, et al.
Published: (2025)
GoIRL: Graph-Oriented Inverse Reinforcement Learning for Multimodal Trajectory Prediction
by: Pei, Muleilan, et al.
Published: (2025)
by: Pei, Muleilan, et al.
Published: (2025)
Medical Image Classification with KAN-Integrated Transformers and Dilated Neighborhood Attention
by: Manzari, Omid Nejati, et al.
Published: (2025)
by: Manzari, Omid Nejati, et al.
Published: (2025)
Rethinking the Unpretentious U-net for Medical Ultrasound Image Segmentation
by: Chen, Gongping, et al.
Published: (2022)
by: Chen, Gongping, et al.
Published: (2022)
MultiFair: Multimodal Balanced Fairness-Aware Medical Classification with Dual-Level Gradient Modulation
by: Zubair, Md, et al.
Published: (2025)
by: Zubair, Md, et al.
Published: (2025)
Linear Image Regridding and Coaddition with Oversampled Point Spread Functions: Lessons from 1D
by: Cao, Kaili
Published: (2025)
by: Cao, Kaili
Published: (2025)
Assessing Large Multimodal Models for One‐Shot Learning and Interpretability in Biomedical Image Classification
by: Wenpin Hou, et al.
Published: (2025)
by: Wenpin Hou, et al.
Published: (2025)
Similar Items
-
Enhancing Multi-task Learning Capability of Medical Generalist Foundation Model via Image-centric Multi-annotation Data
by: Zhu, Xun, et al.
Published: (2025) -
Uni-Med: A Unified Medical Generalist Foundation Model For Multi-Task Learning Via Connector-MoE
by: Zhu, Xun, et al.
Published: (2024) -
MedM-VL: What Makes a Good Medical LVLM?
by: Shi, Yiming, et al.
Published: (2025) -
Connector-S: A Survey of Connectors in Multi-modal Large Language Models
by: Zhu, Xun, et al.
Published: (2025) -
Med-2E3: A 2D-Enhanced 3D Medical Multimodal Large Language Model
by: Shi, Yiming, et al.
Published: (2024)