A Spectrum Evaluation Benchmark for Medical Multi-Modal Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Liu, Jie, Wang, Wenxuan, Su, Yihang, Huan, Jingyuan, Chen, Wenting, Zhang, Yudi, Li, Cheng-Yi, Chang, Kao-Jung, Xin, Xiaohan, Shen, Linlin, Lyu, Michael R. |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Medchain: Bridging the Gap Between LLM Agents and Clinical Practice with Interactive Sequence
by: Liu, Jie, et al.
Published: (2024)
by: Liu, Jie, et al.
Published: (2024)
Beyond the Leaderboard: Rethinking Medical Benchmarks for Large Language Models
by: Chen, Wenting, et al.
Published: (2025)
by: Chen, Wenting, et al.
Published: (2025)
Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models
by: Ding, Meidan, et al.
Published: (2025)
by: Ding, Meidan, et al.
Published: (2025)
Benchmarking Egocentric Clinical Intent Understanding Capability for Medical Multimodal Large Language Models
by: Liu, Shaonan, et al.
Published: (2026)
by: Liu, Shaonan, et al.
Published: (2026)
MedEinst: Benchmarking the Einstellung Effect in Medical LLMs through Counterfactual Differential Diagnosis
by: Chen, Wenting, et al.
Published: (2026)
by: Chen, Wenting, et al.
Published: (2026)
MMedExpert-R1: Strengthening Multimodal Medical Reasoning via Domain-Specific Adaptation and Clinical Guideline Reinforcement
by: Ding, Meidan, et al.
Published: (2026)
by: Ding, Meidan, et al.
Published: (2026)
SurvAgent: Hierarchical CoT-Enhanced Case Banking and Dichotomy-Based Multi-Agent System for Multimodal Survival Prediction
by: Huang, Guolin, et al.
Published: (2025)
by: Huang, Guolin, et al.
Published: (2025)
WSI-LLaVA: A Multimodal Large Language Model for Whole Slide Image
by: Liang, Yuci, et al.
Published: (2024)
by: Liang, Yuci, et al.
Published: (2024)
Medical Reasoning in the Era of LLMs: A Systematic Review of Enhancement Techniques and Applications
by: Wang, Wenxuan, et al.
Published: (2025)
by: Wang, Wenxuan, et al.
Published: (2025)
DAMPER: A Dual-Stage Medical Report Generation Framework with Coarse-Grained MeSH Alignment and Fine-Grained Hypergraph Matching
by: Huang, Xiaofei, et al.
Published: (2024)
by: Huang, Xiaofei, et al.
Published: (2024)
GEM: Context-Aware Gaze EstiMation with Visual Search Behavior Matching for Chest Radiograph
by: Liu, Shaonan, et al.
Published: (2024)
by: Liu, Shaonan, et al.
Published: (2024)
Fine-Grained Image-Text Alignment in Medical Imaging Enables Explainable Cyclic Image-Report Generation
by: Chen, Wenting, et al.
Published: (2023)
by: Chen, Wenting, et al.
Published: (2023)
HySurvPred: Multimodal Hyperbolic Embedding with Angle-Aware Hierarchical Contrastive Learning and Uncertainty Constraints for Survival Prediction
by: Yang, Jiaqi, et al.
Published: (2025)
by: Yang, Jiaqi, et al.
Published: (2025)
CliMedBench: A Large-Scale Chinese Benchmark for Evaluating Medical Large Language Models in Clinical Scenarios
by: Ouyang, Zetian, et al.
Published: (2024)
by: Ouyang, Zetian, et al.
Published: (2024)
Evaluating the Effectiveness of Black-Box Prompt Optimization as the Scale of LLMs Continues to Grow
by: Zhou, Ziyu, et al.
Published: (2025)
by: Zhou, Ziyu, et al.
Published: (2025)
From Compound Figures to Composite Understanding: Developing a Multi-Modal LLM from Biomedical Literature with Medical Multiple-Image Benchmarking and Validation
by: Chen, Zhen, et al.
Published: (2025)
by: Chen, Zhen, et al.
Published: (2025)
M-IDoL: Information Decomposition for Modality-Specific and Diverse Representation Learning in Medical Foundation Model
by: Liu, Yihang, et al.
Published: (2026)
by: Liu, Yihang, et al.
Published: (2026)
Towards a Holistic Framework for Multimodal Large Language Models in Three-dimensional Brain CT Report Generation
by: Li, Cheng-Yi, et al.
Published: (2024)
by: Li, Cheng-Yi, et al.
Published: (2024)
Rethinking Meeting Effectiveness: A Benchmark and Framework for Temporal Fine-grained Automatic Meeting Effectiveness Evaluation
by: Li, Yihang, et al.
Published: (2026)
by: Li, Yihang, et al.
Published: (2026)
Not All Countries Celebrate Thanksgiving: On the Cultural Dominance in Large Language Models
by: Wang, Wenxuan, et al.
Published: (2023)
by: Wang, Wenxuan, et al.
Published: (2023)
Fine-Grained Detoxification via Instance-Level Prefixes for Large Language Models
by: Yi, Xin, et al.
Published: (2024)
by: Yi, Xin, et al.
Published: (2024)
Mask-Encoded Sparsification: Mitigating Biased Gradients in Communication-Efficient Split Learning
by: Zhou, Wenxuan, et al.
Published: (2024)
by: Zhou, Wenxuan, et al.
Published: (2024)
When Benchmarks Age: Temporal Misalignment through Large Language Model Factuality Evaluation
by: Jiang, Xunyi, et al.
Published: (2025)
by: Jiang, Xunyi, et al.
Published: (2025)
Benchmarking Foundation Models and Parameter-Efficient Fine-Tuning for Prognosis Prediction in Medical Imaging
by: Ruffini, Filippo, et al.
Published: (2025)
by: Ruffini, Filippo, et al.
Published: (2025)
Confidence in the Reasoning of Large Language Models
by: Pawitan, Yudi, et al.
Published: (2024)
by: Pawitan, Yudi, et al.
Published: (2024)
EchoMind: An Interrelated Multi-level Benchmark for Evaluating Empathetic Speech Language Models
by: Zhou, Li, et al.
Published: (2025)
by: Zhou, Li, et al.
Published: (2025)
Visualizing Dialogues: Enhancing Image Selection through Dialogue Understanding with Large Language Models
by: Kao, Chang-Sheng, et al.
Published: (2024)
by: Kao, Chang-Sheng, et al.
Published: (2024)
Do Text Edits Generalize to Visual Generation? Benchmarking Cross-Modal Knowledge Editing in UMMs
by: Gao, Xin, et al.
Published: (2026)
by: Gao, Xin, et al.
Published: (2026)
EndoBench: A Comprehensive Evaluation of Multi-Modal Large Language Models for Endoscopy Analysis
by: Liu, Shengyuan, et al.
Published: (2025)
by: Liu, Shengyuan, et al.
Published: (2025)
MM-MoralBench: A MultiModal Moral Evaluation Benchmark for Large Vision-Language Models
by: Yan, Bei, et al.
Published: (2024)
by: Yan, Bei, et al.
Published: (2024)
EchoBench: Benchmarking Sycophancy in Medical Large Vision-Language Models
by: Yuan, Botai, et al.
Published: (2025)
by: Yuan, Botai, et al.
Published: (2025)
Testing and Evaluation of Large Language Models: Correctness, Non-Toxicity, and Fairness
by: Wang, Wenxuan
Published: (2024)
by: Wang, Wenxuan
Published: (2024)
KOFFVQA: An Objectively Evaluated Free-form VQA Benchmark for Large Vision-Language Models in the Korean Language
by: Kim, Yoonshik, et al.
Published: (2025)
by: Kim, Yoonshik, et al.
Published: (2025)
McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models
by: Lan, Tian, et al.
Published: (2025)
by: Lan, Tian, et al.
Published: (2025)
WSI-Agents: A Collaborative Multi-Agent System for Multi-Modal Whole Slide Image Analysis
by: Lyu, Xinheng, et al.
Published: (2025)
by: Lyu, Xinheng, et al.
Published: (2025)
Improving Medical Visual Representation Learning with Pathological-level Cross-Modal Alignment and Correlation Exploration
by: Wang, Jun, et al.
Published: (2025)
by: Wang, Jun, et al.
Published: (2025)
SI-Bench: Benchmarking Social Intelligence of Large Language Models in Human-to-Human Conversations
by: Huang, Shuai, et al.
Published: (2025)
by: Huang, Shuai, et al.
Published: (2025)
Automatic Summarization of Doctor-Patient Encounter Dialogues Using Large Language Model through Prompt Tuning
by: Lyu, Mengxian, et al.
Published: (2024)
by: Lyu, Mengxian, et al.
Published: (2024)
Designing AI-Enabled Games to Support Social-Emotional Learning for Children with Autism Spectrum Disorders
by: Lyu, Yue, et al.
Published: (2024)
by: Lyu, Yue, et al.
Published: (2024)
Modality-Balanced Collaborative Distillation for Multi-Modal Domain Generalization
by: Wang, Xiaohan, et al.
Published: (2025)
by: Wang, Xiaohan, et al.
Published: (2025)
Similar Items
-
Medchain: Bridging the Gap Between LLM Agents and Clinical Practice with Interactive Sequence
by: Liu, Jie, et al.
Published: (2024) -
Beyond the Leaderboard: Rethinking Medical Benchmarks for Large Language Models
by: Chen, Wenting, et al.
Published: (2025) -
Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models
by: Ding, Meidan, et al.
Published: (2025) -
Benchmarking Egocentric Clinical Intent Understanding Capability for Medical Multimodal Large Language Models
by: Liu, Shaonan, et al.
Published: (2026) -
MedEinst: Benchmarking the Einstellung Effect in Medical LLMs through Counterfactual Differential Diagnosis
by: Chen, Wenting, et al.
Published: (2026)