MedMKEB: A Comprehensive Knowledge Editing Benchmark for Medical Multimodal Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Xu, Dexuan, Wang, Jieyi, Chai, Zhongyan, Cao, Yongzhi, Wang, Hanpin, Zhang, Huamin, Huang, Yu |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
TCDiff: Triplex Cascaded Diffusion for High-fidelity Multimodal EHRs Generation with Incomplete Clinical Data
von: Yan, Yandong, et al.
Veröffentlicht: (2025)
von: Yan, Yandong, et al.
Veröffentlicht: (2025)
Revisiting Label Inference Attacks in Vertical Federated Learning: Why They Are Vulnerable and How to Defend
von: Liu, Yige, et al.
Veröffentlicht: (2026)
von: Liu, Yige, et al.
Veröffentlicht: (2026)
MedHallu: A Comprehensive Benchmark for Detecting Medical Hallucinations in Large Language Models
von: Pandit, Shrey, et al.
Veröffentlicht: (2025)
von: Pandit, Shrey, et al.
Veröffentlicht: (2025)
SpeechMedAssist: Efficiently and Effectively Adapting Speech Language Models for Medical Consultation
von: Chen, Sirry, et al.
Veröffentlicht: (2026)
von: Chen, Sirry, et al.
Veröffentlicht: (2026)
Differentiable Rule Induction from Raw Sequence Inputs
von: Gao, Kun, et al.
Veröffentlicht: (2026)
von: Gao, Kun, et al.
Veröffentlicht: (2026)
MedReflect: Teaching Medical LLMs to Self-Improve via Reflective Correction
von: Huang, Yue, et al.
Veröffentlicht: (2025)
von: Huang, Yue, et al.
Veröffentlicht: (2025)
MedBench: A Comprehensive, Standardized, and Reliable Benchmarking System for Evaluating Chinese Medical Large Language Models
von: Liu, Mianxin, et al.
Veröffentlicht: (2024)
von: Liu, Mianxin, et al.
Veröffentlicht: (2024)
DEFNet: Multitasks-based Deep Evidential Fusion Network for Blind Image Quality Assessment
von: Lou, Yiwei, et al.
Veröffentlicht: (2025)
von: Lou, Yiwei, et al.
Veröffentlicht: (2025)
Differentially Private Condorcet Voting
von: Li, Zhechen, et al.
Veröffentlicht: (2022)
von: Li, Zhechen, et al.
Veröffentlicht: (2022)
Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models
von: Ding, Meidan, et al.
Veröffentlicht: (2025)
von: Ding, Meidan, et al.
Veröffentlicht: (2025)
MultiMedEdit: A Scenario-Aware Benchmark for Evaluating Knowledge Editing in Medical VQA
von: Wen, Shengtao, et al.
Veröffentlicht: (2025)
von: Wen, Shengtao, et al.
Veröffentlicht: (2025)
MedHEval: Benchmarking Hallucinations and Mitigation Strategies in Medical Large Vision-Language Models
von: Chang, Aofei, et al.
Veröffentlicht: (2025)
von: Chang, Aofei, et al.
Veröffentlicht: (2025)
VLKEB: A Large Vision-Language Model Knowledge Editing Benchmark
von: Huang, Han, et al.
Veröffentlicht: (2024)
von: Huang, Han, et al.
Veröffentlicht: (2024)
Cross-Lingual Knowledge Editing in Large Language Models
von: Wang, Jiaan, et al.
Veröffentlicht: (2023)
von: Wang, Jiaan, et al.
Veröffentlicht: (2023)
Editing Factual Knowledge and Explanatory Ability of Medical Large Language Models
von: Xu, Derong, et al.
Veröffentlicht: (2024)
von: Xu, Derong, et al.
Veröffentlicht: (2024)
A Comprehensive Study of Knowledge Editing for Large Language Models
von: Zhang, Ningyu, et al.
Veröffentlicht: (2024)
von: Zhang, Ningyu, et al.
Veröffentlicht: (2024)
FairMedQA: Benchmarking Bias in Large Language Models for Medical Question Answering
von: Xiao, Ying, et al.
Veröffentlicht: (2025)
von: Xiao, Ying, et al.
Veröffentlicht: (2025)
Probabilistic Mechanism Design in Diffusion Auctions
von: Zhang, Xinlun, et al.
Veröffentlicht: (2026)
von: Zhang, Xinlun, et al.
Veröffentlicht: (2026)
Unmasking Deceptive Visuals: Benchmarking Multimodal Large Language Models on Misleading Chart Question Answering
von: Chen, Zixin, et al.
Veröffentlicht: (2025)
von: Chen, Zixin, et al.
Veröffentlicht: (2025)
MedKGent: A Large Language Model Agent Framework for Constructing Temporally Evolving Medical Knowledge Graph
von: Zhang, Duzhen, et al.
Veröffentlicht: (2025)
von: Zhang, Duzhen, et al.
Veröffentlicht: (2025)
MedFact: Benchmarking the Fact-Checking Capabilities of Large Language Models on Chinese Medical Texts
von: He, Jiayi, et al.
Veröffentlicht: (2025)
von: He, Jiayi, et al.
Veröffentlicht: (2025)
MEDMKG: Benchmarking Medical Knowledge Exploitation with Multimodal Knowledge Graph
von: Wang, Xiaochen, et al.
Veröffentlicht: (2025)
von: Wang, Xiaochen, et al.
Veröffentlicht: (2025)
MedRepBench: A Comprehensive Benchmark for Medical Report Interpretation
von: Shang, Fangxin, et al.
Veröffentlicht: (2025)
von: Shang, Fangxin, et al.
Veröffentlicht: (2025)
STAMPsy: Towards SpatioTemporal-Aware Mixed-Type Dialogues for Psychological Counseling
von: Wang, Jieyi, et al.
Veröffentlicht: (2024)
von: Wang, Jieyi, et al.
Veröffentlicht: (2024)
MedArabiQ: Benchmarking Large Language Models on Arabic Medical Tasks
von: Daoud, Mouath Abu, et al.
Veröffentlicht: (2025)
von: Daoud, Mouath Abu, et al.
Veröffentlicht: (2025)
Identifying Knowledge Editing Types in Large Language Models
von: Li, Xiaopeng, et al.
Veröffentlicht: (2024)
von: Li, Xiaopeng, et al.
Veröffentlicht: (2024)
Can Large Language Models Help Multimodal Language Analysis? MMLA: A Comprehensive Benchmark
von: Zhang, Hanlei, et al.
Veröffentlicht: (2025)
von: Zhang, Hanlei, et al.
Veröffentlicht: (2025)
MedAdapter: Efficient Test-Time Adaptation of Large Language Models towards Medical Reasoning
von: Shi, Wenqi, et al.
Veröffentlicht: (2024)
von: Shi, Wenqi, et al.
Veröffentlicht: (2024)
Lightweight Large Language Model for Medication Enquiry: Med-Pal
von: Elangovan, Kabilan, et al.
Veröffentlicht: (2024)
von: Elangovan, Kabilan, et al.
Veröffentlicht: (2024)
Knowledge Editing on Black-box Large Language Models
von: Song, Xiaoshuai, et al.
Veröffentlicht: (2024)
von: Song, Xiaoshuai, et al.
Veröffentlicht: (2024)
Towards Localized and Disentangled Knowledge Editing for Multimodal Large Language Models
von: Gu, Leijiang, et al.
Veröffentlicht: (2026)
von: Gu, Leijiang, et al.
Veröffentlicht: (2026)
PerMedCQA: Benchmarking Large Language Models on Medical Consumer Question Answering in Persian Language
von: Jamali, Naghmeh, et al.
Veröffentlicht: (2025)
von: Jamali, Naghmeh, et al.
Veröffentlicht: (2025)
AECBench: A Hierarchical Benchmark for Knowledge Evaluation of Large Language Models in the AEC Field
von: Liang, Chen, et al.
Veröffentlicht: (2025)
von: Liang, Chen, et al.
Veröffentlicht: (2025)
MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models
von: Zuo, Kaiwen, et al.
Veröffentlicht: (2024)
von: Zuo, Kaiwen, et al.
Veröffentlicht: (2024)
Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models
von: Jia, Yifan, et al.
Veröffentlicht: (2025)
von: Jia, Yifan, et al.
Veröffentlicht: (2025)
MedCalc-Eval and MedCalc-Env: Advancing Medical Calculation Capabilities of Large Language Models
von: Mao, Kangkun, et al.
Veröffentlicht: (2025)
von: Mao, Kangkun, et al.
Veröffentlicht: (2025)
Knowledge Editing for Large Language Models: A Survey
von: Wang, Song, et al.
Veröffentlicht: (2023)
von: Wang, Song, et al.
Veröffentlicht: (2023)
RJUA-MedDQA: A Multimodal Benchmark for Medical Document Question Answering and Clinical Reasoning
von: Jin, Congyun, et al.
Veröffentlicht: (2024)
von: Jin, Congyun, et al.
Veröffentlicht: (2024)
Latent Knowledge Scalpel: Precise and Massive Knowledge Editing for Large Language Models
von: Liu, Xin, et al.
Veröffentlicht: (2025)
von: Liu, Xin, et al.
Veröffentlicht: (2025)
QuarkMedBench: A Real-World Scenario Driven Benchmark for Evaluating Large Language Models
von: Wu, Yao, et al.
Veröffentlicht: (2026)
von: Wu, Yao, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
TCDiff: Triplex Cascaded Diffusion for High-fidelity Multimodal EHRs Generation with Incomplete Clinical Data
von: Yan, Yandong, et al.
Veröffentlicht: (2025) -
Revisiting Label Inference Attacks in Vertical Federated Learning: Why They Are Vulnerable and How to Defend
von: Liu, Yige, et al.
Veröffentlicht: (2026) -
MedHallu: A Comprehensive Benchmark for Detecting Medical Hallucinations in Large Language Models
von: Pandit, Shrey, et al.
Veröffentlicht: (2025) -
SpeechMedAssist: Efficiently and Effectively Adapting Speech Language Models for Medical Consultation
von: Chen, Sirry, et al.
Veröffentlicht: (2026) -
Differentiable Rule Induction from Raw Sequence Inputs
von: Gao, Kun, et al.
Veröffentlicht: (2026)