MedMKEB: A Comprehensive Knowledge Editing Benchmark for Medical Multimodal Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Xu, Dexuan, Wang, Jieyi, Chai, Zhongyan, Cao, Yongzhi, Wang, Hanpin, Zhang, Huamin, Huang, Yu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
TCDiff: Triplex Cascaded Diffusion for High-fidelity Multimodal EHRs Generation with Incomplete Clinical Data
por: Yan, Yandong, et al.
Publicado: (2025)
por: Yan, Yandong, et al.
Publicado: (2025)
Revisiting Label Inference Attacks in Vertical Federated Learning: Why They Are Vulnerable and How to Defend
por: Liu, Yige, et al.
Publicado: (2026)
por: Liu, Yige, et al.
Publicado: (2026)
MedHallu: A Comprehensive Benchmark for Detecting Medical Hallucinations in Large Language Models
por: Pandit, Shrey, et al.
Publicado: (2025)
por: Pandit, Shrey, et al.
Publicado: (2025)
SpeechMedAssist: Efficiently and Effectively Adapting Speech Language Models for Medical Consultation
por: Chen, Sirry, et al.
Publicado: (2026)
por: Chen, Sirry, et al.
Publicado: (2026)
Differentiable Rule Induction from Raw Sequence Inputs
por: Gao, Kun, et al.
Publicado: (2026)
por: Gao, Kun, et al.
Publicado: (2026)
MedReflect: Teaching Medical LLMs to Self-Improve via Reflective Correction
por: Huang, Yue, et al.
Publicado: (2025)
por: Huang, Yue, et al.
Publicado: (2025)
MedBench: A Comprehensive, Standardized, and Reliable Benchmarking System for Evaluating Chinese Medical Large Language Models
por: Liu, Mianxin, et al.
Publicado: (2024)
por: Liu, Mianxin, et al.
Publicado: (2024)
DEFNet: Multitasks-based Deep Evidential Fusion Network for Blind Image Quality Assessment
por: Lou, Yiwei, et al.
Publicado: (2025)
por: Lou, Yiwei, et al.
Publicado: (2025)
Differentially Private Condorcet Voting
por: Li, Zhechen, et al.
Publicado: (2022)
por: Li, Zhechen, et al.
Publicado: (2022)
Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models
por: Ding, Meidan, et al.
Publicado: (2025)
por: Ding, Meidan, et al.
Publicado: (2025)
MultiMedEdit: A Scenario-Aware Benchmark for Evaluating Knowledge Editing in Medical VQA
por: Wen, Shengtao, et al.
Publicado: (2025)
por: Wen, Shengtao, et al.
Publicado: (2025)
MedHEval: Benchmarking Hallucinations and Mitigation Strategies in Medical Large Vision-Language Models
por: Chang, Aofei, et al.
Publicado: (2025)
por: Chang, Aofei, et al.
Publicado: (2025)
VLKEB: A Large Vision-Language Model Knowledge Editing Benchmark
por: Huang, Han, et al.
Publicado: (2024)
por: Huang, Han, et al.
Publicado: (2024)
Cross-Lingual Knowledge Editing in Large Language Models
por: Wang, Jiaan, et al.
Publicado: (2023)
por: Wang, Jiaan, et al.
Publicado: (2023)
Editing Factual Knowledge and Explanatory Ability of Medical Large Language Models
por: Xu, Derong, et al.
Publicado: (2024)
por: Xu, Derong, et al.
Publicado: (2024)
A Comprehensive Study of Knowledge Editing for Large Language Models
por: Zhang, Ningyu, et al.
Publicado: (2024)
por: Zhang, Ningyu, et al.
Publicado: (2024)
FairMedQA: Benchmarking Bias in Large Language Models for Medical Question Answering
por: Xiao, Ying, et al.
Publicado: (2025)
por: Xiao, Ying, et al.
Publicado: (2025)
Probabilistic Mechanism Design in Diffusion Auctions
por: Zhang, Xinlun, et al.
Publicado: (2026)
por: Zhang, Xinlun, et al.
Publicado: (2026)
Unmasking Deceptive Visuals: Benchmarking Multimodal Large Language Models on Misleading Chart Question Answering
por: Chen, Zixin, et al.
Publicado: (2025)
por: Chen, Zixin, et al.
Publicado: (2025)
MedKGent: A Large Language Model Agent Framework for Constructing Temporally Evolving Medical Knowledge Graph
por: Zhang, Duzhen, et al.
Publicado: (2025)
por: Zhang, Duzhen, et al.
Publicado: (2025)
MedFact: Benchmarking the Fact-Checking Capabilities of Large Language Models on Chinese Medical Texts
por: He, Jiayi, et al.
Publicado: (2025)
por: He, Jiayi, et al.
Publicado: (2025)
MEDMKG: Benchmarking Medical Knowledge Exploitation with Multimodal Knowledge Graph
por: Wang, Xiaochen, et al.
Publicado: (2025)
por: Wang, Xiaochen, et al.
Publicado: (2025)
MedRepBench: A Comprehensive Benchmark for Medical Report Interpretation
por: Shang, Fangxin, et al.
Publicado: (2025)
por: Shang, Fangxin, et al.
Publicado: (2025)
STAMPsy: Towards SpatioTemporal-Aware Mixed-Type Dialogues for Psychological Counseling
por: Wang, Jieyi, et al.
Publicado: (2024)
por: Wang, Jieyi, et al.
Publicado: (2024)
MedArabiQ: Benchmarking Large Language Models on Arabic Medical Tasks
por: Daoud, Mouath Abu, et al.
Publicado: (2025)
por: Daoud, Mouath Abu, et al.
Publicado: (2025)
Identifying Knowledge Editing Types in Large Language Models
por: Li, Xiaopeng, et al.
Publicado: (2024)
por: Li, Xiaopeng, et al.
Publicado: (2024)
Can Large Language Models Help Multimodal Language Analysis? MMLA: A Comprehensive Benchmark
por: Zhang, Hanlei, et al.
Publicado: (2025)
por: Zhang, Hanlei, et al.
Publicado: (2025)
MedAdapter: Efficient Test-Time Adaptation of Large Language Models towards Medical Reasoning
por: Shi, Wenqi, et al.
Publicado: (2024)
por: Shi, Wenqi, et al.
Publicado: (2024)
Lightweight Large Language Model for Medication Enquiry: Med-Pal
por: Elangovan, Kabilan, et al.
Publicado: (2024)
por: Elangovan, Kabilan, et al.
Publicado: (2024)
Knowledge Editing on Black-box Large Language Models
por: Song, Xiaoshuai, et al.
Publicado: (2024)
por: Song, Xiaoshuai, et al.
Publicado: (2024)
Towards Localized and Disentangled Knowledge Editing for Multimodal Large Language Models
por: Gu, Leijiang, et al.
Publicado: (2026)
por: Gu, Leijiang, et al.
Publicado: (2026)
PerMedCQA: Benchmarking Large Language Models on Medical Consumer Question Answering in Persian Language
por: Jamali, Naghmeh, et al.
Publicado: (2025)
por: Jamali, Naghmeh, et al.
Publicado: (2025)
AECBench: A Hierarchical Benchmark for Knowledge Evaluation of Large Language Models in the AEC Field
por: Liang, Chen, et al.
Publicado: (2025)
por: Liang, Chen, et al.
Publicado: (2025)
MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models
por: Zuo, Kaiwen, et al.
Publicado: (2024)
por: Zuo, Kaiwen, et al.
Publicado: (2024)
Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models
por: Jia, Yifan, et al.
Publicado: (2025)
por: Jia, Yifan, et al.
Publicado: (2025)
MedCalc-Eval and MedCalc-Env: Advancing Medical Calculation Capabilities of Large Language Models
por: Mao, Kangkun, et al.
Publicado: (2025)
por: Mao, Kangkun, et al.
Publicado: (2025)
Knowledge Editing for Large Language Models: A Survey
por: Wang, Song, et al.
Publicado: (2023)
por: Wang, Song, et al.
Publicado: (2023)
RJUA-MedDQA: A Multimodal Benchmark for Medical Document Question Answering and Clinical Reasoning
por: Jin, Congyun, et al.
Publicado: (2024)
por: Jin, Congyun, et al.
Publicado: (2024)
Latent Knowledge Scalpel: Precise and Massive Knowledge Editing for Large Language Models
por: Liu, Xin, et al.
Publicado: (2025)
por: Liu, Xin, et al.
Publicado: (2025)
QuarkMedBench: A Real-World Scenario Driven Benchmark for Evaluating Large Language Models
por: Wu, Yao, et al.
Publicado: (2026)
por: Wu, Yao, et al.
Publicado: (2026)
Ejemplares similares
-
TCDiff: Triplex Cascaded Diffusion for High-fidelity Multimodal EHRs Generation with Incomplete Clinical Data
por: Yan, Yandong, et al.
Publicado: (2025) -
Revisiting Label Inference Attacks in Vertical Federated Learning: Why They Are Vulnerable and How to Defend
por: Liu, Yige, et al.
Publicado: (2026) -
MedHallu: A Comprehensive Benchmark for Detecting Medical Hallucinations in Large Language Models
por: Pandit, Shrey, et al.
Publicado: (2025) -
SpeechMedAssist: Efficiently and Effectively Adapting Speech Language Models for Medical Consultation
por: Chen, Sirry, et al.
Publicado: (2026) -
Differentiable Rule Induction from Raw Sequence Inputs
por: Gao, Kun, et al.
Publicado: (2026)