MMKE-Bench: A Multimodal Editing Benchmark for Diverse Visual Knowledge
Fuente:
arXiv
Saved in:
| Main Authors: | Du, Yuntao, Jiang, Kailin, Gao, Zhi, Shi, Chenrui, Zheng, Zilong, Qi, Siyuan, Li, Qing |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
When Large Multimodal Models Confront Evolving Knowledge: Challenges and Explorations
by: Jiang, Kailin, et al.
Published: (2025)
by: Jiang, Kailin, et al.
Published: (2025)
MMKU-Bench: A Multimodal Update Benchmark for Diverse Visual Knowledge
by: Fu, Baochen, et al.
Published: (2026)
by: Fu, Baochen, et al.
Published: (2026)
In-Context Editing: Learning Knowledge from Self-Induced Distributions
by: Qi, Siyuan, et al.
Published: (2024)
by: Qi, Siyuan, et al.
Published: (2024)
KORE: Enhancing Knowledge Injection for Large Multimodal Models via Knowledge-Oriented Controls
by: Jiang, Kailin, et al.
Published: (2025)
by: Jiang, Kailin, et al.
Published: (2025)
MINED: Probing and Updating with Multimodal Time-Sensitive Knowledge for Large Multimodal Models
by: Jiang, Kailin, et al.
Published: (2025)
by: Jiang, Kailin, et al.
Published: (2025)
VEFX-Bench: A Holistic Benchmark for Generic Video Editing and Visual Effects
by: Gao, Xiangbo, et al.
Published: (2026)
by: Gao, Xiangbo, et al.
Published: (2026)
MIKE: A New Benchmark for Fine-grained Multimodal Entity Knowledge Editing
by: Li, Jiaqi, et al.
Published: (2024)
by: Li, Jiaqi, et al.
Published: (2024)
ADRD-Bench: A Preliminary LLM Benchmark for Alzheimer's Disease and Related Dementias
by: Zhao, Guangxin, et al.
Published: (2026)
by: Zhao, Guangxin, et al.
Published: (2026)
Do Text Edits Generalize to Visual Generation? Benchmarking Cross-Modal Knowledge Editing in UMMs
by: Gao, Xin, et al.
Published: (2026)
by: Gao, Xin, et al.
Published: (2026)
CLM-Bench: Benchmarking and Analyzing Cross-lingual Misalignment of LLMs in Knowledge Editing
by: Hu, Yucheng, et al.
Published: (2026)
by: Hu, Yucheng, et al.
Published: (2026)
Towards Localized and Disentangled Knowledge Editing for Multimodal Large Language Models
by: Gu, Leijiang, et al.
Published: (2026)
by: Gu, Leijiang, et al.
Published: (2026)
VCG-Bench: Towards A Unified Visual-Centric Benchmark for Structured Generation and Editing
by: Su, Xiaoyan, et al.
Published: (2026)
by: Su, Xiaoyan, et al.
Published: (2026)
KnowMT-Bench: Benchmarking Knowledge-Intensive Long-Form Question Answering in Multi-Turn Dialogues
by: Chen, Junhao, et al.
Published: (2025)
by: Chen, Junhao, et al.
Published: (2025)
EpiBench: Benchmarking Multi-turn Research Workflows for Multimodal Agents
by: Dong, Xuan, et al.
Published: (2026)
by: Dong, Xuan, et al.
Published: (2026)
BenchBench: Benchmarking Automated Benchmark Generation
by: Zheng, Yandan, et al.
Published: (2026)
by: Zheng, Yandan, et al.
Published: (2026)
MMTutorBench: The First Multimodal Benchmark for AI Math Tutoring
by: Yang, Tengchao, et al.
Published: (2025)
by: Yang, Tengchao, et al.
Published: (2025)
LastingBench: Defend Benchmarks Against Knowledge Leakage
by: Fang, Yixiong, et al.
Published: (2025)
by: Fang, Yixiong, et al.
Published: (2025)
TransportationGames: Benchmarking Transportation Knowledge of (Multimodal) Large Language Models
by: Zhang, Xue, et al.
Published: (2024)
by: Zhang, Xue, et al.
Published: (2024)
1+1>2: Can Large Language Models Serve as Cross-Lingual Knowledge Aggregators?
by: Huang, Yue, et al.
Published: (2024)
by: Huang, Yue, et al.
Published: (2024)
FaithBench: A Diverse Hallucination Benchmark for Summarization by Modern LLMs
by: Bao, Forrest Sheng, et al.
Published: (2024)
by: Bao, Forrest Sheng, et al.
Published: (2024)
Can Visual Input Be Compressed? A Visual Token Compression Benchmark for Large Multimodal Models
by: Peng, Tianfan, et al.
Published: (2025)
by: Peng, Tianfan, et al.
Published: (2025)
ISO-Bench: Benchmarking Multimodal Causal Reasoning in Visual-Language Models through Procedural Plans
by: Sadana, Ananya, et al.
Published: (2025)
by: Sadana, Ananya, et al.
Published: (2025)
OfficeBench: Benchmarking Language Agents across Multiple Applications for Office Automation
by: Wang, Zilong, et al.
Published: (2024)
by: Wang, Zilong, et al.
Published: (2024)
MC-MKE: A Fine-Grained Multimodal Knowledge Editing Benchmark Emphasizing Modality Consistency
by: Zhang, Junzhe, et al.
Published: (2024)
by: Zhang, Junzhe, et al.
Published: (2024)
MER-Bench: A Comprehensive Benchmark for Multimodal Meme Reappraisal
by: Nie, Yiqi, et al.
Published: (2026)
by: Nie, Yiqi, et al.
Published: (2026)
LocalBench: Benchmarking LLMs on County-Level Local Knowledge and Reasoning
by: Gao, Zihan, et al.
Published: (2025)
by: Gao, Zihan, et al.
Published: (2025)
VinaBench: Benchmark for Faithful and Consistent Visual Narratives
by: Gao, Silin, et al.
Published: (2025)
by: Gao, Silin, et al.
Published: (2025)
FinRAGBench-V: A Benchmark for Multimodal RAG with Visual Citation in the Financial Domain
by: Zhao, Suifeng, et al.
Published: (2025)
by: Zhao, Suifeng, et al.
Published: (2025)
Learning to Edit: Aligning LLMs with Knowledge Editing
by: Jiang, Yuxin, et al.
Published: (2024)
by: Jiang, Yuxin, et al.
Published: (2024)
EduBench: A Comprehensive Benchmarking Dataset for Evaluating Large Language Models in Diverse Educational Scenarios
by: Xu, Bin, et al.
Published: (2025)
by: Xu, Bin, et al.
Published: (2025)
MathBench: Evaluating the Theory and Application Proficiency of LLMs with a Hierarchical Mathematics Benchmark
by: Liu, Hongwei, et al.
Published: (2024)
by: Liu, Hongwei, et al.
Published: (2024)
Benchmarking and Rethinking Knowledge Editing for Large Language Models
by: He, Guoxiu, et al.
Published: (2025)
by: He, Guoxiu, et al.
Published: (2025)
Collu-Bench: A Benchmark for Predicting Language Model Hallucinations in Code
by: Jiang, Nan, et al.
Published: (2024)
by: Jiang, Nan, et al.
Published: (2024)
Multimodal Large Language Models Meet Multimodal Emotion Recognition and Reasoning: A Survey
by: Shou, Yuntao, et al.
Published: (2025)
by: Shou, Yuntao, et al.
Published: (2025)
Hanfu-Bench: A Multimodal Benchmark on Cross-Temporal Cultural Understanding and Transcreation
by: Zhou, Li, et al.
Published: (2025)
by: Zhou, Li, et al.
Published: (2025)
LiveSearchBench: An Automatically Constructed Benchmark for Retrieval and Reasoning over Dynamic Knowledge
by: Zhou, Heng, et al.
Published: (2025)
by: Zhou, Heng, et al.
Published: (2025)
CollabEdit: Towards Non-destructive Collaborative Knowledge Editing
by: Zheng, Jiamu, et al.
Published: (2024)
by: Zheng, Jiamu, et al.
Published: (2024)
SAP-Bench: Benchmarking Multimodal Large Language Models in Surgical Action Planning
by: Xu, Mengya, et al.
Published: (2025)
by: Xu, Mengya, et al.
Published: (2025)
VisualAgentBench: Towards Large Multimodal Models as Visual Foundation Agents
by: Liu, Xiao, et al.
Published: (2024)
by: Liu, Xiao, et al.
Published: (2024)
HomeSafeBench: A Benchmark for Embodied Vision-Language Models in Free-Exploration Home Safety Inspection
by: Gao, Siyuan, et al.
Published: (2025)
by: Gao, Siyuan, et al.
Published: (2025)
Similar Items
-
When Large Multimodal Models Confront Evolving Knowledge: Challenges and Explorations
by: Jiang, Kailin, et al.
Published: (2025) -
MMKU-Bench: A Multimodal Update Benchmark for Diverse Visual Knowledge
by: Fu, Baochen, et al.
Published: (2026) -
In-Context Editing: Learning Knowledge from Self-Induced Distributions
by: Qi, Siyuan, et al.
Published: (2024) -
KORE: Enhancing Knowledge Injection for Large Multimodal Models via Knowledge-Oriented Controls
by: Jiang, Kailin, et al.
Published: (2025) -
MINED: Probing and Updating with Multimodal Time-Sensitive Knowledge for Large Multimodal Models
by: Jiang, Kailin, et al.
Published: (2025)