KBE-DME: Dynamic Multimodal Evaluation via Knowledge Enhanced Benchmark Evolution
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Junzhe, Zhang, Huixuan, Wan, Xiaojun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
EAMA : Entity-Aware Multimodal Alignment Based Approach for News Image Captioning
di: Zhang, Junzhe, et al.
Pubblicazione: (2024)
di: Zhang, Junzhe, et al.
Pubblicazione: (2024)
MC-MKE: A Fine-Grained Multimodal Knowledge Editing Benchmark Emphasizing Modality Consistency
di: Zhang, Junzhe, et al.
Pubblicazione: (2024)
di: Zhang, Junzhe, et al.
Pubblicazione: (2024)
How Much To Guide: Revisiting Adaptive Guidance in Classifier-Free Guidance Text-to-Vision Diffusion Models
di: Zhang, Huixuan, et al.
Pubblicazione: (2025)
di: Zhang, Huixuan, et al.
Pubblicazione: (2025)
UniAIDet: A Unified and Universal Benchmark for AI-Generated Image Content Detection and Localization
di: Zhang, Huixuan, et al.
Pubblicazione: (2025)
di: Zhang, Huixuan, et al.
Pubblicazione: (2025)
M$^{3}$T2IBench: A Large-Scale Multi-Category, Multi-Instance, Multi-Relation Text-to-Image Benchmark
di: Zhang, Huixuan, et al.
Pubblicazione: (2025)
di: Zhang, Huixuan, et al.
Pubblicazione: (2025)
Image Matters: A New Dataset and Empirical Study for Multimodal Hyperbole Detection
di: Zhang, Huixuan, et al.
Pubblicazione: (2023)
di: Zhang, Huixuan, et al.
Pubblicazione: (2023)
Re-Thinking the Automatic Evaluation of Image-Text Alignment in Text-to-Image Models
di: Zhang, Huixuan, et al.
Pubblicazione: (2025)
di: Zhang, Huixuan, et al.
Pubblicazione: (2025)
MINOS: A Multimodal Evaluation Model for Bidirectional Generation Between Image and Text
di: Zhang, Junzhe, et al.
Pubblicazione: (2025)
di: Zhang, Junzhe, et al.
Pubblicazione: (2025)
Exploring and Evaluating Multimodal Knowledge Reasoning Consistency of Multimodal Large Language Models
di: Jia, Boyu, et al.
Pubblicazione: (2025)
di: Jia, Boyu, et al.
Pubblicazione: (2025)
Quantity Matters: Towards Assessing and Mitigating Number Hallucination in Large Vision-Language Models
di: Zhang, Huixuan, et al.
Pubblicazione: (2024)
di: Zhang, Huixuan, et al.
Pubblicazione: (2024)
Cognitive Visual-Language Mapper: Advancing Multimodal Comprehension with Enhanced Visual Knowledge Alignment
di: Li, Yunxin, et al.
Pubblicazione: (2024)
di: Li, Yunxin, et al.
Pubblicazione: (2024)
Illusory VQA: Benchmarking and Enhancing Multimodal Models on Visual Illusions
di: Rostamkhani, Mohammadmostafa, et al.
Pubblicazione: (2024)
di: Rostamkhani, Mohammadmostafa, et al.
Pubblicazione: (2024)
Specializing Large Models for Oracle Bone Script Interpretation via Component-Grounded Multimodal Knowledge Augmentation
di: Zhang, Jianing, et al.
Pubblicazione: (2026)
di: Zhang, Jianing, et al.
Pubblicazione: (2026)
Evolver: Chain-of-Evolution Prompting to Boost Large Multimodal Models for Hateful Meme Detection
di: Huang, Jinfa, et al.
Pubblicazione: (2024)
di: Huang, Jinfa, et al.
Pubblicazione: (2024)
Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation
di: Zhang, Xiaofeng, et al.
Pubblicazione: (2024)
di: Zhang, Xiaofeng, et al.
Pubblicazione: (2024)
Uncovering Entity Identity Confusion in Multimodal Knowledge Editing
di: Wu, Shu, et al.
Pubblicazione: (2026)
di: Wu, Shu, et al.
Pubblicazione: (2026)
Res-Bench: Benchmarking the Robustness of Multimodal Large Language Models to Dynamic Resolution Input
di: Li, Chenxu, et al.
Pubblicazione: (2025)
di: Li, Chenxu, et al.
Pubblicazione: (2025)
Vision Enhancing LLMs: Empowering Multimodal Knowledge Storage and Sharing in LLMs
di: Li, Yunxin, et al.
Pubblicazione: (2023)
di: Li, Yunxin, et al.
Pubblicazione: (2023)
MMEvalPro: Calibrating Multimodal Benchmarks Towards Trustworthy and Efficient Evaluation
di: Huang, Jinsheng, et al.
Pubblicazione: (2024)
di: Huang, Jinsheng, et al.
Pubblicazione: (2024)
LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models
di: Zhang, Kaichen, et al.
Pubblicazione: (2024)
di: Zhang, Kaichen, et al.
Pubblicazione: (2024)
MME-Finance: A Multimodal Finance Benchmark for Expert-level Understanding and Reasoning
di: Gan, Ziliang, et al.
Pubblicazione: (2024)
di: Gan, Ziliang, et al.
Pubblicazione: (2024)
VaseVQA: Multimodal Agent and Benchmark for Ancient Greek Pottery
di: Ge, Jinchao, et al.
Pubblicazione: (2025)
di: Ge, Jinchao, et al.
Pubblicazione: (2025)
MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark
di: Yue, Xiang, et al.
Pubblicazione: (2024)
di: Yue, Xiang, et al.
Pubblicazione: (2024)
SAP-Bench: Benchmarking Multimodal Large Language Models in Surgical Action Planning
di: Xu, Mengya, et al.
Pubblicazione: (2025)
di: Xu, Mengya, et al.
Pubblicazione: (2025)
Understanding Multimodal Procedural Knowledge by Sequencing Multimodal Instructional Manuals
di: Wu, Te-Lin, et al.
Pubblicazione: (2021)
di: Wu, Te-Lin, et al.
Pubblicazione: (2021)
CODIS: Benchmarking Context-Dependent Visual Comprehension for Multimodal Large Language Models
di: Luo, Fuwen, et al.
Pubblicazione: (2024)
di: Luo, Fuwen, et al.
Pubblicazione: (2024)
CVLUE: A New Benchmark Dataset for Chinese Vision-Language Understanding Evaluation
di: Wang, Yuxuan, et al.
Pubblicazione: (2024)
di: Wang, Yuxuan, et al.
Pubblicazione: (2024)
MoDES: Accelerating Mixture-of-Experts Multimodal Large Language Models via Dynamic Expert Skipping
di: Huang, Yushi, et al.
Pubblicazione: (2025)
di: Huang, Yushi, et al.
Pubblicazione: (2025)
ICT: Image-Object Cross-Level Trusted Intervention for Mitigating Object Hallucination in Large Vision-Language Models
di: Chen, Junzhe, et al.
Pubblicazione: (2024)
di: Chen, Junzhe, et al.
Pubblicazione: (2024)
GSR-BENCH: A Benchmark for Grounded Spatial Reasoning Evaluation via Multimodal LLMs
di: Rajabi, Navid, et al.
Pubblicazione: (2024)
di: Rajabi, Navid, et al.
Pubblicazione: (2024)
MLLM-as-a-Judge: Assessing Multimodal LLM-as-a-Judge with Vision-Language Benchmark
di: Chen, Dongping, et al.
Pubblicazione: (2024)
di: Chen, Dongping, et al.
Pubblicazione: (2024)
EXAMS-V: A Multi-Discipline Multilingual Multimodal Exam Benchmark for Evaluating Vision Language Models
di: Das, Rocktim Jyoti, et al.
Pubblicazione: (2024)
di: Das, Rocktim Jyoti, et al.
Pubblicazione: (2024)
KazakhOCR: A Synthetic Benchmark for Evaluating Multimodal Models in Low-Resource Kazakh Script OCR
di: Gagnier, Henry, et al.
Pubblicazione: (2026)
di: Gagnier, Henry, et al.
Pubblicazione: (2026)
Mitigating Multimodal Hallucination via Phase-wise Self-reward
di: Zhang, Yu, et al.
Pubblicazione: (2026)
di: Zhang, Yu, et al.
Pubblicazione: (2026)
RAVENEA: A Benchmark for Multimodal Retrieval-Augmented Visual Culture Understanding
di: Li, Jiaang, et al.
Pubblicazione: (2025)
di: Li, Jiaang, et al.
Pubblicazione: (2025)
AMBER: An LLM-free Multi-dimensional Benchmark for MLLMs Hallucination Evaluation
di: Wang, Junyang, et al.
Pubblicazione: (2023)
di: Wang, Junyang, et al.
Pubblicazione: (2023)
SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning
di: Huang, Haoyu, et al.
Pubblicazione: (2026)
di: Huang, Haoyu, et al.
Pubblicazione: (2026)
UEval: A Benchmark for Unified Multimodal Generation
di: Li, Bo, et al.
Pubblicazione: (2026)
di: Li, Bo, et al.
Pubblicazione: (2026)
IV-Bench: A Benchmark for Image-Grounded Video Perception and Reasoning in Multimodal LLMs
di: Ma, David, et al.
Pubblicazione: (2025)
di: Ma, David, et al.
Pubblicazione: (2025)
Can MLLMs Read the Room? A Multimodal Benchmark for Assessing Deception in Multi-Party Social Interactions
di: Kang, Caixin, et al.
Pubblicazione: (2025)
di: Kang, Caixin, et al.
Pubblicazione: (2025)
Documenti analoghi
-
EAMA : Entity-Aware Multimodal Alignment Based Approach for News Image Captioning
di: Zhang, Junzhe, et al.
Pubblicazione: (2024) -
MC-MKE: A Fine-Grained Multimodal Knowledge Editing Benchmark Emphasizing Modality Consistency
di: Zhang, Junzhe, et al.
Pubblicazione: (2024) -
How Much To Guide: Revisiting Adaptive Guidance in Classifier-Free Guidance Text-to-Vision Diffusion Models
di: Zhang, Huixuan, et al.
Pubblicazione: (2025) -
UniAIDet: A Unified and Universal Benchmark for AI-Generated Image Content Detection and Localization
di: Zhang, Huixuan, et al.
Pubblicazione: (2025) -
M$^{3}$T2IBench: A Large-Scale Multi-Category, Multi-Instance, Multi-Relation Text-to-Image Benchmark
di: Zhang, Huixuan, et al.
Pubblicazione: (2025)