ReactBench: A Cause-Driven Benchmark for Multimodal Hallucination via Systematic Evaluation
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhou, Shizhe, Jia, Bohan, Wu, Kai, Shen, Yan, Li, Tongyun, Wu, Yuyang, Lin, Shaohui |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DF-LLaVA: Unlocking MLLMs for Synthetic Image Detection via Knowledge Injection and Conflict-Driven Self-Reflection
por: Shen, Zhuokang, et al.
Publicado: (2025)
por: Shen, Zhuokang, et al.
Publicado: (2025)
ReactBench: A Benchmark for Topological Reasoning in MLLMs on Chemical Reaction Diagrams
por: Xu, Qiang, et al.
Publicado: (2026)
por: Xu, Qiang, et al.
Publicado: (2026)
CDH-Bench: A Commonsense-Driven Hallucination Benchmark for Evaluating Visual Fidelity in Vision-Language Models
por: Chen, Kesheng, et al.
Publicado: (2026)
por: Chen, Kesheng, et al.
Publicado: (2026)
CompBench: Benchmarking Complex Instruction-guided Image Editing
por: Jia, Bohan, et al.
Publicado: (2025)
por: Jia, Bohan, et al.
Publicado: (2025)
What Color Is It? A Text-Interference Multimodal Hallucination Benchmark
por: Zhao, Jinkun, et al.
Publicado: (2025)
por: Zhao, Jinkun, et al.
Publicado: (2025)
ComplexBench-Edit: Benchmarking Complex Instruction-Driven Image Editing via Compositional Dependencies
por: Wang, Chenglin, et al.
Publicado: (2025)
por: Wang, Chenglin, et al.
Publicado: (2025)
VirtueBench: Evaluating Trustworthiness under Uncertainty in Long Video Understanding
por: Yu, Xueqing, et al.
Publicado: (2026)
por: Yu, Xueqing, et al.
Publicado: (2026)
HallE-Control: Controlling Object Hallucination in Large Multimodal Models
por: Zhai, Bohan, et al.
Publicado: (2023)
por: Zhai, Bohan, et al.
Publicado: (2023)
VideoAesBench: Benchmarking the Video Aesthetics Perception Capabilities of Large Multimodal Models
por: Li, Yunhao, et al.
Publicado: (2026)
por: Li, Yunhao, et al.
Publicado: (2026)
M-ErasureBench: A Comprehensive Multimodal Evaluation Benchmark for Concept Erasure in Diffusion Models
por: Weng, Ju-Hsuan, et al.
Publicado: (2025)
por: Weng, Ju-Hsuan, et al.
Publicado: (2025)
Combating Multimodal LLM Hallucination via Bottom-Up Holistic Reasoning
por: Wu, Shengqiong, et al.
Publicado: (2024)
por: Wu, Shengqiong, et al.
Publicado: (2024)
HalDec-Bench: Benchmarking Hallucination Detector in Image Captioning
por: Saito, Kuniaki, et al.
Publicado: (2026)
por: Saito, Kuniaki, et al.
Publicado: (2026)
HalDec-Bench: Benchmarking Hallucination Detector in Image Captioning
por: Saito, Kuniaki, et al.
Publicado: (2025)
por: Saito, Kuniaki, et al.
Publicado: (2025)
A Survey of Multimodal Hallucination Evaluation and Detection
por: Chen, Zhiyuan, et al.
Publicado: (2025)
por: Chen, Zhiyuan, et al.
Publicado: (2025)
Q-Bench-Portrait: Benchmarking Multimodal Large Language Models on Portrait Image Quality Perception
por: Wu, Sijing, et al.
Publicado: (2026)
por: Wu, Sijing, et al.
Publicado: (2026)
Devling into Adversarial Transferability on Image Classification: Review, Benchmark, and Evaluation
por: Wang, Xiaosen, et al.
Publicado: (2026)
por: Wang, Xiaosen, et al.
Publicado: (2026)
MEGA-Bench: Scaling Multimodal Evaluation to over 500 Real-World Tasks
por: Chen, Jiacheng, et al.
Publicado: (2024)
por: Chen, Jiacheng, et al.
Publicado: (2024)
MIHBench: Benchmarking and Mitigating Multi-Image Hallucinations in Multimodal Large Language Models
por: Li, Jiale, et al.
Publicado: (2025)
por: Li, Jiale, et al.
Publicado: (2025)
MCA-Bench: A Multimodal Benchmark for Evaluating CAPTCHA Robustness Against VLM-based Attacks
por: Wu, Zonglin, et al.
Publicado: (2025)
por: Wu, Zonglin, et al.
Publicado: (2025)
VisBrowse-Bench: Benchmarking Visual-Native Search for Multimodal Browsing Agents
por: Zhang, Zhengbo, et al.
Publicado: (2026)
por: Zhang, Zhengbo, et al.
Publicado: (2026)
Q-Bench-Video: Benchmarking the Video Quality Understanding of LMMs
por: Zhang, Zicheng, et al.
Publicado: (2024)
por: Zhang, Zicheng, et al.
Publicado: (2024)
OmniSafeBench-MM: A Unified Benchmark and Toolbox for Multimodal Jailbreak Attack-Defense Evaluation
por: Jia, Xiaojun, et al.
Publicado: (2025)
por: Jia, Xiaojun, et al.
Publicado: (2025)
GenColorBench: A Color Evaluation Benchmark for Text-to-Image Generation Models
por: Butt, Muhammad Atif, et al.
Publicado: (2025)
por: Butt, Muhammad Atif, et al.
Publicado: (2025)
Localizing Before Answering: A Hallucination Evaluation Benchmark for Grounded Medical Multimodal LLMs
por: Nguyen, Dung, et al.
Publicado: (2025)
por: Nguyen, Dung, et al.
Publicado: (2025)
SpineBench: Benchmarking Multimodal LLMs for Spinal Pathology Analysis
por: Zhang, Chenghanyu, et al.
Publicado: (2025)
por: Zhang, Chenghanyu, et al.
Publicado: (2025)
PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension
por: Ouyang, Kun, et al.
Publicado: (2024)
por: Ouyang, Kun, et al.
Publicado: (2024)
MMDeepResearch-Bench: A Benchmark for Multimodal Deep Research Agents
por: Huang, Peizhou, et al.
Publicado: (2026)
por: Huang, Peizhou, et al.
Publicado: (2026)
DetailVerifyBench: A Benchmark for Dense Hallucination Localization in Long Image Captions
por: Wang, Xinran, et al.
Publicado: (2026)
por: Wang, Xinran, et al.
Publicado: (2026)
Beyond Single Models: Mitigating Multimodal Hallucinations via Adaptive Token Ensemble Decoding
por: Li, Jinlin, et al.
Publicado: (2025)
por: Li, Jinlin, et al.
Publicado: (2025)
UrBench: A Comprehensive Benchmark for Evaluating Large Multimodal Models in Multi-View Urban Scenarios
por: Zhou, Baichuan, et al.
Publicado: (2024)
por: Zhou, Baichuan, et al.
Publicado: (2024)
MICON-Bench: Benchmarking and Enhancing Multi-Image Context Image Generation in Unified Multimodal Models
por: Wu, Mingrui, et al.
Publicado: (2026)
por: Wu, Mingrui, et al.
Publicado: (2026)
GeoBench: Rethinking Multimodal Geometric Problem-Solving via Hierarchical Evaluation
por: Feng, Yuan, et al.
Publicado: (2025)
por: Feng, Yuan, et al.
Publicado: (2025)
ViBe: A Text-to-Video Benchmark for Evaluating Hallucination in Large Multimodal Models
por: Rawte, Vipula, et al.
Publicado: (2024)
por: Rawte, Vipula, et al.
Publicado: (2024)
ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models
por: Roberts, Jonathan, et al.
Publicado: (2025)
por: Roberts, Jonathan, et al.
Publicado: (2025)
MM-SafetyBench: A Benchmark for Safety Evaluation of Multimodal Large Language Models
por: Liu, Xin, et al.
Publicado: (2023)
por: Liu, Xin, et al.
Publicado: (2023)
R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation
por: Chen, Kaijie, et al.
Publicado: (2025)
por: Chen, Kaijie, et al.
Publicado: (2025)
AesBench: An Expert Benchmark for Multimodal Large Language Models on Image Aesthetics Perception
por: Huang, Yipo, et al.
Publicado: (2024)
por: Huang, Yipo, et al.
Publicado: (2024)
PRISMM-Bench: A Benchmark of Peer-Review Grounded Multimodal Inconsistencies
por: Selch, Lukas, et al.
Publicado: (2025)
por: Selch, Lukas, et al.
Publicado: (2025)
Tracing and Mitigating Hallucinations in Multimodal LLMs via Dynamic Attention Localization
por: Yang, Tiancheng, et al.
Publicado: (2025)
por: Yang, Tiancheng, et al.
Publicado: (2025)
Hallucination Benchmark in Medical Visual Question Answering
por: Wu, Jinge, et al.
Publicado: (2024)
por: Wu, Jinge, et al.
Publicado: (2024)
Ejemplares similares
-
DF-LLaVA: Unlocking MLLMs for Synthetic Image Detection via Knowledge Injection and Conflict-Driven Self-Reflection
por: Shen, Zhuokang, et al.
Publicado: (2025) -
ReactBench: A Benchmark for Topological Reasoning in MLLMs on Chemical Reaction Diagrams
por: Xu, Qiang, et al.
Publicado: (2026) -
CDH-Bench: A Commonsense-Driven Hallucination Benchmark for Evaluating Visual Fidelity in Vision-Language Models
por: Chen, Kesheng, et al.
Publicado: (2026) -
CompBench: Benchmarking Complex Instruction-guided Image Editing
por: Jia, Bohan, et al.
Publicado: (2025) -
What Color Is It? A Text-Interference Multimodal Hallucination Benchmark
por: Zhao, Jinkun, et al.
Publicado: (2025)