CDH-Bench: A Commonsense-Driven Hallucination Benchmark for Evaluating Visual Fidelity in Vision-Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Kesheng, Hu, Yamin, Zhou, Qi, Zhu, Zhenqian, Luo, Wenjian |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
AP-BMM: Approximating Capability-Cost Pareto Sets of LLMs via Asynchronous Prior-Guided Bayesian Model Merging
por: Chen, Kesheng, et al.
Publicado: (2025)
por: Chen, Kesheng, et al.
Publicado: (2025)
HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models
por: Guan, Tianrui, et al.
Publicado: (2023)
por: Guan, Tianrui, et al.
Publicado: (2023)
MMLongCite: A Benchmark for Evaluating Fidelity of Long-Context Vision-Language Models
por: Zhou, Keyan, et al.
Publicado: (2025)
por: Zhou, Keyan, et al.
Publicado: (2025)
Heron-Bench: A Benchmark for Evaluating Vision Language Models in Japanese
por: Inoue, Yuichi, et al.
Publicado: (2024)
por: Inoue, Yuichi, et al.
Publicado: (2024)
Mitigating Hallucinations in Large Vision-Language Models by Self-Injecting Hallucinations
por: Lu, Yifan, et al.
Publicado: (2025)
por: Lu, Yifan, et al.
Publicado: (2025)
Visual Riddles: a Commonsense and World Knowledge Challenge for Large Vision and Language Models
por: Bitton-Guetta, Nitzan, et al.
Publicado: (2024)
por: Bitton-Guetta, Nitzan, et al.
Publicado: (2024)
AutoHallusion: Automatic Generation of Hallucination Benchmarks for Vision-Language Models
por: Wu, Xiyang, et al.
Publicado: (2024)
por: Wu, Xiyang, et al.
Publicado: (2024)
MFC-Bench: Benchmarking Multimodal Fact-Checking with Large Vision-Language Models
por: Wang, Shengkang, et al.
Publicado: (2024)
por: Wang, Shengkang, et al.
Publicado: (2024)
TemMed-Bench: Evaluating Temporal Medical Image Reasoning in Vision-Language Models
por: Zhang, Junyi, et al.
Publicado: (2025)
por: Zhang, Junyi, et al.
Publicado: (2025)
VULCA-Bench: A Multicultural Vision-Language Benchmark for Evaluating Cultural Understanding
por: Yu, Haorui, et al.
Publicado: (2026)
por: Yu, Haorui, et al.
Publicado: (2026)
VL-RewardBench: A Challenging Benchmark for Vision-Language Generative Reward Models
por: Li, Lei, et al.
Publicado: (2024)
por: Li, Lei, et al.
Publicado: (2024)
Benchmarking Deflection and Hallucination in Large Vision-Language Models
por: Moratelli, Nicholas, et al.
Publicado: (2026)
por: Moratelli, Nicholas, et al.
Publicado: (2026)
A Comprehensive Analysis for Visual Object Hallucination in Large Vision-Language Models
por: Jing, Liqiang, et al.
Publicado: (2025)
por: Jing, Liqiang, et al.
Publicado: (2025)
Instruction-Aligned Visual Attention for Mitigating Hallucinations in Large Vision-Language Models
por: Li, Bin, et al.
Publicado: (2025)
por: Li, Bin, et al.
Publicado: (2025)
ViCor: Bridging Visual Understanding and Commonsense Reasoning with Large Language Models
por: Zhou, Kaiwen, et al.
Publicado: (2023)
por: Zhou, Kaiwen, et al.
Publicado: (2023)
MMLongBench: Benchmarking Long-Context Vision-Language Models Effectively and Thoroughly
por: Wang, Zhaowei, et al.
Publicado: (2025)
por: Wang, Zhaowei, et al.
Publicado: (2025)
AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation
por: Zhou, Ziwei, et al.
Publicado: (2026)
por: Zhou, Ziwei, et al.
Publicado: (2026)
NaturalBench: Evaluating Vision-Language Models on Natural Adversarial Samples
por: Li, Baiqi, et al.
Publicado: (2024)
por: Li, Baiqi, et al.
Publicado: (2024)
RiskCueBench: Benchmarking Anticipatory Reasoning from Early Risk Cues in Video-Language Models
por: Luo, Sha, et al.
Publicado: (2026)
por: Luo, Sha, et al.
Publicado: (2026)
PhyBench: A Physical Commonsense Benchmark for Evaluating Text-to-Image Models
por: Meng, Fanqing, et al.
Publicado: (2024)
por: Meng, Fanqing, et al.
Publicado: (2024)
VisualSimpleQA: A Benchmark for Decoupled Evaluation of Large Vision-Language Models in Fact-Seeking Question Answering
por: Wang, Yanling, et al.
Publicado: (2025)
por: Wang, Yanling, et al.
Publicado: (2025)
EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents
por: Yang, Rui, et al.
Publicado: (2025)
por: Yang, Rui, et al.
Publicado: (2025)
Black-Box Visual Prompt Engineering for Mitigating Object Hallucination in Large Vision Language Models
por: Woo, Sangmin, et al.
Publicado: (2025)
por: Woo, Sangmin, et al.
Publicado: (2025)
Mitigating Hallucinations in Large Vision-Language Models with Internal Fact-based Contrastive Decoding
por: Wang, Chao, et al.
Publicado: (2025)
por: Wang, Chao, et al.
Publicado: (2025)
Benchmarking and Improving Large Vision-Language Models for Fundamental Visual Graph Understanding and Reasoning
por: Zhu, Yingjie, et al.
Publicado: (2024)
por: Zhu, Yingjie, et al.
Publicado: (2024)
ODE: Open-Set Evaluation of Hallucinations in Multimodal Large Language Models
por: Tu, Yahan, et al.
Publicado: (2024)
por: Tu, Yahan, et al.
Publicado: (2024)
Negative Object Presence Evaluation (NOPE) to Measure Object Hallucination in Vision-Language Models
por: Lovenia, Holy, et al.
Publicado: (2023)
por: Lovenia, Holy, et al.
Publicado: (2023)
MedHallTune: An Instruction-Tuning Benchmark for Mitigating Medical Hallucination in Vision-Language Models
por: Yan, Qiao, et al.
Publicado: (2025)
por: Yan, Qiao, et al.
Publicado: (2025)
SAP-Bench: Benchmarking Multimodal Large Language Models in Surgical Action Planning
por: Xu, Mengya, et al.
Publicado: (2025)
por: Xu, Mengya, et al.
Publicado: (2025)
DynaMath: A Dynamic Visual Benchmark for Evaluating Mathematical Reasoning Robustness of Vision Language Models
por: Zou, Chengke, et al.
Publicado: (2024)
por: Zou, Chengke, et al.
Publicado: (2024)
PM4Bench: Benchmarking Large Vision-Language Models with Parallel Multilingual Multi-Modal Multi-task Corpus
por: Gao, Junyuan, et al.
Publicado: (2025)
por: Gao, Junyuan, et al.
Publicado: (2025)
From Pixels to Tokens: Revisiting Object Hallucinations in Large Vision-Language Models
por: Shang, Yuying, et al.
Publicado: (2024)
por: Shang, Yuying, et al.
Publicado: (2024)
On Epistemic Uncertainty of Visual Tokens for Object Hallucinations in Large Vision-Language Models
por: Seo, Hoigi, et al.
Publicado: (2025)
por: Seo, Hoigi, et al.
Publicado: (2025)
Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models
por: Lee, Yi-Lun, et al.
Publicado: (2024)
por: Lee, Yi-Lun, et al.
Publicado: (2024)
Watch Closely: Mitigating Object Hallucinations in Large Vision-Language Models with Disentangled Decoding
por: Ma, Ruiqi, et al.
Publicado: (2025)
por: Ma, Ruiqi, et al.
Publicado: (2025)
Reefknot: A Comprehensive Benchmark for Relation Hallucination Evaluation, Analysis and Mitigation in Multimodal Large Language Models
por: Zheng, Kening, et al.
Publicado: (2024)
por: Zheng, Kening, et al.
Publicado: (2024)
CAVE: Detecting and Explaining Commonsense Anomalies in Visual Environments
por: Bhagwatkar, Rishika, et al.
Publicado: (2025)
por: Bhagwatkar, Rishika, et al.
Publicado: (2025)
Mitigating Hallucination in Large Vision-Language Models via Adaptive Attention Calibration
por: Fazli, Mehrdad, et al.
Publicado: (2025)
por: Fazli, Mehrdad, et al.
Publicado: (2025)
Bi-VLDoc: Bidirectional Vision-Language Modeling for Visually-Rich Document Understanding
por: Luo, Chuwei, et al.
Publicado: (2022)
por: Luo, Chuwei, et al.
Publicado: (2022)
HomeSafeBench: A Benchmark for Embodied Vision-Language Models in Free-Exploration Home Safety Inspection
por: Gao, Siyuan, et al.
Publicado: (2025)
por: Gao, Siyuan, et al.
Publicado: (2025)
Ejemplares similares
-
AP-BMM: Approximating Capability-Cost Pareto Sets of LLMs via Asynchronous Prior-Guided Bayesian Model Merging
por: Chen, Kesheng, et al.
Publicado: (2025) -
HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models
por: Guan, Tianrui, et al.
Publicado: (2023) -
MMLongCite: A Benchmark for Evaluating Fidelity of Long-Context Vision-Language Models
por: Zhou, Keyan, et al.
Publicado: (2025) -
Heron-Bench: A Benchmark for Evaluating Vision Language Models in Japanese
por: Inoue, Yuichi, et al.
Publicado: (2024) -
Mitigating Hallucinations in Large Vision-Language Models by Self-Injecting Hallucinations
por: Lu, Yifan, et al.
Publicado: (2025)