Measuring the Measurers: Quality Evaluation of Hallucination Benchmarks for Large Vision-Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yan, Bei, Zhang, Jie, Yuan, Zheng, Shan, Shiguang, Chen, Xilin |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MM-MoralBench: A MultiModal Moral Evaluation Benchmark for Large Vision-Language Models
par: Yan, Bei, et autres
Publié: (2024)
par: Yan, Bei, et autres
Publié: (2024)
VLBiasBench: A Comprehensive Benchmark for Evaluating Bias in Large Vision-Language Model
par: Wang, Sibo, et autres
Publié: (2024)
par: Wang, Sibo, et autres
Publié: (2024)
INFACT: A Diagnostic Benchmark for Induced Faithfulness and Factuality Hallucinations in Video-LLMs
par: Yang, Junqi, et autres
Publié: (2026)
par: Yang, Junqi, et autres
Publié: (2026)
VOPE: Revisiting Hallucination of Vision-Language Models in Voluntary Imagination Task
par: Long, Xingming, et autres
Publié: (2025)
par: Long, Xingming, et autres
Publié: (2025)
Trigger without Trace: Towards Stealthy Backdoor Attack on Text-to-Image Diffusion Models
par: Zhang, Jie, et autres
Publié: (2025)
par: Zhang, Jie, et autres
Publié: (2025)
REVAL: A Comprehension Evaluation on Reliability and Values of Large Vision-Language Models
par: Zhang, Jie, et autres
Publié: (2025)
par: Zhang, Jie, et autres
Publié: (2025)
ACT Now: Preempting LVLM Hallucinations via Adaptive Context Integration
par: Yan, Bei, et autres
Publié: (2026)
par: Yan, Bei, et autres
Publié: (2026)
Dysca: A Dynamic and Scalable Benchmark for Evaluating Perception Ability of LVLMs
par: Zhang, Jie, et autres
Publié: (2024)
par: Zhang, Jie, et autres
Publié: (2024)
FullLoRA: Efficiently Boosting the Robustness of Pretrained Vision Transformers
par: Yuan, Zheng, et autres
Publié: (2024)
par: Yuan, Zheng, et autres
Publié: (2024)
Dual Attention Guided Defense Against Malicious Edits
par: Zhang, Jie, et autres
Publié: (2025)
par: Zhang, Jie, et autres
Publié: (2025)
Towards Transferable Defense Against Malicious Image Edits
par: Zhang, Jie, et autres
Publié: (2025)
par: Zhang, Jie, et autres
Publié: (2025)
Assimilation Matters: Model-level Backdoor Detection in Vision-Language Pretrained Models
par: Wang, Zhongqi, et autres
Publié: (2025)
par: Wang, Zhongqi, et autres
Publié: (2025)
Do Vision-Language Models Measure Up? Benchmarking Visual Measurement Reading with MeasureBench
par: Lin, Fenfen, et autres
Publié: (2025)
par: Lin, Fenfen, et autres
Publié: (2025)
SHALE: A Scalable Benchmark for Fine-grained Hallucination Evaluation in LVLMs
par: Yan, Bei, et autres
Publié: (2025)
par: Yan, Bei, et autres
Publié: (2025)
Benchmarking Deflection and Hallucination in Large Vision-Language Models
par: Moratelli, Nicholas, et autres
Publié: (2026)
par: Moratelli, Nicholas, et autres
Publié: (2026)
UniPose: A Unified Multimodal Framework for Human Pose Comprehension, Generation and Editing
par: Li, Yiheng, et autres
Publié: (2024)
par: Li, Yiheng, et autres
Publié: (2024)
Dynamic Multimodal Activation Steering for Hallucination Mitigation in Large Vision-Language Models
par: Yin, Jianghao, et autres
Publié: (2026)
par: Yin, Jianghao, et autres
Publié: (2026)
Semantic Mismatch and Perceptual Degradation: A New Perspective on Image Editing Immunity
par: Dong, Shuai, et autres
Publié: (2025)
par: Dong, Shuai, et autres
Publié: (2025)
Towards a Systematic Evaluation of Hallucinations in Large-Vision Language Models
par: Seth, Ashish, et autres
Publié: (2024)
par: Seth, Ashish, et autres
Publié: (2024)
Jodi: Unification of Visual Generation and Understanding via Joint Modeling
par: Xu, Yifeng, et autres
Publié: (2025)
par: Xu, Yifeng, et autres
Publié: (2025)
MedHEval: Benchmarking Hallucinations and Mitigation Strategies in Medical Large Vision-Language Models
par: Chang, Aofei, et autres
Publié: (2025)
par: Chang, Aofei, et autres
Publié: (2025)
Unified Triplet-Level Hallucination Evaluation for Large Vision-Language Models
par: Wu, Junjie, et autres
Publié: (2024)
par: Wu, Junjie, et autres
Publié: (2024)
Self-Introspective Decoding: Alleviating Hallucinations for Large Vision-Language Models
par: Huo, Fushuo, et autres
Publié: (2024)
par: Huo, Fushuo, et autres
Publié: (2024)
MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models
par: Yang, Garry, et autres
Publié: (2025)
par: Yang, Garry, et autres
Publié: (2025)
MedVH: Towards Systematic Evaluation of Hallucination for Large Vision Language Models in the Medical Context
par: Gu, Zishan, et autres
Publié: (2024)
par: Gu, Zishan, et autres
Publié: (2024)
Mitigating Entangled Steering in Large Vision-Language Models for Hallucination Reduction
par: Zhang, Yuanhong, et autres
Publié: (2026)
par: Zhang, Yuanhong, et autres
Publié: (2026)
A Survey of Multimodal Hallucination Evaluation and Detection
par: Chen, Zhiyuan, et autres
Publié: (2025)
par: Chen, Zhiyuan, et autres
Publié: (2025)
DO-Bench: An Attributable Benchmark for Diagnosing Object Hallucination in Vision-Language Models
par: Wang, JiYang, et autres
Publié: (2026)
par: Wang, JiYang, et autres
Publié: (2026)
Review of Hallucination Understanding in Large Language and Vision Models
par: Ho, Zhengyi, et autres
Publié: (2025)
par: Ho, Zhengyi, et autres
Publié: (2025)
Prefill-Time Intervention for Mitigating Hallucination in Large Vision-Language Models
par: Zhang, Chengsheng, et autres
Publié: (2026)
par: Zhang, Chengsheng, et autres
Publié: (2026)
EchoBench: Benchmarking Sycophancy in Medical Large Vision-Language Models
par: Yuan, Botai, et autres
Publié: (2025)
par: Yuan, Botai, et autres
Publié: (2025)
When Text Hijacks Vision: Benchmarking and Mitigating Text Overlay-Induced Hallucination in Vision Language Models
par: Yakun, Cui, et autres
Publié: (2026)
par: Yakun, Cui, et autres
Publié: (2026)
Benchmarking Large Vision-Language Models on CFMME: A Comprehensive Chinese Financial Multimodal Evaluation Dataset
par: Chen, Qian, et autres
Publié: (2026)
par: Chen, Qian, et autres
Publié: (2026)
MedHallTune: An Instruction-Tuning Benchmark for Mitigating Medical Hallucination in Vision-Language Models
par: Yan, Qiao, et autres
Publié: (2025)
par: Yan, Qiao, et autres
Publié: (2025)
INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling
par: Dong, Xin, et autres
Publié: (2025)
par: Dong, Xin, et autres
Publié: (2025)
CDH-Bench: A Commonsense-Driven Hallucination Benchmark for Evaluating Visual Fidelity in Vision-Language Models
par: Chen, Kesheng, et autres
Publié: (2026)
par: Chen, Kesheng, et autres
Publié: (2026)
Revealing Multi-View Hallucination in Large Vision-Language Models
par: Park, Wooje, et autres
Publié: (2026)
par: Park, Wooje, et autres
Publié: (2026)
DHCP: Detecting Hallucinations by Cross-modal Attention Pattern in Large Vision-Language Models
par: Zhang, Yudong, et autres
Publié: (2024)
par: Zhang, Yudong, et autres
Publié: (2024)
Learning Separable Hidden Unit Contributions for Speaker-Adaptive Lip-Reading
par: Luo, Songtao, et autres
Publié: (2023)
par: Luo, Songtao, et autres
Publié: (2023)
Rethinking the Evaluation of Out-of-Distribution Detection: A Sorites Paradox
par: Long, Xingming, et autres
Publié: (2024)
par: Long, Xingming, et autres
Publié: (2024)
Documents similaires
-
MM-MoralBench: A MultiModal Moral Evaluation Benchmark for Large Vision-Language Models
par: Yan, Bei, et autres
Publié: (2024) -
VLBiasBench: A Comprehensive Benchmark for Evaluating Bias in Large Vision-Language Model
par: Wang, Sibo, et autres
Publié: (2024) -
INFACT: A Diagnostic Benchmark for Induced Faithfulness and Factuality Hallucinations in Video-LLMs
par: Yang, Junqi, et autres
Publié: (2026) -
VOPE: Revisiting Hallucination of Vision-Language Models in Voluntary Imagination Task
par: Long, Xingming, et autres
Publié: (2025) -
Trigger without Trace: Towards Stealthy Backdoor Attack on Text-to-Image Diffusion Models
par: Zhang, Jie, et autres
Publié: (2025)