FREAK: A Fine-grained Hallucination Evaluation Benchmark for Advanced MLLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yin, Zhihan, Liang, Jianxin, Wang, Yueqian, Yao, Yifeng, Zhang, Huishuai, Zhao, Dongyan |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Understanding Multimodal Hallucination with Parameter-Free Representation Alignment
par: Wang, Yueqian, et autres
Publié: (2024)
par: Wang, Yueqian, et autres
Publié: (2024)
Beyond Isolated Facts: Synthesizing Narrative and Grounded Supervision for VideoQA
par: Liang, Jianxin, et autres
Publié: (2025)
par: Liang, Jianxin, et autres
Publié: (2025)
ReasVQA: Advancing VideoQA with Imperfect Reasoning Process
par: Liang, Jianxin, et autres
Publié: (2025)
par: Liang, Jianxin, et autres
Publié: (2025)
ProactiveVideoQA: A Comprehensive Benchmark Evaluating Proactive Interactions in Video Large Language Models
par: Wang, Yueqian, et autres
Publié: (2025)
par: Wang, Yueqian, et autres
Publié: (2025)
MMDuet2: Enhancing Proactive Interaction of Video MLLMs with Multi-Turn Reinforcement Learning
par: Wang, Yueqian, et autres
Publié: (2025)
par: Wang, Yueqian, et autres
Publié: (2025)
VideoLLM Knows When to Speak: Enhancing Time-Sensitive Video Comprehension with Video-Text Duet Interaction Format
par: Wang, Yueqian, et autres
Publié: (2024)
par: Wang, Yueqian, et autres
Publié: (2024)
VideoHallucer: Evaluating Intrinsic and Extrinsic Hallucinations in Large Video-Language Models
par: Wang, Yuxuan, et autres
Publié: (2024)
par: Wang, Yuxuan, et autres
Publié: (2024)
End-to-End Video Question Answering with Frame Scoring Mechanisms and Adaptive Sampling
par: Liang, Jianxin, et autres
Publié: (2024)
par: Liang, Jianxin, et autres
Publié: (2024)
SHALE: A Scalable Benchmark for Fine-grained Hallucination Evaluation in LVLMs
par: Yan, Bei, et autres
Publié: (2025)
par: Yan, Bei, et autres
Publié: (2025)
HawkEye: Training Video-Text LLMs for Grounding Text in Videos
par: Wang, Yueqian, et autres
Publié: (2024)
par: Wang, Yueqian, et autres
Publié: (2024)
Efficient Temporal Extrapolation of Multimodal Large Language Models with Temporal Grounding Bridge
par: Wang, Yuxuan, et autres
Publié: (2024)
par: Wang, Yuxuan, et autres
Publié: (2024)
FINER: MLLMs Hallucinate under Fine-grained Negative Queries
par: Xiao, Rui, et autres
Publié: (2026)
par: Xiao, Rui, et autres
Publié: (2026)
OmniMMI: A Comprehensive Multi-modal Interaction Benchmark in Streaming Video Contexts
par: Wang, Yuxuan, et autres
Publié: (2025)
par: Wang, Yuxuan, et autres
Publié: (2025)
AMBER: An LLM-free Multi-dimensional Benchmark for MLLMs Hallucination Evaluation
par: Wang, Junyang, et autres
Publié: (2023)
par: Wang, Junyang, et autres
Publié: (2023)
STAIR: Spatial-Temporal Reasoning with Auditable Intermediate Results for Video Question Answering
par: Wang, Yueqian, et autres
Publié: (2024)
par: Wang, Yueqian, et autres
Publié: (2024)
RLHF-V: Towards Trustworthy MLLMs via Behavior Alignment from Fine-grained Correctional Human Feedback
par: Yu, Tianyu, et autres
Publié: (2023)
par: Yu, Tianyu, et autres
Publié: (2023)
Open Eyes, Then Reason: Fine-grained Visual Mathematical Understanding in MLLMs
par: Zhang, Shan, et autres
Publié: (2025)
par: Zhang, Shan, et autres
Publié: (2025)
VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation
par: Zhang, Shi-Xue, et autres
Publié: (2025)
par: Zhang, Shi-Xue, et autres
Publié: (2025)
FaithScore: Fine-grained Evaluations of Hallucinations in Large Vision-Language Models
par: Jing, Liqiang, et autres
Publié: (2023)
par: Jing, Liqiang, et autres
Publié: (2023)
Two Causes, Not One: Rethinking Omission and Fabrication Hallucinations in MLLMs
par: Si, Guangzong, et autres
Publié: (2025)
par: Si, Guangzong, et autres
Publié: (2025)
Can Textual Reasoning Improve the Performance of MLLMs on Fine-grained Visual Classification?
par: Zhu, Jie, et autres
Publié: (2026)
par: Zhu, Jie, et autres
Publié: (2026)
LOP: Learning Optimal Pruning for Efficient On-Demand MLLMs Scaling
par: Zhang, Zhihan, et autres
Publié: (2025)
par: Zhang, Zhihan, et autres
Publié: (2025)
Tell Model Where to Look: Mitigating Hallucinations in MLLMs by Vision-Guided Attention
par: Zhao, Jianfei, et autres
Publié: (2025)
par: Zhao, Jianfei, et autres
Publié: (2025)
ChartHal: A Fine-grained Framework Evaluating Hallucination of Large Vision Language Models in Chart Understanding
par: Wang, Xingqi, et autres
Publié: (2025)
par: Wang, Xingqi, et autres
Publié: (2025)
FREAK: Frequency-modulated High-fidelity and Real-time Audio-driven Talking Portrait Synthesis
par: Ni, Ziqi, et autres
Publié: (2025)
par: Ni, Ziqi, et autres
Publié: (2025)
Interpreting and Mitigating Hallucination in MLLMs through Multi-agent Debate
par: Lin, Zheng, et autres
Publié: (2024)
par: Lin, Zheng, et autres
Publié: (2024)
VER-Bench: Evaluating MLLMs on Reasoning with Fine-Grained Visual Evidence
par: Qiang, Chenhui, et autres
Publié: (2025)
par: Qiang, Chenhui, et autres
Publié: (2025)
GOBench: Benchmarking Geometric Optics Generation and Understanding of MLLMs
par: Zhu, Xiaorong, et autres
Publié: (2025)
par: Zhu, Xiaorong, et autres
Publié: (2025)
RoadBench: Benchmarking MLLMs on Fine-Grained Spatial Understanding and Reasoning under Urban Road Scenarios
par: Zhang, Jun, et autres
Publié: (2025)
par: Zhang, Jun, et autres
Publié: (2025)
TARS: MinMax Token-Adaptive Preference Strategy for Hallucination Reduction in MLLMs
par: Zhang, Kejia, et autres
Publié: (2025)
par: Zhang, Kejia, et autres
Publié: (2025)
VisualQuest: A Benchmark for Abstract Visual Reasoning in MLLMs
par: Xiao, Kelaiti, et autres
Publié: (2025)
par: Xiao, Kelaiti, et autres
Publié: (2025)
EFUF: Efficient Fine-grained Unlearning Framework for Mitigating Hallucinations in Multimodal Large Language Models
par: Xing, Shangyu, et autres
Publié: (2024)
par: Xing, Shangyu, et autres
Publié: (2024)
FiVE: A Fine-grained Video Editing Benchmark for Evaluating Emerging Diffusion and Rectified Flow Models
par: Li, Minghan, et autres
Publié: (2025)
par: Li, Minghan, et autres
Publié: (2025)
The Mirage of Performance Gains: Why Contrastive Decoding Fails to Mitigate Object Hallucinations in MLLMs?
par: Yin, Hao, et autres
Publié: (2025)
par: Yin, Hao, et autres
Publié: (2025)
Data-free Knowledge Distillation for Fine-grained Visual Categorization
par: Shao, Renrong, et autres
Publié: (2024)
par: Shao, Renrong, et autres
Publié: (2024)
Ground What You See: Hallucination-Resistant MLLMs via Caption Feedback, Diversity-Aware Sampling, and Conflict Regularization
par: Pan, Miao, et autres
Publié: (2026)
par: Pan, Miao, et autres
Publié: (2026)
Explore the Hallucination on Low-level Perception for MLLMs
par: Sun, Yinan, et autres
Publié: (2024)
par: Sun, Yinan, et autres
Publié: (2024)
EventBench: Towards Comprehensive Benchmarking of Event-based MLLMs
par: Liu, Shaoyu, et autres
Publié: (2025)
par: Liu, Shaoyu, et autres
Publié: (2025)
InstructAttribute: Fine-grained Object Attributes editing with Instruction
par: Yin, Xingxi, et autres
Publié: (2025)
par: Yin, Xingxi, et autres
Publié: (2025)
Towards Trustworthy Dermatology MLLMs: A Benchmark and Multimodal Evaluator for Diagnostic Narratives
par: Shen, Yuhao, et autres
Publié: (2025)
par: Shen, Yuhao, et autres
Publié: (2025)
Documents similaires
-
Understanding Multimodal Hallucination with Parameter-Free Representation Alignment
par: Wang, Yueqian, et autres
Publié: (2024) -
Beyond Isolated Facts: Synthesizing Narrative and Grounded Supervision for VideoQA
par: Liang, Jianxin, et autres
Publié: (2025) -
ReasVQA: Advancing VideoQA with Imperfect Reasoning Process
par: Liang, Jianxin, et autres
Publié: (2025) -
ProactiveVideoQA: A Comprehensive Benchmark Evaluating Proactive Interactions in Video Large Language Models
par: Wang, Yueqian, et autres
Publié: (2025) -
MMDuet2: Enhancing Proactive Interaction of Video MLLMs with Multi-Turn Reinforcement Learning
par: Wang, Yueqian, et autres
Publié: (2025)