Dual-Pathway Circuits of Object Hallucination in Vision-Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Jiaxin, Zhong, Ding, Wang, Yue, Yang, Zhidong, Kang, Zhaolu, Dong, Guangyuan, Zhan, Qishi, Fang, Pengcheng, Liu, Aofan |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ReasonAct: Progressive Training for Fine-Grained Video Reasoning in Small Models
par: Liu, Jiaxin, et autres
Publié: (2025)
par: Liu, Jiaxin, et autres
Publié: (2025)
Beyond Language: Grounding Referring Expressions with Hand Pointing in Egocentric Vision
par: Li, Ling, et autres
Publié: (2026)
par: Li, Ling, et autres
Publié: (2026)
From Pixels to Tokens: Revisiting Object Hallucinations in Large Vision-Language Models
par: Shang, Yuying, et autres
Publié: (2024)
par: Shang, Yuying, et autres
Publié: (2024)
Segmentation-Based Attention Entropy: Detecting and Mitigating Object Hallucinations in Large Vision-Language Models
par: Song, Jiale, et autres
Publié: (2026)
par: Song, Jiale, et autres
Publié: (2026)
Object Hallucination-Free Reinforcement Unlearning for Vision-Language Models
par: Jia, Kaidi, et autres
Publié: (2026)
par: Jia, Kaidi, et autres
Publié: (2026)
Object-Centric Vision Token Pruning for Vision Language Models
par: Li, Guangyuan, et autres
Publié: (2025)
par: Li, Guangyuan, et autres
Publié: (2025)
On Epistemic Uncertainty of Visual Tokens for Object Hallucinations in Large Vision-Language Models
par: Seo, Hoigi, et autres
Publié: (2025)
par: Seo, Hoigi, et autres
Publié: (2025)
CAI: Caption-Sensitive Attention Intervention for Mitigating Object Hallucination in Large Vision-Language Models
par: Li, Qiming, et autres
Publié: (2025)
par: Li, Qiming, et autres
Publié: (2025)
Investigating and Mitigating Object Hallucinations in Pretrained Vision-Language (CLIP) Models
par: Liu, Yufang, et autres
Publié: (2024)
par: Liu, Yufang, et autres
Publié: (2024)
Multi-Object Hallucination in Vision-Language Models
par: Chen, Xuweiyi, et autres
Publié: (2024)
par: Chen, Xuweiyi, et autres
Publié: (2024)
Causal Tracing of Object Representations in Large Vision Language Models: Mechanistic Interpretability and Hallucination Mitigation
par: Li, Qiming, et autres
Publié: (2025)
par: Li, Qiming, et autres
Publié: (2025)
Mitigating Object Hallucinations in Large Vision-Language Models via Attention Calibration
par: Zhu, Younan, et autres
Publié: (2025)
par: Zhu, Younan, et autres
Publié: (2025)
Logical Closed Loop: Uncovering Object Hallucinations in Large Vision-Language Models
par: Wu, Junfei, et autres
Publié: (2024)
par: Wu, Junfei, et autres
Publié: (2024)
Black-Box Visual Prompt Engineering for Mitigating Object Hallucination in Large Vision Language Models
par: Woo, Sangmin, et autres
Publié: (2025)
par: Woo, Sangmin, et autres
Publié: (2025)
RCP: Representation Consistency Pruner for Mitigating Distribution Shift in Large Vision-Language Models
par: Zhang, Jianwei, et autres
Publié: (2026)
par: Zhang, Jianwei, et autres
Publié: (2026)
CAST: Mitigating Object Hallucination in Large Vision-Language Models via Caption-Guided Visual Attention Steering
par: Li, Qiming, et autres
Publié: (2026)
par: Li, Qiming, et autres
Publié: (2026)
Mitigating Object Hallucinations in Vision-Language Models through Region-Aware Attention Recalibration
par: Xu, Yuanzhi, et autres
Publié: (2026)
par: Xu, Yuanzhi, et autres
Publié: (2026)
Language-Guided Token Compression with Reinforcement Learning in Large Vision-Language Models
par: Cao, Sihan, et autres
Publié: (2026)
par: Cao, Sihan, et autres
Publié: (2026)
When Vision Overrides Language: Evaluating and Mitigating Counterfactual Failures in VLAs
par: Fang, Yu, et autres
Publié: (2026)
par: Fang, Yu, et autres
Publié: (2026)
Generate, but Verify: Reducing Hallucination in Vision-Language Models with Retrospective Resampling
par: Wu, Tsung-Han, et autres
Publié: (2025)
par: Wu, Tsung-Han, et autres
Publié: (2025)
Watch Closely: Mitigating Object Hallucinations in Large Vision-Language Models with Disentangled Decoding
par: Ma, Ruiqi, et autres
Publié: (2025)
par: Ma, Ruiqi, et autres
Publié: (2025)
Nullu: Mitigating Object Hallucinations in Large Vision-Language Models via HalluSpace Projection
par: Yang, Le, et autres
Publié: (2024)
par: Yang, Le, et autres
Publié: (2024)
DO-Bench: An Attributable Benchmark for Diagnosing Object Hallucination in Vision-Language Models
par: Wang, JiYang, et autres
Publié: (2026)
par: Wang, JiYang, et autres
Publié: (2026)
Penny Wise, Pixel Foolish: Bypassing Price Constraints in Multimodal Agents via Visual Adversarial Perturbations
par: Qian, Jiachen, et autres
Publié: (2026)
par: Qian, Jiachen, et autres
Publié: (2026)
Vision-Language Introspection: Mitigating Overconfident Hallucinations in MLLMs via Interpretable Bi-Causal Steering
par: Liu, Shuliang, et autres
Publié: (2026)
par: Liu, Shuliang, et autres
Publié: (2026)
Mitigating Hallucinations in Large Vision-Language Models without Performance Degradation
par: Zhu, Xingyu, et autres
Publié: (2026)
par: Zhu, Xingyu, et autres
Publié: (2026)
Negative Object Presence Evaluation (NOPE) to Measure Object Hallucination in Vision-Language Models
par: Lovenia, Holy, et autres
Publié: (2023)
par: Lovenia, Holy, et autres
Publié: (2023)
Detecting and Evaluating Medical Hallucinations in Large Vision Language Models
par: Chen, Jiawei, et autres
Publié: (2024)
par: Chen, Jiawei, et autres
Publié: (2024)
MambaSOD: Dual Mamba-Driven Cross-Modal Fusion Network for RGB-D Salient Object Detection
par: Zhan, Yue, et autres
Publié: (2024)
par: Zhan, Yue, et autres
Publié: (2024)
DOPE: Dual Object Perception-Enhancement Network for Vision-and-Language Navigation
par: Yu, Yinfeng, et autres
Publié: (2025)
par: Yu, Yinfeng, et autres
Publié: (2025)
A Unified Hallucination Mitigation Framework for Large Vision-Language Models
par: Chang, Yue, et autres
Publié: (2024)
par: Chang, Yue, et autres
Publié: (2024)
Relaxing Anchor-Frame Dominance for Mitigating Hallucinations in Video Large Language Models
par: Liu, Zijian, et autres
Publié: (2026)
par: Liu, Zijian, et autres
Publié: (2026)
VORD: Visual Ordinal Calibration for Mitigating Object Hallucinations in Large Vision-Language Models
par: Neo, Dexter, et autres
Publié: (2024)
par: Neo, Dexter, et autres
Publié: (2024)
HTDC: Hesitation-Triggered Differential Calibration for Mitigating Hallucination in Large Vision-Language Models
par: Liu, Xinyun
Publié: (2026)
par: Liu, Xinyun
Publié: (2026)
Analyzing and Mitigating Object Hallucination in Large Vision-Language Models
par: Zhou, Yiyang, et autres
Publié: (2023)
par: Zhou, Yiyang, et autres
Publié: (2023)
Towards Vision-Language Geo-Foundation Model: A Survey
par: Zhou, Yue, et autres
Publié: (2024)
par: Zhou, Yue, et autres
Publié: (2024)
Energy-Guided Decoding for Object Hallucination Mitigation
par: Liu, Xixi, et autres
Publié: (2025)
par: Liu, Xixi, et autres
Publié: (2025)
One Token, Two Fates: A Unified Framework via Vision Token Manipulation Against MLLMs Hallucination
par: Fa, Zhan, et autres
Publié: (2026)
par: Fa, Zhan, et autres
Publié: (2026)
Does Object Grounding Really Reduce Hallucination of Large Vision-Language Models?
par: Geigle, Gregor, et autres
Publié: (2024)
par: Geigle, Gregor, et autres
Publié: (2024)
A Comprehensive Analysis for Visual Object Hallucination in Large Vision-Language Models
par: Jing, Liqiang, et autres
Publié: (2025)
par: Jing, Liqiang, et autres
Publié: (2025)
Documents similaires
-
ReasonAct: Progressive Training for Fine-Grained Video Reasoning in Small Models
par: Liu, Jiaxin, et autres
Publié: (2025) -
Beyond Language: Grounding Referring Expressions with Hand Pointing in Egocentric Vision
par: Li, Ling, et autres
Publié: (2026) -
From Pixels to Tokens: Revisiting Object Hallucinations in Large Vision-Language Models
par: Shang, Yuying, et autres
Publié: (2024) -
Segmentation-Based Attention Entropy: Detecting and Mitigating Object Hallucinations in Large Vision-Language Models
par: Song, Jiale, et autres
Publié: (2026) -
Object Hallucination-Free Reinforcement Unlearning for Vision-Language Models
par: Jia, Kaidi, et autres
Publié: (2026)