Mitigating Image Captioning Hallucinations in Vision-Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhao, Fei, Zhang, Chengcui, Zhang, Runlin, Wang, Tianyang, Li, Xi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Segmentation-Based Attention Entropy: Detecting and Mitigating Object Hallucinations in Large Vision-Language Models
di: Song, Jiale, et al.
Pubblicazione: (2026)
di: Song, Jiale, et al.
Pubblicazione: (2026)
DetailVerifyBench: A Benchmark for Dense Hallucination Localization in Long Image Captions
di: Wang, Xinran, et al.
Pubblicazione: (2026)
di: Wang, Xinran, et al.
Pubblicazione: (2026)
Mitigating Hallucination in Large Vision-Language Models via Adaptive Attention Calibration
di: Fazli, Mehrdad, et al.
Pubblicazione: (2025)
di: Fazli, Mehrdad, et al.
Pubblicazione: (2025)
Hierarchical Refinement of Universal Multimodal Attacks on Vision-Language Models
di: Zhang, Peng-Fei, et al.
Pubblicazione: (2026)
di: Zhang, Peng-Fei, et al.
Pubblicazione: (2026)
STEAR: Layer-Aware Spatiotemporal Evidence Intervention for Hallucination Mitigation in Video Large Language Models
di: Fan, Linfeng, et al.
Pubblicazione: (2026)
di: Fan, Linfeng, et al.
Pubblicazione: (2026)
Mitigating Hallucinations in Large Vision-Language Models with Instruction Contrastive Decoding
di: Wang, Xintong, et al.
Pubblicazione: (2024)
di: Wang, Xintong, et al.
Pubblicazione: (2024)
OneDiff: A Generalist Model for Image Difference Captioning
di: Hu, Erdong, et al.
Pubblicazione: (2024)
di: Hu, Erdong, et al.
Pubblicazione: (2024)
Embedded Heterogeneous Attention Transformer for Cross-lingual Image Captioning
di: Song, Zijie, et al.
Pubblicazione: (2023)
di: Song, Zijie, et al.
Pubblicazione: (2023)
Cross Modification Attention Based Deliberation Model for Image Captioning
di: Lian, Zheng, et al.
Pubblicazione: (2021)
di: Lian, Zheng, et al.
Pubblicazione: (2021)
A Preprocessing Framework for Video Machine Vision under Compression
di: Zhao, Fei, et al.
Pubblicazione: (2025)
di: Zhao, Fei, et al.
Pubblicazione: (2025)
Vocabulary Hijacking in LVLMs: Unveiling Critical Attention Heads by Excluding Inert Tokens to Mitigate Hallucination
di: Chen, Yangneng, et al.
Pubblicazione: (2026)
di: Chen, Yangneng, et al.
Pubblicazione: (2026)
Improving Multi-modal Large Language Model through Boosting Vision Capabilities
di: Sun, Yanpeng, et al.
Pubblicazione: (2024)
di: Sun, Yanpeng, et al.
Pubblicazione: (2024)
Group-based Distinctive Image Captioning with Memory Difference Encoding and Attention
di: Wang, Jiuniu, et al.
Pubblicazione: (2025)
di: Wang, Jiuniu, et al.
Pubblicazione: (2025)
Mitigating Hallucination in Multimodal Large Language Model via Hallucination-targeted Direct Preference Optimization
di: Fu, Yuhan, et al.
Pubblicazione: (2024)
di: Fu, Yuhan, et al.
Pubblicazione: (2024)
PolySmart @ TRECVid 2024 Video Captioning (VTT)
di: Wu, Jiaxin, et al.
Pubblicazione: (2024)
di: Wu, Jiaxin, et al.
Pubblicazione: (2024)
HAIC: Improving Human Action Understanding and Generation with Better Captions for Multi-modal Large Language Models
di: Wang, Xiao, et al.
Pubblicazione: (2025)
di: Wang, Xiao, et al.
Pubblicazione: (2025)
MarkMatch: Same-Hand Stuffing Detection
di: Zhao, Fei, et al.
Pubblicazione: (2025)
di: Zhao, Fei, et al.
Pubblicazione: (2025)
AeroLite: Tag-Guided Lightweight Generation of Aerial Image Captions
di: Zi, Xing, et al.
Pubblicazione: (2025)
di: Zi, Xing, et al.
Pubblicazione: (2025)
Unveiling Encoder-Free Vision-Language Models
di: Diao, Haiwen, et al.
Pubblicazione: (2024)
di: Diao, Haiwen, et al.
Pubblicazione: (2024)
Fine-grained Image Retrieval via Dual-Vision Adaptation
di: Jiang, Xin, et al.
Pubblicazione: (2025)
di: Jiang, Xin, et al.
Pubblicazione: (2025)
Cross-modal Proxy Evolving for OOD Detection with Vision-Language Models
di: Tang, Hao, et al.
Pubblicazione: (2026)
di: Tang, Hao, et al.
Pubblicazione: (2026)
DuoTeach: Dual Role Self-Teaching for Coarse-to-Fine Decision Coordination in Vision--Language Models
di: Yang, Wei, et al.
Pubblicazione: (2025)
di: Yang, Wei, et al.
Pubblicazione: (2025)
Enhancing Interactive Image Retrieval With Query Rewriting Using Large Language Models and Vision Language Models
di: Zhu, Hongyi, et al.
Pubblicazione: (2024)
di: Zhu, Hongyi, et al.
Pubblicazione: (2024)
DPC: Dual-Prompt Collaboration for Tuning Vision-Language Models
di: Li, Haoyang, et al.
Pubblicazione: (2025)
di: Li, Haoyang, et al.
Pubblicazione: (2025)
MAO: Efficient Model-Agnostic Optimization of Prompt Tuning for Vision-Language Models
di: Li, Haoyang, et al.
Pubblicazione: (2025)
di: Li, Haoyang, et al.
Pubblicazione: (2025)
See or Guess: Counterfactually Regularized Image Captioning
di: Cao, Qian, et al.
Pubblicazione: (2024)
di: Cao, Qian, et al.
Pubblicazione: (2024)
Test-Time Adaptation with CLIP Reward for Zero-Shot Generalization in Vision-Language Models
di: Zhao, Shuai, et al.
Pubblicazione: (2023)
di: Zhao, Shuai, et al.
Pubblicazione: (2023)
Spatio-Temporal Data Enhanced Vision-Language Model for Traffic Scene Understanding
di: Ma, Jingtian, et al.
Pubblicazione: (2025)
di: Ma, Jingtian, et al.
Pubblicazione: (2025)
Vision-Language Models Learn Super Images for Efficient Partially Relevant Video Retrieval
di: Nishimura, Taichi, et al.
Pubblicazione: (2023)
di: Nishimura, Taichi, et al.
Pubblicazione: (2023)
Edit As You Wish: Video Caption Editing with Multi-grained User Control
di: Yao, Linli, et al.
Pubblicazione: (2023)
di: Yao, Linli, et al.
Pubblicazione: (2023)
HeGraphAdapter: Tuning Multi-Modal Vision-Language Models with Heterogeneous Graph Adapter
di: Zhao, Yumiao, et al.
Pubblicazione: (2024)
di: Zhao, Yumiao, et al.
Pubblicazione: (2024)
Hallu-PI: Evaluating Hallucination in Multi-modal Large Language Models within Perturbed Inputs
di: Ding, Peng, et al.
Pubblicazione: (2024)
di: Ding, Peng, et al.
Pubblicazione: (2024)
Enhancing Vision-Language Tracking by Effectively Converting Textual Cues into Visual Cues
di: Feng, X., et al.
Pubblicazione: (2024)
di: Feng, X., et al.
Pubblicazione: (2024)
CLIP-PCQA: Exploring Subjective-Aligned Vision-Language Modeling for Point Cloud Quality Assessment
di: Liu, Yating, et al.
Pubblicazione: (2025)
di: Liu, Yating, et al.
Pubblicazione: (2025)
Selective Vision-Language Subspace Projection for Few-shot CLIP
di: Zhu, Xingyu, et al.
Pubblicazione: (2024)
di: Zhu, Xingyu, et al.
Pubblicazione: (2024)
PDA: Text-Augmented Defense Framework for Robust Vision-Language Models against Adversarial Image Attacks
di: Xu, Jingning, et al.
Pubblicazione: (2026)
di: Xu, Jingning, et al.
Pubblicazione: (2026)
Towards Real-World Adverse Weather Image Restoration: Enhancing Clearness and Semantics with Vision-Language Models
di: Xu, Jiaqi, et al.
Pubblicazione: (2024)
di: Xu, Jiaqi, et al.
Pubblicazione: (2024)
TextRefiner: Internal Visual Feature as Efficient Refiner for Vision-Language Models Prompt Tuning
di: Xie, Jingjing, et al.
Pubblicazione: (2024)
di: Xie, Jingjing, et al.
Pubblicazione: (2024)
Seeing is Believing: Mitigating Hallucination in Large Vision-Language Models via CLIP-Guided Decoding
di: Deng, Ailin, et al.
Pubblicazione: (2024)
di: Deng, Ailin, et al.
Pubblicazione: (2024)
Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis
di: Bucciarelli, Davide, et al.
Pubblicazione: (2024)
di: Bucciarelli, Davide, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Segmentation-Based Attention Entropy: Detecting and Mitigating Object Hallucinations in Large Vision-Language Models
di: Song, Jiale, et al.
Pubblicazione: (2026) -
DetailVerifyBench: A Benchmark for Dense Hallucination Localization in Long Image Captions
di: Wang, Xinran, et al.
Pubblicazione: (2026) -
Mitigating Hallucination in Large Vision-Language Models via Adaptive Attention Calibration
di: Fazli, Mehrdad, et al.
Pubblicazione: (2025) -
Hierarchical Refinement of Universal Multimodal Attacks on Vision-Language Models
di: Zhang, Peng-Fei, et al.
Pubblicazione: (2026) -
STEAR: Layer-Aware Spatiotemporal Evidence Intervention for Hallucination Mitigation in Video Large Language Models
di: Fan, Linfeng, et al.
Pubblicazione: (2026)