Mitigating Hallucinations in Diffusion Models through Adaptive Attention Modulation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Oorloff, Trevine, Yacoob, Yaser, Shrivastava, Abhinav |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AVFF: Audio-Visual Feature Fusion for Video Deepfake Detection
par: Oorloff, Trevine, et autres
Publié: (2024)
par: Oorloff, Trevine, et autres
Publié: (2024)
Stable Diffusion Models are Secretly Good at Visual In-Context Learning
par: Oorloff, Trevine, et autres
Publié: (2025)
par: Oorloff, Trevine, et autres
Publié: (2025)
Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning
par: Liu, Fuxiao, et autres
Publié: (2023)
par: Liu, Fuxiao, et autres
Publié: (2023)
Efficient Continuous Video Flow Model for Video Prediction
par: Shrivastava, Gaurav, et autres
Publié: (2024)
par: Shrivastava, Gaurav, et autres
Publié: (2024)
Evolutionary Caching to Accelerate Your Off-the-Shelf Diffusion Model
par: Aggarwal, Anirud, et autres
Publié: (2025)
par: Aggarwal, Anirud, et autres
Publié: (2025)
InVi: Object Insertion In Videos Using Off-the-Shelf Diffusion Models
par: Saini, Nirat, et autres
Publié: (2024)
par: Saini, Nirat, et autres
Publié: (2024)
Continuous Video Process: Modeling Videos as Continuous Multi-Dimensional Processes for Video Prediction
par: Shrivastava, Gaurav, et autres
Publié: (2024)
par: Shrivastava, Gaurav, et autres
Publié: (2024)
Mitigating Hallucination in Large Vision-Language Models via Adaptive Attention Calibration
par: Fazli, Mehrdad, et autres
Publié: (2025)
par: Fazli, Mehrdad, et autres
Publié: (2025)
Scale Space Diffusion
par: Mukhopadhyay, Soumik, et autres
Publié: (2026)
par: Mukhopadhyay, Soumik, et autres
Publié: (2026)
Mitigating Hallucination in Large Vision-Language Models through Aligning Attention Distribution to Information Flow
par: Zhao, Jianfei, et autres
Publié: (2025)
par: Zhao, Jianfei, et autres
Publié: (2025)
Accelerate High-Quality Diffusion Models with Inner Loop Feedback
par: Gwilliam, Matthew, et autres
Publié: (2025)
par: Gwilliam, Matthew, et autres
Publié: (2025)
HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models
par: Guan, Tianrui, et autres
Publié: (2023)
par: Guan, Tianrui, et autres
Publié: (2023)
SAVAA: Mitigating Hallucinations in LVLMs via Step-wise Adaptive Visual Attention Amplification
par: Zhang, Jiacheng, et autres
Publié: (2026)
par: Zhang, Jiacheng, et autres
Publié: (2026)
NeRV-Diffusion: Diffuse Implicit Neural Representations for Video Synthesis
par: Ren, Yixuan, et autres
Publié: (2025)
par: Ren, Yixuan, et autres
Publié: (2025)
Attention Hijackers: Detect and Disentangle Attention Hijacking in LVLMs for Hallucination Mitigation
par: Chen, Beitao, et autres
Publié: (2025)
par: Chen, Beitao, et autres
Publié: (2025)
Tell Model Where to Look: Mitigating Hallucinations in MLLMs by Vision-Guided Attention
par: Zhao, Jianfei, et autres
Publié: (2025)
par: Zhao, Jianfei, et autres
Publié: (2025)
VEGAS: Mitigating Hallucinations in Large Vision-Language Models via Vision-Encoder Attention Guided Adaptive Steering
par: Wang, Zihu, et autres
Publié: (2025)
par: Wang, Zihu, et autres
Publié: (2025)
Mitigating Diffusion Model Hallucinations with Dynamic Guidance
par: Triaridis, Kostas, et autres
Publié: (2025)
par: Triaridis, Kostas, et autres
Publié: (2025)
Mitigating Object Hallucination via Concentric Causal Attention
par: Xing, Yun, et autres
Publié: (2024)
par: Xing, Yun, et autres
Publié: (2024)
V-VIPE: Variational View Invariant Pose Embedding
par: Levy, Mara, et autres
Publié: (2024)
par: Levy, Mara, et autres
Publié: (2024)
Video Decomposition Prior: A Methodology to Decompose Videos into Layers
par: Shrivastava, Gaurav, et autres
Publié: (2024)
par: Shrivastava, Gaurav, et autres
Publié: (2024)
TeCoNeRV: Leveraging Temporal Coherence for Compressible Neural Representations for Videos
par: Padmanabhan, Namitha, et autres
Publié: (2026)
par: Padmanabhan, Namitha, et autres
Publié: (2026)
Instruction-Aligned Visual Attention for Mitigating Hallucinations in Large Vision-Language Models
par: Li, Bin, et autres
Publié: (2025)
par: Li, Bin, et autres
Publié: (2025)
Tracing and Mitigating Hallucinations in Multimodal LLMs via Dynamic Attention Localization
par: Yang, Tiancheng, et autres
Publié: (2025)
par: Yang, Tiancheng, et autres
Publié: (2025)
MDSAM:Memory-Driven Sparse Attention Matrix for LVLMs Hallucination Mitigation
par: Lu, Shuaiye, et autres
Publié: (2025)
par: Lu, Shuaiye, et autres
Publié: (2025)
Attention Reallocation: Towards Zero-cost and Controllable Hallucination Mitigation of MLLMs
par: Tu, Chongjun, et autres
Publié: (2025)
par: Tu, Chongjun, et autres
Publié: (2025)
Mitigating Hallucination in Vision-Language Models through Barrier-Regulated Adaptive Closed-form Steering
par: Jana, Soumyadeep, et autres
Publié: (2026)
par: Jana, Soumyadeep, et autres
Publié: (2026)
Self-Correction Inside the Model: Leveraging Layer Attention to Mitigate Hallucinations in Large Vision Language Models
par: Fu, April
Publié: (2026)
par: Fu, April
Publié: (2026)
CAI: Caption-Sensitive Attention Intervention for Mitigating Object Hallucination in Large Vision-Language Models
par: Li, Qiming, et autres
Publié: (2025)
par: Li, Qiming, et autres
Publié: (2025)
Mixture of Decoding: An Attention-Inspired Adaptive Decoding Strategy to Mitigate Hallucinations in Large Vision-Language Models
par: Chen, Xinlong, et autres
Publié: (2025)
par: Chen, Xinlong, et autres
Publié: (2025)
Beyond Single Models: Mitigating Multimodal Hallucinations via Adaptive Token Ensemble Decoding
par: Li, Jinlin, et autres
Publié: (2025)
par: Li, Jinlin, et autres
Publié: (2025)
Look Carefully: Adaptive Visual Reinforcements in Multimodal Large Language Models for Hallucination Mitigation
par: Zhu, Xingyu, et autres
Publié: (2026)
par: Zhu, Xingyu, et autres
Publié: (2026)
PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model
par: Arif, Kazi Hasan Ibn, et autres
Publié: (2025)
par: Arif, Kazi Hasan Ibn, et autres
Publié: (2025)
Interpreting and Mitigating Hallucination in MLLMs through Multi-agent Debate
par: Lin, Zheng, et autres
Publié: (2024)
par: Lin, Zheng, et autres
Publié: (2024)
Characterizing Motion Encoding in Video Diffusion Timesteps
par: Baherwani, Vatsal, et autres
Publié: (2025)
par: Baherwani, Vatsal, et autres
Publié: (2025)
Mitigating Object Hallucinations in Vision-Language Models through Region-Aware Attention Recalibration
par: Xu, Yuanzhi, et autres
Publié: (2026)
par: Xu, Yuanzhi, et autres
Publié: (2026)
Mitigating Modality Prior-Induced Hallucinations in Multimodal Large Language Models via Deciphering Attention Causality
par: Zhou, Guanyu, et autres
Publié: (2024)
par: Zhou, Guanyu, et autres
Publié: (2024)
Cross-Modal Attention Calibration for LVLM Hallucination Mitigation
par: Li, Jiaming, et autres
Publié: (2025)
par: Li, Jiaming, et autres
Publié: (2025)
AVCD: Mitigating Hallucinations in Audio-Visual Large Language Models through Contrastive Decoding
par: Jung, Chaeyoung, et autres
Publié: (2025)
par: Jung, Chaeyoung, et autres
Publié: (2025)
EAGLES: Efficient Accelerated 3D Gaussians with Lightweight EncodingS
par: Girish, Sharath, et autres
Publié: (2023)
par: Girish, Sharath, et autres
Publié: (2023)
Documents similaires
-
AVFF: Audio-Visual Feature Fusion for Video Deepfake Detection
par: Oorloff, Trevine, et autres
Publié: (2024) -
Stable Diffusion Models are Secretly Good at Visual In-Context Learning
par: Oorloff, Trevine, et autres
Publié: (2025) -
Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning
par: Liu, Fuxiao, et autres
Publié: (2023) -
Efficient Continuous Video Flow Model for Video Prediction
par: Shrivastava, Gaurav, et autres
Publié: (2024) -
Evolutionary Caching to Accelerate Your Off-the-Shelf Diffusion Model
par: Aggarwal, Anirud, et autres
Publié: (2025)