When Sinks Help or Hurt: Unified Framework for Attention Sink in Large Vision-Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Choi, Jiho, Kim, Jaemin, Kim, Sanghwan, Hong, Seunghoon, Park, Jin-Hwi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SinkTrack: Attention Sink based Context Anchoring for Large Language Models
di: Liu, Xu, et al.
Pubblicazione: (2026)
di: Liu, Xu, et al.
Pubblicazione: (2026)
To Sink or Not to Sink: Visual Information Pathways in Large Vision-Language Models
di: Luo, Jiayun, et al.
Pubblicazione: (2025)
di: Luo, Jiayun, et al.
Pubblicazione: (2025)
See What You Are Told: Visual Attention Sink in Large Multimodal Models
di: Kang, Seil, et al.
Pubblicazione: (2025)
di: Kang, Seil, et al.
Pubblicazione: (2025)
Artifacts and Attention Sinks: Structured Approximations for Efficient Vision Transformers
di: Lu, Andrew, et al.
Pubblicazione: (2025)
di: Lu, Andrew, et al.
Pubblicazione: (2025)
Attention Sinks in Diffusion Transformers: A Causal Analysis
di: Wu, Fangzheng, et al.
Pubblicazione: (2026)
di: Wu, Fangzheng, et al.
Pubblicazione: (2026)
AdaRank: Adaptive Rank Pruning for Enhanced Model Merging
di: Lee, Chanhyuk, et al.
Pubblicazione: (2025)
di: Lee, Chanhyuk, et al.
Pubblicazione: (2025)
On the Nature of Attention Sink that Shapes Decoding Strategy in Omni-LLMs
di: Yoo, Suho, et al.
Pubblicazione: (2026)
di: Yoo, Suho, et al.
Pubblicazione: (2026)
DySink: Dynamic Frame Sinks for Autoregressive Long Video Generation
di: Ye, Bo, et al.
Pubblicazione: (2026)
di: Ye, Bo, et al.
Pubblicazione: (2026)
EDIT: Enhancing Vision Transformers by Mitigating Attention Sink through an Encoder-Decoder Architecture
di: Feng, Wenfeng, et al.
Pubblicazione: (2025)
di: Feng, Wenfeng, et al.
Pubblicazione: (2025)
Mirage in the Eyes: Hallucination Attack on Multi-modal Large Language Models with Only Attention Sink
di: Wang, Yining, et al.
Pubblicazione: (2025)
di: Wang, Yining, et al.
Pubblicazione: (2025)
CAMEO: Correspondence-Attention Alignment for Multi-View Diffusion Models
di: Kwon, Minkyung, et al.
Pubblicazione: (2025)
di: Kwon, Minkyung, et al.
Pubblicazione: (2025)
Don't Miss the Forest for the Trees: Attentional Vision Calibration for Large Vision Language Models
di: Woo, Sangmin, et al.
Pubblicazione: (2024)
di: Woo, Sangmin, et al.
Pubblicazione: (2024)
3D-Aware Vision-Language Models Fine-Tuning with Geometric Distillation
di: Lee, Seonho, et al.
Pubblicazione: (2025)
di: Lee, Seonho, et al.
Pubblicazione: (2025)
Geometry without Position? When Positional Embeddings Help and Hurt Spatial Reasoning
di: Shi, Jian, et al.
Pubblicazione: (2026)
di: Shi, Jian, et al.
Pubblicazione: (2026)
Addressing Exacerbated Attention Sink for Source-Free Cross-Domain Few-Shot Learning
di: Yi, Shuai, et al.
Pubblicazione: (2026)
di: Yi, Shuai, et al.
Pubblicazione: (2026)
Deep Forcing: Training-Free Long Video Generation with Deep Sink and Participative Compression
di: Yi, Jung, et al.
Pubblicazione: (2025)
di: Yi, Jung, et al.
Pubblicazione: (2025)
Distilling ODE Solvers of Diffusion Models into Smaller Steps
di: Kim, Sanghwan, et al.
Pubblicazione: (2023)
di: Kim, Sanghwan, et al.
Pubblicazione: (2023)
SAGE: Sink-Aware Grounded Decoding for Multimodal Hallucination Mitigation
di: Shukla, Tripti, et al.
Pubblicazione: (2026)
di: Shukla, Tripti, et al.
Pubblicazione: (2026)
Bridging the gap to real-world language-grounded visual concept learning
di: Jung, Whie, et al.
Pubblicazione: (2025)
di: Jung, Whie, et al.
Pubblicazione: (2025)
StableSketcher: Enhancing Diffusion Model for Pixel-based Sketch Generation via Visual Question Answering Feedback
di: Park, Jiho, et al.
Pubblicazione: (2025)
di: Park, Jiho, et al.
Pubblicazione: (2025)
Intriguing Properties of Large Language and Vision Models
di: Lee, Young-Jun, et al.
Pubblicazione: (2024)
di: Lee, Young-Jun, et al.
Pubblicazione: (2024)
SceneNAT: Masked Generative Modeling for Language-Guided Indoor Scene Synthesis
di: Choi, Jeongjun, et al.
Pubblicazione: (2026)
di: Choi, Jeongjun, et al.
Pubblicazione: (2026)
Mitigating Attention Sinks and Massive Activations in Audio-Visual Speech Recognition with LLMs
di: Anand, et al.
Pubblicazione: (2025)
di: Anand, et al.
Pubblicazione: (2025)
SEA: Evaluating Sketch Abstraction Efficiency via Element-level Commonsense Visual Question Answering
di: Park, Jiho, et al.
Pubblicazione: (2026)
di: Park, Jiho, et al.
Pubblicazione: (2026)
SplatFlow: Multi-View Rectified Flow Model for 3D Gaussian Splatting Synthesis
di: Go, Hyojun, et al.
Pubblicazione: (2024)
di: Go, Hyojun, et al.
Pubblicazione: (2024)
Reasoning Can Hurt the Inductive Abilities of Large Language Models
di: Jin, Haibo, et al.
Pubblicazione: (2025)
di: Jin, Haibo, et al.
Pubblicazione: (2025)
Interpreting Attention Heads for Image-to-Text Information Flow in Large Vision-Language Models
di: Kim, Jinyeong, et al.
Pubblicazione: (2025)
di: Kim, Jinyeong, et al.
Pubblicazione: (2025)
What Helps---and What Hurts: Bidirectional Explanations for Vision Transformers
di: Su, Qin, et al.
Pubblicazione: (2026)
di: Su, Qin, et al.
Pubblicazione: (2026)
HalLoc: Token-level Localization of Hallucinations for Vision Language Models
di: Park, Eunkyu, et al.
Pubblicazione: (2025)
di: Park, Eunkyu, et al.
Pubblicazione: (2025)
ActionSink: Toward Precise Robot Manipulation with Dynamic Integration of Action Flow
di: Guo, Shanshan, et al.
Pubblicazione: (2025)
di: Guo, Shanshan, et al.
Pubblicazione: (2025)
Dual Prototype Attention for Unsupervised Video Object Segmentation
di: Cho, Suhwan, et al.
Pubblicazione: (2022)
di: Cho, Suhwan, et al.
Pubblicazione: (2022)
Index-Preserving Lightweight Token Pruning for Efficient Document Understanding in Vision-Language Models
di: Son, Jaemin, et al.
Pubblicazione: (2025)
di: Son, Jaemin, et al.
Pubblicazione: (2025)
World in a Frame: Understanding Culture Mixing as a New Challenge for Vision-Language Models
di: Kim, Eunsu, et al.
Pubblicazione: (2025)
di: Kim, Eunsu, et al.
Pubblicazione: (2025)
Phantom of Latent for Large Language and Vision Models
di: Lee, Byung-Kwan, et al.
Pubblicazione: (2024)
di: Lee, Byung-Kwan, et al.
Pubblicazione: (2024)
PALM: Predicting Actions through Language Models
di: Kim, Sanghwan, et al.
Pubblicazione: (2023)
di: Kim, Sanghwan, et al.
Pubblicazione: (2023)
Chameleon: A Data-Efficient Generalist for Dense Visual Prediction in the Wild
di: Kim, Donggyun, et al.
Pubblicazione: (2024)
di: Kim, Donggyun, et al.
Pubblicazione: (2024)
Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling
di: Park, Sungjune, et al.
Pubblicazione: (2025)
di: Park, Sungjune, et al.
Pubblicazione: (2025)
HyperFlow: Gradient-Free Emulation of Few-Shot Fine-Tuning
di: Kim, Donggyun, et al.
Pubblicazione: (2025)
di: Kim, Donggyun, et al.
Pubblicazione: (2025)
Representation Shift: Unifying Token Compression with FlashAttention
di: Choi, Joonmyung, et al.
Pubblicazione: (2025)
di: Choi, Joonmyung, et al.
Pubblicazione: (2025)
SurgMLLMBench: A Multimodal Large Language Model Benchmark Dataset for Surgical Scene Understanding
di: Choi, Tae-Min, et al.
Pubblicazione: (2025)
di: Choi, Tae-Min, et al.
Pubblicazione: (2025)
Documenti analoghi
-
SinkTrack: Attention Sink based Context Anchoring for Large Language Models
di: Liu, Xu, et al.
Pubblicazione: (2026) -
To Sink or Not to Sink: Visual Information Pathways in Large Vision-Language Models
di: Luo, Jiayun, et al.
Pubblicazione: (2025) -
See What You Are Told: Visual Attention Sink in Large Multimodal Models
di: Kang, Seil, et al.
Pubblicazione: (2025) -
Artifacts and Attention Sinks: Structured Approximations for Efficient Vision Transformers
di: Lu, Andrew, et al.
Pubblicazione: (2025) -
Attention Sinks in Diffusion Transformers: A Causal Analysis
di: Wu, Fangzheng, et al.
Pubblicazione: (2026)