EDIT: Enhancing Vision Transformers by Mitigating Attention Sink through an Encoder-Decoder Architecture
Fuente:
arXiv
Guardado en:
| Autores principales: | Feng, Wenfeng, Wang, Hongxiang, Wang, Jianlong, Zhang, Xin, Zhao, Jingjing, Liang, Yueyue, Chen, Xiang, Han, Duokui |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Artifacts and Attention Sinks: Structured Approximations for Efficient Vision Transformers
por: Lu, Andrew, et al.
Publicado: (2025)
por: Lu, Andrew, et al.
Publicado: (2025)
Mitigating Hallucination in Large Vision-Language Models through Aligning Attention Distribution to Information Flow
por: Zhao, Jianfei, et al.
Publicado: (2025)
por: Zhao, Jianfei, et al.
Publicado: (2025)
SAGE: Sink-Aware Grounded Decoding for Multimodal Hallucination Mitigation
por: Shukla, Tripti, et al.
Publicado: (2026)
por: Shukla, Tripti, et al.
Publicado: (2026)
On the Nature of Attention Sink that Shapes Decoding Strategy in Omni-LLMs
por: Yoo, Suho, et al.
Publicado: (2026)
por: Yoo, Suho, et al.
Publicado: (2026)
Tell Model Where to Look: Mitigating Hallucinations in MLLMs by Vision-Guided Attention
por: Zhao, Jianfei, et al.
Publicado: (2025)
por: Zhao, Jianfei, et al.
Publicado: (2025)
VEGAS: Mitigating Hallucinations in Large Vision-Language Models via Vision-Encoder Attention Guided Adaptive Steering
por: Wang, Zihu, et al.
Publicado: (2025)
por: Wang, Zihu, et al.
Publicado: (2025)
Enhancing Temporal Understanding in Video-LLMs through Stacked Temporal Attention in Vision Encoders
por: Rasekh, Ali, et al.
Publicado: (2025)
por: Rasekh, Ali, et al.
Publicado: (2025)
Enhanced Encoder-Decoder Architecture for Accurate Monocular Depth Estimation
por: Das, Dabbrata, et al.
Publicado: (2024)
por: Das, Dabbrata, et al.
Publicado: (2024)
SinkTrack: Attention Sink based Context Anchoring for Large Language Models
por: Liu, Xu, et al.
Publicado: (2026)
por: Liu, Xu, et al.
Publicado: (2026)
When Sinks Help or Hurt: Unified Framework for Attention Sink in Large Vision-Language Models
por: Choi, Jiho, et al.
Publicado: (2026)
por: Choi, Jiho, et al.
Publicado: (2026)
An Enhanced Encoder-Decoder Network Architecture for Reducing Information Loss in Image Semantic Segmentation
por: Gao, Zijun, et al.
Publicado: (2024)
por: Gao, Zijun, et al.
Publicado: (2024)
Attention Sinks in Diffusion Transformers: A Causal Analysis
por: Wu, Fangzheng, et al.
Publicado: (2026)
por: Wu, Fangzheng, et al.
Publicado: (2026)
Vision Transformers are Circulant Attention Learners
por: Han, Dongchen, et al.
Publicado: (2025)
por: Han, Dongchen, et al.
Publicado: (2025)
S2AFormer: Strip Self-Attention for Efficient Vision Transformer
por: Xu, Guoan, et al.
Publicado: (2025)
por: Xu, Guoan, et al.
Publicado: (2025)
Mitigating Hallucinations in Large Vision-Language Models with Instruction Contrastive Decoding
por: Wang, Xintong, et al.
Publicado: (2024)
por: Wang, Xintong, et al.
Publicado: (2024)
GPT-IMAGE-EDIT-1.5M: A Million-Scale, GPT-Generated Image Dataset
por: Wang, Yuhan, et al.
Publicado: (2025)
por: Wang, Yuhan, et al.
Publicado: (2025)
DarSwin-Unet: Distortion Aware Encoder-Decoder Architecture
por: Athwale, Akshaya, et al.
Publicado: (2024)
por: Athwale, Akshaya, et al.
Publicado: (2024)
Beyond the Vision Encoder: Identifying and Mitigating Spatial Bias in Large Vision-Language Models
por: Zhu, Yingjie, et al.
Publicado: (2025)
por: Zhu, Yingjie, et al.
Publicado: (2025)
To Sink or Not to Sink: Visual Information Pathways in Large Vision-Language Models
por: Luo, Jiayun, et al.
Publicado: (2025)
por: Luo, Jiayun, et al.
Publicado: (2025)
Mitigating Attention Sinks and Massive Activations in Audio-Visual Speech Recognition with LLMs
por: Anand, et al.
Publicado: (2025)
por: Anand, et al.
Publicado: (2025)
AnchorFormer: Differentiable Anchor Attention for Efficient Vision Transformer
por: Shan, Jiquan, et al.
Publicado: (2025)
por: Shan, Jiquan, et al.
Publicado: (2025)
FADE: A Task-Agnostic Upsampling Operator for Encoder-Decoder Architectures
por: Lu, Hao, et al.
Publicado: (2024)
por: Lu, Hao, et al.
Publicado: (2024)
Learning A Physical-aware Diffusion Model Based on Transformer for Underwater Image Enhancement
por: Zhao, Chen, et al.
Publicado: (2024)
por: Zhao, Chen, et al.
Publicado: (2024)
Attention Based Encoder Decoder Model for Video Captioning in Nepali (2023)
por: Parajuli, Kabita, et al.
Publicado: (2023)
por: Parajuli, Kabita, et al.
Publicado: (2023)
Mixture of Decoding: An Attention-Inspired Adaptive Decoding Strategy to Mitigate Hallucinations in Large Vision-Language Models
por: Chen, Xinlong, et al.
Publicado: (2025)
por: Chen, Xinlong, et al.
Publicado: (2025)
Representative Attention For Vision Transformers
por: Li, Yuntong, et al.
Publicado: (2026)
por: Li, Yuntong, et al.
Publicado: (2026)
YARD: Y-Architecture Register Decoding for Efficient Hallucination Mitigation in Large Vision-Language Models
por: Chen, Ting, et al.
Publicado: (2026)
por: Chen, Ting, et al.
Publicado: (2026)
MED-VT++: Unifying Multimodal Learning with a Multiscale Encoder-Decoder Video Transformer
por: Karim, Rezaul, et al.
Publicado: (2023)
por: Karim, Rezaul, et al.
Publicado: (2023)
Buster: Implanting Semantic Backdoor into Text Encoder to Mitigate NSFW Content Generation
por: Zhao, Xin, et al.
Publicado: (2024)
por: Zhao, Xin, et al.
Publicado: (2024)
Don't Deceive Me: Mitigating Gaslighting through Attention Reallocation in LMMs
por: Jiao, Pengkun, et al.
Publicado: (2025)
por: Jiao, Pengkun, et al.
Publicado: (2025)
IKOD: Mitigating Visual Attention Degradation in Large Vision-Language Models
por: Yang, Jiabing, et al.
Publicado: (2025)
por: Yang, Jiabing, et al.
Publicado: (2025)
Spiking Vision Transformer with Saccadic Attention
por: Wang, Shuai, et al.
Publicado: (2025)
por: Wang, Shuai, et al.
Publicado: (2025)
PA-Attack: Guiding Gray-Box Attacks on LVLM Vision Encoders with Prototypes and Attention
por: Mei, Hefei, et al.
Publicado: (2026)
por: Mei, Hefei, et al.
Publicado: (2026)
GLID: Pre-training a Generalist Encoder-Decoder Vision Model
por: Liu, Jihao, et al.
Publicado: (2024)
por: Liu, Jihao, et al.
Publicado: (2024)
Spotlight and Shadow: Attention-Guided Dual-Anchor Introspective Decoding for MLLM Hallucination Mitigation
por: Wu, Yebo, et al.
Publicado: (2026)
por: Wu, Yebo, et al.
Publicado: (2026)
BSViT: A Burst Spiking Vision Transformer for Expressive and Efficient Visual Representation Learning
por: Peng, Hongxiang, et al.
Publicado: (2026)
por: Peng, Hongxiang, et al.
Publicado: (2026)
TERDNet: Transformer Encoder-Recurrent Decoder Network for Scene Change Detection
por: Yoon, Jiae, et al.
Publicado: (2026)
por: Yoon, Jiae, et al.
Publicado: (2026)
Adapting LLaMA Decoder to Vision Transformer
por: Wang, Jiahao, et al.
Publicado: (2024)
por: Wang, Jiahao, et al.
Publicado: (2024)
DASViT: Differentiable Architecture Search for Vision Transformer
por: Wu, Pengjin, et al.
Publicado: (2025)
por: Wu, Pengjin, et al.
Publicado: (2025)
EagleVision: Object-level Attribute Multimodal LLM for Remote Sensing
por: Jiang, Hongxiang, et al.
Publicado: (2025)
por: Jiang, Hongxiang, et al.
Publicado: (2025)
Ejemplares similares
-
Artifacts and Attention Sinks: Structured Approximations for Efficient Vision Transformers
por: Lu, Andrew, et al.
Publicado: (2025) -
Mitigating Hallucination in Large Vision-Language Models through Aligning Attention Distribution to Information Flow
por: Zhao, Jianfei, et al.
Publicado: (2025) -
SAGE: Sink-Aware Grounded Decoding for Multimodal Hallucination Mitigation
por: Shukla, Tripti, et al.
Publicado: (2026) -
On the Nature of Attention Sink that Shapes Decoding Strategy in Omni-LLMs
por: Yoo, Suho, et al.
Publicado: (2026) -
Tell Model Where to Look: Mitigating Hallucinations in MLLMs by Vision-Guided Attention
por: Zhao, Jianfei, et al.
Publicado: (2025)