Artifacts and Attention Sinks: Structured Approximations for Efficient Vision Transformers
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Lu, Andrew, Liao, Wentinn, Wang, Liuhui, Yang, Huzheng, Shi, Jianbo |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
AlignedCut: Visual Concepts Discovery on Brain-Guided Universal Feature Space
von: Yang, Huzheng, et al.
Veröffentlicht: (2024)
von: Yang, Huzheng, et al.
Veröffentlicht: (2024)
Brain Decodes Deep Nets
von: Yang, Huzheng, et al.
Veröffentlicht: (2023)
von: Yang, Huzheng, et al.
Veröffentlicht: (2023)
Vibe Spaces for Creatively Connecting and Expressing Visual Concepts
von: Yang, Huzheng, et al.
Veröffentlicht: (2025)
von: Yang, Huzheng, et al.
Veröffentlicht: (2025)
"I Know It When I See It": Mood Spaces for Connecting and Expressing Visual Concepts
von: Yang, Huzheng, et al.
Veröffentlicht: (2025)
von: Yang, Huzheng, et al.
Veröffentlicht: (2025)
When Sinks Help or Hurt: Unified Framework for Attention Sink in Large Vision-Language Models
von: Choi, Jiho, et al.
Veröffentlicht: (2026)
von: Choi, Jiho, et al.
Veröffentlicht: (2026)
Attention Sinks in Diffusion Transformers: A Causal Analysis
von: Wu, Fangzheng, et al.
Veröffentlicht: (2026)
von: Wu, Fangzheng, et al.
Veröffentlicht: (2026)
EDIT: Enhancing Vision Transformers by Mitigating Attention Sink through an Encoder-Decoder Architecture
von: Feng, Wenfeng, et al.
Veröffentlicht: (2025)
von: Feng, Wenfeng, et al.
Veröffentlicht: (2025)
EfficientFSL: Enhancing Few-Shot Classification via Query-Only Tuning in Vision Transformers
von: Liao, Wenwen, et al.
Veröffentlicht: (2026)
von: Liao, Wenwen, et al.
Veröffentlicht: (2026)
SinkTrack: Attention Sink based Context Anchoring for Large Language Models
von: Liu, Xu, et al.
Veröffentlicht: (2026)
von: Liu, Xu, et al.
Veröffentlicht: (2026)
Structured Initialization for Attention in Vision Transformers
von: Zheng, Jianqiao, et al.
Veröffentlicht: (2024)
von: Zheng, Jianqiao, et al.
Veröffentlicht: (2024)
Representative Attention For Vision Transformers
von: Li, Yuntong, et al.
Veröffentlicht: (2026)
von: Li, Yuntong, et al.
Veröffentlicht: (2026)
PADRe: A Unifying Polynomial Attention Drop-in Replacement for Efficient Vision Transformer
von: Letourneau, Pierre-David, et al.
Veröffentlicht: (2024)
von: Letourneau, Pierre-David, et al.
Veröffentlicht: (2024)
EViT: An Eagle Vision Transformer with Bi-Fovea Self-Attention
von: Shi, Yulong, et al.
Veröffentlicht: (2023)
von: Shi, Yulong, et al.
Veröffentlicht: (2023)
S2AFormer: Strip Self-Attention for Efficient Vision Transformer
von: Xu, Guoan, et al.
Veröffentlicht: (2025)
von: Xu, Guoan, et al.
Veröffentlicht: (2025)
ToSA: Token Selective Attention for Efficient Vision Transformers
von: Singh, Manish Kumar, et al.
Veröffentlicht: (2024)
von: Singh, Manish Kumar, et al.
Veröffentlicht: (2024)
MaTVLM: Hybrid Mamba-Transformer for Efficient Vision-Language Modeling
von: Li, Yingyue, et al.
Veröffentlicht: (2025)
von: Li, Yingyue, et al.
Veröffentlicht: (2025)
Vision Transformers are Circulant Attention Learners
von: Han, Dongchen, et al.
Veröffentlicht: (2025)
von: Han, Dongchen, et al.
Veröffentlicht: (2025)
To Sink or Not to Sink: Visual Information Pathways in Large Vision-Language Models
von: Luo, Jiayun, et al.
Veröffentlicht: (2025)
von: Luo, Jiayun, et al.
Veröffentlicht: (2025)
On the Nature of Attention Sink that Shapes Decoding Strategy in Omni-LLMs
von: Yoo, Suho, et al.
Veröffentlicht: (2026)
von: Yoo, Suho, et al.
Veröffentlicht: (2026)
Vision Transformers with Hierarchical Attention
von: Liu, Yun, et al.
Veröffentlicht: (2021)
von: Liu, Yun, et al.
Veröffentlicht: (2021)
Efficient Adaptation of Pre-trained Vision Transformer underpinned by Approximately Orthogonal Fine-Tuning Strategy
von: Yang, Yiting, et al.
Veröffentlicht: (2025)
von: Yang, Yiting, et al.
Veröffentlicht: (2025)
MARformer: An Efficient Metal Artifact Reduction Transformer for Dental CBCT Images
von: Shi, Yuxuan, et al.
Veröffentlicht: (2023)
von: Shi, Yuxuan, et al.
Veröffentlicht: (2023)
AnchorFormer: Differentiable Anchor Attention for Efficient Vision Transformer
von: Shan, Jiquan, et al.
Veröffentlicht: (2025)
von: Shan, Jiquan, et al.
Veröffentlicht: (2025)
Spiking Vision Transformer with Saccadic Attention
von: Wang, Shuai, et al.
Veröffentlicht: (2025)
von: Wang, Shuai, et al.
Veröffentlicht: (2025)
Multi-manifold Attention for Vision Transformers
von: Konstantinidis, Dimitrios, et al.
Veröffentlicht: (2022)
von: Konstantinidis, Dimitrios, et al.
Veröffentlicht: (2022)
HAViT: Historical Attention Vision Transformer
von: Banik, Swarnendu, et al.
Veröffentlicht: (2026)
von: Banik, Swarnendu, et al.
Veröffentlicht: (2026)
CS-VLM: Compressed Sensing Attention for Efficient Vision-Language Representation Learning
von: Kiruluta, Andrew, et al.
Veröffentlicht: (2025)
von: Kiruluta, Andrew, et al.
Veröffentlicht: (2025)
Parameter-Efficient and Memory-Efficient Tuning for Vision Transformer: A Disentangled Approach
von: Zhang, Taolin, et al.
Veröffentlicht: (2024)
von: Zhang, Taolin, et al.
Veröffentlicht: (2024)
Query-Efficient Hard-Label Black-Box Attack against Vision Transformers
von: Zhou, Chao, et al.
Veröffentlicht: (2024)
von: Zhou, Chao, et al.
Veröffentlicht: (2024)
ArtifactWorld: Scaling 3D Gaussian Splatting Artifact Restoration via Video Generation Models
von: Wang, Xinliang, et al.
Veröffentlicht: (2026)
von: Wang, Xinliang, et al.
Veröffentlicht: (2026)
VMonarch: Efficient Video Diffusion Transformers with Structured Attention
von: Liang, Cheng, et al.
Veröffentlicht: (2026)
von: Liang, Cheng, et al.
Veröffentlicht: (2026)
Scaling Spike-driven Transformer with Efficient Spike Firing Approximation Training
von: Yao, Man, et al.
Veröffentlicht: (2024)
von: Yao, Man, et al.
Veröffentlicht: (2024)
SynArtifact: Classifying and Alleviating Artifacts in Synthetic Images via Vision-Language Model
von: Cao, Bin, et al.
Veröffentlicht: (2024)
von: Cao, Bin, et al.
Veröffentlicht: (2024)
HEART-VIT: Hessian-Guided Efficient Dynamic Attention and Token Pruning in Vision Transformer
von: Uddin, Mohammad Helal, et al.
Veröffentlicht: (2025)
von: Uddin, Mohammad Helal, et al.
Veröffentlicht: (2025)
TCSAFormer: Efficient Vision Transformer with Token Compression and Sparse Attention for Medical Image Segmentation
von: Xia, Zunhui, et al.
Veröffentlicht: (2025)
von: Xia, Zunhui, et al.
Veröffentlicht: (2025)
Multi-criteria Token Fusion with One-step-ahead Attention for Efficient Vision Transformers
von: Lee, Sanghyeok, et al.
Veröffentlicht: (2024)
von: Lee, Sanghyeok, et al.
Veröffentlicht: (2024)
Structural Attention: Rethinking Transformer for Unpaired Medical Image Synthesis
von: Phan, Vu Minh Hieu, et al.
Veröffentlicht: (2024)
von: Phan, Vu Minh Hieu, et al.
Veröffentlicht: (2024)
JetViT: Efficient High-Resolution Vision Transformer with Post-Training Attention Search
von: Zou, Dongyun, et al.
Veröffentlicht: (2026)
von: Zou, Dongyun, et al.
Veröffentlicht: (2026)
Dynamic Accumulated Attention Map for Interpreting Evolution of Decision-Making in Vision Transformer
von: Liao, Yi, et al.
Veröffentlicht: (2025)
von: Liao, Yi, et al.
Veröffentlicht: (2025)
Polyline Path Masked Attention for Vision Transformer
von: Zhao, Zhongchen, et al.
Veröffentlicht: (2025)
von: Zhao, Zhongchen, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
AlignedCut: Visual Concepts Discovery on Brain-Guided Universal Feature Space
von: Yang, Huzheng, et al.
Veröffentlicht: (2024) -
Brain Decodes Deep Nets
von: Yang, Huzheng, et al.
Veröffentlicht: (2023) -
Vibe Spaces for Creatively Connecting and Expressing Visual Concepts
von: Yang, Huzheng, et al.
Veröffentlicht: (2025) -
"I Know It When I See It": Mood Spaces for Connecting and Expressing Visual Concepts
von: Yang, Huzheng, et al.
Veröffentlicht: (2025) -
When Sinks Help or Hurt: Unified Framework for Attention Sink in Large Vision-Language Models
von: Choi, Jiho, et al.
Veröffentlicht: (2026)