Dynamic Accumulated Attention Map for Interpreting Evolution of Decision-Making in Vision Transformer
Fuente:
arXiv
Salvato in:
| Autori principali: | Liao, Yi, Gao, Yongsheng, Zhang, Weichuan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Neuron Abandoning Attention Flow: Visual Explanation of Dynamics inside CNN Models
di: Liao, Yi, et al.
Pubblicazione: (2024)
di: Liao, Yi, et al.
Pubblicazione: (2024)
Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis
di: Chowdhury, Arpita, et al.
Pubblicazione: (2025)
di: Chowdhury, Arpita, et al.
Pubblicazione: (2025)
IFViT: Interpretable Fixed-Length Representation for Fingerprint Matching via Vision Transformer
di: Qiu, Yuhang, et al.
Pubblicazione: (2024)
di: Qiu, Yuhang, et al.
Pubblicazione: (2024)
Cognitive Alignment At No Cost: Inducing Human Attention Biases For Interpretable Vision Transformers
di: Knights, Ethan
Pubblicazione: (2026)
di: Knights, Ethan
Pubblicazione: (2026)
Adaptive receptive field-based spatial-frequency feature reconstruction network for few-shot fine-grained image classification
di: Zhang, Linyue, et al.
Pubblicazione: (2026)
di: Zhang, Linyue, et al.
Pubblicazione: (2026)
Spiking Vision Transformer with Saccadic Attention
di: Wang, Shuai, et al.
Pubblicazione: (2025)
di: Wang, Shuai, et al.
Pubblicazione: (2025)
Class-Discriminative Attention Maps for Vision Transformers
di: Brocki, Lennart, et al.
Pubblicazione: (2023)
di: Brocki, Lennart, et al.
Pubblicazione: (2023)
Attention Retention for Continual Learning with Vision Transformers
di: Lu, Yue, et al.
Pubblicazione: (2026)
di: Lu, Yue, et al.
Pubblicazione: (2026)
The Linear Attention Resurrection in Vision Transformer
di: Zheng, Chuanyang
Pubblicazione: (2025)
di: Zheng, Chuanyang
Pubblicazione: (2025)
RAD: Retrieval-Augmented Decision-Making of Meta-Actions with Vision-Language Models in Autonomous Driving
di: Wang, Yujin, et al.
Pubblicazione: (2025)
di: Wang, Yujin, et al.
Pubblicazione: (2025)
[Re] Improving Interpretation Faithfulness for Vision Transformers
di: Kurek, Izabela, et al.
Pubblicazione: (2025)
di: Kurek, Izabela, et al.
Pubblicazione: (2025)
Selective Aggregation of Attention Maps Improves Diffusion-Based Visual Interpretation
di: Park, Jungwon, et al.
Pubblicazione: (2026)
di: Park, Jungwon, et al.
Pubblicazione: (2026)
PolaFormer: Polarity-aware Linear Attention for Vision Transformers
di: Meng, Weikang, et al.
Pubblicazione: (2025)
di: Meng, Weikang, et al.
Pubblicazione: (2025)
Exploiting Information Redundancy in Attention Maps for Extreme Quantization of Vision Transformers
di: Maisonnave, Lucas, et al.
Pubblicazione: (2025)
di: Maisonnave, Lucas, et al.
Pubblicazione: (2025)
Why Text Prevails: Vision May Undermine Multimodal Medical Decision Making
di: Dai, Siyuan, et al.
Pubblicazione: (2025)
di: Dai, Siyuan, et al.
Pubblicazione: (2025)
Attention Guided CAM: Visual Explanations of Vision Transformer Guided by Self-Attention
di: Leem, Saebom, et al.
Pubblicazione: (2024)
di: Leem, Saebom, et al.
Pubblicazione: (2024)
CSA-Net: Channel-wise Spatially Autocorrelated Attention Networks
di: Nikzad, Nick, et al.
Pubblicazione: (2024)
di: Nikzad, Nick, et al.
Pubblicazione: (2024)
Object Navigation with Structure-Semantic Reasoning-Based Multi-level Map and Multimodal Decision-Making LLM
di: Yan, Chongshang, et al.
Pubblicazione: (2025)
di: Yan, Chongshang, et al.
Pubblicazione: (2025)
ProtoPFormer: Concentrating on Prototypical Parts in Vision Transformers for Interpretable Image Recognition
di: Xue, Mengqi, et al.
Pubblicazione: (2022)
di: Xue, Mengqi, et al.
Pubblicazione: (2022)
Make It Efficient: Dynamic Sparse Attention for Autoregressive Image Generation
di: Xiang, Xunzhi, et al.
Pubblicazione: (2025)
di: Xiang, Xunzhi, et al.
Pubblicazione: (2025)
Can Cross-Layer Transcoders Replace Vision Transformer Activations? An Interpretable Perspective on Vision
di: Chatzoudis, Gerasimos, et al.
Pubblicazione: (2026)
di: Chatzoudis, Gerasimos, et al.
Pubblicazione: (2026)
MAP: Mitigating Hallucinations in Large Vision-Language Models with Map-Level Attention Processing
di: Li, Chenxi, et al.
Pubblicazione: (2025)
di: Li, Chenxi, et al.
Pubblicazione: (2025)
SPARO: Selective Attention for Robust and Compositional Transformer Encodings for Vision
di: Vani, Ankit, et al.
Pubblicazione: (2024)
di: Vani, Ankit, et al.
Pubblicazione: (2024)
Evaluating Visual Explanations of Attention Maps for Transformer-based Medical Imaging
di: Chung, Minjae, et al.
Pubblicazione: (2025)
di: Chung, Minjae, et al.
Pubblicazione: (2025)
HAZARD Challenge: Embodied Decision Making in Dynamically Changing Environments
di: Zhou, Qinhong, et al.
Pubblicazione: (2024)
di: Zhou, Qinhong, et al.
Pubblicazione: (2024)
EDIT: Enhancing Vision Transformers by Mitigating Attention Sink through an Encoder-Decoder Architecture
di: Feng, Wenfeng, et al.
Pubblicazione: (2025)
di: Feng, Wenfeng, et al.
Pubblicazione: (2025)
JetViT: Efficient High-Resolution Vision Transformer with Post-Training Attention Search
di: Zou, Dongyun, et al.
Pubblicazione: (2026)
di: Zou, Dongyun, et al.
Pubblicazione: (2026)
Improving Interpretation Faithfulness for Vision Transformers
di: Hu, Lijie, et al.
Pubblicazione: (2023)
di: Hu, Lijie, et al.
Pubblicazione: (2023)
Improved Belief-Attention in Vision Task
di: Zhang, Guoqiang
Pubblicazione: (2026)
di: Zhang, Guoqiang
Pubblicazione: (2026)
Interpretable Decision-Making for End-to-End Autonomous Driving
di: Mirzaie, Mona, et al.
Pubblicazione: (2025)
di: Mirzaie, Mona, et al.
Pubblicazione: (2025)
STAA: Spatio-Temporal Attention Attribution for Real-Time Interpreting Transformer-based Video Models
di: Wang, Zerui, et al.
Pubblicazione: (2024)
di: Wang, Zerui, et al.
Pubblicazione: (2024)
ECViT: Efficient Convolutional Vision Transformer with Local-Attention and Multi-scale Stages
di: Qian, Zhoujie
Pubblicazione: (2025)
di: Qian, Zhoujie
Pubblicazione: (2025)
Symbolic Rule Extraction from Attention-Guided Sparse Representations in Vision Transformers
di: Padalkar, Parth, et al.
Pubblicazione: (2025)
di: Padalkar, Parth, et al.
Pubblicazione: (2025)
MSVIT: Improving Spiking Vision Transformer Using Multi-scale Attention Fusion
di: Hua, Wei, et al.
Pubblicazione: (2025)
di: Hua, Wei, et al.
Pubblicazione: (2025)
InfiniteVL: Synergizing Linear and Sparse Attention for Highly-Efficient, Unlimited-Input Vision-Language Models
di: Tao, Hongyuan, et al.
Pubblicazione: (2025)
di: Tao, Hongyuan, et al.
Pubblicazione: (2025)
GAFR-Net: A Graph Attention and Fuzzy-Rule Network for Interpretable Breast Cancer Image Classification
di: Gao, Lin-Guo, et al.
Pubblicazione: (2026)
di: Gao, Lin-Guo, et al.
Pubblicazione: (2026)
CascadedViT: Cascaded Chunk-FeedForward and Cascaded Group Attention Vision Transformer
di: Sivakumar, Srivathsan, et al.
Pubblicazione: (2025)
di: Sivakumar, Srivathsan, et al.
Pubblicazione: (2025)
OmniMRI: A Unified Vision--Language Foundation Model for Generalist MRI Interpretation
di: He, Xingxin, et al.
Pubblicazione: (2025)
di: He, Xingxin, et al.
Pubblicazione: (2025)
Large Vision-Language Models Get Lost in Attention
di: Xi, Gongli, et al.
Pubblicazione: (2026)
di: Xi, Gongli, et al.
Pubblicazione: (2026)
Representation Separation for Semantic Segmentation with Vision Transformers
di: Hong, Yuanduo, et al.
Pubblicazione: (2022)
di: Hong, Yuanduo, et al.
Pubblicazione: (2022)
Documenti analoghi
-
Neuron Abandoning Attention Flow: Visual Explanation of Dynamics inside CNN Models
di: Liao, Yi, et al.
Pubblicazione: (2024) -
Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis
di: Chowdhury, Arpita, et al.
Pubblicazione: (2025) -
IFViT: Interpretable Fixed-Length Representation for Fingerprint Matching via Vision Transformer
di: Qiu, Yuhang, et al.
Pubblicazione: (2024) -
Cognitive Alignment At No Cost: Inducing Human Attention Biases For Interpretable Vision Transformers
di: Knights, Ethan
Pubblicazione: (2026) -
Adaptive receptive field-based spatial-frequency feature reconstruction network for few-shot fine-grained image classification
di: Zhang, Linyue, et al.
Pubblicazione: (2026)