Sparse but not Simpler: A Multi-Level Interpretability Analysis of Vision Transformers
Fuente:
arXiv
Salvato in:
| Autore principale: | Zhang, Siyu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Simple-RF: Regularizing Sparse Input Radiance Fields with Simpler Solutions
di: Somraj, Nagabhushan, et al.
Pubblicazione: (2024)
di: Somraj, Nagabhushan, et al.
Pubblicazione: (2024)
Point Transformer V3: Simpler, Faster, Stronger
di: Wu, Xiaoyang, et al.
Pubblicazione: (2023)
di: Wu, Xiaoyang, et al.
Pubblicazione: (2023)
Multimodal Interpretation of Remote Sensing Images: Dynamic Resolution Input Strategy and Multi-scale Vision-Language Alignment Mechanism
di: Zhang, Siyu, et al.
Pubblicazione: (2025)
di: Zhang, Siyu, et al.
Pubblicazione: (2025)
Vision Transformer with Sparse Scan Prior
di: Zhang, Yuguang, et al.
Pubblicazione: (2024)
di: Zhang, Yuguang, et al.
Pubblicazione: (2024)
Interpretability-Aware Vision Transformer
di: Qiang, Yao, et al.
Pubblicazione: (2023)
di: Qiang, Yao, et al.
Pubblicazione: (2023)
Interpretable and Testable Vision Features via Sparse Autoencoders
di: Stevens, Samuel, et al.
Pubblicazione: (2025)
di: Stevens, Samuel, et al.
Pubblicazione: (2025)
Interpretability Transfer from Language to Vision via Sparse Autoencoders
di: Kravets, Alexey, et al.
Pubblicazione: (2026)
di: Kravets, Alexey, et al.
Pubblicazione: (2026)
GMAR: Gradient-Driven Multi-Head Attention Rollout for Vision Transformer Interpretability
di: Jo, Sehyeong, et al.
Pubblicazione: (2025)
di: Jo, Sehyeong, et al.
Pubblicazione: (2025)
ComFe: An Interpretable Head for Vision Transformers
di: Mannix, Evelyn J., et al.
Pubblicazione: (2024)
di: Mannix, Evelyn J., et al.
Pubblicazione: (2024)
Causal Interpretation of Sparse Autoencoder Features in Vision
di: Han, Sangyu, et al.
Pubblicazione: (2025)
di: Han, Sangyu, et al.
Pubblicazione: (2025)
Interpretable Vision Transformers in Image Classification via SVDA
di: Arampatzakis, Vasileios, et al.
Pubblicazione: (2026)
di: Arampatzakis, Vasileios, et al.
Pubblicazione: (2026)
Cluster-Level Sparse Multi-Instance Learning for Whole-Slide Images
di: Zhang, Yuedi, et al.
Pubblicazione: (2025)
di: Zhang, Yuedi, et al.
Pubblicazione: (2025)
Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis
di: Chowdhury, Arpita, et al.
Pubblicazione: (2025)
di: Chowdhury, Arpita, et al.
Pubblicazione: (2025)
Interpretable Vision Transformers in Monocular Depth Estimation via SVDA
di: Arampatzakis, Vasileios, et al.
Pubblicazione: (2026)
di: Arampatzakis, Vasileios, et al.
Pubblicazione: (2026)
B-cos Alignment for Inherently Interpretable CNNs and Vision Transformers
di: Böhle, Moritz, et al.
Pubblicazione: (2023)
di: Böhle, Moritz, et al.
Pubblicazione: (2023)
Interpretable Image Classification with Adaptive Prototype-based Vision Transformers
di: Ma, Chiyu, et al.
Pubblicazione: (2024)
di: Ma, Chiyu, et al.
Pubblicazione: (2024)
Hierarchical Vision Transformer with Prototypes for Interpretable Medical Image Classification
di: Gallée, Luisa, et al.
Pubblicazione: (2025)
di: Gallée, Luisa, et al.
Pubblicazione: (2025)
A TRPCA-Inspired Deep Unfolding Network for Hyperspectral Image Denoising via Thresholded t-SVD and Top-K Sparse Transformer
di: Li, Liang, et al.
Pubblicazione: (2025)
di: Li, Liang, et al.
Pubblicazione: (2025)
Fast and Interpretable 2D Homography Decomposition: Similarity-Kernel-Similarity and Affine-Core-Affine Transformations
di: Cai, Shen, et al.
Pubblicazione: (2024)
di: Cai, Shen, et al.
Pubblicazione: (2024)
Sparse-Tuning: Adapting Vision Transformers with Efficient Fine-tuning and Inference
di: Liu, Ting, et al.
Pubblicazione: (2024)
di: Liu, Ting, et al.
Pubblicazione: (2024)
SparseVoxFormer: Sparse Voxel-based Transformer for Multi-modal 3D Object Detection
di: Son, Hyeongseok, et al.
Pubblicazione: (2025)
di: Son, Hyeongseok, et al.
Pubblicazione: (2025)
Event-Level Detection of Surgical Instrument Handovers in Videos with Interpretable Vision Models
di: Katsarou, Katerina, et al.
Pubblicazione: (2026)
di: Katsarou, Katerina, et al.
Pubblicazione: (2026)
Transforming Vision Transformer: Towards Efficient Multi-Task Asynchronous Learning
di: Zhong, Hanwen, et al.
Pubblicazione: (2025)
di: Zhong, Hanwen, et al.
Pubblicazione: (2025)
Comprehensive Information Bottleneck for Unveiling Universal Attribution to Interpret Vision Transformers
di: Hong, Jung-Ho, et al.
Pubblicazione: (2025)
di: Hong, Jung-Ho, et al.
Pubblicazione: (2025)
Exploring Token-Level Augmentation in Vision Transformer for Semi-Supervised Semantic Segmentation
di: Zhang, Dengke, et al.
Pubblicazione: (2025)
di: Zhang, Dengke, et al.
Pubblicazione: (2025)
LeMeViT: Efficient Vision Transformer with Learnable Meta Tokens for Remote Sensing Image Interpretation
di: Jiang, Wentao, et al.
Pubblicazione: (2024)
di: Jiang, Wentao, et al.
Pubblicazione: (2024)
Multi-manifold Attention for Vision Transformers
di: Konstantinidis, Dimitrios, et al.
Pubblicazione: (2022)
di: Konstantinidis, Dimitrios, et al.
Pubblicazione: (2022)
DeepHistoViT: An Interpretable Vision Transformer Framework for Histopathological Cancer Classification
di: Mosalpuri, Ravi, et al.
Pubblicazione: (2026)
di: Mosalpuri, Ravi, et al.
Pubblicazione: (2026)
Multi-Modal Interpretability for Enhanced Localization in Vision-Language Models
di: Imran, Muhammad, et al.
Pubblicazione: (2025)
di: Imran, Muhammad, et al.
Pubblicazione: (2025)
[Re] Improving Interpretation Faithfulness for Vision Transformers
di: Kurek, Izabela, et al.
Pubblicazione: (2025)
di: Kurek, Izabela, et al.
Pubblicazione: (2025)
SpectralKD: A Unified Framework for Interpreting and Distilling Vision Transformers via Spectral Analysis
di: Tian, Huiyuan, et al.
Pubblicazione: (2024)
di: Tian, Huiyuan, et al.
Pubblicazione: (2024)
SparseFormer: Detecting Objects in HRW Shots via Sparse Vision Transformer
di: Li, Wenxi, et al.
Pubblicazione: (2025)
di: Li, Wenxi, et al.
Pubblicazione: (2025)
TCSAFormer: Efficient Vision Transformer with Token Compression and Sparse Attention for Medical Image Segmentation
di: Xia, Zunhui, et al.
Pubblicazione: (2025)
di: Xia, Zunhui, et al.
Pubblicazione: (2025)
LMLT: Low-to-high Multi-Level Vision Transformer for Image Super-Resolution
di: Kim, Jeongsoo, et al.
Pubblicazione: (2024)
di: Kim, Jeongsoo, et al.
Pubblicazione: (2024)
SparX: A Sparse Cross-Layer Connection Mechanism for Hierarchical Vision Mamba and Transformer Networks
di: Lou, Meng, et al.
Pubblicazione: (2024)
di: Lou, Meng, et al.
Pubblicazione: (2024)
Mechanistic Interpretability of Diffusion Models: Circuit-Level Analysis and Causal Validation
di: Roy, Dip
Pubblicazione: (2025)
di: Roy, Dip
Pubblicazione: (2025)
LUCID-SAE: Learning Unified Vision-Language Sparse Codes for Interpretable Concept Discovery
di: Gu, Difei, et al.
Pubblicazione: (2026)
di: Gu, Difei, et al.
Pubblicazione: (2026)
Improving Vision Transformers by Overlapping Heads in Multi-Head Self-Attention
di: Zhang, Tianxiao, et al.
Pubblicazione: (2024)
di: Zhang, Tianxiao, et al.
Pubblicazione: (2024)
Multi-Tailed Vision Transformer for Efficient Inference
di: Wang, Yunke, et al.
Pubblicazione: (2022)
di: Wang, Yunke, et al.
Pubblicazione: (2022)
Enhancing Indoor Occupancy Prediction via Sparse Query-Based Multi-Level Consistent Knowledge Distillation
di: Li, Xiang, et al.
Pubblicazione: (2026)
di: Li, Xiang, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Simple-RF: Regularizing Sparse Input Radiance Fields with Simpler Solutions
di: Somraj, Nagabhushan, et al.
Pubblicazione: (2024) -
Point Transformer V3: Simpler, Faster, Stronger
di: Wu, Xiaoyang, et al.
Pubblicazione: (2023) -
Multimodal Interpretation of Remote Sensing Images: Dynamic Resolution Input Strategy and Multi-scale Vision-Language Alignment Mechanism
di: Zhang, Siyu, et al.
Pubblicazione: (2025) -
Vision Transformer with Sparse Scan Prior
di: Zhang, Yuguang, et al.
Pubblicazione: (2024) -
Interpretability-Aware Vision Transformer
di: Qiang, Yao, et al.
Pubblicazione: (2023)