TORE: Token Recycling in Vision Transformers for Efficient Active Visual Exploration
Fuente:
arXiv
Saved in:
| Main Authors: | Olszewski, Jan, Rymarczyk, Dawid, Wójcik, Piotr, Pach, Mateusz, Zieliński, Bartosz |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
LucidPPN: Unambiguous Prototypical Parts Network for User-centric Interpretable Computer Vision
by: Pach, Mateusz, et al.
Published: (2024)
by: Pach, Mateusz, et al.
Published: (2024)
Revisiting FunnyBirds evaluation framework for prototypical parts networks
by: Opłatek, Szymon, et al.
Published: (2024)
by: Opłatek, Szymon, et al.
Published: (2024)
ProtoQuant: Quantization of Prototypical Parts For General and Fine-Grained Image Classification
by: Janusz, Mikołaj, et al.
Published: (2026)
by: Janusz, Mikołaj, et al.
Published: (2026)
OMENN: One Matrix to Explain Neural Networks
by: Wróbel, Adam, et al.
Published: (2024)
by: Wróbel, Adam, et al.
Published: (2024)
InfoDisent: Explainability of Image Classification Models by Information Disentanglement
by: Struski, Łukasz, et al.
Published: (2024)
by: Struski, Łukasz, et al.
Published: (2024)
DAVE: Distribution-aware Attribution via ViT Gradient Decomposition
by: Wróbel, Adam, et al.
Published: (2026)
by: Wróbel, Adam, et al.
Published: (2026)
SIDE: Sparse Information Disentanglement for Explainable Artificial Intelligence
by: Dubovik, Viktar, et al.
Published: (2025)
by: Dubovik, Viktar, et al.
Published: (2025)
Beyond Grids: Exploring Elastic Input Sampling for Vision Transformers
by: Pardyl, Adam, et al.
Published: (2023)
by: Pardyl, Adam, et al.
Published: (2023)
ProtoSeg: Interpretable Semantic Segmentation with Prototypical Parts
by: Sacha, Mikołaj, et al.
Published: (2023)
by: Sacha, Mikołaj, et al.
Published: (2023)
Sparse Autoencoders Learn Monosemantic Features in Vision-Language Models
by: Pach, Mateusz, et al.
Published: (2025)
by: Pach, Mateusz, et al.
Published: (2025)
Frequency-Aware Token Reduction for Efficient Vision Transformer
by: Lee, Dong-Jae, et al.
Published: (2025)
by: Lee, Dong-Jae, et al.
Published: (2025)
Stitch: Training-Free Position Control in Multimodal Diffusion Transformers
by: Bader, Jessica, et al.
Published: (2025)
by: Bader, Jessica, et al.
Published: (2025)
Learning to Merge Tokens via Decoupled Embedding for Efficient Vision Transformers
by: Lee, Dong Hoon, et al.
Published: (2024)
by: Lee, Dong Hoon, et al.
Published: (2024)
Energy-Driven Adaptive Visual Token Pruning for Efficient Vision-Language Models
by: He, Jialuo, et al.
Published: (2026)
by: He, Jialuo, et al.
Published: (2026)
GTP-ViT: Efficient Vision Transformers via Graph-based Token Propagation
by: Xu, Xuwei, et al.
Published: (2023)
by: Xu, Xuwei, et al.
Published: (2023)
Learning to Mask and Permute Visual Tokens for Vision Transformer Pre-Training
by: Baraldi, Lorenzo, et al.
Published: (2023)
by: Baraldi, Lorenzo, et al.
Published: (2023)
Spectral Vision Transformer for Efficient Tokenization with Limited Data
by: Roberts, Alexandra G., et al.
Published: (2026)
by: Roberts, Alexandra G., et al.
Published: (2026)
The Latent Color Subspace: Emergent Order in High-Dimensional Chaos
by: Pach, Mateusz, et al.
Published: (2026)
by: Pach, Mateusz, et al.
Published: (2026)
FCoT-VL:Advancing Text-oriented Large Vision-Language Models with Efficient Visual Token Compression
by: Li, Jianjian, et al.
Published: (2025)
by: Li, Jianjian, et al.
Published: (2025)
AEGIS: Preserving privacy of 3D Facial Avatars with Adversarial Perturbations
by: Wolkiewicz, Dawid, et al.
Published: (2025)
by: Wolkiewicz, Dawid, et al.
Published: (2025)
Efficient Multi-Source Knowledge Transfer by Model Merging
by: Osial, Marcin, et al.
Published: (2025)
by: Osial, Marcin, et al.
Published: (2025)
Efficient Vision-Language Models by Summarizing Visual Tokens into Compact Registers
by: Wen, Yuxin, et al.
Published: (2024)
by: Wen, Yuxin, et al.
Published: (2024)
AT-SNN: Adaptive Tokens for Vision Transformer on Spiking Neural Network
by: Kang, Donghwa, et al.
Published: (2024)
by: Kang, Donghwa, et al.
Published: (2024)
Uncertainty-DTW for Sequences and Visual Tokens
by: Wang, Lei, et al.
Published: (2026)
by: Wang, Lei, et al.
Published: (2026)
Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens
by: Kim, Sohee, et al.
Published: (2025)
by: Kim, Sohee, et al.
Published: (2025)
Vision Foundation Models as Effective Visual Tokenizers for Autoregressive Image Generation
by: Zheng, Anlin, et al.
Published: (2025)
by: Zheng, Anlin, et al.
Published: (2025)
Token Pruning using a Lightweight Background Aware Vision Transformer
by: Sah, Sudhakar, et al.
Published: (2024)
by: Sah, Sudhakar, et al.
Published: (2024)
TinyDrop: Tiny Model Guided Token Dropping for Vision Transformers
by: Wang, Guoxin, et al.
Published: (2025)
by: Wang, Guoxin, et al.
Published: (2025)
Detecting Regional Spurious Correlations in Vision Transformers via Token Discarding
by: Kang, Solha, et al.
Published: (2025)
by: Kang, Solha, et al.
Published: (2025)
Efficient Search of Implantable Adaptive Cells for Medical Image Segmentation
by: Benedykciuk, Emil, et al.
Published: (2026)
by: Benedykciuk, Emil, et al.
Published: (2026)
VORTEX: Challenging CNNs at Texture Recognition by using Vision Transformers with Orderless and Randomized Token Encodings
by: Scabini, Leonardo, et al.
Published: (2025)
by: Scabini, Leonardo, et al.
Published: (2025)
ActiveVLN: Towards Active Exploration via Multi-Turn RL in Vision-and-Language Navigation
by: Zhang, Zekai, et al.
Published: (2025)
by: Zhang, Zekai, et al.
Published: (2025)
Fourier Compressor: Frequency-Domain Visual Token Compression for Vision-Language Models
by: Wang, Huanyu, et al.
Published: (2025)
by: Wang, Huanyu, et al.
Published: (2025)
Beyond Attention Scores: SVD-Based Vision Token Pruning for Efficient Vision-Language Models
by: Apedo, Yvon, et al.
Published: (2026)
by: Apedo, Yvon, et al.
Published: (2026)
Evading Visual Aphasia: Contrastive Adaptive Semantic Token Pruning for Vision-Language Models
by: Ma, Jie, et al.
Published: (2026)
by: Ma, Jie, et al.
Published: (2026)
ProMIL: Probabilistic Multiple Instance Learning for Medical Imaging
by: Struski, Łukasz, et al.
Published: (2023)
by: Struski, Łukasz, et al.
Published: (2023)
PLPHP: Per-Layer Per-Head Vision Token Pruning for Efficient Large Vision-Language Models
by: Meng, Yu, et al.
Published: (2025)
by: Meng, Yu, et al.
Published: (2025)
Scaling Vision Models Does Not Consistently Improve Localisation-Based Explanation Quality
by: Cedro, Mateusz, et al.
Published: (2026)
by: Cedro, Mateusz, et al.
Published: (2026)
ZipVL: Efficient Large Vision-Language Models with Dynamic Token Sparsification
by: He, Yefei, et al.
Published: (2024)
by: He, Yefei, et al.
Published: (2024)
TCP-SSM: Efficient Vision State Space Models with Token-Conditioned Poles
by: Shoouri, Sara, et al.
Published: (2026)
by: Shoouri, Sara, et al.
Published: (2026)
Similar Items
-
LucidPPN: Unambiguous Prototypical Parts Network for User-centric Interpretable Computer Vision
by: Pach, Mateusz, et al.
Published: (2024) -
Revisiting FunnyBirds evaluation framework for prototypical parts networks
by: Opłatek, Szymon, et al.
Published: (2024) -
ProtoQuant: Quantization of Prototypical Parts For General and Fine-Grained Image Classification
by: Janusz, Mikołaj, et al.
Published: (2026) -
OMENN: One Matrix to Explain Neural Networks
by: Wróbel, Adam, et al.
Published: (2024) -
InfoDisent: Explainability of Image Classification Models by Information Disentanglement
by: Struski, Łukasz, et al.
Published: (2024)