SPoT: Subpixel Placement of Tokens in Vision Transformers
Fuente:
arXiv
Saved in:
| Main Authors: | Hjelkrem-Tan, Martine, Aasan, Marius, Arteaga, Gabriel Y., Rivera, Adín Ramírez |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Why Prototypes Collapse: Diagnosing and Preventing Partial Collapse in Prototypical Self-Supervised Learning
by: Arteaga, Gabriel Y., et al.
Published: (2025)
by: Arteaga, Gabriel Y., et al.
Published: (2025)
Suppressing Non-Semantic Noise in Masked Image Modeling Representations
by: Hjelkrem-Tan, Martine, et al.
Published: (2026)
by: Hjelkrem-Tan, Martine, et al.
Published: (2026)
Differentiable Hierarchical Visual Tokenization
by: Aasan, Marius, et al.
Published: (2025)
by: Aasan, Marius, et al.
Published: (2025)
A Spitting Image: Modular Superpixel Tokenization in Vision Transformers
by: Aasan, Marius, et al.
Published: (2024)
by: Aasan, Marius, et al.
Published: (2024)
Self-Organizing Visual Prototypes for Non-Parametric Representation Learning
by: Silva, Thalles, et al.
Published: (2025)
by: Silva, Thalles, et al.
Published: (2025)
Learning from Memory: Non-Parametric Memory Augmented Self-Supervised Learning of Visual Features
by: Silva, Thalles, et al.
Published: (2024)
by: Silva, Thalles, et al.
Published: (2024)
SPoRC-VIST: A Benchmark for Evaluating Generative Natural Narrative in Vision-Language Models
by: Zeng, Yunlin
Published: (2026)
by: Zeng, Yunlin
Published: (2026)
SCENES: Subpixel Correspondence Estimation With Epipolar Supervision
by: Kloepfer, Dominik A., et al.
Published: (2024)
by: Kloepfer, Dominik A., et al.
Published: (2024)
SATA: Spatial Autocorrelation Token Analysis for Enhancing the Robustness of Vision Transformers
by: Nikzad, Nick, et al.
Published: (2024)
by: Nikzad, Nick, et al.
Published: (2024)
ToFe: Lagged Token Freezing and Reusing for Efficient Vision Transformer Inference
by: Zhang, Haoyue, et al.
Published: (2025)
by: Zhang, Haoyue, et al.
Published: (2025)
Pre-training of Lightweight Vision Transformers on Small Datasets with Minimally Scaled Images
by: Tan, Jen Hong
Published: (2024)
by: Tan, Jen Hong
Published: (2024)
Pruning One More Token is Enough: Leveraging Latency-Workload Non-Linearities for Vision Transformers on the Edge
by: Eliopoulos, Nick John, et al.
Published: (2024)
by: Eliopoulos, Nick John, et al.
Published: (2024)
Token Caching for Diffusion Transformer Acceleration
by: Lou, Jinming, et al.
Published: (2024)
by: Lou, Jinming, et al.
Published: (2024)
Attention Transfer Is Not Universally Effective for Vision Transformers
by: Qin, Huaiyuan, et al.
Published: (2026)
by: Qin, Huaiyuan, et al.
Published: (2026)
Token Turing Machines are Efficient Vision Models
by: Jajal, Purvish, et al.
Published: (2024)
by: Jajal, Purvish, et al.
Published: (2024)
ZACH-ViT: A Zero-Token Vision Transformer with ShuffleStrides Data Augmentation for Robust Lung Ultrasound Classification
by: Angelakis, Athanasios, et al.
Published: (2025)
by: Angelakis, Athanasios, et al.
Published: (2025)
Efficient Visual Transformer by Learnable Token Merging
by: Wang, Yancheng, et al.
Published: (2024)
by: Wang, Yancheng, et al.
Published: (2024)
TORE: Token Recycling in Vision Transformers for Efficient Active Visual Exploration
by: Olszewski, Jan, et al.
Published: (2023)
by: Olszewski, Jan, et al.
Published: (2023)
AdaPerceiver: Transformers with Adaptive Width, Depth, and Tokens
by: Jajal, Purvish, et al.
Published: (2025)
by: Jajal, Purvish, et al.
Published: (2025)
Uncertainty-Aware Token Importance Estimation in Spiking Transformers
by: Liu, Wenxuan, et al.
Published: (2026)
by: Liu, Wenxuan, et al.
Published: (2026)
DeSparsify: Adversarial Attack Against Token Sparsification Mechanisms in Vision Transformers
by: Yehezkel, Oryan, et al.
Published: (2024)
by: Yehezkel, Oryan, et al.
Published: (2024)
Artificial intelligence application in lymphoma diagnosis: from Convolutional Neural Network to Vision Transformer
by: Rivera, Daniel, et al.
Published: (2025)
by: Rivera, Daniel, et al.
Published: (2025)
SkipViT: Speeding Up Vision Transformers with a Token-Level Skip Connection
by: Ataiefard, Foozhan, et al.
Published: (2024)
by: Ataiefard, Foozhan, et al.
Published: (2024)
Native Segmentation Vision Transformers
by: Brasó, Guillem, et al.
Published: (2025)
by: Brasó, Guillem, et al.
Published: (2025)
Don't Look Twice: Faster Video Transformers with Run-Length Tokenization
by: Choudhury, Rohan, et al.
Published: (2024)
by: Choudhury, Rohan, et al.
Published: (2024)
Iwin Transformer: Hierarchical Vision Transformer using Interleaved Windows
by: Huo, Simin, et al.
Published: (2025)
by: Huo, Simin, et al.
Published: (2025)
Tokenizing Buildings: A Transformer for Layout Synthesis
by: de Guevara, Manuel Ladron, et al.
Published: (2025)
by: de Guevara, Manuel Ladron, et al.
Published: (2025)
VORTEX: Challenging CNNs at Texture Recognition by using Vision Transformers with Orderless and Randomized Token Encodings
by: Scabini, Leonardo, et al.
Published: (2025)
by: Scabini, Leonardo, et al.
Published: (2025)
Decorrelation Speeds Up Vision Transformers
by: Carrigg, Kieran, et al.
Published: (2025)
by: Carrigg, Kieran, et al.
Published: (2025)
Slicing Vision Transformer for Flexible Inference
by: Zhang, Yitian, et al.
Published: (2024)
by: Zhang, Yitian, et al.
Published: (2024)
RAViT: Resolution-Adaptive Vision Transformer
by: Guidez, Martial, et al.
Published: (2026)
by: Guidez, Martial, et al.
Published: (2026)
Rotary Position Embedding for Vision Transformer
by: Heo, Byeongho, et al.
Published: (2024)
by: Heo, Byeongho, et al.
Published: (2024)
DPL: Decoupled Prototype Learning for Enhancing Robustness of Vision-Language Transformers to Missing Modalities
by: Lu, Jueqing, et al.
Published: (2025)
by: Lu, Jueqing, et al.
Published: (2025)
Transformers with Joint Tokens and Local-Global Attention for Efficient Human Pose Estimation
by: Kinfu, Kaleab A., et al.
Published: (2025)
by: Kinfu, Kaleab A., et al.
Published: (2025)
BATR-FST: Bi-Level Adaptive Token Refinement for Few-Shot Transformers
by: Al-Habib, Mohammed, et al.
Published: (2025)
by: Al-Habib, Mohammed, et al.
Published: (2025)
VFM-VAE: Vision Foundation Models Can Be Good Tokenizers for Latent Diffusion Models
by: Bi, Tianci, et al.
Published: (2025)
by: Bi, Tianci, et al.
Published: (2025)
NiNformer: A Network in Network Transformer with Token Mixing Generated Gating Function
by: Abdullah, Abdullah Nazhat, et al.
Published: (2024)
by: Abdullah, Abdullah Nazhat, et al.
Published: (2024)
Compact Vision Transformer by Reduction of Kernel Complexity
by: Wang, Yancheng, et al.
Published: (2025)
by: Wang, Yancheng, et al.
Published: (2025)
Split Adaptation for Pre-trained Vision Transformers
by: Wang, Lixu, et al.
Published: (2025)
by: Wang, Lixu, et al.
Published: (2025)
DASViT: Differentiable Architecture Search for Vision Transformer
by: Wu, Pengjin, et al.
Published: (2025)
by: Wu, Pengjin, et al.
Published: (2025)
Similar Items
-
Why Prototypes Collapse: Diagnosing and Preventing Partial Collapse in Prototypical Self-Supervised Learning
by: Arteaga, Gabriel Y., et al.
Published: (2025) -
Suppressing Non-Semantic Noise in Masked Image Modeling Representations
by: Hjelkrem-Tan, Martine, et al.
Published: (2026) -
Differentiable Hierarchical Visual Tokenization
by: Aasan, Marius, et al.
Published: (2025) -
A Spitting Image: Modular Superpixel Tokenization in Vision Transformers
by: Aasan, Marius, et al.
Published: (2024) -
Self-Organizing Visual Prototypes for Non-Parametric Representation Learning
by: Silva, Thalles, et al.
Published: (2025)