Positional Encodings Anchor Spatial Structure in Vision Transformers: A Geometric Perspective on Robustness
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Mannes, Mahmoud |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AnchorFormer: Differentiable Anchor Attention for Efficient Vision Transformer
par: Shan, Jiquan, et autres
Publié: (2025)
par: Shan, Jiquan, et autres
Publié: (2025)
Parabolic Position Encoding: Vision-Centric, Principled, Extrapolatable, General
par: Øhrstrøm, Christoffer Koo, et autres
Publié: (2026)
par: Øhrstrøm, Christoffer Koo, et autres
Publié: (2026)
SATA: Spatial Autocorrelation Token Analysis for Enhancing the Robustness of Vision Transformers
par: Nikzad, Nick, et autres
Publié: (2024)
par: Nikzad, Nick, et autres
Publié: (2024)
Improving Position Encoding of Transformers for Multivariate Time Series Classification
par: Foumani, Navid Mohammadi, et autres
Publié: (2023)
par: Foumani, Navid Mohammadi, et autres
Publié: (2023)
Rotary Position Embedding for Vision Transformer
par: Heo, Byeongho, et autres
Publié: (2024)
par: Heo, Byeongho, et autres
Publié: (2024)
Beyond Gaussian Bottlenecks: Topologically Aligned Encoding of Vision-Transformer Feature Spaces
par: Bond, Andrew, et autres
Publié: (2026)
par: Bond, Andrew, et autres
Publié: (2026)
Revisiting Transformation Invariant Geometric Deep Learning: An Initial Representation Perspective
par: Zhang, Ziwei, et autres
Publié: (2021)
par: Zhang, Ziwei, et autres
Publié: (2021)
SeqPE: Transformer with Sequential Position Encoding
par: Li, Huayang, et autres
Publié: (2025)
par: Li, Huayang, et autres
Publié: (2025)
Maximizing the Position Embedding for Vision Transformers with Global Average Pooling
par: Lee, Wonjun, et autres
Publié: (2025)
par: Lee, Wonjun, et autres
Publié: (2025)
LieRE: Lie Rotational Positional Encodings
par: Ostmeier, Sophie, et autres
Publié: (2024)
par: Ostmeier, Sophie, et autres
Publié: (2024)
Leveraging Registers in Vision Transformers for Robust Adaptation
par: Yellapragada, Srikar, et autres
Publié: (2025)
par: Yellapragada, Srikar, et autres
Publié: (2025)
Inducing Spatial Locality in Vision Transformers through the Training Protocol
par: Toledo, Eduardo Santiago, et autres
Publié: (2026)
par: Toledo, Eduardo Santiago, et autres
Publié: (2026)
From Edges to Depth: Probing the Spatial Hierarchy in Vision Transformers
par: Sanghavi, Jainum
Publié: (2026)
par: Sanghavi, Jainum
Publié: (2026)
ViTaPEs: Visuotactile Position Encodings for Cross-Modal Alignment in Multimodal Transformers
par: Lygerakis, Fotios, et autres
Publié: (2025)
par: Lygerakis, Fotios, et autres
Publié: (2025)
Anisotropic Fourier Features for Positional Encoding in Medical Imaging
par: Jabareen, Nabil, et autres
Publié: (2025)
par: Jabareen, Nabil, et autres
Publié: (2025)
Approximate Nullspace Augmented Finetuning for Robust Vision Transformers
par: Liu, Haoyang, et autres
Publié: (2024)
par: Liu, Haoyang, et autres
Publié: (2024)
A Geometric Perspective on Diffusion Models
par: Chen, Defang, et autres
Publié: (2023)
par: Chen, Defang, et autres
Publié: (2023)
Mechanistic Understandings of Representation Vulnerabilities and Engineering Robust Vision Transformers
par: Islam, Chashi Mahiul, et autres
Publié: (2025)
par: Islam, Chashi Mahiul, et autres
Publié: (2025)
LightMedSeg: Lightweight 3D Medical Image Segmentation with Learned Spatial Anchors
par: Tyagi, Kavyansh, et autres
Publié: (2026)
par: Tyagi, Kavyansh, et autres
Publié: (2026)
Hyperbolic Structured Classification for Robust Single Positive Multi-label Learning
par: Lin, Yiming, et autres
Publié: (2025)
par: Lin, Yiming, et autres
Publié: (2025)
Energy-Regularized Spatial Masking: A Novel Approach to Enhancing Robustness and Interpretability in Vision Models
par: Devynck, Tom, et autres
Publié: (2026)
par: Devynck, Tom, et autres
Publié: (2026)
A Language Anchor-Guided Method for Robust Noisy Domain Generalization
par: Dai, Zilin, et autres
Publié: (2025)
par: Dai, Zilin, et autres
Publié: (2025)
PEPS: Positional Encoding Projected Sampling -- Extended
par: Perez, Guillaume, et autres
Publié: (2026)
par: Perez, Guillaume, et autres
Publié: (2026)
AEGIS: Anchor-Enforced Gradient Isolation for Knowledge-Preserving Vision-Language-Action Fine-Tuning
par: Singh, Guransh
Publié: (2026)
par: Singh, Guransh
Publié: (2026)
RayRoPE: Projective Ray Positional Encoding for Multi-view Attention
par: Wu, Yu, et autres
Publié: (2026)
par: Wu, Yu, et autres
Publié: (2026)
The Effects of Grouped Structural Global Pruning of Vision Transformers on Domain Generalisation
par: Riaz, Hamza, et autres
Publié: (2025)
par: Riaz, Hamza, et autres
Publié: (2025)
Language-Driven Anchors for Zero-Shot Adversarial Robustness
par: Li, Xiao, et autres
Publié: (2023)
par: Li, Xiao, et autres
Publié: (2023)
SpecFormer: Guarding Vision Transformer Robustness via Maximum Singular Value Penalization
par: Hu, Xixu, et autres
Publié: (2024)
par: Hu, Xixu, et autres
Publié: (2024)
DPL: Decoupled Prototype Learning for Enhancing Robustness of Vision-Language Transformers to Missing Modalities
par: Lu, Jueqing, et autres
Publié: (2025)
par: Lu, Jueqing, et autres
Publié: (2025)
EaqVLA: Encoding-aligned Quantization for Vision-Language-Action Models
par: Jiang, Feng, et autres
Publié: (2025)
par: Jiang, Feng, et autres
Publié: (2025)
PEVLM: Parallel Encoding for Vision-Language Models
par: Kang, Letian, et autres
Publié: (2025)
par: Kang, Letian, et autres
Publié: (2025)
CCAR: Intrinsic Robustness as an Emergent Geometric Property
par: Samanta, Akash, et autres
Publié: (2026)
par: Samanta, Akash, et autres
Publié: (2026)
NPNet: A Non-Parametric Network with Adaptive Gaussian-Fourier Positional Encoding for 3D Classification and Segmentation
par: Saeid, Mohammad, et autres
Publié: (2026)
par: Saeid, Mohammad, et autres
Publié: (2026)
STR-Cert: Robustness Certification for Deep Text Recognition on Deep Learning Pipelines and Vision Transformers
par: Shao, Daqian, et autres
Publié: (2023)
par: Shao, Daqian, et autres
Publié: (2023)
PatchGuard: Adversarially Robust Anomaly Detection and Localization through Vision Transformers and Pseudo Anomalies
par: Nafez, Mojtaba, et autres
Publié: (2025)
par: Nafez, Mojtaba, et autres
Publié: (2025)
Vision-Language Models Encode Clinical Guidelines for Concept-Based Medical Reasoning
par: Harmanani, Mohamed, et autres
Publié: (2026)
par: Harmanani, Mohamed, et autres
Publié: (2026)
On Optimal Sampling for Learning SDF Using MLPs Equipped with Positional Encoding
par: Lin, Guying, et autres
Publié: (2024)
par: Lin, Guying, et autres
Publié: (2024)
Robustness of Structured Data Extraction from Perspectively Distorted Documents
par: Nakada, Hyakka, et autres
Publié: (2025)
par: Nakada, Hyakka, et autres
Publié: (2025)
VORTEX: Challenging CNNs at Texture Recognition by using Vision Transformers with Orderless and Randomized Token Encodings
par: Scabini, Leonardo, et autres
Publié: (2025)
par: Scabini, Leonardo, et autres
Publié: (2025)
ZACH-ViT: A Zero-Token Vision Transformer with ShuffleStrides Data Augmentation for Robust Lung Ultrasound Classification
par: Angelakis, Athanasios, et autres
Publié: (2025)
par: Angelakis, Athanasios, et autres
Publié: (2025)
Documents similaires
-
AnchorFormer: Differentiable Anchor Attention for Efficient Vision Transformer
par: Shan, Jiquan, et autres
Publié: (2025) -
Parabolic Position Encoding: Vision-Centric, Principled, Extrapolatable, General
par: Øhrstrøm, Christoffer Koo, et autres
Publié: (2026) -
SATA: Spatial Autocorrelation Token Analysis for Enhancing the Robustness of Vision Transformers
par: Nikzad, Nick, et autres
Publié: (2024) -
Improving Position Encoding of Transformers for Multivariate Time Series Classification
par: Foumani, Navid Mohammadi, et autres
Publié: (2023) -
Rotary Position Embedding for Vision Transformer
par: Heo, Byeongho, et autres
Publié: (2024)