Vision Transformers Need Registers
Fuente:
arXiv
Saved in:
| Main Authors: | Darcet, Timothée, Oquab, Maxime, Mairal, Julien, Bojanowski, Piotr |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Cluster and Predict Latent Patches for Improved Masked Image Modeling
by: Darcet, Timothée, et al.
Published: (2025)
by: Darcet, Timothée, et al.
Published: (2025)
You Don't Need Domain-Specific Data Augmentations When Scaling Self-Supervised Learning
by: Moutakanni, Théo, et al.
Published: (2024)
by: Moutakanni, Théo, et al.
Published: (2024)
DINOv2 Meets Text: A Unified Framework for Image- and Pixel-Level Vision-Language Alignment
by: Jose, Cijo, et al.
Published: (2024)
by: Jose, Cijo, et al.
Published: (2024)
Automatic Data Curation for Self-Supervised Learning: A Clustering-Based Approach
by: Vo, Huy V., et al.
Published: (2024)
by: Vo, Huy V., et al.
Published: (2024)
Vision Transformers Need More Than Registers
by: Shi, Cheng, et al.
Published: (2026)
by: Shi, Cheng, et al.
Published: (2026)
DINOv2: Learning Robust Visual Features without Supervision
by: Oquab, Maxime, et al.
Published: (2023)
by: Oquab, Maxime, et al.
Published: (2023)
Vision Transformers Don't Need Trained Registers
by: Jiang, Nick, et al.
Published: (2025)
by: Jiang, Nick, et al.
Published: (2025)
Efficient Universal Perception Encoder
by: Zhu, Chenchen, et al.
Published: (2026)
by: Zhu, Chenchen, et al.
Published: (2026)
DINOv3
by: Siméoni, Oriane, et al.
Published: (2025)
by: Siméoni, Oriane, et al.
Published: (2025)
Revisiting [CLS] and Patch Token Interaction in Vision Transformers
by: Marouani, Alexis, et al.
Published: (2026)
by: Marouani, Alexis, et al.
Published: (2026)
Advancing human-centric AI for robust X-ray analysis through holistic self-supervised learning
by: Moutakanni, Théo, et al.
Published: (2024)
by: Moutakanni, Théo, et al.
Published: (2024)
Mamba-R: Vision Mamba ALSO Needs Registers
by: Wang, Feng, et al.
Published: (2024)
by: Wang, Feng, et al.
Published: (2024)
Vision Transformers with Self-Distilled Registers
by: Chen, Yinjie, et al.
Published: (2025)
by: Chen, Yinjie, et al.
Published: (2025)
Activation Quantization of Vision Encoders Needs Prefixing Registers
by: Kim, Seunghyeon, et al.
Published: (2025)
by: Kim, Seunghyeon, et al.
Published: (2025)
Leveraging Registers in Vision Transformers for Robust Adaptation
by: Yellapragada, Srikar, et al.
Published: (2025)
by: Yellapragada, Srikar, et al.
Published: (2025)
On Good Practices for Task-Specific Distillation of Large Pretrained Visual Models
by: Marrie, Juliette, et al.
Published: (2024)
by: Marrie, Juliette, et al.
Published: (2024)
LUDVIG: Learning-Free Uplifting of 2D Visual Features to Gaussian Splatting Scenes
by: Marrie, Juliette, et al.
Published: (2024)
by: Marrie, Juliette, et al.
Published: (2024)
Zero-Ablation Overstates Register Content Dependence in DINO Vision Transformers
by: Parodi, Felipe, et al.
Published: (2026)
by: Parodi, Felipe, et al.
Published: (2026)
Registers Matter for Pixel-Space Diffusion Transformers
by: Starodubcev, Nikita, et al.
Published: (2026)
by: Starodubcev, Nikita, et al.
Published: (2026)
Do We Need Reformer for Vision? An Experimental Comparison with Vision Transformers
by: Bellaj, Ali El, et al.
Published: (2025)
by: Bellaj, Ali El, et al.
Published: (2025)
MicroFlow: Domain-Specific Optical Flow for Ground Deformation Estimation in Seismic Events
by: Bertrand, Juliette, et al.
Published: (2025)
by: Bertrand, Juliette, et al.
Published: (2025)
Optimal transport unlocks end-to-end learning for single-molecule localization
by: Seailles, Romain, et al.
Published: (2025)
by: Seailles, Romain, et al.
Published: (2025)
You Only Need Less Attention at Each Stage in Vision Transformers
by: Zhang, Shuoxi, et al.
Published: (2024)
by: Zhang, Shuoxi, et al.
Published: (2024)
Global and Dense Embeddings of Earth: Major TOM Floating in the Latent Space
by: Czerkawski, Mikolaj, et al.
Published: (2024)
by: Czerkawski, Mikolaj, et al.
Published: (2024)
Multi-Token Prediction Needs Registers
by: Gerontopoulos, Anastasios, et al.
Published: (2025)
by: Gerontopoulos, Anastasios, et al.
Published: (2025)
Beyond MMSE: Enhancing PnP Restoration with ProxiMAP
by: Vert, Kenta, et al.
Published: (2026)
by: Vert, Kenta, et al.
Published: (2026)
Scale-invariant brain morphometry: application to sulcal depth
by: Dieudonné, Maxime, et al.
Published: (2025)
by: Dieudonné, Maxime, et al.
Published: (2025)
Do All Vision Transformers Need Registers? A Cross-Architectural Reassessment
by: Baxevanakis, Spiros, et al.
Published: (2026)
by: Baxevanakis, Spiros, et al.
Published: (2026)
YARD: Y-Architecture Register Decoding for Efficient Hallucination Mitigation in Large Vision-Language Models
by: Chen, Ting, et al.
Published: (2026)
by: Chen, Ting, et al.
Published: (2026)
Image Processing and Machine Learning for Hyperspectral Unmixing: An Overview and the HySUPP Python Package
by: Rasti, Behnood, et al.
Published: (2023)
by: Rasti, Behnood, et al.
Published: (2023)
Fast Semisupervised Unmixing Using Nonconvex Optimization
by: Rasti, Behnood, et al.
Published: (2024)
by: Rasti, Behnood, et al.
Published: (2024)
Unsupervised Imaging Inverse Problems with Diffusion Distribution Matching
by: Meanti, Giacomo, et al.
Published: (2025)
by: Meanti, Giacomo, et al.
Published: (2025)
Back to the Features: DINO as a Foundation for Video World Models
by: Baldassarre, Federico, et al.
Published: (2025)
by: Baldassarre, Federico, et al.
Published: (2025)
Do VLMs Need Vision Transformers? Evaluating State Space Models as Vision Encoders
by: Kuo, Shang-Jui Ray, et al.
Published: (2026)
by: Kuo, Shang-Jui Ray, et al.
Published: (2026)
Low-Rank Few-Shot Adaptation of Vision-Language Models
by: Zanella, Maxime, et al.
Published: (2024)
by: Zanella, Maxime, et al.
Published: (2024)
Boosting Vision-Language Models with Transduction
by: Zanella, Maxime, et al.
Published: (2024)
by: Zanella, Maxime, et al.
Published: (2024)
VGGT-$Ω$
by: Wang, Jianyuan, et al.
Published: (2026)
by: Wang, Jianyuan, et al.
Published: (2026)
Mapping Image Transformations Onto Pixel Processor Arrays
by: Bose, Laurie, et al.
Published: (2024)
by: Bose, Laurie, et al.
Published: (2024)
Online Gaussian Test-Time Adaptation of Vision-Language Models
by: Fuchs, Clément, et al.
Published: (2025)
by: Fuchs, Clément, et al.
Published: (2025)
Register assisted aggregation for Visual Place Recognition
by: Yu, Xuan, et al.
Published: (2024)
by: Yu, Xuan, et al.
Published: (2024)
Similar Items
-
Cluster and Predict Latent Patches for Improved Masked Image Modeling
by: Darcet, Timothée, et al.
Published: (2025) -
You Don't Need Domain-Specific Data Augmentations When Scaling Self-Supervised Learning
by: Moutakanni, Théo, et al.
Published: (2024) -
DINOv2 Meets Text: A Unified Framework for Image- and Pixel-Level Vision-Language Alignment
by: Jose, Cijo, et al.
Published: (2024) -
Automatic Data Curation for Self-Supervised Learning: A Clustering-Based Approach
by: Vo, Huy V., et al.
Published: (2024) -
Vision Transformers Need More Than Registers
by: Shi, Cheng, et al.
Published: (2026)