Vision Transformers Need More Than Registers
Fuente:
arXiv
Guardado en:
| Autores principales: | Shi, Cheng, Yu, Yizhou, Yang, Sibei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Vision Function Layer in Multimodal LLMs
por: Shi, Cheng, et al.
Publicado: (2025)
por: Shi, Cheng, et al.
Publicado: (2025)
Vision Transformers Need Registers
por: Darcet, Timothée, et al.
Publicado: (2023)
por: Darcet, Timothée, et al.
Publicado: (2023)
The devil is in the object boundary: towards annotation-free instance segmentation using Foundation Models
por: Shi, Cheng, et al.
Publicado: (2024)
por: Shi, Cheng, et al.
Publicado: (2024)
Vision Transformers Don't Need Trained Registers
por: Jiang, Nick, et al.
Publicado: (2025)
por: Jiang, Nick, et al.
Publicado: (2025)
No More Sibling Rivalry: Debiasing Human-Object Interaction Detection
por: Yang, Bin, et al.
Publicado: (2025)
por: Yang, Bin, et al.
Publicado: (2025)
WeaveTime: Stream from Earlier Frames into Emergent Memory in VideoLLMs
por: Zhang, Yulin, et al.
Publicado: (2026)
por: Zhang, Yulin, et al.
Publicado: (2026)
Plain-Det: A Plain Multi-Dataset Object Detector
por: Shi, Cheng, et al.
Publicado: (2024)
por: Shi, Cheng, et al.
Publicado: (2024)
Mamba-R: Vision Mamba ALSO Needs Registers
por: Wang, Feng, et al.
Publicado: (2024)
por: Wang, Feng, et al.
Publicado: (2024)
Vision Transformers with Self-Distilled Registers
por: Chen, Yinjie, et al.
Publicado: (2025)
por: Chen, Yinjie, et al.
Publicado: (2025)
Eyes Wide Open: Ego Proactive Video-LLM for Streaming Video
por: Zhang, Yulin, et al.
Publicado: (2025)
por: Zhang, Yulin, et al.
Publicado: (2025)
Rethinking Query-based Transformer for Continual Image Segmentation
por: Zhu, Yuchen, et al.
Publicado: (2025)
por: Zhu, Yuchen, et al.
Publicado: (2025)
TransXNet: Learning Both Global and Local Dynamics with a Dual Dynamic Token Mixer for Visual Recognition
por: Lou, Meng, et al.
Publicado: (2023)
por: Lou, Meng, et al.
Publicado: (2023)
Activation Quantization of Vision Encoders Needs Prefixing Registers
por: Kim, Seunghyeon, et al.
Publicado: (2025)
por: Kim, Seunghyeon, et al.
Publicado: (2025)
A Survey on Graph Neural Networks and Graph Transformers in Computer Vision: A Task-Oriented Perspective
por: Chen, Chaoqi, et al.
Publicado: (2022)
por: Chen, Chaoqi, et al.
Publicado: (2022)
Leveraging Registers in Vision Transformers for Robust Adaptation
por: Yellapragada, Srikar, et al.
Publicado: (2025)
por: Yellapragada, Srikar, et al.
Publicado: (2025)
More Than the Final Answer: Improving Visual Extraction and Logical Consistency in Vision-Language Models
por: Just, Hoang Anh, et al.
Publicado: (2025)
por: Just, Hoang Anh, et al.
Publicado: (2025)
GPO-V: Jailbreak Diffusion Vision Language Model by Global Probability Optimization
por: Pan, Yu, et al.
Publicado: (2026)
por: Pan, Yu, et al.
Publicado: (2026)
Discovering Influential Neuron Path in Vision Transformers
por: Wang, Yifan, et al.
Publicado: (2025)
por: Wang, Yifan, et al.
Publicado: (2025)
Curriculum Point Prompting for Weakly-Supervised Referring Image Segmentation
por: Dai, Qiyuan, et al.
Publicado: (2024)
por: Dai, Qiyuan, et al.
Publicado: (2024)
Free on the Fly: Enhancing Flexibility in Test-Time Adaptation with Online EM
por: Dai, Qiyuan, et al.
Publicado: (2025)
por: Dai, Qiyuan, et al.
Publicado: (2025)
SparX: A Sparse Cross-Layer Connection Mechanism for Hierarchical Vision Mamba and Transformer Networks
por: Lou, Meng, et al.
Publicado: (2024)
por: Lou, Meng, et al.
Publicado: (2024)
Why LVLMs Are More Prone to Hallucinations in Longer Responses: The Role of Context
por: Zheng, Ge, et al.
Publicado: (2025)
por: Zheng, Ge, et al.
Publicado: (2025)
More Than Positive and Negative: Communicating Fine Granularity in Medical Diagnosis
por: Peng, Xiangyu, et al.
Publicado: (2024)
por: Peng, Xiangyu, et al.
Publicado: (2024)
Part2Object: Hierarchical Unsupervised 3D Instance Segmentation
por: Shi, Cheng, et al.
Publicado: (2024)
por: Shi, Cheng, et al.
Publicado: (2024)
Hypergraph Vision Transformers: Images are More than Nodes, More than Edges
por: Fixelle, Joshua
Publicado: (2025)
por: Fixelle, Joshua
Publicado: (2025)
Adaptive Part Learning for Fine-Grained Generalized Category Discovery: A Plug-and-Play Enhancement
por: Dai, Qiyuan, et al.
Publicado: (2025)
por: Dai, Qiyuan, et al.
Publicado: (2025)
Parameters as Experts: Adapting Vision Models with Dynamic Parameter Routing
por: Lou, Meng, et al.
Publicado: (2026)
por: Lou, Meng, et al.
Publicado: (2026)
Augmenting Moment Retrieval: Zero-Dependency Two-Stage Learning
por: Wei, Zhengxuan, et al.
Publicado: (2025)
por: Wei, Zhengxuan, et al.
Publicado: (2025)
Zero-Ablation Overstates Register Content Dependence in DINO Vision Transformers
por: Parodi, Felipe, et al.
Publicado: (2026)
por: Parodi, Felipe, et al.
Publicado: (2026)
Registers Matter for Pixel-Space Diffusion Transformers
por: Starodubcev, Nikita, et al.
Publicado: (2026)
por: Starodubcev, Nikita, et al.
Publicado: (2026)
Do We Need Reformer for Vision? An Experimental Comparison with Vision Transformers
por: Bellaj, Ali El, et al.
Publicado: (2025)
por: Bellaj, Ali El, et al.
Publicado: (2025)
Representation Entanglement for Generation: Training Diffusion Transformers Is Much Easier Than You Think
por: Wu, Ge, et al.
Publicado: (2025)
por: Wu, Ge, et al.
Publicado: (2025)
There is More to Attention: Statistical Filtering Enhances Explanations in Vision Transformers
por: Ayyar, Meghna P, et al.
Publicado: (2025)
por: Ayyar, Meghna P, et al.
Publicado: (2025)
Sim-DETR: Unlock DETR for Temporal Sentence Grounding
por: Tang, Jiajin, et al.
Publicado: (2025)
por: Tang, Jiajin, et al.
Publicado: (2025)
VLDrive: Vision-Augmented Lightweight MLLMs for Efficient Language-grounded Autonomous Driving
por: Zhang, Ruifei, et al.
Publicado: (2025)
por: Zhang, Ruifei, et al.
Publicado: (2025)
More Than Memory Savings: Zeroth-Order Optimization Mitigates Forgetting in Continual Learning
por: Yu, Wanhao, et al.
Publicado: (2025)
por: Yu, Wanhao, et al.
Publicado: (2025)
Exploring How Generative MLLMs Perceive More Than CLIP with the Same Vision Encoder
por: Li, Siting, et al.
Publicado: (2024)
por: Li, Siting, et al.
Publicado: (2024)
An Image is Worth More Than 16x16 Patches: Exploring Transformers on Individual Pixels
por: Nguyen, Duy-Kien, et al.
Publicado: (2024)
por: Nguyen, Duy-Kien, et al.
Publicado: (2024)
MaTe: Images Are All You Need for Material Transfer via Diffusion Transformer
por: Huang, Nisha, et al.
Publicado: (2026)
por: Huang, Nisha, et al.
Publicado: (2026)
You Only Need Less Attention at Each Stage in Vision Transformers
por: Zhang, Shuoxi, et al.
Publicado: (2024)
por: Zhang, Shuoxi, et al.
Publicado: (2024)
Ejemplares similares
-
Vision Function Layer in Multimodal LLMs
por: Shi, Cheng, et al.
Publicado: (2025) -
Vision Transformers Need Registers
por: Darcet, Timothée, et al.
Publicado: (2023) -
The devil is in the object boundary: towards annotation-free instance segmentation using Foundation Models
por: Shi, Cheng, et al.
Publicado: (2024) -
Vision Transformers Don't Need Trained Registers
por: Jiang, Nick, et al.
Publicado: (2025) -
No More Sibling Rivalry: Debiasing Human-Object Interaction Detection
por: Yang, Bin, et al.
Publicado: (2025)