ViR: Towards Efficient Vision Retention Backbones
Fuente:
arXiv
Salvato in:
| Autori principali: | Hatamizadeh, Ali, Ranzinger, Michael, Lan, Shiyi, Alvarez, Jose M., Fidler, Sanja, Kautz, Jan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MambaVision: A Hybrid Mamba-Transformer Vision Backbone
di: Hatamizadeh, Ali, et al.
Pubblicazione: (2024)
di: Hatamizadeh, Ali, et al.
Pubblicazione: (2024)
FasterViT: Fast Vision Transformers with Hierarchical Attention
di: Hatamizadeh, Ali, et al.
Pubblicazione: (2023)
di: Hatamizadeh, Ali, et al.
Pubblicazione: (2023)
DiffiT: Diffusion Vision Transformers for Image Generation
di: Hatamizadeh, Ali, et al.
Pubblicazione: (2023)
di: Hatamizadeh, Ali, et al.
Pubblicazione: (2023)
RADIOv2.5: Improved Baselines for Agglomerative Vision Foundation Models
di: Heinrich, Greg, et al.
Pubblicazione: (2024)
di: Heinrich, Greg, et al.
Pubblicazione: (2024)
Beyond MACs: Hardware Efficient Architecture Design for Vision Backbones
di: Nottebaum, Moritz, et al.
Pubblicazione: (2026)
di: Nottebaum, Moritz, et al.
Pubblicazione: (2026)
CPUBone: Efficient Vision Backbone Design for Devices with Low Parallelization Capabilities
di: Nottebaum, Moritz, et al.
Pubblicazione: (2026)
di: Nottebaum, Moritz, et al.
Pubblicazione: (2026)
AM-RADIO: Agglomerative Vision Foundation Model -- Reduce All Domains Into One
di: Ranzinger, Mike, et al.
Pubblicazione: (2023)
di: Ranzinger, Mike, et al.
Pubblicazione: (2023)
DriveCritic: Towards Context-Aware, Human-Aligned Evaluation for Autonomous Driving with Vision-Language Models
di: Song, Jingyu, et al.
Pubblicazione: (2025)
di: Song, Jingyu, et al.
Pubblicazione: (2025)
Revisiting the Integration of Convolution and Attention for Vision Backbone
di: Zhu, Lei, et al.
Pubblicazione: (2024)
di: Zhu, Lei, et al.
Pubblicazione: (2024)
MDP: Multidimensional Vision Model Pruning with Latency Constraint
di: Sun, Xinglong, et al.
Pubblicazione: (2025)
di: Sun, Xinglong, et al.
Pubblicazione: (2025)
DriveSuprim: Towards Precise Trajectory Selection for End-to-End Planning
di: Yao, Wenhao, et al.
Pubblicazione: (2025)
di: Yao, Wenhao, et al.
Pubblicazione: (2025)
RadarGen: Automotive Radar Point Cloud Generation from Cameras
di: Borreda, Tomer, et al.
Pubblicazione: (2025)
di: Borreda, Tomer, et al.
Pubblicazione: (2025)
LF-ViT: Reducing Spatial Redundancy in Vision Transformer for Efficient Image Recognition
di: Hu, Youbing, et al.
Pubblicazione: (2024)
di: Hu, Youbing, et al.
Pubblicazione: (2024)
GTP-ViT: Efficient Vision Transformers via Graph-based Token Propagation
di: Xu, Xuwei, et al.
Pubblicazione: (2023)
di: Xu, Xuwei, et al.
Pubblicazione: (2023)
Vision Backbone Efficient Selection for Image Classification in Low-Data Regimes
di: Guerin, Joris, et al.
Pubblicazione: (2024)
di: Guerin, Joris, et al.
Pubblicazione: (2024)
JetViT: Efficient High-Resolution Vision Transformer with Post-Training Attention Search
di: Zou, Dongyun, et al.
Pubblicazione: (2026)
di: Zou, Dongyun, et al.
Pubblicazione: (2026)
Trio-ViT: Post-Training Quantization and Acceleration for Softmax-Free Efficient Vision Transformer
di: Shi, Huihong, et al.
Pubblicazione: (2024)
di: Shi, Huihong, et al.
Pubblicazione: (2024)
Exploring Camera Encoder Designs for Autonomous Driving Perception
di: Lakshmanan, Barath, et al.
Pubblicazione: (2024)
di: Lakshmanan, Barath, et al.
Pubblicazione: (2024)
Attention Retention for Continual Learning with Vision Transformers
di: Lu, Yue, et al.
Pubblicazione: (2026)
di: Lu, Yue, et al.
Pubblicazione: (2026)
Vision-LSTM: xLSTM as Generic Vision Backbone
di: Alkin, Benedikt, et al.
Pubblicazione: (2024)
di: Alkin, Benedikt, et al.
Pubblicazione: (2024)
Tiny-ViT: A Compact Vision Transformer for Efficient and Explainable Potato Leaf Disease Classification
di: Mia, Shakil, et al.
Pubblicazione: (2026)
di: Mia, Shakil, et al.
Pubblicazione: (2026)
LuxDiT: Lighting Estimation with Video Diffusion Transformer
di: Liang, Ruofan, et al.
Pubblicazione: (2025)
di: Liang, Ruofan, et al.
Pubblicazione: (2025)
CoMViT: An Efficient Vision Backbone for Supervised Classification in Medical Imaging
di: Safdar, Aon, et al.
Pubblicazione: (2025)
di: Safdar, Aon, et al.
Pubblicazione: (2025)
ViLaCD-R1: A Vision-Language Framework for Semantic Change Detection in Remote Sensing
di: Ma, Xingwei, et al.
Pubblicazione: (2025)
di: Ma, Xingwei, et al.
Pubblicazione: (2025)
ViGoR: Improving Visual Grounding of Large Vision Language Models with Fine-Grained Reward Modeling
di: Yan, Siming, et al.
Pubblicazione: (2024)
di: Yan, Siming, et al.
Pubblicazione: (2024)
ViT-Lens: Towards Omni-modal Representations
di: Lei, Weixian, et al.
Pubblicazione: (2023)
di: Lei, Weixian, et al.
Pubblicazione: (2023)
MAP: Unleashing Hybrid Mamba-Transformer Vision Backbone's Potential with Masked Autoregressive Pretraining
di: Liu, Yunze, et al.
Pubblicazione: (2024)
di: Liu, Yunze, et al.
Pubblicazione: (2024)
Photorealistic Object Insertion with Diffusion-Guided Inverse Rendering
di: Liang, Ruofan, et al.
Pubblicazione: (2024)
di: Liang, Ruofan, et al.
Pubblicazione: (2024)
FeatSharp: Your Vision Model Features, Sharper
di: Ranzinger, Mike, et al.
Pubblicazione: (2025)
di: Ranzinger, Mike, et al.
Pubblicazione: (2025)
VideoPanda: Video Panoramic Diffusion with Multi-view Attention
di: Xie, Kevin, et al.
Pubblicazione: (2025)
di: Xie, Kevin, et al.
Pubblicazione: (2025)
HydraViT: Stacking Heads for a Scalable ViT
di: Haberer, Janek, et al.
Pubblicazione: (2024)
di: Haberer, Janek, et al.
Pubblicazione: (2024)
HAVIR: HierArchical Vision to Image Reconstruction using CLIP-Guided Versatile Diffusion
di: Zhang, Shiyi, et al.
Pubblicazione: (2025)
di: Zhang, Shiyi, et al.
Pubblicazione: (2025)
Socratic-MCTS: Test-Time Visual Reasoning by Asking the Right Questions
di: Acuna, David, et al.
Pubblicazione: (2025)
di: Acuna, David, et al.
Pubblicazione: (2025)
SAC-ViT: Semantic-Aware Clustering Vision Transformer with Early Exit
di: Hu, Youbing, et al.
Pubblicazione: (2025)
di: Hu, Youbing, et al.
Pubblicazione: (2025)
ViT-Linearizer: Distilling Quadratic Knowledge into Linear-Time Vision Models
di: Wei, Guoyizhe, et al.
Pubblicazione: (2025)
di: Wei, Guoyizhe, et al.
Pubblicazione: (2025)
ButterflyViT: 354$\times$ Expert Compression for Edge Vision Transformers
di: Karmore, Aryan
Pubblicazione: (2026)
di: Karmore, Aryan
Pubblicazione: (2026)
Multi-Dimensional Pruning: Joint Channel, Layer and Block Pruning with Latency Constraint
di: Sun, Xinglong, et al.
Pubblicazione: (2024)
di: Sun, Xinglong, et al.
Pubblicazione: (2024)
GreedyViG: Dynamic Axial Graph Construction for Efficient Vision GNNs
di: Munir, Mustafa, et al.
Pubblicazione: (2024)
di: Munir, Mustafa, et al.
Pubblicazione: (2024)
Empowering Backbone Models for Visual Text Generation with Input Granularity Control and Glyph-Aware Training
di: Li, Wenbo, et al.
Pubblicazione: (2024)
di: Li, Wenbo, et al.
Pubblicazione: (2024)
TAP-SLF: Parameter-Efficient Adaptation of Vision Foundation Models for Multi-Task Ultrasound Image Analysis
di: Wan, Hui, et al.
Pubblicazione: (2026)
di: Wan, Hui, et al.
Pubblicazione: (2026)
Documenti analoghi
-
MambaVision: A Hybrid Mamba-Transformer Vision Backbone
di: Hatamizadeh, Ali, et al.
Pubblicazione: (2024) -
FasterViT: Fast Vision Transformers with Hierarchical Attention
di: Hatamizadeh, Ali, et al.
Pubblicazione: (2023) -
DiffiT: Diffusion Vision Transformers for Image Generation
di: Hatamizadeh, Ali, et al.
Pubblicazione: (2023) -
RADIOv2.5: Improved Baselines for Agglomerative Vision Foundation Models
di: Heinrich, Greg, et al.
Pubblicazione: (2024) -
Beyond MACs: Hardware Efficient Architecture Design for Vision Backbones
di: Nottebaum, Moritz, et al.
Pubblicazione: (2026)