FasterViT: Fast Vision Transformers with Hierarchical Attention
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hatamizadeh, Ali, Heinrich, Greg, Yin, Hongxu, Tao, Andrew, Alvarez, Jose M., Kautz, Jan, Molchanov, Pavlo |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MambaVision: A Hybrid Mamba-Transformer Vision Backbone
par: Hatamizadeh, Ali, et autres
Publié: (2024)
par: Hatamizadeh, Ali, et autres
Publié: (2024)
AM-RADIO: Agglomerative Vision Foundation Model -- Reduce All Domains Into One
par: Ranzinger, Mike, et autres
Publié: (2023)
par: Ranzinger, Mike, et autres
Publié: (2023)
RADIOv2.5: Improved Baselines for Agglomerative Vision Foundation Models
par: Heinrich, Greg, et autres
Publié: (2024)
par: Heinrich, Greg, et autres
Publié: (2024)
FeatSharp: Your Vision Model Features, Sharper
par: Ranzinger, Mike, et autres
Publié: (2025)
par: Ranzinger, Mike, et autres
Publié: (2025)
ViR: Towards Efficient Vision Retention Backbones
par: Hatamizadeh, Ali, et autres
Publié: (2023)
par: Hatamizadeh, Ali, et autres
Publié: (2023)
C-RADIOv4 (Tech Report)
par: Ranzinger, Mike, et autres
Publié: (2026)
par: Ranzinger, Mike, et autres
Publié: (2026)
DiffiT: Diffusion Vision Transformers for Image Generation
par: Hatamizadeh, Ali, et autres
Publié: (2023)
par: Hatamizadeh, Ali, et autres
Publié: (2023)
Step Out and Seek Around: On Warm-Start Training with Incremental Data
par: Shen, Maying, et autres
Publié: (2024)
par: Shen, Maying, et autres
Publié: (2024)
Adaptive Sharpness-Aware Pruning for Robust Sparse Networks
par: Bair, Anna, et autres
Publié: (2023)
par: Bair, Anna, et autres
Publié: (2023)
LITA: Language Instructed Temporal-Localization Assistant
par: Huang, De-An, et autres
Publié: (2024)
par: Huang, De-An, et autres
Publié: (2024)
VILA: On Pre-training for Visual Language Models
par: Lin, Ji, et autres
Publié: (2023)
par: Lin, Ji, et autres
Publié: (2023)
Scaling Vision Pre-Training to 4K Resolution
par: Shi, Baifeng, et autres
Publié: (2025)
par: Shi, Baifeng, et autres
Publié: (2025)
Advancing Weight and Channel Sparsification with Enhanced Saliency
par: Sun, Xinglong, et autres
Publié: (2025)
par: Sun, Xinglong, et autres
Publié: (2025)
PHI-S: Distribution Balancing for Label-Free Multi-Teacher Distillation
par: Ranzinger, Mike, et autres
Publié: (2024)
par: Ranzinger, Mike, et autres
Publié: (2024)
3D Aware Region Prompted Vision Language Model
par: Cheng, An-Chieh, et autres
Publié: (2025)
par: Cheng, An-Chieh, et autres
Publié: (2025)
Attend Before Attention: Efficient and Scalable Video Understanding via Autoregressive Gazing
par: Shi, Baifeng, et autres
Publié: (2026)
par: Shi, Baifeng, et autres
Publié: (2026)
VILA$^2$: VILA Augmented VILA
par: Fang, Yunhao, et autres
Publié: (2024)
par: Fang, Yunhao, et autres
Publié: (2024)
X-VILA: Cross-Modality Alignment for Large Language Model
par: Ye, Hanrong, et autres
Publié: (2024)
par: Ye, Hanrong, et autres
Publié: (2024)
JetViT: Efficient High-Resolution Vision Transformer with Post-Training Attention Search
par: Zou, Dongyun, et autres
Publié: (2026)
par: Zou, Dongyun, et autres
Publié: (2026)
Grounded 3D-Aware Spatial Vision-Language Modeling
par: Cheng, An-Chieh, et autres
Publié: (2026)
par: Cheng, An-Chieh, et autres
Publié: (2026)
FastPose-ViT: A Vision Transformer for Real-Time Spacecraft Pose Estimation
par: Ancey, Pierre, et autres
Publié: (2025)
par: Ancey, Pierre, et autres
Publié: (2025)
Vision Transformers with Hierarchical Attention
par: Liu, Yun, et autres
Publié: (2021)
par: Liu, Yun, et autres
Publié: (2021)
ViT-AdaLA: Adapting Vision Transformers with Linear Attention
par: Li, Yifan, et autres
Publié: (2026)
par: Li, Yifan, et autres
Publié: (2026)
SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models
par: Cheng, An-Chieh, et autres
Publié: (2024)
par: Cheng, An-Chieh, et autres
Publié: (2024)
ViTAR: Vision Transformer with Any Resolution
par: Fan, Qihang, et autres
Publié: (2024)
par: Fan, Qihang, et autres
Publié: (2024)
Stateful Token Reduction for Long-Video Hybrid VLMs
par: Jiang, Jindong, et autres
Publié: (2026)
par: Jiang, Jindong, et autres
Publié: (2026)
COIN: Control-Inpainting Diffusion Prior for Human and Camera Motion Estimation
par: Li, Jiefeng, et autres
Publié: (2024)
par: Li, Jiefeng, et autres
Publié: (2024)
ReViT: Enhancing Vision Transformers Feature Diversity with Attention Residual Connections
par: Diko, Anxhelo, et autres
Publié: (2024)
par: Diko, Anxhelo, et autres
Publié: (2024)
ThinkingViT: Matryoshka Thinking Vision Transformer for Elastic Inference
par: Hojjat, Ali, et autres
Publié: (2025)
par: Hojjat, Ali, et autres
Publié: (2025)
FastViDAR: Real-Time Omnidirectional Depth Estimation via Alternative Hierarchical Attention
par: Zhao, Hangtian, et autres
Publié: (2025)
par: Zhao, Hangtian, et autres
Publié: (2025)
Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders
par: Jiang, Yitong, et autres
Publié: (2026)
par: Jiang, Yitong, et autres
Publié: (2026)
MicroViT: A Vision Transformer with Low Complexity Self Attention for Edge Device
par: Setyawan, Novendra, et autres
Publié: (2025)
par: Setyawan, Novendra, et autres
Publié: (2025)
Castling-ViT: Compressing Self-Attention via Switching Towards Linear-Angular Attention at Vision Transformer Inference
par: You, Haoran, et autres
Publié: (2022)
par: You, Haoran, et autres
Publié: (2022)
HIRI-ViT: Scaling Vision Transformer with High Resolution Inputs
par: Yao, Ting, et autres
Publié: (2024)
par: Yao, Ting, et autres
Publié: (2024)
TwinTURBO: Semi-Supervised Fine-Tuning of Foundation Models via Mutual Information Decompositions for Downstream Task and Latent Spaces
par: Quétant, Guillaume, et autres
Publié: (2025)
par: Quétant, Guillaume, et autres
Publié: (2025)
ADFQ-ViT: Activation-Distribution-Friendly Post-Training Quantization for Vision Transformers
par: Jiang, Yanfeng, et autres
Publié: (2024)
par: Jiang, Yanfeng, et autres
Publié: (2024)
ViT-5: Vision Transformers for The Mid-2020s
par: Wang, Feng, et autres
Publié: (2026)
par: Wang, Feng, et autres
Publié: (2026)
LocalViT: Analyzing Locality in Vision Transformers
par: Li, Yawei, et autres
Publié: (2021)
par: Li, Yawei, et autres
Publié: (2021)
FTerViT: Fully Ternary Vision Transformer
par: Ruciński, Szymon, et autres
Publié: (2026)
par: Ruciński, Szymon, et autres
Publié: (2026)
Retina Vision Transformer (RetinaViT): Introducing Scaled Patches into Vision Transformers
par: Shu, Yuyang, et autres
Publié: (2024)
par: Shu, Yuyang, et autres
Publié: (2024)
Documents similaires
-
MambaVision: A Hybrid Mamba-Transformer Vision Backbone
par: Hatamizadeh, Ali, et autres
Publié: (2024) -
AM-RADIO: Agglomerative Vision Foundation Model -- Reduce All Domains Into One
par: Ranzinger, Mike, et autres
Publié: (2023) -
RADIOv2.5: Improved Baselines for Agglomerative Vision Foundation Models
par: Heinrich, Greg, et autres
Publié: (2024) -
FeatSharp: Your Vision Model Features, Sharper
par: Ranzinger, Mike, et autres
Publié: (2025) -
ViR: Towards Efficient Vision Retention Backbones
par: Hatamizadeh, Ali, et autres
Publié: (2023)