ViT-5: Vision Transformers for The Mid-2020s
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wang, Feng, Ren, Sucheng, Zhang, Tiezheng, Neskovic, Predrag, Bhattad, Anand, Xie, Cihang, Yuille, Alan |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
ViMix-14M: A Curated Multi-Source Video-Text Dataset with Long-Form, High-Quality Captions and Crawl-Free Access
von: Yang, Timing, et al.
Veröffentlicht: (2025)
von: Yang, Timing, et al.
Veröffentlicht: (2025)
M-VAR: Decoupled Scale-wise Autoregressive Modeling for High-Quality Image Generation
von: Ren, Sucheng, et al.
Veröffentlicht: (2024)
von: Ren, Sucheng, et al.
Veröffentlicht: (2024)
Rejuvenating image-GPT as Strong Visual Representation Learners
von: Ren, Sucheng, et al.
Veröffentlicht: (2023)
von: Ren, Sucheng, et al.
Veröffentlicht: (2023)
ARVideo: Autoregressive Pretraining for Self-Supervised Video Representation Learning
von: Ren, Sucheng, et al.
Veröffentlicht: (2024)
von: Ren, Sucheng, et al.
Veröffentlicht: (2024)
Mamba-R: Vision Mamba ALSO Needs Registers
von: Wang, Feng, et al.
Veröffentlicht: (2024)
von: Wang, Feng, et al.
Veröffentlicht: (2024)
SPFormer: Enhancing Vision Transformer with Superpixel Representation
von: Mei, Jieru, et al.
Veröffentlicht: (2024)
von: Mei, Jieru, et al.
Veröffentlicht: (2024)
Spiral RoPE: Rotate Your Rotary Positional Embeddings in the 2D Plane
von: Liu, Haoyu, et al.
Veröffentlicht: (2026)
von: Liu, Haoyu, et al.
Veröffentlicht: (2026)
Adventurer: Optimizing Vision Mamba Architecture Designs for Efficiency
von: Wang, Feng, et al.
Veröffentlicht: (2024)
von: Wang, Feng, et al.
Veröffentlicht: (2024)
Autoregressive Pretraining with Mamba in Vision
von: Ren, Sucheng, et al.
Veröffentlicht: (2024)
von: Ren, Sucheng, et al.
Veröffentlicht: (2024)
Grouping First, Attending Smartly: Training-Free Acceleration for Diffusion Transformers
von: Ren, Sucheng, et al.
Veröffentlicht: (2025)
von: Ren, Sucheng, et al.
Veröffentlicht: (2025)
Name That Part: 3D Part Segmentation and Naming
von: Paul, Soumava, et al.
Veröffentlicht: (2025)
von: Paul, Soumava, et al.
Veröffentlicht: (2025)
EA-ViT: Efficient Adaptation for Elastic Vision Transformer
von: Zhu, Chen, et al.
Veröffentlicht: (2025)
von: Zhu, Chen, et al.
Veröffentlicht: (2025)
From Pixels to Objects: A Hierarchical Approach for Part and Object Segmentation Using Local and Global Aggregation
von: Xie, Yunfei, et al.
Veröffentlicht: (2024)
von: Xie, Yunfei, et al.
Veröffentlicht: (2024)
ACC-ViT : Atrous Convolution's Comeback in Vision Transformers
von: Ibtehaz, Nabil, et al.
Veröffentlicht: (2024)
von: Ibtehaz, Nabil, et al.
Veröffentlicht: (2024)
ADFQ-ViT: Activation-Distribution-Friendly Post-Training Quantization for Vision Transformers
von: Jiang, Yanfeng, et al.
Veröffentlicht: (2024)
von: Jiang, Yanfeng, et al.
Veröffentlicht: (2024)
ViT-AdaLA: Adapting Vision Transformers with Linear Attention
von: Li, Yifan, et al.
Veröffentlicht: (2026)
von: Li, Yifan, et al.
Veröffentlicht: (2026)
IML-ViT: Benchmarking Image Manipulation Localization by Vision Transformer
von: Ma, Xiaochen, et al.
Veröffentlicht: (2023)
von: Ma, Xiaochen, et al.
Veröffentlicht: (2023)
Dictionary-based Framework for Interpretable and Consistent Object Parsing
von: Zhang, Tiezheng, et al.
Veröffentlicht: (2025)
von: Zhang, Tiezheng, et al.
Veröffentlicht: (2025)
ViT-CoMer: Vision Transformer with Convolutional Multi-scale Feature Interaction for Dense Predictions
von: Xia, Chunlong, et al.
Veröffentlicht: (2024)
von: Xia, Chunlong, et al.
Veröffentlicht: (2024)
Medical Vision Generalist: Unifying Medical Imaging Tasks in Context
von: Ren, Sucheng, et al.
Veröffentlicht: (2024)
von: Ren, Sucheng, et al.
Veröffentlicht: (2024)
ViT-Explainer: An Interactive Walkthrough of the Vision Transformer Pipeline
von: Hernandez, Juan Manuel, et al.
Veröffentlicht: (2026)
von: Hernandez, Juan Manuel, et al.
Veröffentlicht: (2026)
Filter & Align: Leveraging Human Knowledge to Curate Image-Text Data
von: Zhang, Lei, et al.
Veröffentlicht: (2023)
von: Zhang, Lei, et al.
Veröffentlicht: (2023)
ViT-FIQA: Assessing Face Image Quality using Vision Transformers
von: Atzori, Andrea, et al.
Veröffentlicht: (2025)
von: Atzori, Andrea, et al.
Veröffentlicht: (2025)
MPTQ-ViT: Mixed-Precision Post-Training Quantization for Vision Transformer
von: Tai, Yu-Shan, et al.
Veröffentlicht: (2024)
von: Tai, Yu-Shan, et al.
Veröffentlicht: (2024)
ViT-1.58b: Mobile Vision Transformers in the 1-bit Era
von: Yuan, Zhengqing, et al.
Veröffentlicht: (2024)
von: Yuan, Zhengqing, et al.
Veröffentlicht: (2024)
HIRI-ViT: Scaling Vision Transformer with High Resolution Inputs
von: Yao, Ting, et al.
Veröffentlicht: (2024)
von: Yao, Ting, et al.
Veröffentlicht: (2024)
VAT: Vision Action Transformer by Unlocking Full Representation of ViT
von: Li, Wenhao, et al.
Veröffentlicht: (2025)
von: Li, Wenhao, et al.
Veröffentlicht: (2025)
Localization vs. Semantics: Visual Representations in Unimodal and Multimodal Models
von: Li, Zhuowan, et al.
Veröffentlicht: (2022)
von: Li, Zhuowan, et al.
Veröffentlicht: (2022)
ViTamin: Designing Scalable Vision Models in the Vision-Language Era
von: Chen, Jieneng, et al.
Veröffentlicht: (2024)
von: Chen, Jieneng, et al.
Veröffentlicht: (2024)
ViT-DD: Multi-Task Vision Transformer for Semi-Supervised Driver Distraction Detection
von: Ma, Yunsheng, et al.
Veröffentlicht: (2022)
von: Ma, Yunsheng, et al.
Veröffentlicht: (2022)
APHQ-ViT: Post-Training Quantization with Average Perturbation Hessian Based Reconstruction for Vision Transformers
von: Wu, Zhuguanyu, et al.
Veröffentlicht: (2025)
von: Wu, Zhuguanyu, et al.
Veröffentlicht: (2025)
CAS-ViT: Convolutional Additive Self-attention Vision Transformers for Efficient Mobile Applications
von: Zhang, Tianfang, et al.
Veröffentlicht: (2024)
von: Zhang, Tianfang, et al.
Veröffentlicht: (2024)
Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs
von: Kuzucu, Selim, et al.
Veröffentlicht: (2025)
von: Kuzucu, Selim, et al.
Veröffentlicht: (2025)
Hyb-KAN ViT: Hybrid Kolmogorov-Arnold Networks Augmented Vision Transformer
von: Dey, Sainath, et al.
Veröffentlicht: (2025)
von: Dey, Sainath, et al.
Veröffentlicht: (2025)
SVD-ViT: Does SVD Make Vision Transformers Attend More to the Foreground?
von: Murata, Haruhiko, et al.
Veröffentlicht: (2026)
von: Murata, Haruhiko, et al.
Veröffentlicht: (2026)
ViT$^3$: Unlocking Test-Time Training in Vision
von: Han, Dongchen, et al.
Veröffentlicht: (2025)
von: Han, Dongchen, et al.
Veröffentlicht: (2025)
HResFormer: Hybrid Residual Transformer for Volumetric Medical Image Segmentation
von: Ren, Sucheng, et al.
Veröffentlicht: (2024)
von: Ren, Sucheng, et al.
Veröffentlicht: (2024)
ViLBench: A Suite for Vision-Language Process Reward Modeling
von: Tu, Haoqin, et al.
Veröffentlicht: (2025)
von: Tu, Haoqin, et al.
Veröffentlicht: (2025)
LL-ViT: Edge Deployable Vision Transformers with Look Up Table Neurons
von: Nag, Shashank, et al.
Veröffentlicht: (2025)
von: Nag, Shashank, et al.
Veröffentlicht: (2025)
Vision-Language-Vision Auto-Encoder: Scalable Knowledge Distillation from Diffusion Models
von: Zhang, Tiezheng, et al.
Veröffentlicht: (2025)
von: Zhang, Tiezheng, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
ViMix-14M: A Curated Multi-Source Video-Text Dataset with Long-Form, High-Quality Captions and Crawl-Free Access
von: Yang, Timing, et al.
Veröffentlicht: (2025) -
M-VAR: Decoupled Scale-wise Autoregressive Modeling for High-Quality Image Generation
von: Ren, Sucheng, et al.
Veröffentlicht: (2024) -
Rejuvenating image-GPT as Strong Visual Representation Learners
von: Ren, Sucheng, et al.
Veröffentlicht: (2023) -
ARVideo: Autoregressive Pretraining for Self-Supervised Video Representation Learning
von: Ren, Sucheng, et al.
Veröffentlicht: (2024) -
Mamba-R: Vision Mamba ALSO Needs Registers
von: Wang, Feng, et al.
Veröffentlicht: (2024)