VAT: Vision Action Transformer by Unlocking Full Representation of ViT
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Wenhao, Ma, Chengwei, Mao, Weixin |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ViT-VS: On the Applicability of Pretrained Vision Transformer Features for Generalizable Visual Servoing
par: Scherl, Alessandro, et autres
Publié: (2025)
par: Scherl, Alessandro, et autres
Publié: (2025)
ViT$^3$: Unlocking Test-Time Training in Vision
par: Han, Dongchen, et autres
Publié: (2025)
par: Han, Dongchen, et autres
Publié: (2025)
Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs
par: Kuzucu, Selim, et autres
Publié: (2025)
par: Kuzucu, Selim, et autres
Publié: (2025)
ReViP: Mitigating False Completion in Vision-Language-Action Models with Vision-Proprioception Rebalance
par: Li, Zhuohao, et autres
Publié: (2026)
par: Li, Zhuohao, et autres
Publié: (2026)
BFA++: Hierarchical Best-Feature-Aware Token Prune for Multi-View Vision Language Action Model
par: Li, Haosheng, et autres
Publié: (2026)
par: Li, Haosheng, et autres
Publié: (2026)
ViTA-Seg: Vision Transformer for Amodal Segmentation in Robotics
par: Caramia, Donato, et autres
Publié: (2025)
par: Caramia, Donato, et autres
Publié: (2025)
ViT-5: Vision Transformers for The Mid-2020s
par: Wang, Feng, et autres
Publié: (2026)
par: Wang, Feng, et autres
Publié: (2026)
IML-ViT: Benchmarking Image Manipulation Localization by Vision Transformer
par: Ma, Xiaochen, et autres
Publié: (2023)
par: Ma, Xiaochen, et autres
Publié: (2023)
Uni-LaViRA: Language-Vision-Robot Actions Translation for Unified Embodied Navigation
par: Ding, Hongyu, et autres
Publié: (2026)
par: Ding, Hongyu, et autres
Publié: (2026)
Adapting Pretrained ViTs with Convolution Injector for Visuo-Motor Control
par: Hwang, Dongyoon, et autres
Publié: (2024)
par: Hwang, Dongyoon, et autres
Publié: (2024)
LARY: A Latent Action Representation Yielding Benchmark for Generalizable Vision-to-Action Alignment
par: Nie, Dujun, et autres
Publié: (2026)
par: Nie, Dujun, et autres
Publié: (2026)
EA-ViT: Efficient Adaptation for Elastic Vision Transformer
par: Zhu, Chen, et autres
Publié: (2025)
par: Zhu, Chen, et autres
Publié: (2025)
ACC-ViT : Atrous Convolution's Comeback in Vision Transformers
par: Ibtehaz, Nabil, et autres
Publié: (2024)
par: Ibtehaz, Nabil, et autres
Publié: (2024)
ViT-AdaLA: Adapting Vision Transformers with Linear Attention
par: Li, Yifan, et autres
Publié: (2026)
par: Li, Yifan, et autres
Publié: (2026)
SToRe3D: Sparse Token Relevance in ViTs for Efficient Multi-View 3D Object Detection
par: Papais, Sandro, et autres
Publié: (2026)
par: Papais, Sandro, et autres
Publié: (2026)
LiteViLNet: Lightweight Vision-LiDAR Fusion Network for Efficient Road Segmentation
par: Peng, Daojie, et autres
Publié: (2026)
par: Peng, Daojie, et autres
Publié: (2026)
ViT-DD: Multi-Task Vision Transformer for Semi-Supervised Driver Distraction Detection
par: Ma, Yunsheng, et autres
Publié: (2022)
par: Ma, Yunsheng, et autres
Publié: (2022)
HIRI-ViT: Scaling Vision Transformer with High Resolution Inputs
par: Yao, Ting, et autres
Publié: (2024)
par: Yao, Ting, et autres
Publié: (2024)
GesVLA: Gesture-Aware Vision-Language-Action Model Embedded Representations
par: Guo, Wenxuan, et autres
Publié: (2026)
par: Guo, Wenxuan, et autres
Publié: (2026)
Scene-Graph ViT: End-to-End Open-Vocabulary Visual Relationship Detection
par: Salzmann, Tim, et autres
Publié: (2024)
par: Salzmann, Tim, et autres
Publié: (2024)
AutoMoT: A Unified Vision-Language-Action Model with Asynchronous Mixture-of-Transformers for End-to-End Autonomous Driving
par: Huang, Wenhui, et autres
Publié: (2026)
par: Huang, Wenhui, et autres
Publié: (2026)
Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy
par: Hou, Zhi, et autres
Publié: (2025)
par: Hou, Zhi, et autres
Publié: (2025)
ViT-Explainer: An Interactive Walkthrough of the Vision Transformer Pipeline
par: Hernandez, Juan Manuel, et autres
Publié: (2026)
par: Hernandez, Juan Manuel, et autres
Publié: (2026)
ADFQ-ViT: Activation-Distribution-Friendly Post-Training Quantization for Vision Transformers
par: Jiang, Yanfeng, et autres
Publié: (2024)
par: Jiang, Yanfeng, et autres
Publié: (2024)
ViT-FIQA: Assessing Face Image Quality using Vision Transformers
par: Atzori, Andrea, et autres
Publié: (2025)
par: Atzori, Andrea, et autres
Publié: (2025)
MPTQ-ViT: Mixed-Precision Post-Training Quantization for Vision Transformer
par: Tai, Yu-Shan, et autres
Publié: (2024)
par: Tai, Yu-Shan, et autres
Publié: (2024)
Towards Long-horizon Embodied Agents with Tool-Aligned Vision-Language-Action Models
par: Lei, Zixing, et autres
Publié: (2026)
par: Lei, Zixing, et autres
Publié: (2026)
Trio-ViT: Post-Training Quantization and Acceleration for Softmax-Free Efficient Vision Transformer
par: Shi, Huihong, et autres
Publié: (2024)
par: Shi, Huihong, et autres
Publié: (2024)
RotVLA: Rotational Latent Action for Vision-Language-Action Model
par: Li, Qiwei, et autres
Publié: (2026)
par: Li, Qiwei, et autres
Publié: (2026)
ConViTac: Aligning Visual-Tactile Fusion with Contrastive Representations
par: Wu, Zhiyuan, et autres
Publié: (2025)
par: Wu, Zhiyuan, et autres
Publié: (2025)
Unified Vision-Language-Action Model
par: Wang, Yuqi, et autres
Publié: (2025)
par: Wang, Yuqi, et autres
Publié: (2025)
SIMPACT: Simulation-Enabled Action Planning using Vision-Language Models
par: Liu, Haowen, et autres
Publié: (2025)
par: Liu, Haowen, et autres
Publié: (2025)
PD-VLA: Accelerating Vision-Language-Action Model Integrated with Action Chunking via Parallel Decoding
par: Song, Wenxuan, et autres
Publié: (2025)
par: Song, Wenxuan, et autres
Publié: (2025)
Action Draft and Verify: A Self-Verifying Framework for Vision-Language-Action Model
par: Zhao, Chen, et autres
Publié: (2026)
par: Zhao, Chen, et autres
Publié: (2026)
Hyb-KAN ViT: Hybrid Kolmogorov-Arnold Networks Augmented Vision Transformer
par: Dey, Sainath, et autres
Publié: (2025)
par: Dey, Sainath, et autres
Publié: (2025)
SVD-ViT: Does SVD Make Vision Transformers Attend More to the Foreground?
par: Murata, Haruhiko, et autres
Publié: (2026)
par: Murata, Haruhiko, et autres
Publié: (2026)
ViT-1.58b: Mobile Vision Transformers in the 1-bit Era
par: Yuan, Zhengqing, et autres
Publié: (2024)
par: Yuan, Zhengqing, et autres
Publié: (2024)
CAS-ViT: Convolutional Additive Self-attention Vision Transformers for Efficient Mobile Applications
par: Zhang, Tianfang, et autres
Publié: (2024)
par: Zhang, Tianfang, et autres
Publié: (2024)
SAC-ViT: Semantic-Aware Clustering Vision Transformer with Early Exit
par: Hu, Youbing, et autres
Publié: (2025)
par: Hu, Youbing, et autres
Publié: (2025)
What Matters in Building Vision-Language-Action Models for Generalist Robots
par: Li, Xinghang, et autres
Publié: (2024)
par: Li, Xinghang, et autres
Publié: (2024)
Documents similaires
-
ViT-VS: On the Applicability of Pretrained Vision Transformer Features for Generalizable Visual Servoing
par: Scherl, Alessandro, et autres
Publié: (2025) -
ViT$^3$: Unlocking Test-Time Training in Vision
par: Han, Dongchen, et autres
Publié: (2025) -
Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs
par: Kuzucu, Selim, et autres
Publié: (2025) -
ReViP: Mitigating False Completion in Vision-Language-Action Models with Vision-Proprioception Rebalance
par: Li, Zhuohao, et autres
Publié: (2026) -
BFA++: Hierarchical Best-Feature-Aware Token Prune for Multi-View Vision Language Action Model
par: Li, Haosheng, et autres
Publié: (2026)