AugVLA-3D: Depth-Driven Feature Augmentation for Vision-Language-Action Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Rao, Zhifeng, Chen, Wenlong, Xie, Lei, Hua, Xia, Yin, Dongfu, Tian, Zhen, Yu, F. Richard |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DepthVLA: Enhancing Vision-Language-Action Models with Depth-Aware Spatial Reasoning
di: Yuan, Tianyuan, et al.
Pubblicazione: (2025)
di: Yuan, Tianyuan, et al.
Pubblicazione: (2025)
SaiVLA-0: Cerebrum--Pons--Cerebellum Tripartite Architecture for Compute-Aware Vision-Language-Action
di: Shi, Xiang, et al.
Pubblicazione: (2026)
di: Shi, Xiang, et al.
Pubblicazione: (2026)
AIR-VLA: Vision-Language-Action Systems for Aerial Manipulation
di: Sun, Jianli, et al.
Pubblicazione: (2026)
di: Sun, Jianli, et al.
Pubblicazione: (2026)
GeoVLA: Empowering 3D Representations in Vision-Language-Action Models
di: Sun, Lin, et al.
Pubblicazione: (2025)
di: Sun, Lin, et al.
Pubblicazione: (2025)
QDepth-VLA: Quantized Depth Prediction as Auxiliary Supervision for Vision-Language-Action Models
di: Li, Yixuan, et al.
Pubblicazione: (2025)
di: Li, Yixuan, et al.
Pubblicazione: (2025)
EdgeVLA: Efficient Vision-Language-Action Models
di: Budzianowski, Paweł, et al.
Pubblicazione: (2025)
di: Budzianowski, Paweł, et al.
Pubblicazione: (2025)
3D-VLA: A 3D Vision-Language-Action Generative World Model
di: Zhen, Haoyu, et al.
Pubblicazione: (2024)
di: Zhen, Haoyu, et al.
Pubblicazione: (2024)
GST-VLA: Structured Gaussian Spatial Tokens for 3D Depth-Aware Vision-Language-Action Models
di: Sarowar, Md Selim, et al.
Pubblicazione: (2026)
di: Sarowar, Md Selim, et al.
Pubblicazione: (2026)
Spec-VLA: Speculative Decoding for Vision-Language-Action Models with Relaxed Acceptance
di: Wang, Songsheng, et al.
Pubblicazione: (2025)
di: Wang, Songsheng, et al.
Pubblicazione: (2025)
DeepThinkVLA: Enhancing Reasoning Capability of Vision-Language-Action Models
di: Yin, Cheng, et al.
Pubblicazione: (2025)
di: Yin, Cheng, et al.
Pubblicazione: (2025)
LoopVLA: Learning Sufficiency in Recurrent Refinement for Vision-Language-Action Models
di: Shen, Boyang, et al.
Pubblicazione: (2026)
di: Shen, Boyang, et al.
Pubblicazione: (2026)
MAP-VLA: Memory-Augmented Prompting for Vision-Language-Action Model in Robotic Manipulation
di: Li, Runhao, et al.
Pubblicazione: (2025)
di: Li, Runhao, et al.
Pubblicazione: (2025)
E-VLA: Event-Augmented Vision-Language-Action Model for Dark and Blurred Scenes
di: Zhai, Jiajun, et al.
Pubblicazione: (2026)
di: Zhai, Jiajun, et al.
Pubblicazione: (2026)
AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment
di: Kong, Weijie, et al.
Pubblicazione: (2026)
di: Kong, Weijie, et al.
Pubblicazione: (2026)
AugUndo: Scaling Up Augmentations for Monocular Depth Completion and Estimation
di: Wu, Yangchao, et al.
Pubblicazione: (2023)
di: Wu, Yangchao, et al.
Pubblicazione: (2023)
DropVLA: An Action-Level Backdoor Attack on Vision-Language-Action Models
di: Xu, Zonghuan, et al.
Pubblicazione: (2025)
di: Xu, Zonghuan, et al.
Pubblicazione: (2025)
AVA-VLA: Improving Vision-Language-Action models with Active Visual Attention
di: Xiao, Lei, et al.
Pubblicazione: (2025)
di: Xiao, Lei, et al.
Pubblicazione: (2025)
PriorVLA: Prior-Preserving Adaptation for Vision-Language-Action Models
di: Guo, Xinyu, et al.
Pubblicazione: (2026)
di: Guo, Xinyu, et al.
Pubblicazione: (2026)
RePO-VLA: Recovery-Driven Policy Optimization for Vision-Language-Action Models
di: Liufu, Weijia, et al.
Pubblicazione: (2026)
di: Liufu, Weijia, et al.
Pubblicazione: (2026)
AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
di: Yu, Wenda, et al.
Pubblicazione: (2026)
di: Yu, Wenda, et al.
Pubblicazione: (2026)
VLA-Thinker: Boosting Vision-Language-Action Models through Thinking-with-Image Reasoning
di: Wang, Chaoyang, et al.
Pubblicazione: (2026)
di: Wang, Chaoyang, et al.
Pubblicazione: (2026)
IA-VLA: Input Augmentation for Vision-Language-Action models in settings with semantically complex tasks
di: Hannus, Eric, et al.
Pubblicazione: (2025)
di: Hannus, Eric, et al.
Pubblicazione: (2025)
FreezeVLA: Action-Freezing Attacks against Vision-Language-Action Models
di: Wang, Xin, et al.
Pubblicazione: (2025)
di: Wang, Xin, et al.
Pubblicazione: (2025)
4D-VLA: Spatiotemporal Vision-Language-Action Pretraining with Cross-Scene Calibration
di: Zhang, Jiahui, et al.
Pubblicazione: (2025)
di: Zhang, Jiahui, et al.
Pubblicazione: (2025)
RLinf-VLA: A Unified and Efficient Framework for Reinforcement Learning of Vision-Language-Action Models
di: Zang, Hongzhi, et al.
Pubblicazione: (2025)
di: Zang, Hongzhi, et al.
Pubblicazione: (2025)
CRL-VLA: Continual Vision-Language-Action Learning
di: Zeng, Qixin, et al.
Pubblicazione: (2026)
di: Zeng, Qixin, et al.
Pubblicazione: (2026)
RotVLA: Rotational Latent Action for Vision-Language-Action Model
di: Li, Qiwei, et al.
Pubblicazione: (2026)
di: Li, Qiwei, et al.
Pubblicazione: (2026)
ACoT-VLA: Action Chain-of-Thought for Vision-Language-Action Models
di: Zhong, Linqing, et al.
Pubblicazione: (2026)
di: Zhong, Linqing, et al.
Pubblicazione: (2026)
PointVLA: Injecting the 3D World into Vision-Language-Action Models
di: Li, Chengmeng, et al.
Pubblicazione: (2025)
di: Li, Chengmeng, et al.
Pubblicazione: (2025)
SwitchVLA: Execution-Aware Task Switching for Vision-Language-Action Models
di: Li, Meng, et al.
Pubblicazione: (2025)
di: Li, Meng, et al.
Pubblicazione: (2025)
DynamicVLA: A Vision-Language-Action Model for Dynamic Object Manipulation
di: Xie, Haozhe, et al.
Pubblicazione: (2026)
di: Xie, Haozhe, et al.
Pubblicazione: (2026)
VLA-Cache: Efficient Vision-Language-Action Manipulation via Adaptive Token Caching
di: Xu, Siyu, et al.
Pubblicazione: (2025)
di: Xu, Siyu, et al.
Pubblicazione: (2025)
CoVLA: Comprehensive Vision-Language-Action Dataset for Autonomous Driving
di: Arai, Hidehisa, et al.
Pubblicazione: (2024)
di: Arai, Hidehisa, et al.
Pubblicazione: (2024)
StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision
di: Deng, Shengliang, et al.
Pubblicazione: (2025)
di: Deng, Shengliang, et al.
Pubblicazione: (2025)
Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
di: Liang, Zhixuan, et al.
Pubblicazione: (2025)
di: Liang, Zhixuan, et al.
Pubblicazione: (2025)
CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies
di: Du, Fan, et al.
Pubblicazione: (2026)
di: Du, Fan, et al.
Pubblicazione: (2026)
ElegantVLA: Learning When to Think for Efficient Vision-Language-Action Models
di: Li, Ye, et al.
Pubblicazione: (2026)
di: Li, Ye, et al.
Pubblicazione: (2026)
StyleVLA: Driving Style-Aware Vision Language Action Model for Autonomous Driving
di: Gao, Yuan, et al.
Pubblicazione: (2026)
di: Gao, Yuan, et al.
Pubblicazione: (2026)
ROI-Driven Foveated Attention for Unified Egocentric Representations in Vision-Language-Action Systems
di: Sun, Xinhai, et al.
Pubblicazione: (2026)
di: Sun, Xinhai, et al.
Pubblicazione: (2026)
VP-VLA: Visual Prompting as an Interface for Vision-Language-Action Models
di: Wang, Zixuan, et al.
Pubblicazione: (2026)
di: Wang, Zixuan, et al.
Pubblicazione: (2026)
Documenti analoghi
-
DepthVLA: Enhancing Vision-Language-Action Models with Depth-Aware Spatial Reasoning
di: Yuan, Tianyuan, et al.
Pubblicazione: (2025) -
SaiVLA-0: Cerebrum--Pons--Cerebellum Tripartite Architecture for Compute-Aware Vision-Language-Action
di: Shi, Xiang, et al.
Pubblicazione: (2026) -
AIR-VLA: Vision-Language-Action Systems for Aerial Manipulation
di: Sun, Jianli, et al.
Pubblicazione: (2026) -
GeoVLA: Empowering 3D Representations in Vision-Language-Action Models
di: Sun, Lin, et al.
Pubblicazione: (2025) -
QDepth-VLA: Quantized Depth Prediction as Auxiliary Supervision for Vision-Language-Action Models
di: Li, Yixuan, et al.
Pubblicazione: (2025)