QDepth-VLA: Quantized Depth Prediction as Auxiliary Supervision for Vision-Language-Action Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Yixuan, Chen, Yuhui, Zhou, Mingcai, Li, Haoran, Zhang, Zhengtao, Zhao, Dongbin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
RotVLA: Rotational Latent Action for Vision-Language-Action Model
di: Li, Qiwei, et al.
Pubblicazione: (2026)
di: Li, Qiwei, et al.
Pubblicazione: (2026)
Survey of Vision-Language-Action Models for Embodied Manipulation
di: Li, Haoran, et al.
Pubblicazione: (2025)
di: Li, Haoran, et al.
Pubblicazione: (2025)
LLaDA-VLA: Vision Language Diffusion Action Models
di: Wen, Yuqing, et al.
Pubblicazione: (2025)
di: Wen, Yuqing, et al.
Pubblicazione: (2025)
ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver
di: Song, Wenxuan, et al.
Pubblicazione: (2025)
di: Song, Wenxuan, et al.
Pubblicazione: (2025)
VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers
di: Wang, Yating, et al.
Pubblicazione: (2025)
di: Wang, Yating, et al.
Pubblicazione: (2025)
PD-VLA: Accelerating Vision-Language-Action Model Integrated with Action Chunking via Parallel Decoding
di: Song, Wenxuan, et al.
Pubblicazione: (2025)
di: Song, Wenxuan, et al.
Pubblicazione: (2025)
GesVLA: Gesture-Aware Vision-Language-Action Model Embedded Representations
di: Guo, Wenxuan, et al.
Pubblicazione: (2026)
di: Guo, Wenxuan, et al.
Pubblicazione: (2026)
Unified Diffusion VLA: Vision-Language-Action Model via Joint Discrete Denoising Diffusion Process
di: Chen, Jiayi, et al.
Pubblicazione: (2025)
di: Chen, Jiayi, et al.
Pubblicazione: (2025)
HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model
di: Liu, Jiaming, et al.
Pubblicazione: (2025)
di: Liu, Jiaming, et al.
Pubblicazione: (2025)
QUAR-VLA: Vision-Language-Action Model for Quadruped Robots
di: Ding, Pengxiang, et al.
Pubblicazione: (2023)
di: Ding, Pengxiang, et al.
Pubblicazione: (2023)
VLA-Arena: An Open-Source Framework for Benchmarking Vision-Language-Action Models
di: Zhang, Borong, et al.
Pubblicazione: (2025)
di: Zhang, Borong, et al.
Pubblicazione: (2025)
Evo-Depth: A Lightweight Depth-Enhanced Vision-Language-Action Model
di: Lin, Tao, et al.
Pubblicazione: (2026)
di: Lin, Tao, et al.
Pubblicazione: (2026)
FD-VLA: Force-Distilled Vision-Language-Action Model for Contact-Rich Manipulation
di: Zhao, Ruiteng, et al.
Pubblicazione: (2026)
di: Zhao, Ruiteng, et al.
Pubblicazione: (2026)
InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
di: Yang, Shuai, et al.
Pubblicazione: (2025)
di: Yang, Shuai, et al.
Pubblicazione: (2025)
UrbanVLA: A Vision-Language-Action Model for Urban Micromobility
di: Li, Anqi, et al.
Pubblicazione: (2025)
di: Li, Anqi, et al.
Pubblicazione: (2025)
CronusVLA: Towards Efficient and Robust Manipulation via Multi-Frame Vision-Language-Action Modeling
di: Li, Hao, et al.
Pubblicazione: (2025)
di: Li, Hao, et al.
Pubblicazione: (2025)
VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model
di: Sun, Jingwen, et al.
Pubblicazione: (2026)
di: Sun, Jingwen, et al.
Pubblicazione: (2026)
BitVLA: 1-bit Vision-Language-Action Models for Robotics Manipulation
di: Wang, Hongyu, et al.
Pubblicazione: (2025)
di: Wang, Hongyu, et al.
Pubblicazione: (2025)
Reasoning-VLA: A Fast and General Vision-Language-Action Reasoning Model for Autonomous Driving
di: Zhang, Dapeng, et al.
Pubblicazione: (2025)
di: Zhang, Dapeng, et al.
Pubblicazione: (2025)
QVLA: Not All Channels Are Equal in Vision-Language-Action Model's Quantization
di: Xu, Yuhao, et al.
Pubblicazione: (2026)
di: Xu, Yuhao, et al.
Pubblicazione: (2026)
DynamicVLA: A Vision-Language-Action Model for Dynamic Object Manipulation
di: Xie, Haozhe, et al.
Pubblicazione: (2026)
di: Xie, Haozhe, et al.
Pubblicazione: (2026)
DualCoT-VLA: Visual-Linguistic Chain of Thought via Parallel Reasoning for Vision-Language-Action Models
di: Zhong, Zhide, et al.
Pubblicazione: (2026)
di: Zhong, Zhide, et al.
Pubblicazione: (2026)
From Pixels to Tokens: A Systematic Study of Latent Action Supervision for Vision-Language-Action Models
di: Lin, Yihan, et al.
Pubblicazione: (2026)
di: Lin, Yihan, et al.
Pubblicazione: (2026)
MAP-VLA: Memory-Augmented Prompting for Vision-Language-Action Model in Robotic Manipulation
di: Li, Runhao, et al.
Pubblicazione: (2025)
di: Li, Runhao, et al.
Pubblicazione: (2025)
UAV-Track VLA: Embodied Aerial Tracking via Vision-Language-Action Models
di: Zhang, Qiyao, et al.
Pubblicazione: (2026)
di: Zhang, Qiyao, et al.
Pubblicazione: (2026)
VLA-R1: Enhancing Reasoning in Vision-Language-Action Models
di: Ye, Angen, et al.
Pubblicazione: (2025)
di: Ye, Angen, et al.
Pubblicazione: (2025)
StreamingVLA: Streaming Vision-Language-Action Model with Action Flow Matching and Adaptive Early Observation
di: Shi, Yiran, et al.
Pubblicazione: (2026)
di: Shi, Yiran, et al.
Pubblicazione: (2026)
MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation
di: Shi, Hao, et al.
Pubblicazione: (2025)
di: Shi, Hao, et al.
Pubblicazione: (2025)
StableVLA: Towards Robust Vision-Language-Action Models without Extra Data
di: Fu, Yiyang, et al.
Pubblicazione: (2026)
di: Fu, Yiyang, et al.
Pubblicazione: (2026)
DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge
di: Zhang, Wenyao, et al.
Pubblicazione: (2025)
di: Zhang, Wenyao, et al.
Pubblicazione: (2025)
MobileVLA-R1: Reinforcing Vision-Language-Action for Mobile Robots
di: Huang, Ting, et al.
Pubblicazione: (2025)
di: Huang, Ting, et al.
Pubblicazione: (2025)
CogVLA: Cognition-Aligned Vision-Language-Action Model via Instruction-Driven Routing & Sparsification
di: Li, Wei, et al.
Pubblicazione: (2025)
di: Li, Wei, et al.
Pubblicazione: (2025)
EVOLVE-VLA: Test-Time Training from Environment Feedback for Vision-Language-Action Models
di: Bai, Zechen, et al.
Pubblicazione: (2025)
di: Bai, Zechen, et al.
Pubblicazione: (2025)
dVLA: Diffusion Vision-Language-Action Model with Multimodal Chain-of-Thought
di: Wen, Junjie, et al.
Pubblicazione: (2025)
di: Wen, Junjie, et al.
Pubblicazione: (2025)
PixelVLA: Advancing Pixel-level Understanding in Vision-Language-Action Model
di: Liang, Wenqi, et al.
Pubblicazione: (2025)
di: Liang, Wenqi, et al.
Pubblicazione: (2025)
TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation
di: Wen, Junjie, et al.
Pubblicazione: (2024)
di: Wen, Junjie, et al.
Pubblicazione: (2024)
SpecPrune-VLA: Accelerating Vision-Language-Action Models via Action-Aware Self-Speculative Pruning
di: Wang, Hanzhen, et al.
Pubblicazione: (2025)
di: Wang, Hanzhen, et al.
Pubblicazione: (2025)
GST-VLA: Structured Gaussian Spatial Tokens for 3D Depth-Aware Vision-Language-Action Models
di: Sarowar, Md Selim, et al.
Pubblicazione: (2026)
di: Sarowar, Md Selim, et al.
Pubblicazione: (2026)
MiVLA: Towards Generalizable Vision-Language-Action Model with Human-Robot Mutual Imitation Pre-training
di: Yin, Zhenhan, et al.
Pubblicazione: (2025)
di: Yin, Zhenhan, et al.
Pubblicazione: (2025)
PointVLA: Injecting the 3D World into Vision-Language-Action Models
di: Li, Chengmeng, et al.
Pubblicazione: (2025)
di: Li, Chengmeng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
RotVLA: Rotational Latent Action for Vision-Language-Action Model
di: Li, Qiwei, et al.
Pubblicazione: (2026) -
Survey of Vision-Language-Action Models for Embodied Manipulation
di: Li, Haoran, et al.
Pubblicazione: (2025) -
LLaDA-VLA: Vision Language Diffusion Action Models
di: Wen, Yuqing, et al.
Pubblicazione: (2025) -
ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver
di: Song, Wenxuan, et al.
Pubblicazione: (2025) -
VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers
di: Wang, Yating, et al.
Pubblicazione: (2025)