Joint-Aligned Latent Action: Towards Scalable VLA Pretraining in the Wild
Fuente:
arXiv
Salvato in:
| Autori principali: | Luo, Hao, Wang, Ye, Zhang, Wanpeng, Yuan, Haoqi, Feng, Yicheng, Xu, Haiweng, Zheng, Sipeng, Lu, Zongqing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Spatial-Aware VLA Pretraining through Visual-Physical Alignment from Human Videos
di: Feng, Yicheng, et al.
Pubblicazione: (2025)
di: Feng, Yicheng, et al.
Pubblicazione: (2025)
Unmasking the Illusion of Embodied Reasoning in Vision-Language-Action Models
di: Xu, Haiweng, et al.
Pubblicazione: (2026)
di: Xu, Haiweng, et al.
Pubblicazione: (2026)
DiG-Flow: Discrepancy-Guided Flow Matching for Robust VLA Models
di: Zhang, Wanpeng, et al.
Pubblicazione: (2025)
di: Zhang, Wanpeng, et al.
Pubblicazione: (2025)
Conservative Offline Robot Policy Learning via Posterior-Transition Reweighting
di: Zhang, Wanpeng, et al.
Pubblicazione: (2026)
di: Zhang, Wanpeng, et al.
Pubblicazione: (2026)
Being-H0.7: A Latent World-Action Model from Egocentric Videos
di: Luo, Hao, et al.
Pubblicazione: (2026)
di: Luo, Hao, et al.
Pubblicazione: (2026)
Rethinking Visual-Language-Action Model Scaling: Alignment, Mixture, and Regularization
di: Wang, Ye, et al.
Pubblicazione: (2026)
di: Wang, Ye, et al.
Pubblicazione: (2026)
Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos
di: Luo, Hao, et al.
Pubblicazione: (2025)
di: Luo, Hao, et al.
Pubblicazione: (2025)
Being-H0.5: Scaling Human-Centric Robot Learning for Cross-Embodiment Generalization
di: Luo, Hao, et al.
Pubblicazione: (2026)
di: Luo, Hao, et al.
Pubblicazione: (2026)
X-DiffVLA: X-Embodied Diffusion Action Heads for Vision-Language-Action Models
di: Li, Boyu, et al.
Pubblicazione: (2026)
di: Li, Boyu, et al.
Pubblicazione: (2026)
UniTacHand: Unified Spatio-Tactile Representation for Human to Robotic Hand Skill Transfer
di: Zhang, Chi, et al.
Pubblicazione: (2025)
di: Zhang, Chi, et al.
Pubblicazione: (2025)
DemoGrasp: Universal Dexterous Grasping from a Single Demonstration
di: Yuan, Haoqi, et al.
Pubblicazione: (2025)
di: Yuan, Haoqi, et al.
Pubblicazione: (2025)
VideoOrion: Tokenizing Object Dynamics in Videos
di: Feng, Yicheng, et al.
Pubblicazione: (2024)
di: Feng, Yicheng, et al.
Pubblicazione: (2024)
Unified Multimodal Understanding via Byte-Pair Visual Encoding
di: Zhang, Wanpeng, et al.
Pubblicazione: (2025)
di: Zhang, Wanpeng, et al.
Pubblicazione: (2025)
Efficient Residual Learning with Mixture-of-Experts for Universal Dexterous Grasping
di: Huang, Ziye, et al.
Pubblicazione: (2024)
di: Huang, Ziye, et al.
Pubblicazione: (2024)
Learning Diverse Bimanual Dexterous Manipulation Skills from Human Demonstrations
di: Zhou, Bohan, et al.
Pubblicazione: (2024)
di: Zhou, Bohan, et al.
Pubblicazione: (2024)
Cross-Embodiment Dexterous Grasping with Reinforcement Learning
di: Yuan, Haoqi, et al.
Pubblicazione: (2024)
di: Yuan, Haoqi, et al.
Pubblicazione: (2024)
FutureVLA: Joint Visuomotor Prediction for Vision-Language-Action Model
di: Xu, Xiaoxu, et al.
Pubblicazione: (2026)
di: Xu, Xiaoxu, et al.
Pubblicazione: (2026)
RL from Physical Feedback: Aligning Large Motion Models with Humanoid Control
di: Yue, Junpeng, et al.
Pubblicazione: (2025)
di: Yue, Junpeng, et al.
Pubblicazione: (2025)
Universal Dexterous Functional Grasping via Demonstration-Editing Reinforcement Learning
di: Mao, Chuan, et al.
Pubblicazione: (2025)
di: Mao, Chuan, et al.
Pubblicazione: (2025)
WorldVLA: Towards Autoregressive Action World Model
di: Cen, Jun, et al.
Pubblicazione: (2025)
di: Cen, Jun, et al.
Pubblicazione: (2025)
Being-0: A Humanoid Robotic Agent with Vision-Language Models and Modular Skills
di: Yuan, Haoqi, et al.
Pubblicazione: (2025)
di: Yuan, Haoqi, et al.
Pubblicazione: (2025)
MimicDreamer: Aligning Human and Robot Demonstrations for Scalable VLA Training
di: Li, Haoyun, et al.
Pubblicazione: (2025)
di: Li, Haoyun, et al.
Pubblicazione: (2025)
DemoHLM: From One Demonstration to Generalizable Humanoid Loco-Manipulation
di: Fu, Yuhui, et al.
Pubblicazione: (2025)
di: Fu, Yuhui, et al.
Pubblicazione: (2025)
From Pixels to Tokens: Byte-Pair Encoding on Quantized Visual Modalities
di: Zhang, Wanpeng, et al.
Pubblicazione: (2024)
di: Zhang, Wanpeng, et al.
Pubblicazione: (2024)
HARP-VLA: Human-Robot Aligned Representation Learning for Vision-Language-Action Model
di: Zhu, Xiang, et al.
Pubblicazione: (2026)
di: Zhu, Xiang, et al.
Pubblicazione: (2026)
Latent Reasoning VLA: Latent Thinking and Prediction for Vision-Language-Action Models
di: Bai, Shuanghao, et al.
Pubblicazione: (2026)
di: Bai, Shuanghao, et al.
Pubblicazione: (2026)
RotVLA: Rotational Latent Action for Vision-Language-Action Model
di: Li, Qiwei, et al.
Pubblicazione: (2026)
di: Li, Qiwei, et al.
Pubblicazione: (2026)
AtomVLA: Scalable Post-Training for Robotic Manipulation via Predictive Latent World Models
di: Sun, Xiaoquan, et al.
Pubblicazione: (2026)
di: Sun, Xiaoquan, et al.
Pubblicazione: (2026)
Afford-VLA: Action-Aligned Visual Planning via Internalized Affordance
di: Wang, Runze, et al.
Pubblicazione: (2026)
di: Wang, Runze, et al.
Pubblicazione: (2026)
PhysiFlow: Physics-Aware Humanoid Whole-Body VLA via Multi-Brain Latent Flow Matching and Robust Tracking
di: Qin, Weikai, et al.
Pubblicazione: (2026)
di: Qin, Weikai, et al.
Pubblicazione: (2026)
UniCode: Learning a Unified Codebook for Multimodal Large Language Models
di: Zheng, Sipeng, et al.
Pubblicazione: (2024)
di: Zheng, Sipeng, et al.
Pubblicazione: (2024)
QuadrupedGPT: Towards a Versatile Quadruped Agent in Open-ended Worlds
di: Mei, Yuting, et al.
Pubblicazione: (2024)
di: Mei, Yuting, et al.
Pubblicazione: (2024)
NS-VLA: Towards Neuro-Symbolic Vision-Language-Action Models
di: Zhu, Ziyue, et al.
Pubblicazione: (2026)
di: Zhu, Ziyue, et al.
Pubblicazione: (2026)
RynnVLA-002: A Unified Vision-Language-Action and World Model
di: Cen, Jun, et al.
Pubblicazione: (2025)
di: Cen, Jun, et al.
Pubblicazione: (2025)
UniVLA: Learning to Act Anywhere with Task-centric Latent Actions
di: Bu, Qingwen, et al.
Pubblicazione: (2025)
di: Bu, Qingwen, et al.
Pubblicazione: (2025)
MergeVLA: Cross-Skill Model Merging Toward a Generalist Vision-Language-Action Agent
di: Fu, Yuxia, et al.
Pubblicazione: (2025)
di: Fu, Yuxia, et al.
Pubblicazione: (2025)
DriveWorld-VLA: Unified Latent-Space World Modeling with Vision-Language-Action for Autonomous Driving
di: jia, Feiyang, et al.
Pubblicazione: (2026)
di: jia, Feiyang, et al.
Pubblicazione: (2026)
ST4VLA: Spatially Guided Training for Vision-Language-Action Models
di: Ye, Jinhui, et al.
Pubblicazione: (2026)
di: Ye, Jinhui, et al.
Pubblicazione: (2026)
SmoothVLA: Aligning Vision-Language-Action Models with Physical Constraints via Intrinsic Smoothness Optimization
di: Li, Jiashun, et al.
Pubblicazione: (2026)
di: Li, Jiashun, et al.
Pubblicazione: (2026)
VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning
di: Lu, Guanxing, et al.
Pubblicazione: (2025)
di: Lu, Guanxing, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Spatial-Aware VLA Pretraining through Visual-Physical Alignment from Human Videos
di: Feng, Yicheng, et al.
Pubblicazione: (2025) -
Unmasking the Illusion of Embodied Reasoning in Vision-Language-Action Models
di: Xu, Haiweng, et al.
Pubblicazione: (2026) -
DiG-Flow: Discrepancy-Guided Flow Matching for Robust VLA Models
di: Zhang, Wanpeng, et al.
Pubblicazione: (2025) -
Conservative Offline Robot Policy Learning via Posterior-Transition Reweighting
di: Zhang, Wanpeng, et al.
Pubblicazione: (2026) -
Being-H0.7: A Latent World-Action Model from Egocentric Videos
di: Luo, Hao, et al.
Pubblicazione: (2026)