Rethinking Visual-Language-Action Model Scaling: Alignment, Mixture, and Regularization
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Ye, Zheng, Sipeng, Luo, Hao, Zhang, Wanpeng, Yuan, Haoqi, Xu, Chaoyi, Xu, Haiweng, Feng, Yicheng, Yu, Mingyang, Kang, Zhiyu, Lu, Zongqing, Jin, Qin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Joint-Aligned Latent Action: Towards Scalable VLA Pretraining in the Wild
di: Luo, Hao, et al.
Pubblicazione: (2026)
di: Luo, Hao, et al.
Pubblicazione: (2026)
Conservative Offline Robot Policy Learning via Posterior-Transition Reweighting
di: Zhang, Wanpeng, et al.
Pubblicazione: (2026)
di: Zhang, Wanpeng, et al.
Pubblicazione: (2026)
Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos
di: Luo, Hao, et al.
Pubblicazione: (2025)
di: Luo, Hao, et al.
Pubblicazione: (2025)
Spatial-Aware VLA Pretraining through Visual-Physical Alignment from Human Videos
di: Feng, Yicheng, et al.
Pubblicazione: (2025)
di: Feng, Yicheng, et al.
Pubblicazione: (2025)
Being-H0.7: A Latent World-Action Model from Egocentric Videos
di: Luo, Hao, et al.
Pubblicazione: (2026)
di: Luo, Hao, et al.
Pubblicazione: (2026)
Being-H0.5: Scaling Human-Centric Robot Learning for Cross-Embodiment Generalization
di: Luo, Hao, et al.
Pubblicazione: (2026)
di: Luo, Hao, et al.
Pubblicazione: (2026)
Unmasking the Illusion of Embodied Reasoning in Vision-Language-Action Models
di: Xu, Haiweng, et al.
Pubblicazione: (2026)
di: Xu, Haiweng, et al.
Pubblicazione: (2026)
DiG-Flow: Discrepancy-Guided Flow Matching for Robust VLA Models
di: Zhang, Wanpeng, et al.
Pubblicazione: (2025)
di: Zhang, Wanpeng, et al.
Pubblicazione: (2025)
Unified Multimodal Understanding via Byte-Pair Visual Encoding
di: Zhang, Wanpeng, et al.
Pubblicazione: (2025)
di: Zhang, Wanpeng, et al.
Pubblicazione: (2025)
VideoOrion: Tokenizing Object Dynamics in Videos
di: Feng, Yicheng, et al.
Pubblicazione: (2024)
di: Feng, Yicheng, et al.
Pubblicazione: (2024)
From Pixels to Tokens: Byte-Pair Encoding on Quantized Visual Modalities
di: Zhang, Wanpeng, et al.
Pubblicazione: (2024)
di: Zhang, Wanpeng, et al.
Pubblicazione: (2024)
UniTacHand: Unified Spatio-Tactile Representation for Human to Robotic Hand Skill Transfer
di: Zhang, Chi, et al.
Pubblicazione: (2025)
di: Zhang, Chi, et al.
Pubblicazione: (2025)
DemoGrasp: Universal Dexterous Grasping from a Single Demonstration
di: Yuan, Haoqi, et al.
Pubblicazione: (2025)
di: Yuan, Haoqi, et al.
Pubblicazione: (2025)
X-DiffVLA: X-Embodied Diffusion Action Heads for Vision-Language-Action Models
di: Li, Boyu, et al.
Pubblicazione: (2026)
di: Li, Boyu, et al.
Pubblicazione: (2026)
UniCode: Learning a Unified Codebook for Multimodal Large Language Models
di: Zheng, Sipeng, et al.
Pubblicazione: (2024)
di: Zheng, Sipeng, et al.
Pubblicazione: (2024)
Universal Dexterous Functional Grasping via Demonstration-Editing Reinforcement Learning
di: Mao, Chuan, et al.
Pubblicazione: (2025)
di: Mao, Chuan, et al.
Pubblicazione: (2025)
DemoHLM: From One Demonstration to Generalizable Humanoid Loco-Manipulation
di: Fu, Yuhui, et al.
Pubblicazione: (2025)
di: Fu, Yuhui, et al.
Pubblicazione: (2025)
Efficient Residual Learning with Mixture-of-Experts for Universal Dexterous Grasping
di: Huang, Ziye, et al.
Pubblicazione: (2024)
di: Huang, Ziye, et al.
Pubblicazione: (2024)
AdaRefiner: Refining Decisions of Language Models with Adaptive Feedback
di: Zhang, Wanpeng, et al.
Pubblicazione: (2023)
di: Zhang, Wanpeng, et al.
Pubblicazione: (2023)
Scaling Large Motion Models with Million-Level Human Motions
di: Wang, Ye, et al.
Pubblicazione: (2024)
di: Wang, Ye, et al.
Pubblicazione: (2024)
POV: Prompt-Oriented View-Agnostic Learning for Egocentric Hand-Object Interaction in the Multi-View World
di: Xu, Boshen, et al.
Pubblicazione: (2024)
di: Xu, Boshen, et al.
Pubblicazione: (2024)
SPAFormer: Sequential 3D Part Assembly with Transformers
di: Xu, Boshen, et al.
Pubblicazione: (2024)
di: Xu, Boshen, et al.
Pubblicazione: (2024)
Learning Diverse Bimanual Dexterous Manipulation Skills from Human Demonstrations
di: Zhou, Bohan, et al.
Pubblicazione: (2024)
di: Zhou, Bohan, et al.
Pubblicazione: (2024)
Cross-Embodiment Dexterous Grasping with Reinforcement Learning
di: Yuan, Haoqi, et al.
Pubblicazione: (2024)
di: Yuan, Haoqi, et al.
Pubblicazione: (2024)
Being-0: A Humanoid Robotic Agent with Vision-Language Models and Modular Skills
di: Yuan, Haoqi, et al.
Pubblicazione: (2025)
di: Yuan, Haoqi, et al.
Pubblicazione: (2025)
Tackling Non-Stationarity in Reinforcement Learning via Causal-Origin Representation
di: Zhang, Wanpeng, et al.
Pubblicazione: (2023)
di: Zhang, Wanpeng, et al.
Pubblicazione: (2023)
OpenT2M: No-frill Motion Generation with Open-source,Large-scale, High-quality Data
di: Cao, Bin, et al.
Pubblicazione: (2026)
di: Cao, Bin, et al.
Pubblicazione: (2026)
Pre-trained Visual Dynamics Representations for Efficient Policy Learning
di: Luo, Hao, et al.
Pubblicazione: (2024)
di: Luo, Hao, et al.
Pubblicazione: (2024)
Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model
di: Cao, Bin, et al.
Pubblicazione: (2025)
di: Cao, Bin, et al.
Pubblicazione: (2025)
Taking Notes Brings Focus? Towards Multi-Turn Multimodal Dialogue Learning
di: Liu, Jiazheng, et al.
Pubblicazione: (2025)
di: Liu, Jiazheng, et al.
Pubblicazione: (2025)
Creative Agents: Empowering Agents with Imagination for Creative Tasks
di: Cai, Penglin, et al.
Pubblicazione: (2023)
di: Cai, Penglin, et al.
Pubblicazione: (2023)
QuadrupedGPT: Towards a Versatile Quadruped Agent in Open-ended Worlds
di: Mei, Yuting, et al.
Pubblicazione: (2024)
di: Mei, Yuting, et al.
Pubblicazione: (2024)
Robust Motion Generation using Part-level Reliable Data from Videos
di: Li, Boyuan, et al.
Pubblicazione: (2025)
di: Li, Boyuan, et al.
Pubblicazione: (2025)
EgoDTM: Towards 3D-Aware Egocentric Video-Language Pretraining
di: Xu, Boshen, et al.
Pubblicazione: (2025)
di: Xu, Boshen, et al.
Pubblicazione: (2025)
Microorganisms Promote Soil Phosphorus Bioavailability at the Beginning of Pedogenesis
di: Mingyang Xu, et al.
Pubblicazione: (2025)
di: Mingyang Xu, et al.
Pubblicazione: (2025)
Visual Grounding for Object-Level Generalization in Reinforcement Learning
di: Jiang, Haobin, et al.
Pubblicazione: (2024)
di: Jiang, Haobin, et al.
Pubblicazione: (2024)
Rethinking Cross-Domain Evaluation for Face Forgery Detection with Semantic Fine-grained Alignment and Mixture-of-Experts
di: Luo, Yuhan, et al.
Pubblicazione: (2026)
di: Luo, Yuhan, et al.
Pubblicazione: (2026)
Mask Consistency Regularization in Object Removal
di: Yuan, Hua, et al.
Pubblicazione: (2025)
di: Yuan, Hua, et al.
Pubblicazione: (2025)
New pairing mechanism via chiral electron-hole condensation for non-BCS superconductivity
di: Tan, Wanpeng
Pubblicazione: (2023)
di: Tan, Wanpeng
Pubblicazione: (2023)
VALLR-Pin: Uncertainty-Factorized Visual Speech Recognition for Mandarin with Pinyin Guidance
di: Sun, Chang, et al.
Pubblicazione: (2025)
di: Sun, Chang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Joint-Aligned Latent Action: Towards Scalable VLA Pretraining in the Wild
di: Luo, Hao, et al.
Pubblicazione: (2026) -
Conservative Offline Robot Policy Learning via Posterior-Transition Reweighting
di: Zhang, Wanpeng, et al.
Pubblicazione: (2026) -
Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos
di: Luo, Hao, et al.
Pubblicazione: (2025) -
Spatial-Aware VLA Pretraining through Visual-Physical Alignment from Human Videos
di: Feng, Yicheng, et al.
Pubblicazione: (2025) -
Being-H0.7: A Latent World-Action Model from Egocentric Videos
di: Luo, Hao, et al.
Pubblicazione: (2026)