WoVR: World Models as Reliable Simulators for Post-Training VLA Policies with RL
Fuente:
arXiv
Salvato in:
| Autori principali: | Jiang, Zhennan, Zhou, Shangqing, Jiang, Yutong, Huang, Zefang, Wei, Mingjie, Chen, Yuhui, Zhou, Tianxing, Guo, Zhen, Lin, Hao, Zhang, Quanlu, Wang, Yu, Li, Haoran, Yu, Chao, Zhao, Dongbin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Generalizing Consistency Policy to Visual RL with Prioritized Proximal Experience Regularization
di: Li, Haoran, et al.
Pubblicazione: (2024)
di: Li, Haoran, et al.
Pubblicazione: (2024)
World4RL: Diffusion World Models for Policy Refinement with Reinforcement Learning for Robotic Manipulation
di: Jiang, Zhennan, et al.
Pubblicazione: (2025)
di: Jiang, Zhennan, et al.
Pubblicazione: (2025)
TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning
di: Chen, Yuhui, et al.
Pubblicazione: (2025)
di: Chen, Yuhui, et al.
Pubblicazione: (2025)
ConRFT: A Reinforced Fine-tuning Method for VLA Models via Consistency Policy
di: Chen, Yuhui, et al.
Pubblicazione: (2025)
di: Chen, Yuhui, et al.
Pubblicazione: (2025)
Posterior Optimization with Clipped Objective for Bridging Efficiency and Stability in Generative Policy Learning
di: Chen, Yuhui, et al.
Pubblicazione: (2026)
di: Chen, Yuhui, et al.
Pubblicazione: (2026)
Boosting Continuous Control with Consistency Policy
di: Chen, Yuhui, et al.
Pubblicazione: (2023)
di: Chen, Yuhui, et al.
Pubblicazione: (2023)
QDepth-VLA: Quantized Depth Prediction as Auxiliary Supervision for Vision-Language-Action Models
di: Li, Yixuan, et al.
Pubblicazione: (2025)
di: Li, Yixuan, et al.
Pubblicazione: (2025)
RLinf-USER: A Unified and Extensible System for Real-World Online Policy Learning in Embodied AI
di: Zang, Hongzhi, et al.
Pubblicazione: (2026)
di: Zang, Hongzhi, et al.
Pubblicazione: (2026)
SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning
di: Li, Haozhan, et al.
Pubblicazione: (2025)
di: Li, Haozhan, et al.
Pubblicazione: (2025)
IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model
di: Jiang, Anqing, et al.
Pubblicazione: (2025)
di: Jiang, Anqing, et al.
Pubblicazione: (2025)
Dual-Granularity Contrastive Reward via Generated Episodic Guidance for Efficient Embodied RL
di: Liu, Xin, et al.
Pubblicazione: (2026)
di: Liu, Xin, et al.
Pubblicazione: (2026)
Sword: Style-Robust World Models as Simulators via Dynamic Latent Bootstrapping for VLA Policy Post-Training
di: Gao, Jiaxuan, et al.
Pubblicazione: (2026)
di: Gao, Jiaxuan, et al.
Pubblicazione: (2026)
Efficient Recurrent Off-Policy RL Requires a Context-Encoder-Specific Learning Rate
di: Luo, Fan-Ming, et al.
Pubblicazione: (2024)
di: Luo, Fan-Ming, et al.
Pubblicazione: (2024)
Beyond Action Residuals: Real-World Robot Policy Steering via Bottleneck Latent Reinforcement Learning
di: Yu, Dongjie, et al.
Pubblicazione: (2026)
di: Yu, Dongjie, et al.
Pubblicazione: (2026)
Towards Long-Lived Robots: Continual Learning VLA Models via Reinforcement Fine-Tuning
di: Liu, Yuan, et al.
Pubblicazione: (2026)
di: Liu, Yuan, et al.
Pubblicazione: (2026)
Learning from Mistakes: Post-Training for Driving VLA with Takeover Data
di: Gao, Yinfeng, et al.
Pubblicazione: (2026)
di: Gao, Yinfeng, et al.
Pubblicazione: (2026)
RL-VLA$^3$: A Flexible and Asynchronous Reinforcement Learning Framework for VLA Training
di: Sun, Haoran, et al.
Pubblicazione: (2026)
di: Sun, Haoran, et al.
Pubblicazione: (2026)
RL-100: Performant Robotic Manipulation with Real-World Reinforcement Learning
di: Lei, Kun, et al.
Pubblicazione: (2025)
di: Lei, Kun, et al.
Pubblicazione: (2025)
Efficient bound preserving and asymptotic preserving semi-implicit schemes for the fast reaction-diffusion system
di: Zhao, Yu, et al.
Pubblicazione: (2024)
di: Zhao, Yu, et al.
Pubblicazione: (2024)
JigsawRL: Assembling RL Pipelines for Efficient LLM Post-Training
di: Hu, Zhengding, et al.
Pubblicazione: (2026)
di: Hu, Zhengding, et al.
Pubblicazione: (2026)
VLA Model Post-Training via Action-Chunked PPO and Self Behavior Cloning
di: Wang, Si-Cheng, et al.
Pubblicazione: (2025)
di: Wang, Si-Cheng, et al.
Pubblicazione: (2025)
Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models
di: Zhang, Hongyin, et al.
Pubblicazione: (2025)
di: Zhang, Hongyin, et al.
Pubblicazione: (2025)
End-to-End Dexterous Arm-Hand VLA Policies via Shared Autonomy: VR Teleoperation Augmented by Autonomous Hand VLA Policy for Efficient Data Collection
di: Cui, Yu, et al.
Pubblicazione: (2025)
di: Cui, Yu, et al.
Pubblicazione: (2025)
CoScale-RL: Efficient Post-Training by Co-Scaling Data and Computation
di: Chen, Yutong, et al.
Pubblicazione: (2026)
di: Chen, Yutong, et al.
Pubblicazione: (2026)
World-Env: Leveraging World Model as a Virtual Environment for VLA Post-Training
di: Xiao, Junjin, et al.
Pubblicazione: (2025)
di: Xiao, Junjin, et al.
Pubblicazione: (2025)
SCOPE-RL: Stable and Quantitative Control of Policy Entropy in RL Post-Training
di: Wang, Chen, et al.
Pubblicazione: (2025)
di: Wang, Chen, et al.
Pubblicazione: (2025)
AtomVLA: Scalable Post-Training for Robotic Manipulation via Predictive Latent World Models
di: Sun, Xiaoquan, et al.
Pubblicazione: (2026)
di: Sun, Xiaoquan, et al.
Pubblicazione: (2026)
VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning
di: Lu, Guanxing, et al.
Pubblicazione: (2025)
di: Lu, Guanxing, et al.
Pubblicazione: (2025)
R-WoM: Retrieval-augmented World Model For Computer-use Agents
di: Mei, Kai, et al.
Pubblicazione: (2025)
di: Mei, Kai, et al.
Pubblicazione: (2025)
$π_\texttt{RL}$: Online RL Fine-tuning for Flow-based Vision-Language-Action Models
di: Chen, Kang, et al.
Pubblicazione: (2025)
di: Chen, Kang, et al.
Pubblicazione: (2025)
Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training
di: Fakoor, Rasool, et al.
Pubblicazione: (2026)
di: Fakoor, Rasool, et al.
Pubblicazione: (2026)
Adaptive Simulation Experiment for LLM Policy Optimization
di: Hu, Mingjie, et al.
Pubblicazione: (2026)
di: Hu, Mingjie, et al.
Pubblicazione: (2026)
Unleashing Efficient Asynchronous RL Post-Training via Staleness-Constrained Rollout Coordination
di: Li, Haoyang, et al.
Pubblicazione: (2026)
di: Li, Haoyang, et al.
Pubblicazione: (2026)
RLinf-VLA: A Unified and Efficient Framework for Reinforcement Learning of Vision-Language-Action Models
di: Zang, Hongzhi, et al.
Pubblicazione: (2025)
di: Zang, Hongzhi, et al.
Pubblicazione: (2025)
Refined Policy Distillation: From VLA Generalists to RL Experts
di: Jülg, Tobias, et al.
Pubblicazione: (2025)
di: Jülg, Tobias, et al.
Pubblicazione: (2025)
Parallels Between VLA Model Post-Training and Human Motor Learning: Progress, Challenges, and Trends
di: Xiang, Tian-Yu, et al.
Pubblicazione: (2025)
di: Xiang, Tian-Yu, et al.
Pubblicazione: (2025)
Frozen Gaussian sampling algorithms for simulating Markovian open quantum systems in the semiclassical regime
di: Xu, Limin, et al.
Pubblicazione: (2025)
di: Xu, Limin, et al.
Pubblicazione: (2025)
Stochastic Schrödinger equation approach to real-time dynamics of Anderson-Holstein impurities: an open quantum system perspective
di: Huang, Zhen, et al.
Pubblicazione: (2023)
di: Huang, Zhen, et al.
Pubblicazione: (2023)
SeedVR2: One-Step Video Restoration via Diffusion Adversarial Post-Training
di: Wang, Jianyi, et al.
Pubblicazione: (2025)
di: Wang, Jianyi, et al.
Pubblicazione: (2025)
When Seconds Count: Designing Real-Time VR Interventions for Stress Inoculation Training in Novice Physicians
di: Zhang, Shuhao, et al.
Pubblicazione: (2026)
di: Zhang, Shuhao, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Generalizing Consistency Policy to Visual RL with Prioritized Proximal Experience Regularization
di: Li, Haoran, et al.
Pubblicazione: (2024) -
World4RL: Diffusion World Models for Policy Refinement with Reinforcement Learning for Robotic Manipulation
di: Jiang, Zhennan, et al.
Pubblicazione: (2025) -
TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning
di: Chen, Yuhui, et al.
Pubblicazione: (2025) -
ConRFT: A Reinforced Fine-tuning Method for VLA Models via Consistency Policy
di: Chen, Yuhui, et al.
Pubblicazione: (2025) -
Posterior Optimization with Clipped Objective for Bridging Efficiency and Stability in Generative Policy Learning
di: Chen, Yuhui, et al.
Pubblicazione: (2026)