SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Haozhan, Zuo, Yuxin, Yu, Jiale, Zhang, Yuhao, Yang, Zhaohui, Zhang, Kaiyan, Zhu, Xuekai, Zhang, Yuchen, Chen, Tianxing, Cui, Ganqu, Wang, Dehui, Luo, Dingxiang, Fan, Yuchen, Sun, Youbang, Zeng, Jia, Pang, Jiangmiao, Zhang, Shanghang, Wang, Yu, Mu, Yao, Zhou, Bowen, Ding, Ning |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
TTRL: Test-Time Reinforcement Learning
par: Zuo, Yuxin, et autres
Publié: (2025)
par: Zuo, Yuxin, et autres
Publié: (2025)
Fourier Position Embedding: Enhancing Attention's Periodic Extension for Length Generalization
par: Hua, Ermo, et autres
Publié: (2024)
par: Hua, Ermo, et autres
Publié: (2024)
JustRL: Scaling a 1.5B LLM with a Simple RL Recipe
par: He, Bingxiang, et autres
Publié: (2025)
par: He, Bingxiang, et autres
Publié: (2025)
EvoDriveVLA: Evolving Driving VLA Models via Collaborative Perception-Planning Distillation
par: Cao, Jiajun, et autres
Publié: (2026)
par: Cao, Jiajun, et autres
Publié: (2026)
Towards a Unified View of Large Language Model Post-Training
par: Lv, Xingtai, et autres
Publié: (2025)
par: Lv, Xingtai, et autres
Publié: (2025)
Teaching Thinking Models to Reason with Tools: A Full-Pipeline Recipe for Tool-Integrated Reasoning
par: Cheng, Qianjia, et autres
Publié: (2026)
par: Cheng, Qianjia, et autres
Publié: (2026)
WoVR: World Models as Reliable Simulators for Post-Training VLA Policies with RL
par: Jiang, Zhennan, et autres
Publié: (2026)
par: Jiang, Zhennan, et autres
Publié: (2026)
Towards Human-Like Manipulation through RL-Augmented Teleoperation and Mixture-of-Dexterous-Experts VLA
par: Tang, Tutian, et autres
Publié: (2026)
par: Tang, Tutian, et autres
Publié: (2026)
Technologies on Effectiveness and Efficiency: A Survey of State Spaces Models
par: Lv, Xingtai, et autres
Publié: (2025)
par: Lv, Xingtai, et autres
Publié: (2025)
Post-Trained MoE Can Skip Half Experts via Self-Distillation
par: Lv, Xingtai, et autres
Publié: (2026)
par: Lv, Xingtai, et autres
Publié: (2026)
How Far Can Unsupervised RLVR Scale LLM Training?
par: He, Bingxiang, et autres
Publié: (2026)
par: He, Bingxiang, et autres
Publié: (2026)
SimVLA: A Simple VLA Baseline for Robotic Manipulation
par: Luo, Yuankai, et autres
Publié: (2026)
par: Luo, Yuankai, et autres
Publié: (2026)
FlowRL: Matching Reward Distributions for LLM Reasoning
par: Zhu, Xuekai, et autres
Publié: (2025)
par: Zhu, Xuekai, et autres
Publié: (2025)
World-VLA-Loop: Closed-Loop Learning of Video World Model and VLA Policy
par: Liu, Xiaokang, et autres
Publié: (2026)
par: Liu, Xiaokang, et autres
Publié: (2026)
ManualVLA: A Unified VLA Model for Chain-of-Thought Manual Generation and Robotic Manipulation
par: Gu, Chenyang, et autres
Publié: (2025)
par: Gu, Chenyang, et autres
Publié: (2025)
What Can RL Bring to VLA Generalization? An Empirical Study
par: Liu, Jijia, et autres
Publié: (2025)
par: Liu, Jijia, et autres
Publié: (2025)
What to Ignore, What to React: Visually Robust RL Fine-Tuning of VLA Models
par: Peng, Yuanfang, et autres
Publié: (2026)
par: Peng, Yuanfang, et autres
Publié: (2026)
Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models
par: Zhang, Hongyin, et autres
Publié: (2025)
par: Zhang, Hongyin, et autres
Publié: (2025)
BlockVLA: Accelerating Autoregressive VLA via Block Diffusion Finetuning
par: Wang, Ruiheng, et autres
Publié: (2026)
par: Wang, Ruiheng, et autres
Publié: (2026)
The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models
par: Cui, Ganqu, et autres
Publié: (2025)
par: Cui, Ganqu, et autres
Publié: (2025)
TrackVLA++: Unleashing Reasoning and Memory Capabilities in VLA Models for Embodied Visual Tracking
par: Liu, Jiahang, et autres
Publié: (2025)
par: Liu, Jiahang, et autres
Publié: (2025)
ST4VLA: Spatially Guided Training for Vision-Language-Action Models
par: Ye, Jinhui, et autres
Publié: (2026)
par: Ye, Jinhui, et autres
Publié: (2026)
TrackVLA: Embodied Visual Tracking in the Wild
par: Wang, Shaoan, et autres
Publié: (2025)
par: Wang, Shaoan, et autres
Publié: (2025)
VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning
par: Lu, Guanxing, et autres
Publié: (2025)
par: Lu, Guanxing, et autres
Publié: (2025)
Any3D-VLA: Enhancing VLA Robustness via Diverse Point Clouds
par: Fan, Xianzhe, et autres
Publié: (2026)
par: Fan, Xianzhe, et autres
Publié: (2026)
RL-VLA$^3$: A Flexible and Asynchronous Reinforcement Learning Framework for VLA Training
par: Sun, Haoran, et autres
Publié: (2026)
par: Sun, Haoran, et autres
Publié: (2026)
SSRL: Self-Search Reinforcement Learning
par: Fan, Yuchen, et autres
Publié: (2025)
par: Fan, Yuchen, et autres
Publié: (2025)
dVLA: Diffusion Vision-Language-Action Model with Multimodal Chain-of-Thought
par: Wen, Junjie, et autres
Publié: (2025)
par: Wen, Junjie, et autres
Publié: (2025)
EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models
par: Yang, Yantai, et autres
Publié: (2025)
par: Yang, Yantai, et autres
Publié: (2025)
InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy
par: Chen, Xinyi, et autres
Publié: (2025)
par: Chen, Xinyi, et autres
Publié: (2025)
VLA Knows Its Limits
par: Wang, Haoxuan, et autres
Publié: (2026)
par: Wang, Haoxuan, et autres
Publié: (2026)
MedXpertQA: Benchmarking Expert-Level Medical Reasoning and Understanding
par: Zuo, Yuxin, et autres
Publié: (2025)
par: Zuo, Yuxin, et autres
Publié: (2025)
RedVLA: Physical Red Teaming for Vision-Language-Action Models
par: Zhang, Yuhao, et autres
Publié: (2026)
par: Zhang, Yuhao, et autres
Publié: (2026)
Sci-VLA: Agentic VLA Inference Plugin for Long-Horizon Tasks in Scientific Experiments
par: Pang, Yiwen, et autres
Publié: (2026)
par: Pang, Yiwen, et autres
Publié: (2026)
TacVLA: Contact-Aware Tactile Fusion for Robust Vision-Language-Action Manipulation
par: Zhang, Kaidi, et autres
Publié: (2026)
par: Zhang, Kaidi, et autres
Publié: (2026)
InternVLA-A1: Unifying Understanding, Generation and Action for Robotic Manipulation
par: Cai, Junhao, et autres
Publié: (2026)
par: Cai, Junhao, et autres
Publié: (2026)
SwiftVLA: Unlocking Spatiotemporal Dynamics for Lightweight VLA Models at Minimal Overhead
par: Ni, Chaojun, et autres
Publié: (2025)
par: Ni, Chaojun, et autres
Publié: (2025)
Latent Reasoning VLA: Latent Thinking and Prediction for Vision-Language-Action Models
par: Bai, Shuanghao, et autres
Publié: (2026)
par: Bai, Shuanghao, et autres
Publié: (2026)
ForceVLA: Enhancing VLA Models with a Force-aware MoE for Contact-rich Manipulation
par: Yu, Jiawen, et autres
Publié: (2025)
par: Yu, Jiawen, et autres
Publié: (2025)
Scalable Efficient Training of Large Language Models with Low-dimensional Projected Attention
par: Lv, Xingtai, et autres
Publié: (2024)
par: Lv, Xingtai, et autres
Publié: (2024)
Documents similaires
-
TTRL: Test-Time Reinforcement Learning
par: Zuo, Yuxin, et autres
Publié: (2025) -
Fourier Position Embedding: Enhancing Attention's Periodic Extension for Length Generalization
par: Hua, Ermo, et autres
Publié: (2024) -
JustRL: Scaling a 1.5B LLM with a Simple RL Recipe
par: He, Bingxiang, et autres
Publié: (2025) -
EvoDriveVLA: Evolving Driving VLA Models via Collaborative Perception-Planning Distillation
par: Cao, Jiajun, et autres
Publié: (2026) -
Towards a Unified View of Large Language Model Post-Training
par: Lv, Xingtai, et autres
Publié: (2025)