Improving Vision-Language-Action Model with Online Reinforcement Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Guo, Yanjiang, Zhang, Jianke, Chen, Xiaoyu, Ji, Xiang, Wang, Yen-Jen, Hu, Yucheng, Chen, Jianyu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
HiRT: Enhancing Robotic Control with Hierarchical Robot Transformers
par: Zhang, Jianke, et autres
Publié: (2024)
par: Zhang, Jianke, et autres
Publié: (2024)
Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations
par: Hu, Yucheng, et autres
Publié: (2024)
par: Hu, Yucheng, et autres
Publié: (2024)
VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models
par: Zhang, Jianke, et autres
Publié: (2026)
par: Zhang, Jianke, et autres
Publié: (2026)
UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent
par: Zhang, Jianke, et autres
Publié: (2025)
par: Zhang, Jianke, et autres
Publié: (2025)
Prediction with Action: Visual Policy Learning via Joint Denoising Process
par: Guo, Yanjiang, et autres
Publié: (2024)
par: Guo, Yanjiang, et autres
Publié: (2024)
MindDrive: A Vision-Language-Action Model for Autonomous Driving via Online Reinforcement Learning
par: Fu, Haoyu, et autres
Publié: (2025)
par: Fu, Haoyu, et autres
Publié: (2025)
Benchmarking Vision, Language, & Action Models on Robotic Learning Tasks
par: Guruprasad, Pranav, et autres
Publié: (2024)
par: Guruprasad, Pranav, et autres
Publié: (2024)
LLaDA-VLA: Vision Language Diffusion Action Models
par: Wen, Yuqing, et autres
Publié: (2025)
par: Wen, Yuqing, et autres
Publié: (2025)
AVA-VLA: Improving Vision-Language-Action models with Active Visual Attention
par: Xiao, Lei, et autres
Publié: (2025)
par: Xiao, Lei, et autres
Publié: (2025)
Tactile Modality Fusion for Vision-Language-Action Models
par: Morissette, Charlotte, et autres
Publié: (2026)
par: Morissette, Charlotte, et autres
Publié: (2026)
PVI: Plug-in Visual Injection for Vision-Language-Action Models
par: Zhang, Zezhou, et autres
Publié: (2026)
par: Zhang, Zezhou, et autres
Publié: (2026)
ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning
par: Huang, Chi-Pin, et autres
Publié: (2025)
par: Huang, Chi-Pin, et autres
Publié: (2025)
A Survey on Efficient Vision-Language-Action Models
par: Yu, Zhaoshu, et autres
Publié: (2025)
par: Yu, Zhaoshu, et autres
Publié: (2025)
F1: A Vision-Language-Action Model Bridging Understanding and Generation to Actions
par: Lv, Qi, et autres
Publié: (2025)
par: Lv, Qi, et autres
Publié: (2025)
Unified Vision-Language-Action Model
par: Wang, Yuqi, et autres
Publié: (2025)
par: Wang, Yuqi, et autres
Publié: (2025)
Test-Time Training for Visual Foresight Vision-Language-Action Models
par: Park, Sangwu, et autres
Publié: (2026)
par: Park, Sangwu, et autres
Publié: (2026)
PointACT: Vision-Language-Action Models with Multi-Scale Point-Action Interaction
par: Chen, Shizhe, et autres
Publié: (2026)
par: Chen, Shizhe, et autres
Publié: (2026)
UAM: A Dual-Stream Perspective on Forgetting in VLA Training
par: Zhang, Jianke, et autres
Publié: (2026)
par: Zhang, Jianke, et autres
Publié: (2026)
PointVLA: Injecting the 3D World into Vision-Language-Action Models
par: Li, Chengmeng, et autres
Publié: (2025)
par: Li, Chengmeng, et autres
Publié: (2025)
Self-Improving Vision-Language-Action Models with Data Generation via Residual RL
par: Xiao, Wenli, et autres
Publié: (2025)
par: Xiao, Wenli, et autres
Publié: (2025)
From Spatial to Actions: Grounding Vision-Language-Action Model in Spatial Foundation Priors
par: Zhang, Zhengshen, et autres
Publié: (2025)
par: Zhang, Zhengshen, et autres
Publié: (2025)
VLA-Arena: An Open-Source Framework for Benchmarking Vision-Language-Action Models
par: Zhang, Borong, et autres
Publié: (2025)
par: Zhang, Borong, et autres
Publié: (2025)
Scalable Vision-Language-Action Model Pretraining for Robotic Manipulation with Real-Life Human Activity Videos
par: Li, Qixiu, et autres
Publié: (2025)
par: Li, Qixiu, et autres
Publié: (2025)
The Compression Gap: Why Discrete Tokenization Limits Vision-Language-Action Model Scaling
par: Shiba, Takuya
Publié: (2026)
par: Shiba, Takuya
Publié: (2026)
ChatVLA: Unified Multimodal Understanding and Robot Control with Vision-Language-Action Model
par: Zhou, Zhongyi, et autres
Publié: (2025)
par: Zhou, Zhongyi, et autres
Publié: (2025)
Hybrid Training for Vision-Language-Action Models
par: Mazzaglia, Pietro, et autres
Publié: (2025)
par: Mazzaglia, Pietro, et autres
Publié: (2025)
VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers
par: Wang, Yating, et autres
Publié: (2025)
par: Wang, Yating, et autres
Publié: (2025)
ManipLVM-R1: Reinforcement Learning for Reasoning in Embodied Manipulation with Large Vision-Language Models
par: Song, Zirui, et autres
Publié: (2025)
par: Song, Zirui, et autres
Publié: (2025)
Improving Robustness of Vision-Language-Action Models by Restoring Corrupted Visual Inputs
par: Orjuela, Daniel Yezid Guarnizo, et autres
Publié: (2026)
par: Orjuela, Daniel Yezid Guarnizo, et autres
Publié: (2026)
Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
par: Liang, Zhixuan, et autres
Publié: (2025)
par: Liang, Zhixuan, et autres
Publié: (2025)
Universal Pose Pretraining for Generalizable Vision-Language-Action Policies
par: Lin, Haitao, et autres
Publié: (2026)
par: Lin, Haitao, et autres
Publié: (2026)
WorldVLN: Autoregressive World Action Model for Aerial Vision-Language Navigation
par: Zhao, Baining, et autres
Publié: (2026)
par: Zhao, Baining, et autres
Publié: (2026)
GesVLA: Gesture-Aware Vision-Language-Action Model Embedded Representations
par: Guo, Wenxuan, et autres
Publié: (2026)
par: Guo, Wenxuan, et autres
Publié: (2026)
LARY: A Latent Action Representation Yielding Benchmark for Generalizable Vision-to-Action Alignment
par: Nie, Dujun, et autres
Publié: (2026)
par: Nie, Dujun, et autres
Publié: (2026)
MARVL: Multi-Stage Guidance for Robotic Manipulation via Vision-Language Models
par: Zhou, Xunlan, et autres
Publié: (2026)
par: Zhou, Xunlan, et autres
Publié: (2026)
VISTA: Enhancing Visual Conditioning via Track-Following Preference Optimization in Vision-Language-Action Models
par: Chen, Yiye, et autres
Publié: (2026)
par: Chen, Yiye, et autres
Publié: (2026)
Interactive Post-Training for Vision-Language-Action Models
par: Tan, Shuhan, et autres
Publié: (2025)
par: Tan, Shuhan, et autres
Publié: (2025)
Action Draft and Verify: A Self-Verifying Framework for Vision-Language-Action Model
par: Zhao, Chen, et autres
Publié: (2026)
par: Zhao, Chen, et autres
Publié: (2026)
FlowHijack: A Dynamics-Aware Backdoor Attack on Flow-Matching Vision-Language-Action Models
par: An, Xinyuan, et autres
Publié: (2026)
par: An, Xinyuan, et autres
Publié: (2026)
LLARVA: Vision-Action Instruction Tuning Enhances Robot Learning
par: Niu, Dantong, et autres
Publié: (2024)
par: Niu, Dantong, et autres
Publié: (2024)
Documents similaires
-
HiRT: Enhancing Robotic Control with Hierarchical Robot Transformers
par: Zhang, Jianke, et autres
Publié: (2024) -
Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations
par: Hu, Yucheng, et autres
Publié: (2024) -
VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models
par: Zhang, Jianke, et autres
Publié: (2026) -
UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent
par: Zhang, Jianke, et autres
Publié: (2025) -
Prediction with Action: Visual Policy Learning via Joint Denoising Process
par: Guo, Yanjiang, et autres
Publié: (2024)