Scaling Offline Model-Based RL via Jointly-Optimized World-Action Model Pretraining
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Cheng, Jie, Qiao, Ruixi, Ma, Yingwei, Li, Binhua, Xiong, Gang, Miao, Qinghai, Li, Yongbin, Lv, Yisheng |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Stop Summation: Min-Form Credit Assignment Is All Process Reward Model Needs for Reasoning
par: Cheng, Jie, et autres
Publié: (2025)
par: Cheng, Jie, et autres
Publié: (2025)
RIME: Robust Preference-based Reinforcement Learning with Noisy Preferences
par: Cheng, Jie, et autres
Publié: (2024)
par: Cheng, Jie, et autres
Publié: (2024)
Alibaba LingmaAgent: Improving Automated Issue Resolution via Comprehensive Repository Exploration
par: Ma, Yingwei, et autres
Publié: (2024)
par: Ma, Yingwei, et autres
Publié: (2024)
Thinking Longer, Not Larger: Enhancing Software Engineering Agents via Scaling Test-Time Compute
par: Ma, Yingwei, et autres
Publié: (2025)
par: Ma, Yingwei, et autres
Publié: (2025)
Offline Reinforcement Learning with Discrete Diffusion Skills
par: Qiao, RuiXi, et autres
Publié: (2025)
par: Qiao, RuiXi, et autres
Publié: (2025)
MiniDrive: More Efficient Vision-Language Models with Multi-Level 2D Features as Text Tokens for Autonomous Driving
par: Zhang, Enming, et autres
Publié: (2024)
par: Zhang, Enming, et autres
Publié: (2024)
LLMs as Continuous Learners: Improving the Reproduction of Defective Code in Software Issues
par: Lin, Yalan, et autres
Publié: (2024)
par: Lin, Yalan, et autres
Publié: (2024)
RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization
par: Dong, Yihong, et autres
Publié: (2025)
par: Dong, Yihong, et autres
Publié: (2025)
Scalable Offline Model-Based RL with Action Chunks
par: Park, Kwanyoung, et autres
Publié: (2025)
par: Park, Kwanyoung, et autres
Publié: (2025)
Evaluation of Safety Cognition Capability in Vision-Language Models for Autonomous Driving
par: Zhang, Enming, et autres
Publié: (2025)
par: Zhang, Enming, et autres
Publié: (2025)
Codev-Bench: How Do LLMs Understand Developer-Centric Code Completion?
par: Pan, Zhenyu, et autres
Publié: (2024)
par: Pan, Zhenyu, et autres
Publié: (2024)
Lingma SWE-GPT: An Open Development-Process-Centric Language Model for Automated Software Improvement
par: Ma, Yingwei, et autres
Publié: (2024)
par: Ma, Yingwei, et autres
Publié: (2024)
Inference Time Policy Optimization for Offline RL with Differentiable World Models
par: Deb, Rohan, et autres
Publié: (2026)
par: Deb, Rohan, et autres
Publié: (2026)
Large Language Model Unlearning for Source Code
par: Jiang, Xue, et autres
Publié: (2025)
par: Jiang, Xue, et autres
Publié: (2025)
SUMO-MCP: Leveraging the Model Context Protocol for Autonomous Traffic Simulation and Optimization
par: Ye, Chenglong, et autres
Publié: (2025)
par: Ye, Chenglong, et autres
Publié: (2025)
Dual Alignment Maximin Optimization for Offline Model-based RL
par: Zhou, Chi, et autres
Publié: (2025)
par: Zhou, Chi, et autres
Publié: (2025)
Meta-DT: Offline Meta-RL as Conditional Sequence Modeling with World Model Disentanglement
par: Wang, Zhi, et autres
Publié: (2024)
par: Wang, Zhi, et autres
Publié: (2024)
Are Expressive Models Truly Necessary for Offline RL?
par: Wang, Guan, et autres
Publié: (2024)
par: Wang, Guan, et autres
Publié: (2024)
DAWM: Diffusion Action World Models for Offline Reinforcement Learning via Action-Inferred Transitions
par: Li, Zongyue, et autres
Publié: (2025)
par: Li, Zongyue, et autres
Publié: (2025)
Making Offline RL Online: Collaborative World Models for Offline Visual Reinforcement Learning
par: Wang, Qi, et autres
Publié: (2023)
par: Wang, Qi, et autres
Publié: (2023)
Diffusion Models as Optimizers for Efficient Planning in Offline RL
par: Huang, Renming, et autres
Publié: (2024)
par: Huang, Renming, et autres
Publié: (2024)
AdamO: A Collapse-Suppressed Optimizer for Offline RL
par: Qiao, Nan, et autres
Publié: (2026)
par: Qiao, Nan, et autres
Publié: (2026)
Latent Action Pretraining Through World Modeling
par: Tharwat, Bahey, et autres
Publié: (2025)
par: Tharwat, Bahey, et autres
Publié: (2025)
Scaling Offline RL via Efficient and Expressive Shortcut Models
par: Espinosa-Dice, Nicolas, et autres
Publié: (2025)
par: Espinosa-Dice, Nicolas, et autres
Publié: (2025)
Advantage Weighted Matching: Aligning RL with Pretraining in Diffusion Models
par: Xue, Shuchen, et autres
Publié: (2025)
par: Xue, Shuchen, et autres
Publié: (2025)
VLA-OPD: Bridging Offline SFT and Online RL for Vision-Language-Action Models via On-Policy Distillation
par: Zhong, Zhide, et autres
Publié: (2026)
par: Zhong, Zhide, et autres
Publié: (2026)
Discover, Learn, and Reinforce: Scaling Vision-Language-Action Pretraining with Diverse RL-Generated Trajectories
par: Yang, Rushuai, et autres
Publié: (2025)
par: Yang, Rushuai, et autres
Publié: (2025)
Iterative Forward Tuning Boosts In-Context Learning in Language Models
par: Yang, Jiaxi, et autres
Publié: (2023)
par: Yang, Jiaxi, et autres
Publié: (2023)
Webscale-RL: Automated Data Pipeline for Scaling RL Data to Pretraining Levels
par: Cen, Zhepeng, et autres
Publié: (2025)
par: Cen, Zhepeng, et autres
Publié: (2025)
SLAC: Simulation-Pretrained Latent Action Space for Whole-Body Real-World RL
par: Hu, Jiaheng, et autres
Publié: (2025)
par: Hu, Jiaheng, et autres
Publié: (2025)
Format-Adapter: Improving Reasoning Capability of LLMs by Adapting Suitable Format
par: Wang, Dingzirui, et autres
Publié: (2025)
par: Wang, Dingzirui, et autres
Publié: (2025)
SC-Tune: Unleashing Self-Consistent Referential Comprehension in Large Vision Language Models
par: Yue, Tongtian, et autres
Publié: (2024)
par: Yue, Tongtian, et autres
Publié: (2024)
Enhancing Offline Model-Based RL via Active Model Selection: A Bayesian Optimization Perspective
par: Yang, Yu-Wei, et autres
Publié: (2025)
par: Yang, Yu-Wei, et autres
Publié: (2025)
Model-Based Reinforcement Learning with Multi-Task Offline Pretraining
par: Pan, Minting, et autres
Publié: (2023)
par: Pan, Minting, et autres
Publié: (2023)
Mitigating Distribution Shift in Model-based Offline RL via Shifts-aware Reward Learning
par: Luo, Wang, et autres
Publié: (2024)
par: Luo, Wang, et autres
Publié: (2024)
GigaWorld-Policy: An Efficient Action-Centered World--Action Model
par: Ye, Angen, et autres
Publié: (2026)
par: Ye, Angen, et autres
Publié: (2026)
To Diff or Not to Diff? Structure-Aware and Adaptive Output Formats for Efficient LLM-based Code Editing
par: Cheng, Wei, et autres
Publié: (2026)
par: Cheng, Wei, et autres
Publié: (2026)
Joint BS Deployment and Power Optimization for Minimum EMF Exposure with RL in Real-World Based Urban Scenario
par: Long, Xueyun, et autres
Publié: (2025)
par: Long, Xueyun, et autres
Publié: (2025)
Scaling Vision-and-Language Navigation With Offline RL
par: Bundele, Valay, et autres
Publié: (2024)
par: Bundele, Valay, et autres
Publié: (2024)
ResWM: Residual-Action World Model for Visual RL
par: Zhang, Jseen, et autres
Publié: (2026)
par: Zhang, Jseen, et autres
Publié: (2026)
Documents similaires
-
Stop Summation: Min-Form Credit Assignment Is All Process Reward Model Needs for Reasoning
par: Cheng, Jie, et autres
Publié: (2025) -
RIME: Robust Preference-based Reinforcement Learning with Noisy Preferences
par: Cheng, Jie, et autres
Publié: (2024) -
Alibaba LingmaAgent: Improving Automated Issue Resolution via Comprehensive Repository Exploration
par: Ma, Yingwei, et autres
Publié: (2024) -
Thinking Longer, Not Larger: Enhancing Software Engineering Agents via Scaling Test-Time Compute
par: Ma, Yingwei, et autres
Publié: (2025) -
Offline Reinforcement Learning with Discrete Diffusion Skills
par: Qiao, RuiXi, et autres
Publié: (2025)