FOSP: Fine-tuning Offline Safe Policy through World Models
Fuente:
arXiv
Saved in:
| Main Authors: | Cao, Chenyang, Xin, Yucheng, Wu, Silang, He, Longxiang, Yan, Zichen, Tan, Junbo, Wang, Xueqian |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Offline Goal-Conditioned Reinforcement Learning for Safety-Critical Tasks with Recovery Policy
by: Cao, Chenyang, et al.
Published: (2024)
by: Cao, Chenyang, et al.
Published: (2024)
DiffCPS: Diffusion Model based Constrained Policy Search for Offline Reinforcement Learning
by: He, Longxiang, et al.
Published: (2023)
by: He, Longxiang, et al.
Published: (2023)
Robust Policy Expansion for Offline-to-Online RL under Diverse Data Corruption
by: He, Longxiang, et al.
Published: (2025)
by: He, Longxiang, et al.
Published: (2025)
AlignIQL: Policy Alignment in Implicit Q-Learning through Constrained Optimization
by: He, Longxiang, et al.
Published: (2024)
by: He, Longxiang, et al.
Published: (2024)
FDPP: Fine-tune Diffusion Policy with Human Preference
by: Chen, Yuxin, et al.
Published: (2025)
by: Chen, Yuxin, et al.
Published: (2025)
MOTO: Offline Pre-training to Online Fine-tuning for Model-based Robot Learning
by: Rafailov, Rafael, et al.
Published: (2024)
by: Rafailov, Rafael, et al.
Published: (2024)
Behavioral Mode Discovery for Fine-tuning Multimodal Generative Policies
by: Longhini, Alberta, et al.
Published: (2026)
by: Longhini, Alberta, et al.
Published: (2026)
Residual Reward Models for Preference-based Reinforcement Learning
by: Cao, Chenyang, et al.
Published: (2025)
by: Cao, Chenyang, et al.
Published: (2025)
ReinFlow: Fine-tuning Flow Matching Policy with Online Reinforcement Learning
by: Zhang, Tonghe, et al.
Published: (2025)
by: Zhang, Tonghe, et al.
Published: (2025)
CO-RFT: Efficient Fine-Tuning of Vision-Language-Action Models through Chunked Offline Reinforcement Learning
by: Huang, Dongchi, et al.
Published: (2025)
by: Huang, Dongchi, et al.
Published: (2025)
Safe Offline Reinforcement Learning with Feasibility-Guided Diffusion Model
by: Zheng, Yinan, et al.
Published: (2024)
by: Zheng, Yinan, et al.
Published: (2024)
Efficient Online RL Fine Tuning with Offline Pre-trained Policy Only
by: Xiao, Wei, et al.
Published: (2025)
by: Xiao, Wei, et al.
Published: (2025)
Safe Deep Policy Adaptation
by: Xiao, Wenli, et al.
Published: (2023)
by: Xiao, Wenli, et al.
Published: (2023)
Safe Offline Reinforcement Learning with Real-Time Budget Constraints
by: Lin, Qian, et al.
Published: (2023)
by: Lin, Qian, et al.
Published: (2023)
Dataset Clustering for Improved Offline Policy Learning
by: Wang, Qiang, et al.
Published: (2024)
by: Wang, Qiang, et al.
Published: (2024)
Toward Safe Autonomous Robotic Endovascular Interventions using World Models
by: Robertshaw, Harry, et al.
Published: (2026)
by: Robertshaw, Harry, et al.
Published: (2026)
Diffusion Policies with Value-Conditional Optimization for Offline Reinforcement Learning
by: Ma, Yunchang, et al.
Published: (2025)
by: Ma, Yunchang, et al.
Published: (2025)
REFINE-DP: Diffusion Policy Fine-tuning for Humanoid Loco-manipulation via Reinforcement Learning
by: Gu, Zhaoyuan, et al.
Published: (2026)
by: Gu, Zhaoyuan, et al.
Published: (2026)
Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning
by: Yin, Patrick, et al.
Published: (2025)
by: Yin, Patrick, et al.
Published: (2025)
Uncertainty Comes for Free: Human-in-the-Loop Policies with Diffusion Models
by: He, Zhanpeng, et al.
Published: (2025)
by: He, Zhanpeng, et al.
Published: (2025)
Boundary-to-Region Supervision for Offline Safe Reinforcement Learning
by: Su, Huikang, et al.
Published: (2025)
by: Su, Huikang, et al.
Published: (2025)
Adaptive Advantage-Guided Policy Regularization for Offline Reinforcement Learning
by: Liu, Tenglong, et al.
Published: (2024)
by: Liu, Tenglong, et al.
Published: (2024)
Uni-O4: Unifying Online and Offline Deep Reinforcement Learning with Multi-Step On-Policy Optimization
by: Lei, Kun, et al.
Published: (2023)
by: Lei, Kun, et al.
Published: (2023)
Spatial-Temporal Graph Diffusion Policy with Kinematic Modeling for Bimanual Robotic Manipulation
by: Lv, Qi, et al.
Published: (2025)
by: Lv, Qi, et al.
Published: (2025)
SATA: Safe and Adaptive Torque-Based Locomotion Policies Inspired by Animal Learning
by: Li, Peizhuo, et al.
Published: (2025)
by: Li, Peizhuo, et al.
Published: (2025)
Safe Policy Exploration Improvement via Subgoals
by: Angulo, Brian, et al.
Published: (2024)
by: Angulo, Brian, et al.
Published: (2024)
AutoLoop: Fast Visual SLAM Fine-tuning through Agentic Curriculum Learning
by: Lahiany, Assaf, et al.
Published: (2025)
by: Lahiany, Assaf, et al.
Published: (2025)
A Real-World Quadrupedal Locomotion Benchmark for Offline Reinforcement Learning
by: Zhang, Hongyin, et al.
Published: (2023)
by: Zhang, Hongyin, et al.
Published: (2023)
Safe Domain Randomization via Uncertainty-Aware Out-of-Distribution Detection and Policy Adaptation
by: Danesh, Mohamad H., et al.
Published: (2025)
by: Danesh, Mohamad H., et al.
Published: (2025)
Learning Getting-Up Policies for Real-World Humanoid Robots
by: He, Xialin, et al.
Published: (2025)
by: He, Xialin, et al.
Published: (2025)
ViIK: Flow-based Vision Inverse Kinematics Solver with Fusing Collision Checking
by: Meng, Qinglong, et al.
Published: (2024)
by: Meng, Qinglong, et al.
Published: (2024)
Contact-Anchored Policies: Contact Conditioning Creates Strong Robot Utility Models
by: Cui, Zichen Jeff, et al.
Published: (2026)
by: Cui, Zichen Jeff, et al.
Published: (2026)
Off-Policy Safe Reinforcement Learning with Constrained Optimistic Exploration
by: Li, Guopeng, et al.
Published: (2026)
by: Li, Guopeng, et al.
Published: (2026)
Adaptive Q-Chunking for Offline-to-Online Reinforcement Learning
by: Gireesh, Nandiraju, et al.
Published: (2026)
by: Gireesh, Nandiraju, et al.
Published: (2026)
Beyond Hard Constraints: Budget-Conditioned Reachability For Safe Offline Reinforcement Learning
by: Brahmanage, Janaka Chathuranga, et al.
Published: (2026)
by: Brahmanage, Janaka Chathuranga, et al.
Published: (2026)
RPG: Robust Policy Gating for Smooth Multi-Skill Transitions in Humanoid Fighting
by: Xin, Yucheng, et al.
Published: (2026)
by: Xin, Yucheng, et al.
Published: (2026)
SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows
by: Yang, Chenyu, et al.
Published: (2026)
by: Yang, Chenyu, et al.
Published: (2026)
Real-World Offline Reinforcement Learning from Vision Language Model Feedback
by: Venkataraman, Sreyas, et al.
Published: (2024)
by: Venkataraman, Sreyas, et al.
Published: (2024)
Robust Policy Learning via Offline Skill Diffusion
by: Kim, Woo Kyung, et al.
Published: (2024)
by: Kim, Woo Kyung, et al.
Published: (2024)
COSBO: Conservative Offline Simulation-Based Policy Optimization
by: Kargar, Eshagh, et al.
Published: (2024)
by: Kargar, Eshagh, et al.
Published: (2024)
Similar Items
-
Offline Goal-Conditioned Reinforcement Learning for Safety-Critical Tasks with Recovery Policy
by: Cao, Chenyang, et al.
Published: (2024) -
DiffCPS: Diffusion Model based Constrained Policy Search for Offline Reinforcement Learning
by: He, Longxiang, et al.
Published: (2023) -
Robust Policy Expansion for Offline-to-Online RL under Diverse Data Corruption
by: He, Longxiang, et al.
Published: (2025) -
AlignIQL: Policy Alignment in Implicit Q-Learning through Constrained Optimization
by: He, Longxiang, et al.
Published: (2024) -
FDPP: Fine-tune Diffusion Policy with Human Preference
by: Chen, Yuxin, et al.
Published: (2025)