Robust Policy Expansion for Offline-to-Online RL under Diverse Data Corruption
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | He, Longxiang, Ye, Deheng, Tan, Junbo, Wang, Xueqian, Shen, Li |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Towards Robust Offline Reinforcement Learning under Diverse Data Corruption
von: Yang, Rui, et al.
Veröffentlicht: (2023)
von: Yang, Rui, et al.
Veröffentlicht: (2023)
DiffCPS: Diffusion Model based Constrained Policy Search for Offline Reinforcement Learning
von: He, Longxiang, et al.
Veröffentlicht: (2023)
von: He, Longxiang, et al.
Veröffentlicht: (2023)
Uncertainty-based Offline Variational Bayesian Reinforcement Learning for Robustness under Diverse Data Corruptions
von: Yang, Rui, et al.
Veröffentlicht: (2024)
von: Yang, Rui, et al.
Veröffentlicht: (2024)
Offline Goal-Conditioned Reinforcement Learning for Safety-Critical Tasks with Recovery Policy
von: Cao, Chenyang, et al.
Veröffentlicht: (2024)
von: Cao, Chenyang, et al.
Veröffentlicht: (2024)
Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone
von: Mark, Max Sobol, et al.
Veröffentlicht: (2024)
von: Mark, Max Sobol, et al.
Veröffentlicht: (2024)
Action-Free Offline-to-Online RL via Discretised State Policies
von: Neggatu, Natinael Solomon, et al.
Veröffentlicht: (2026)
von: Neggatu, Natinael Solomon, et al.
Veröffentlicht: (2026)
Efficient Online RL Fine Tuning with Offline Pre-trained Policy Only
von: Xiao, Wei, et al.
Veröffentlicht: (2025)
von: Xiao, Wei, et al.
Veröffentlicht: (2025)
FOSP: Fine-tuning Offline Safe Policy through World Models
von: Cao, Chenyang, et al.
Veröffentlicht: (2024)
von: Cao, Chenyang, et al.
Veröffentlicht: (2024)
Corruption Robust Offline Reinforcement Learning with Human Feedback
von: Mandal, Debmalya, et al.
Veröffentlicht: (2024)
von: Mandal, Debmalya, et al.
Veröffentlicht: (2024)
Augmenting Offline RL with Unlabeled Data
von: Wang, Zhao, et al.
Veröffentlicht: (2024)
von: Wang, Zhao, et al.
Veröffentlicht: (2024)
General Flexible $f$-divergence for Challenging Offline RL Datasets with Low Stochasticity and Diverse Behavior Policies
von: Wang, Jianxun, et al.
Veröffentlicht: (2026)
von: Wang, Jianxun, et al.
Veröffentlicht: (2026)
An Empirical Study on the Effectiveness of Incorporating Offline RL As Online RL Subroutines
von: Su, Jianhai, et al.
Veröffentlicht: (2025)
von: Su, Jianhai, et al.
Veröffentlicht: (2025)
Provably Mitigating Corruption, Overoptimization, and Verbosity Simultaneously in Offline and Online RLHF/DPO Alignment
von: Chen, Ziyi, et al.
Veröffentlicht: (2025)
von: Chen, Ziyi, et al.
Veröffentlicht: (2025)
Enhancing Robustness of Offline Reinforcement Learning Under Data Corruption via Sharpness-Aware Minimization
von: Xu, Le, et al.
Veröffentlicht: (2025)
von: Xu, Le, et al.
Veröffentlicht: (2025)
ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning
von: Liu, Zeyuan, et al.
Veröffentlicht: (2025)
von: Liu, Zeyuan, et al.
Veröffentlicht: (2025)
Tackling Data Corruption in Offline Reinforcement Learning via Sequence Modeling
von: Xu, Jiawei, et al.
Veröffentlicht: (2024)
von: Xu, Jiawei, et al.
Veröffentlicht: (2024)
AlignIQL: Policy Alignment in Implicit Q-Learning through Constrained Optimization
von: He, Longxiang, et al.
Veröffentlicht: (2024)
von: He, Longxiang, et al.
Veröffentlicht: (2024)
Offline vs. Online Learning in Model-based RL: Lessons for Data Collection Strategies
von: Chen, Jiaqi, et al.
Veröffentlicht: (2025)
von: Chen, Jiaqi, et al.
Veröffentlicht: (2025)
Integrating Domain Knowledge for handling Limited Data in Offline RL
von: Gangopadhyay, Briti, et al.
Veröffentlicht: (2024)
von: Gangopadhyay, Briti, et al.
Veröffentlicht: (2024)
PROF: An LLM-based Reward Code Preference Optimization Framework for Offline Imitation Learning
von: Sun, Shengjie, et al.
Veröffentlicht: (2025)
von: Sun, Shengjie, et al.
Veröffentlicht: (2025)
Are Expressive Models Truly Necessary for Offline RL?
von: Wang, Guan, et al.
Veröffentlicht: (2024)
von: Wang, Guan, et al.
Veröffentlicht: (2024)
SOPE: Stabilizing Off-Policy Evaluation for Online RL with Prior Data
von: Romeo, Carlo, et al.
Veröffentlicht: (2026)
von: Romeo, Carlo, et al.
Veröffentlicht: (2026)
Adaptive Policy Selection and Fine-Tuning under Interaction Budgets for Offline-to-Online Reinforcement Learning
von: Bozkurt, Alper Kamil, et al.
Veröffentlicht: (2026)
von: Bozkurt, Alper Kamil, et al.
Veröffentlicht: (2026)
Chain-of-Goals Hierarchical Policy for Long-Horizon Offline Goal-Conditioned RL
von: Choi, Jinwoo, et al.
Veröffentlicht: (2026)
von: Choi, Jinwoo, et al.
Veröffentlicht: (2026)
QuAIL: Quality-Aware Inertial Learning for Robust Training under Data Corruption
von: Sabella, Mattia, et al.
Veröffentlicht: (2026)
von: Sabella, Mattia, et al.
Veröffentlicht: (2026)
COOPO: Cyclic Offline-Online Policy Optimization Algorithm
von: Liu, Qisai, et al.
Veröffentlicht: (2026)
von: Liu, Qisai, et al.
Veröffentlicht: (2026)
Budgeting Counterfactual for Offline RL
von: Liu, Yao, et al.
Veröffentlicht: (2023)
von: Liu, Yao, et al.
Veröffentlicht: (2023)
Cal-QL: Calibrated Offline RL Pre-Training for Efficient Online Fine-Tuning
von: Nakamoto, Mitsuhiko, et al.
Veröffentlicht: (2023)
von: Nakamoto, Mitsuhiko, et al.
Veröffentlicht: (2023)
Residual Q-Learning: Offline and Online Policy Customization without Value
von: Li, Chenran, et al.
Veröffentlicht: (2023)
von: Li, Chenran, et al.
Veröffentlicht: (2023)
CORD: Generalizable Cooperation via Role Diversity
von: Matsuyama, Kanefumi, et al.
Veröffentlicht: (2025)
von: Matsuyama, Kanefumi, et al.
Veröffentlicht: (2025)
SCOPE-RL: A Python Library for Offline Reinforcement Learning and Off-Policy Evaluation
von: Kiyohara, Haruka, et al.
Veröffentlicht: (2023)
von: Kiyohara, Haruka, et al.
Veröffentlicht: (2023)
Soft Policy Optimization: Online Off-Policy RL for Sequence Models
von: Cohen, Taco, et al.
Veröffentlicht: (2025)
von: Cohen, Taco, et al.
Veröffentlicht: (2025)
ViVa: Video-Trained Value Functions for Guiding Online RL from Diverse Data
von: Dashora, Nitish, et al.
Veröffentlicht: (2025)
von: Dashora, Nitish, et al.
Veröffentlicht: (2025)
ISEP: Implicit Support Expansion for Offline Reinforcement Learning via Stochastic Policy Optimization
von: Chen, Yifei, et al.
Veröffentlicht: (2026)
von: Chen, Yifei, et al.
Veröffentlicht: (2026)
Selective Uncertainty Propagation in Offline RL
von: Krishnamurthy, Sanath Kumar, et al.
Veröffentlicht: (2023)
von: Krishnamurthy, Sanath Kumar, et al.
Veröffentlicht: (2023)
Decoupled Prioritized Resampling for Offline RL
von: Yue, Yang, et al.
Veröffentlicht: (2023)
von: Yue, Yang, et al.
Veröffentlicht: (2023)
Dual Alignment Maximin Optimization for Offline Model-based RL
von: Zhou, Chi, et al.
Veröffentlicht: (2025)
von: Zhou, Chi, et al.
Veröffentlicht: (2025)
Failure-Aware RL: Reliable Offline-to-Online Reinforcement Learning with Self-Recovery for Real-World Manipulation
von: Li, Huanyu, et al.
Veröffentlicht: (2026)
von: Li, Huanyu, et al.
Veröffentlicht: (2026)
Belief-Based Offline Reinforcement Learning for Delay-Robust Policy Optimization
von: Zhan, Simon Sinong, et al.
Veröffentlicht: (2025)
von: Zhan, Simon Sinong, et al.
Veröffentlicht: (2025)
H2O+: An Improved Framework for Hybrid Offline-and-Online RL with Dynamics Gaps
von: Niu, Haoyi, et al.
Veröffentlicht: (2023)
von: Niu, Haoyi, et al.
Veröffentlicht: (2023)
Ähnliche Einträge
-
Towards Robust Offline Reinforcement Learning under Diverse Data Corruption
von: Yang, Rui, et al.
Veröffentlicht: (2023) -
DiffCPS: Diffusion Model based Constrained Policy Search for Offline Reinforcement Learning
von: He, Longxiang, et al.
Veröffentlicht: (2023) -
Uncertainty-based Offline Variational Bayesian Reinforcement Learning for Robustness under Diverse Data Corruptions
von: Yang, Rui, et al.
Veröffentlicht: (2024) -
Offline Goal-Conditioned Reinforcement Learning for Safety-Critical Tasks with Recovery Policy
von: Cao, Chenyang, et al.
Veröffentlicht: (2024) -
Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone
von: Mark, Max Sobol, et al.
Veröffentlicht: (2024)