Active Advantage-Aligned Online Reinforcement Learning with Offline Data
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Xuefeng, Le, Hung T. C., Chen, Siyu, Stevens, Rick, Yang, Zhuoran, Walter, Matthew R., Chen, Yuxin |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Blending Imitation and Reinforcement Learning for Robust Policy Improvement
par: Liu, Xuefeng, et autres
Publié: (2023)
par: Liu, Xuefeng, et autres
Publié: (2023)
DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization
par: Liu, Xuefeng, et autres
Publié: (2025)
par: Liu, Xuefeng, et autres
Publié: (2025)
Contextual Active Model Selection
par: Liu, Xuefeng, et autres
Publié: (2022)
par: Liu, Xuefeng, et autres
Publié: (2022)
Active Policy Improvement from Multiple Black-box Oracles
par: Liu, Xuefeng, et autres
Publié: (2023)
par: Liu, Xuefeng, et autres
Publié: (2023)
Information-Directed Offline-to-Online Reinforcement Learning
par: Chen, Keru
Publié: (2026)
par: Chen, Keru
Publié: (2026)
Energy-Guided Diffusion Sampling for Offline-to-Online Reinforcement Learning
par: Liu, Xu-Hui, et autres
Publié: (2024)
par: Liu, Xu-Hui, et autres
Publié: (2024)
Taming OOD Actions for Offline Reinforcement Learning: An Advantage-Based Approach
par: Chen, Xuyang, et autres
Publié: (2025)
par: Chen, Xuyang, et autres
Publié: (2025)
Adaptive Advantage-Guided Policy Regularization for Offline Reinforcement Learning
par: Liu, Tenglong, et autres
Publié: (2024)
par: Liu, Tenglong, et autres
Publié: (2024)
Diffusion Policies for Risk-Averse Behavior Modeling in Offline Reinforcement Learning
par: Chen, Xiaocong, et autres
Publié: (2024)
par: Chen, Xiaocong, et autres
Publié: (2024)
Policy-Guided Causal State Representation for Offline Reinforcement Learning Recommendation
par: Wang, Siyu, et autres
Publié: (2025)
par: Wang, Siyu, et autres
Publié: (2025)
Efficient Cross-Domain Offline Reinforcement Learning with Dynamics- and Value-Aligned Data Filtering
par: Qiao, Zhongjian, et autres
Publié: (2025)
par: Qiao, Zhongjian, et autres
Publié: (2025)
Instrumental Variable Value Iteration for Causal Offline Reinforcement Learning
par: Liao, Luofeng, et autres
Publié: (2021)
par: Liao, Luofeng, et autres
Publié: (2021)
Towards Robust Offline-to-Online Reinforcement Learning via Uncertainty and Smoothness
par: Wen, Xiaoyu, et autres
Publié: (2023)
par: Wen, Xiaoyu, et autres
Publié: (2023)
Pessimistic Value Iteration for Multi-Task Data Sharing in Offline Reinforcement Learning
par: Bai, Chenjia, et autres
Publié: (2024)
par: Bai, Chenjia, et autres
Publié: (2024)
Target-Aligned Bellman Backup for Cross-domain Offline Reinforcement Learning
par: Liu, Wei, et autres
Publié: (2026)
par: Liu, Wei, et autres
Publié: (2026)
Making Offline RL Online: Collaborative World Models for Offline Visual Reinforcement Learning
par: Wang, Qi, et autres
Publié: (2023)
par: Wang, Qi, et autres
Publié: (2023)
Enhancing Robustness of Offline Reinforcement Learning Under Data Corruption via Sharpness-Aware Minimization
par: Xu, Le, et autres
Publié: (2025)
par: Xu, Le, et autres
Publié: (2025)
Online Pre-Training for Offline-to-Online Reinforcement Learning
par: Shin, Yongjae, et autres
Publié: (2025)
par: Shin, Yongjae, et autres
Publié: (2025)
Enhancing Online Reinforcement Learning with Meta-Learned Objective from Offline Data
par: Deng, Shilong, et autres
Publié: (2025)
par: Deng, Shilong, et autres
Publié: (2025)
Bayesian Design Principles for Offline-to-Online Reinforcement Learning
par: Hu, Hao, et autres
Publié: (2024)
par: Hu, Hao, et autres
Publié: (2024)
ROAD: Adaptive Data Mixing for Offline-to-Online Reinforcement Learning via Bi-Level Optimization
par: Yang, Letian, et autres
Publié: (2026)
par: Yang, Letian, et autres
Publié: (2026)
A2PO: Towards Effective Offline Reinforcement Learning from an Advantage-aware Perspective
par: Qing, Yunpeng, et autres
Publié: (2024)
par: Qing, Yunpeng, et autres
Publié: (2024)
Offline Trajectory Optimization for Offline Reinforcement Learning
par: Zhao, Ziqi, et autres
Publié: (2024)
par: Zhao, Ziqi, et autres
Publié: (2024)
Dual-Robust Cross-Domain Offline Reinforcement Learning Against Dynamics Shifts
par: Qiao, Zhongjian, et autres
Publié: (2025)
par: Qiao, Zhongjian, et autres
Publié: (2025)
RLSynC: Offline-Online Reinforcement Learning for Synthon Completion
par: Baker, Frazier N., et autres
Publié: (2023)
par: Baker, Frazier N., et autres
Publié: (2023)
Offline-Online Reinforcement Learning for Linear Mixture MDPs
par: Zhang, Zhongjun, et autres
Publié: (2026)
par: Zhang, Zhongjun, et autres
Publié: (2026)
Quantile-Optimal Policy Learning under Unmeasured Confounding
par: Chen, Zhongren, et autres
Publié: (2025)
par: Chen, Zhongren, et autres
Publié: (2025)
Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data
par: Zhou, Zhiyuan, et autres
Publié: (2024)
par: Zhou, Zhiyuan, et autres
Publié: (2024)
FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning
par: Koirala, Prajwal, et autres
Publié: (2024)
par: Koirala, Prajwal, et autres
Publié: (2024)
DmC: Nearest Neighbor Guidance Diffusion Model for Offline Cross-domain Reinforcement Learning
par: Van, Linh Le Pham, et autres
Publié: (2025)
par: Van, Linh Le Pham, et autres
Publié: (2025)
Settling the Sample Complexity of Online Reinforcement Learning
par: Zhang, Zihan, et autres
Publié: (2023)
par: Zhang, Zihan, et autres
Publié: (2023)
Active Reinforcement Learning Strategies for Offline Policy Improvement
par: Dukkipati, Ambedkar, et autres
Publié: (2024)
par: Dukkipati, Ambedkar, et autres
Publié: (2024)
Efficient Online Decision Tree Learning with Active Feature Acquisition
par: Rahbar, Arman, et autres
Publié: (2023)
par: Rahbar, Arman, et autres
Publié: (2023)
Any-step Dynamics Model Improves Future Predictions for Online and Offline Reinforcement Learning
par: Lin, Haoxin, et autres
Publié: (2024)
par: Lin, Haoxin, et autres
Publié: (2024)
Efficient and Uncertainty-Aware Diffusion Framework for Offline-to-Online Reinforcement Learning
par: Bui, Ha Manh, et autres
Publié: (2026)
par: Bui, Ha Manh, et autres
Publié: (2026)
Your Offline Policy is Not Trustworthy: Bilevel Reinforcement Learning for Sequential Portfolio Optimization
par: Yuan, Haochen, et autres
Publié: (2025)
par: Yuan, Haochen, et autres
Publié: (2025)
Online Optimization for Offline Safe Reinforcement Learning
par: Chemingui, Yassine, et autres
Publié: (2025)
par: Chemingui, Yassine, et autres
Publié: (2025)
The Three Regimes of Offline-to-Online Reinforcement Learning
par: Li, Lu, et autres
Publié: (2025)
par: Li, Lu, et autres
Publié: (2025)
Contrastive UCB: Provably Efficient Contrastive Self-Supervised Learning in Online Reinforcement Learning
par: Qiu, Shuang, et autres
Publié: (2022)
par: Qiu, Shuang, et autres
Publié: (2022)
Provable Zero-Shot Generalization in Offline Reinforcement Learning
par: Wang, Zhiyong, et autres
Publié: (2025)
par: Wang, Zhiyong, et autres
Publié: (2025)
Documents similaires
-
Blending Imitation and Reinforcement Learning for Robust Policy Improvement
par: Liu, Xuefeng, et autres
Publié: (2023) -
DrugImproverGPT: A Large Language Model for Drug Optimization with Fine-Tuning via Structured Policy Optimization
par: Liu, Xuefeng, et autres
Publié: (2025) -
Contextual Active Model Selection
par: Liu, Xuefeng, et autres
Publié: (2022) -
Active Policy Improvement from Multiple Black-box Oracles
par: Liu, Xuefeng, et autres
Publié: (2023) -
Information-Directed Offline-to-Online Reinforcement Learning
par: Chen, Keru
Publié: (2026)