COOPO: Cyclic Offline-Online Policy Optimization Algorithm
Fuente:
arXiv
Saved in:
| Main Authors: | Liu, Qisai, Jiang, Zhanhong, Waite, Joshua Russell, Balu, Aditya, Fleming, Cody, Sarkar, Soumik |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Bidirectional Linear Recurrent Models for Sequence-Level Multisource Fusion
by: Liu, Qisai, et al.
Published: (2025)
by: Liu, Qisai, et al.
Published: (2025)
Latent Safety-Constrained Policy Approach for Safe Offline Reinforcement Learning
by: Koirala, Prajwal, et al.
Published: (2024)
by: Koirala, Prajwal, et al.
Published: (2024)
LexiSafe: Offline Safe Reinforcement Learning with Lexicographic Safety-Reward Hierarchy
by: Yang, Hsin-Jung, et al.
Published: (2026)
by: Yang, Hsin-Jung, et al.
Published: (2026)
FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning
by: Koirala, Prajwal, et al.
Published: (2024)
by: Koirala, Prajwal, et al.
Published: (2024)
Enhancing PPO with Trajectory-Aware Hybrid Policies
by: Liu, Qisai, et al.
Published: (2025)
by: Liu, Qisai, et al.
Published: (2025)
TabQL: In-Context Q-Learning with Tabular Foundation Models
by: Liu, Qisai, et al.
Published: (2026)
by: Liu, Qisai, et al.
Published: (2026)
FUSE: First-Order and Second-Order Unified SynthEsis in Stochastic Optimization
by: Jiang, Zhanhong, et al.
Published: (2025)
by: Jiang, Zhanhong, et al.
Published: (2025)
RLS3: RL-Based Synthetic Sample Selection to Enhance Spatial Reasoning in Vision-Language Models for Indoor Autonomous Perception
by: Waite, Joshua R., et al.
Published: (2025)
by: Waite, Joshua R., et al.
Published: (2025)
DeCAF: Decentralized Consensus-And-Factorization for Low-Rank Adaptation of Foundation Models
by: Saadati, Nastaran, et al.
Published: (2025)
by: Saadati, Nastaran, et al.
Published: (2025)
Lighting-aware Unified Model for Instance Segmentation
by: Liu, Qisai, et al.
Published: (2026)
by: Liu, Qisai, et al.
Published: (2026)
Neural CDEs as Correctors for Learned Time Series Models
by: Shahid, Muhammad Bilal, et al.
Published: (2025)
by: Shahid, Muhammad Bilal, et al.
Published: (2025)
Decentralized Relaxed Smooth Optimization with Gradient Descent Methods
by: Jiang, Zhanhong, et al.
Published: (2025)
by: Jiang, Zhanhong, et al.
Published: (2025)
Balancing Utility and Privacy: Dynamically Private SGD with Random Projection
by: Jiang, Zhanhong, et al.
Published: (2025)
by: Jiang, Zhanhong, et al.
Published: (2025)
DIMAT: Decentralized Iterative Merging-And-Training for Deep Learning Models
by: Saadati, Nastaran, et al.
Published: (2024)
by: Saadati, Nastaran, et al.
Published: (2024)
ADKO: Agentic Decentralized Knowledge Optimization
by: Rillo, Lucas Nerone, et al.
Published: (2026)
by: Rillo, Lucas Nerone, et al.
Published: (2026)
Beyond State-Wise Mirror Descent: Offline Policy Optimization with Parametric Policies
by: Li, Xiang, et al.
Published: (2026)
by: Li, Xiang, et al.
Published: (2026)
CROP: Conservative Reward for Model-based Offline Policy Optimization
by: Li, Hao, et al.
Published: (2023)
by: Li, Hao, et al.
Published: (2023)
Online Optimization for Offline Safe Reinforcement Learning
by: Chemingui, Yassine, et al.
Published: (2025)
by: Chemingui, Yassine, et al.
Published: (2025)
Federated Offline Policy Optimization with Dual Regularization
by: Yue, Sheng, et al.
Published: (2024)
by: Yue, Sheng, et al.
Published: (2024)
Action-Free Offline-to-Online RL via Discretised State Policies
by: Neggatu, Natinael Solomon, et al.
Published: (2026)
by: Neggatu, Natinael Solomon, et al.
Published: (2026)
Residual Q-Learning: Offline and Online Policy Customization without Value
by: Li, Chenran, et al.
Published: (2023)
by: Li, Chenran, et al.
Published: (2023)
Efficient Online RL Fine Tuning with Offline Pre-trained Policy Only
by: Xiao, Wei, et al.
Published: (2025)
by: Xiao, Wei, et al.
Published: (2025)
Robust Policy Expansion for Offline-to-Online RL under Diverse Data Corruption
by: He, Longxiang, et al.
Published: (2025)
by: He, Longxiang, et al.
Published: (2025)
AgGym: An agricultural biotic stress simulation environment for ultra-precision management planning
by: Khosravi, Mahsa, et al.
Published: (2024)
by: Khosravi, Mahsa, et al.
Published: (2024)
Regularized Offline Policy Optimization with Posterior Hybrid Bayesian Belief
by: Lin, Hongqiang, et al.
Published: (2026)
by: Lin, Hongqiang, et al.
Published: (2026)
Preferred-Action-Optimized Diffusion Policies for Offline Reinforcement Learning
by: Zhang, Tianle, et al.
Published: (2024)
by: Zhang, Tianle, et al.
Published: (2024)
Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning
by: Hu, Jifeng, et al.
Published: (2025)
by: Hu, Jifeng, et al.
Published: (2025)
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning
by: Gao, Chen-Xiao, et al.
Published: (2025)
by: Gao, Chen-Xiao, et al.
Published: (2025)
Adversarial Policy Optimization for Offline Preference-based Reinforcement Learning
by: Kang, Hyungkyu, et al.
Published: (2025)
by: Kang, Hyungkyu, et al.
Published: (2025)
Diffusion Policies with Value-Conditional Optimization for Offline Reinforcement Learning
by: Ma, Yunchang, et al.
Published: (2025)
by: Ma, Yunchang, et al.
Published: (2025)
Modular Diffusion Policy Training: Decoupling and Recombining Guidance and Diffusion for Offline RL
by: Chen, Zhaoyang, et al.
Published: (2025)
by: Chen, Zhaoyang, et al.
Published: (2025)
Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization
by: Liu, Zongkai, et al.
Published: (2024)
by: Liu, Zongkai, et al.
Published: (2024)
ROAD: Adaptive Data Mixing for Offline-to-Online Reinforcement Learning via Bi-Level Optimization
by: Yang, Letian, et al.
Published: (2026)
by: Yang, Letian, et al.
Published: (2026)
Offline Trajectory Optimization for Offline Reinforcement Learning
by: Zhao, Ziqi, et al.
Published: (2024)
by: Zhao, Ziqi, et al.
Published: (2024)
Development and Validation of Heparin Dosing Policies Using an Offline Reinforcement Learning Algorithm
by: Lim, Yooseok, et al.
Published: (2024)
by: Lim, Yooseok, et al.
Published: (2024)
Offline Reinforcement Learning in Large State Spaces: Algorithms and Guarantees
by: Jiang, Nan, et al.
Published: (2025)
by: Jiang, Nan, et al.
Published: (2025)
COSBO: Conservative Offline Simulation-Based Policy Optimization
by: Kargar, Eshagh, et al.
Published: (2024)
by: Kargar, Eshagh, et al.
Published: (2024)
Belief-Based Offline Reinforcement Learning for Delay-Robust Policy Optimization
by: Zhan, Simon Sinong, et al.
Published: (2025)
by: Zhan, Simon Sinong, et al.
Published: (2025)
Offline Model-Based Optimization via Policy-Guided Gradient Search
by: Chemingui, Yassine, et al.
Published: (2024)
by: Chemingui, Yassine, et al.
Published: (2024)
Value-Incentivized Preference Optimization: A Unified Approach to Online and Offline RLHF
by: Cen, Shicong, et al.
Published: (2024)
by: Cen, Shicong, et al.
Published: (2024)
Similar Items
-
Bidirectional Linear Recurrent Models for Sequence-Level Multisource Fusion
by: Liu, Qisai, et al.
Published: (2025) -
Latent Safety-Constrained Policy Approach for Safe Offline Reinforcement Learning
by: Koirala, Prajwal, et al.
Published: (2024) -
LexiSafe: Offline Safe Reinforcement Learning with Lexicographic Safety-Reward Hierarchy
by: Yang, Hsin-Jung, et al.
Published: (2026) -
FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning
by: Koirala, Prajwal, et al.
Published: (2024) -
Enhancing PPO with Trajectory-Aware Hybrid Policies
by: Liu, Qisai, et al.
Published: (2025)