Beyond State-Wise Mirror Descent: Offline Policy Optimization with Parametric Policies
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Xiang, Zhang, Yuheng, Jiang, Nan |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Policy Mirror Descent with Lookahead
par: Protopapas, Kimon, et autres
Publié: (2024)
par: Protopapas, Kimon, et autres
Publié: (2024)
Functional Acceleration for Policy Mirror Descent
par: Chelu, Veronica, et autres
Publié: (2024)
par: Chelu, Veronica, et autres
Publié: (2024)
Statistical Tractability of Off-policy Evaluation of History-dependent Policies in POMDPs
par: Zhang, Yuheng, et autres
Publié: (2025)
par: Zhang, Yuheng, et autres
Publié: (2025)
StaQ it! Growing neural networks for Policy Mirror Descent
par: Shilova, Alena, et autres
Publié: (2025)
par: Shilova, Alena, et autres
Publié: (2025)
Improving LLM General Preference Alignment via Optimistic Online Mirror Descent
par: Zhang, Yuheng, et autres
Publié: (2025)
par: Zhang, Yuheng, et autres
Publié: (2025)
Stochastic MeanFlow Policies: One-Step Generative Control with Entropic Mirror Descent
par: Wang, Zeyuan, et autres
Publié: (2026)
par: Wang, Zeyuan, et autres
Publié: (2026)
Rethinking Importance Sampling in LLM Policy Optimization: A Cumulative Token Perspective
par: Zhang, Yuheng, et autres
Publié: (2026)
par: Zhang, Yuheng, et autres
Publié: (2026)
Q-MMR: Off-Policy Evaluation via Recursive Reweighting and Moment Matching
par: Li, Xiang, et autres
Publié: (2026)
par: Li, Xiang, et autres
Publié: (2026)
COOPO: Cyclic Offline-Online Policy Optimization Algorithm
par: Liu, Qisai, et autres
Publié: (2026)
par: Liu, Qisai, et autres
Publié: (2026)
CROP: Conservative Reward for Model-based Offline Policy Optimization
par: Li, Hao, et autres
Publié: (2023)
par: Li, Hao, et autres
Publié: (2023)
Preferred-Action-Optimized Diffusion Policies for Offline Reinforcement Learning
par: Zhang, Tianle, et autres
Publié: (2024)
par: Zhang, Tianle, et autres
Publié: (2024)
Federated Offline Policy Optimization with Dual Regularization
par: Yue, Sheng, et autres
Publié: (2024)
par: Yue, Sheng, et autres
Publié: (2024)
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning
par: Gao, Chen-Xiao, et autres
Publié: (2025)
par: Gao, Chen-Xiao, et autres
Publié: (2025)
Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning
par: Hu, Jifeng, et autres
Publié: (2025)
par: Hu, Jifeng, et autres
Publié: (2025)
Diffusion Policies with Value-Conditional Optimization for Offline Reinforcement Learning
par: Ma, Yunchang, et autres
Publié: (2025)
par: Ma, Yunchang, et autres
Publié: (2025)
Beyond Importance Sampling: Rejection-Gated Policy Optimization
par: Sun, Ziwu, et autres
Publié: (2026)
par: Sun, Ziwu, et autres
Publié: (2026)
Regularized Offline Policy Optimization with Posterior Hybrid Bayesian Belief
par: Lin, Hongqiang, et autres
Publié: (2026)
par: Lin, Hongqiang, et autres
Publié: (2026)
Adversarial Policy Optimization for Offline Preference-based Reinforcement Learning
par: Kang, Hyungkyu, et autres
Publié: (2025)
par: Kang, Hyungkyu, et autres
Publié: (2025)
Offline Reinforcement Learning in Large State Spaces: Algorithms and Guarantees
par: Jiang, Nan, et autres
Publié: (2025)
par: Jiang, Nan, et autres
Publié: (2025)
Offline Policy Evaluation for Reinforcement Learning with Adaptively Collected Data
par: Madhow, Sunil, et autres
Publié: (2023)
par: Madhow, Sunil, et autres
Publié: (2023)
COSBO: Conservative Offline Simulation-Based Policy Optimization
par: Kargar, Eshagh, et autres
Publié: (2024)
par: Kargar, Eshagh, et autres
Publié: (2024)
On the Curses of Future and History in Future-dependent Value Functions for Off-policy Evaluation
par: Zhang, Yuheng, et autres
Publié: (2024)
par: Zhang, Yuheng, et autres
Publié: (2024)
Detector-Evasive LLM Paraphrasing via Constrained Policy Optimization
par: Wang, Mingyi, et autres
Publié: (2026)
par: Wang, Mingyi, et autres
Publié: (2026)
Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization
par: Liu, Zongkai, et autres
Publié: (2024)
par: Liu, Zongkai, et autres
Publié: (2024)
Action-Free Offline-to-Online RL via Discretised State Policies
par: Neggatu, Natinael Solomon, et autres
Publié: (2026)
par: Neggatu, Natinael Solomon, et autres
Publié: (2026)
Beyond the Boundaries of Proximal Policy Optimization
par: Tan, Charlie B., et autres
Publié: (2024)
par: Tan, Charlie B., et autres
Publié: (2024)
Belief-Based Offline Reinforcement Learning for Delay-Robust Policy Optimization
par: Zhan, Simon Sinong, et autres
Publié: (2025)
par: Zhan, Simon Sinong, et autres
Publié: (2025)
Offline Model-Based Optimization via Policy-Guided Gradient Search
par: Chemingui, Yassine, et autres
Publié: (2024)
par: Chemingui, Yassine, et autres
Publié: (2024)
Beyond Semantic Manipulation: Token-Space Attacks on Reward Models
par: Zhang, Yuheng, et autres
Publié: (2026)
par: Zhang, Yuheng, et autres
Publié: (2026)
State Regularized Policy Optimization on Data with Dynamics Shift
par: Xue, Zhenghai, et autres
Publié: (2023)
par: Xue, Zhenghai, et autres
Publié: (2023)
Offline Reinforcement Learning with Generative Trajectory Policies
par: Feng, Xinsong, et autres
Publié: (2025)
par: Feng, Xinsong, et autres
Publié: (2025)
Mirror Learning: A Unifying Framework of Policy Optimisation
par: Kuba, Jakub Grudzien, et autres
Publié: (2022)
par: Kuba, Jakub Grudzien, et autres
Publié: (2022)
OM2P: Offline Multi-Agent Mean-Flow Policy
par: Li, Zhuoran, et autres
Publié: (2025)
par: Li, Zhuoran, et autres
Publié: (2025)
Reference-Sampled Boltzmann Projection for KL-Regularized RLVR: Target-Matched Weighted SFT, Finite One-Shot Gaps, and Policy Mirror Descent
par: Shu, Yao, et autres
Publié: (2026)
par: Shu, Yao, et autres
Publié: (2026)
Policy Constraint by Only Support Constraint for Offline Reinforcement Learning
par: Gao, Yunkai, et autres
Publié: (2025)
par: Gao, Yunkai, et autres
Publié: (2025)
Fast Convergence of Softmax Policy Mirror Ascent
par: Asad, Reza, et autres
Publié: (2024)
par: Asad, Reza, et autres
Publié: (2024)
ISEP: Implicit Support Expansion for Offline Reinforcement Learning via Stochastic Policy Optimization
par: Chen, Yifei, et autres
Publié: (2026)
par: Chen, Yifei, et autres
Publié: (2026)
SimuDICE: Offline Policy Optimization Through World Model Updates and DICE Estimation
par: Brita, Catalin E., et autres
Publié: (2024)
par: Brita, Catalin E., et autres
Publié: (2024)
Optimizing Warfarin Dosing Using Contextual Bandit: An Offline Policy Learning and Evaluation Method
par: Huang, Yong, et autres
Publié: (2024)
par: Huang, Yong, et autres
Publié: (2024)
UCPO: Uncertainty-Aware Policy Optimization
par: Zeng, Xianzhou, et autres
Publié: (2026)
par: Zeng, Xianzhou, et autres
Publié: (2026)
Documents similaires
-
Policy Mirror Descent with Lookahead
par: Protopapas, Kimon, et autres
Publié: (2024) -
Functional Acceleration for Policy Mirror Descent
par: Chelu, Veronica, et autres
Publié: (2024) -
Statistical Tractability of Off-policy Evaluation of History-dependent Policies in POMDPs
par: Zhang, Yuheng, et autres
Publié: (2025) -
StaQ it! Growing neural networks for Policy Mirror Descent
par: Shilova, Alena, et autres
Publié: (2025) -
Improving LLM General Preference Alignment via Optimistic Online Mirror Descent
par: Zhang, Yuheng, et autres
Publié: (2025)