ACPO: A Policy Optimization Algorithm for Average MDPs with Constraints
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Agnihotri, Akhil, Jain, Rahul, Luo, Haipeng |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
e-COP : Episodic Constrained Optimization of Policies
par: Agnihotri, Akhil, et autres
Publié: (2024)
par: Agnihotri, Akhil, et autres
Publié: (2024)
Learning General Parameterized Policies for Infinite Horizon Average Reward Constrained MDPs via Primal-Dual Policy Gradient Algorithm
par: Bai, Qinbo, et autres
Publié: (2024)
par: Bai, Qinbo, et autres
Publié: (2024)
A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs
par: Hong, Kihyuk, et autres
Publié: (2025)
par: Hong, Kihyuk, et autres
Publié: (2025)
Multi-Objective Reward and Preference Optimization: Theory and Algorithms
par: Agnihotri, Akhil
Publié: (2025)
par: Agnihotri, Akhil
Publié: (2025)
Global Convergence for Average Reward Constrained MDPs with Primal-Dual Actor Critic Algorithm
par: Xu, Yang, et autres
Publié: (2025)
par: Xu, Yang, et autres
Publié: (2025)
Best Policy Learning from Trajectory Preference Feedback
par: Agnihotri, Akhil, et autres
Publié: (2025)
par: Agnihotri, Akhil, et autres
Publié: (2025)
Multi-Objective Preference Optimization: Improving Human Alignment of Generative Models
par: Agnihotri, Akhil, et autres
Publié: (2025)
par: Agnihotri, Akhil, et autres
Publié: (2025)
DeepAveragers: Offline Reinforcement Learning by Solving Derived Non-Parametric MDPs
par: Shrestha, Aayam, et autres
Publié: (2020)
par: Shrestha, Aayam, et autres
Publié: (2020)
Geometric Algorithms for Neural Combinatorial Optimization with Constraints
par: Karalias, Nikolaos, et autres
Publié: (2025)
par: Karalias, Nikolaos, et autres
Publié: (2025)
Efficient Online Learning with Offline Datasets for Infinite Horizon MDPs: A Bayesian Approach
par: Tang, Dengwang, et autres
Publié: (2023)
par: Tang, Dengwang, et autres
Publié: (2023)
Learning Policy Committees for Effective Personalization in MDPs with Diverse Tasks
par: Ge, Luise, et autres
Publié: (2025)
par: Ge, Luise, et autres
Publié: (2025)
Last-Iterate Convergence of General Parameterized Policies in Constrained MDPs
par: Mondal, Washim Uddin, et autres
Publié: (2024)
par: Mondal, Washim Uddin, et autres
Publié: (2024)
On-line Learning in Tree MDPs by Treating Policies as Bandit Arms
par: Shah, Anvay, et autres
Publié: (2026)
par: Shah, Anvay, et autres
Publié: (2026)
Physics-Informed Causal MDPs for Sequential Constraint Repair in Engineering Simulation Pipelines
par: Qiao, Chuhan
Publié: (2026)
par: Qiao, Chuhan
Publié: (2026)
Efficient Policy Optimization in Robust Constrained MDPs with Iteration Complexity Guarantees
par: Ganguly, Sourav, et autres
Publié: (2025)
par: Ganguly, Sourav, et autres
Publié: (2025)
Efficient Online RFT with Plug-and-Play LLM Judges: Unlocking State-of-the-Art Performance
par: Agnihotri, Rudransh, et autres
Publié: (2025)
par: Agnihotri, Rudransh, et autres
Publié: (2025)
Online Bandit Learning with Offline Preference Data for Improved RLHF
par: Agnihotri, Akhil, et autres
Publié: (2024)
par: Agnihotri, Akhil, et autres
Publié: (2024)
Provably Adaptive Average Reward Reinforcement Learning for Metric Spaces
par: Kar, Avik, et autres
Publié: (2024)
par: Kar, Avik, et autres
Publié: (2024)
Regret Analysis of Policy Gradient Algorithm for Infinite Horizon Average Reward Markov Decision Processes
par: Bai, Qinbo, et autres
Publié: (2023)
par: Bai, Qinbo, et autres
Publié: (2023)
Second-Order Actor-Critic Methods for Discounted MDPs via Policy Hessian Decomposition
par: Manivannan, Sanjeev, et autres
Publié: (2026)
par: Manivannan, Sanjeev, et autres
Publié: (2026)
Teaching Precommitted Agents: Model-Free Policy Evaluation and Control in Quasi-Hyperbolic Discounted MDPs
par: Eshwar, S. R.
Publié: (2025)
par: Eshwar, S. R.
Publié: (2025)
Average-Reward Soft Actor-Critic
par: Adamczyk, Jacob, et autres
Publié: (2025)
par: Adamczyk, Jacob, et autres
Publié: (2025)
Constraint-Conditioned Policy Optimization for Versatile Safe Reinforcement Learning
par: Yao, Yihang, et autres
Publié: (2023)
par: Yao, Yihang, et autres
Publié: (2023)
Automatic Constraint Policy Optimization based on Continuous Constraint Interpolation Framework for Offline Reinforcement Learning
par: Han, Xinchen, et autres
Publié: (2026)
par: Han, Xinchen, et autres
Publié: (2026)
WARP: On the Benefits of Weight Averaged Rewarded Policies
par: Ramé, Alexandre, et autres
Publié: (2024)
par: Ramé, Alexandre, et autres
Publié: (2024)
Offline Reinforcement Learning with Generative Trajectory Policies
par: Feng, Xinsong, et autres
Publié: (2025)
par: Feng, Xinsong, et autres
Publié: (2025)
COOPO: Cyclic Offline-Online Policy Optimization Algorithm
par: Liu, Qisai, et autres
Publié: (2026)
par: Liu, Qisai, et autres
Publié: (2026)
No-Regret Reinforcement Learning in Smooth MDPs
par: Maran, Davide, et autres
Publié: (2024)
par: Maran, Davide, et autres
Publié: (2024)
EVAL: EigenVector-based Average-reward Learning
par: Adamczyk, Jacob, et autres
Publié: (2025)
par: Adamczyk, Jacob, et autres
Publié: (2025)
RL in Latent MDPs is Tractable: Online Guarantees via Off-Policy Evaluation
par: Kwon, Jeongyeol, et autres
Publié: (2024)
par: Kwon, Jeongyeol, et autres
Publié: (2024)
Low-Rank MDPs with Continuous Action Spaces
par: Bennett, Andrew, et autres
Publié: (2023)
par: Bennett, Andrew, et autres
Publié: (2023)
Efficient Solution and Learning of Robust Factored MDPs
par: Schnitzer, Yannik, et autres
Publié: (2025)
par: Schnitzer, Yannik, et autres
Publié: (2025)
ACPO: AI-Enabled Compiler Framework
par: Ashouri, Amir H., et autres
Publié: (2023)
par: Ashouri, Amir H., et autres
Publié: (2023)
Learning Fair Ranking Policies via Differentiable Optimization of Ordered Weighted Averages
par: Dinh, My H., et autres
Publié: (2024)
par: Dinh, My H., et autres
Publié: (2024)
Adaptive Opponent Policy Detection in Multi-Agent MDPs: Real-Time Strategy Switch Identification Using Running Error Estimation
par: Mridul, Mohidul Haque, et autres
Publié: (2024)
par: Mridul, Mohidul Haque, et autres
Publié: (2024)
Robust LLM Alignment via Distributionally Robust Direct Preference Optimization
par: Xu, Zaiyan, et autres
Publié: (2025)
par: Xu, Zaiyan, et autres
Publié: (2025)
RSPO: Risk-Seeking Policy Optimization for Pass@k and Max@k Metrics in Large Language Models
par: Zhang, Kaichen, et autres
Publié: (2025)
par: Zhang, Kaichen, et autres
Publié: (2025)
When Dynamics Shift, Robust Task Inference Wins: Offline Imitation Learning with Behavior Foundation Models Revisited
par: Agrawal, Rishabh, et autres
Publié: (2026)
par: Agrawal, Rishabh, et autres
Publié: (2026)
Policy Constraint by Only Support Constraint for Offline Reinforcement Learning
par: Gao, Yunkai, et autres
Publié: (2025)
par: Gao, Yunkai, et autres
Publié: (2025)
Missingness-MDPs: Bridging the Theory of Missing Data and POMDPs
par: Wendland, Joshua, et autres
Publié: (2026)
par: Wendland, Joshua, et autres
Publié: (2026)
Documents similaires
-
e-COP : Episodic Constrained Optimization of Policies
par: Agnihotri, Akhil, et autres
Publié: (2024) -
Learning General Parameterized Policies for Infinite Horizon Average Reward Constrained MDPs via Primal-Dual Policy Gradient Algorithm
par: Bai, Qinbo, et autres
Publié: (2024) -
A Computationally Efficient Algorithm for Infinite-Horizon Average-Reward Linear MDPs
par: Hong, Kihyuk, et autres
Publié: (2025) -
Multi-Objective Reward and Preference Optimization: Theory and Algorithms
par: Agnihotri, Akhil
Publié: (2025) -
Global Convergence for Average Reward Constrained MDPs with Primal-Dual Actor Critic Algorithm
par: Xu, Yang, et autres
Publié: (2025)