Global Convergence of Average Reward Constrained MDPs with Neural Critic and General Policy Parameterization
Fuente:
arXiv
Salvato in:
| Autori principali: | Satheesh, Anirudh, Barman, Pankaj Kumar, Mondal, Washim Uddin, Aggarwal, Vaneet |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Last-Iterate Convergence of General Parameterized Policies in Constrained MDPs
di: Mondal, Washim Uddin, et al.
Pubblicazione: (2024)
di: Mondal, Washim Uddin, et al.
Pubblicazione: (2024)
Regret Analysis of Unichain Average Reward Constrained MDPs with General Parameterization
di: Satheesh, Anirudh, et al.
Pubblicazione: (2026)
di: Satheesh, Anirudh, et al.
Pubblicazione: (2026)
Learning General Parameterized Policies for Infinite Horizon Average Reward Constrained MDPs via Primal-Dual Policy Gradient Algorithm
di: Bai, Qinbo, et al.
Pubblicazione: (2024)
di: Bai, Qinbo, et al.
Pubblicazione: (2024)
Global Convergence for Average Reward Constrained MDPs with Primal-Dual Actor Critic Algorithm
di: Xu, Yang, et al.
Pubblicazione: (2025)
di: Xu, Yang, et al.
Pubblicazione: (2025)
Order-Optimal Regret with Novel Policy Gradient Approaches in Infinite-Horizon Average Reward MDPs
di: Ganesh, Swetha, et al.
Pubblicazione: (2024)
di: Ganesh, Swetha, et al.
Pubblicazione: (2024)
A Sharper Global Convergence Analysis for Average Reward Reinforcement Learning via an Actor-Critic Approach
di: Ganesh, Swetha, et al.
Pubblicazione: (2024)
di: Ganesh, Swetha, et al.
Pubblicazione: (2024)
Sample-Efficient Constrained Reinforcement Learning with General Parameterization
di: Mondal, Washim Uddin, et al.
Pubblicazione: (2024)
di: Mondal, Washim Uddin, et al.
Pubblicazione: (2024)
Improved Sample Complexity Analysis of Natural Policy Gradient Algorithm with General Parameterization for Infinite Horizon Discounted Reward Markov Decision Processes
di: Mondal, Washim Uddin, et al.
Pubblicazione: (2023)
di: Mondal, Washim Uddin, et al.
Pubblicazione: (2023)
Finite-Sample Analysis of Policy Evaluation for Robust Average Reward Reinforcement Learning
di: Xu, Yang, et al.
Pubblicazione: (2025)
di: Xu, Yang, et al.
Pubblicazione: (2025)
Constrained Reinforcement Learning with Average Reward Objective: Model-Based and Model-Free Algorithms
di: Aggarwal, Vaneet, et al.
Pubblicazione: (2024)
di: Aggarwal, Vaneet, et al.
Pubblicazione: (2024)
Regret Analysis of Policy Gradient Algorithm for Infinite Horizon Average Reward Markov Decision Processes
di: Bai, Qinbo, et al.
Pubblicazione: (2023)
di: Bai, Qinbo, et al.
Pubblicazione: (2023)
Primal-Only Actor Critic Algorithm for Robust Constrained Average Cost MDPs
di: Satheesh, Anirudh, et al.
Pubblicazione: (2025)
di: Satheesh, Anirudh, et al.
Pubblicazione: (2025)
Regret Analysis of Average-Reward Unichain MDPs via an Actor-Critic Approach
di: Ganesh, Swetha, et al.
Pubblicazione: (2025)
di: Ganesh, Swetha, et al.
Pubblicazione: (2025)
Mean-Field Approximation of Cooperative Constrained Multi-Agent Reinforcement Learning (CMARL)
di: Mondal, Washim Uddin, et al.
Pubblicazione: (2022)
di: Mondal, Washim Uddin, et al.
Pubblicazione: (2022)
Distributionally Robust Self Paced Curriculum Reinforcement Learning
di: Satheesh, Anirudh, et al.
Pubblicazione: (2025)
di: Satheesh, Anirudh, et al.
Pubblicazione: (2025)
Provably Efficient Algorithms for S- and Non-Rectangular Robust MDPs with General Parameterization
di: Satheesh, Anirudh, et al.
Pubblicazione: (2026)
di: Satheesh, Anirudh, et al.
Pubblicazione: (2026)
Efficient $Q$-Learning and Actor-Critic Methods for Robust Average Reward Reinforcement Learning
di: Xu, Yang, et al.
Pubblicazione: (2025)
di: Xu, Yang, et al.
Pubblicazione: (2025)
Match or Replay: Self Imitating Proximal Policy Optimization
di: Chaudhary, Gaurav, et al.
Pubblicazione: (2026)
di: Chaudhary, Gaurav, et al.
Pubblicazione: (2026)
On The Global Convergence Of Online RLHF With Neural Parametrization
di: Gaur, Mudit, et al.
Pubblicazione: (2024)
di: Gaur, Mudit, et al.
Pubblicazione: (2024)
Closing the Gap: Achieving Global Convergence (Last Iterate) of Actor-Critic under Markovian Sampling with Neural Network Parametrization
di: Gaur, Mudit, et al.
Pubblicazione: (2024)
di: Gaur, Mudit, et al.
Pubblicazione: (2024)
Global Convergence Guarantees for Federated Policy Gradient Methods with Adversaries
di: Ganesh, Swetha, et al.
Pubblicazione: (2024)
di: Ganesh, Swetha, et al.
Pubblicazione: (2024)
Quantum Speedups in Regret Analysis of Infinite Horizon Average-Reward Markov Decision Processes
di: Ganguly, Bhargav, et al.
Pubblicazione: (2023)
di: Ganguly, Bhargav, et al.
Pubblicazione: (2023)
Near-Optimal Sample Complexity Bounds for Constrained Average-Reward MDPs
di: Wei, Yukuan, et al.
Pubblicazione: (2025)
di: Wei, Yukuan, et al.
Pubblicazione: (2025)
Two-Timescale Critic-Actor for Average Reward MDPs with Function Approximation
di: Panda, Prashansa, et al.
Pubblicazione: (2024)
di: Panda, Prashansa, et al.
Pubblicazione: (2024)
On the Global Convergence of Policy Gradient in Average Reward Markov Decision Processes
di: Kumar, Navdeep, et al.
Pubblicazione: (2024)
di: Kumar, Navdeep, et al.
Pubblicazione: (2024)
Sample Complexity Analysis for Constrained Bilevel Reinforcement Learning
di: Saxena, Naman, et al.
Pubblicazione: (2026)
di: Saxena, Naman, et al.
Pubblicazione: (2026)
Towards Global Optimality for Practical Average Reward Reinforcement Learning without Mixing Time Oracles
di: Patel, Bhrij, et al.
Pubblicazione: (2024)
di: Patel, Bhrij, et al.
Pubblicazione: (2024)
A Constrained Multi-Agent Reinforcement Learning Approach to Autonomous Traffic Signal Control
di: Satheesh, Anirudh, et al.
Pubblicazione: (2025)
di: Satheesh, Anirudh, et al.
Pubblicazione: (2025)
Policy Gradient in Robust MDPs with Global Convergence Guarantee
di: Wang, Qiuhao, et al.
Pubblicazione: (2022)
di: Wang, Qiuhao, et al.
Pubblicazione: (2022)
Reinforcement Learning for Infinite-Horizon Average-Reward Linear MDPs via Approximation by Discounted-Reward MDPs
di: Hong, Kihyuk, et al.
Pubblicazione: (2024)
di: Hong, Kihyuk, et al.
Pubblicazione: (2024)
Non-Rectangular Average-Reward Robust MDPs: Optimal Policies and Their Transient Values
di: Wang, Shengbo, et al.
Pubblicazione: (2026)
di: Wang, Shengbo, et al.
Pubblicazione: (2026)
Persistent-Transient Policy Evaluation for Markov Chains via Minimal Peripheral Quotients
di: Xu, Yang, et al.
Pubblicazione: (2026)
di: Xu, Yang, et al.
Pubblicazione: (2026)
Improving Molecule Generation and Drug Discovery with a Knowledge-enhanced Generative Model
di: Malusare, Aditya, et al.
Pubblicazione: (2024)
di: Malusare, Aditya, et al.
Pubblicazione: (2024)
Achieving Zero Constraint Violation for Constrained Reinforcement Learning via Conservative Natural Policy Gradient Primal-Dual Algorithm
di: Bai, Qinbo, et al.
Pubblicazione: (2022)
di: Bai, Qinbo, et al.
Pubblicazione: (2022)
Accelerating Quantum Reinforcement Learning with a Quantum Natural Policy Gradient Based Approach
di: Xu, Yang, et al.
Pubblicazione: (2025)
di: Xu, Yang, et al.
Pubblicazione: (2025)
BAGEL: Projection-Free Algorithm for Adversarially Constrained Online Convex Optimization
di: Lu, Yiyang, et al.
Pubblicazione: (2025)
di: Lu, Yiyang, et al.
Pubblicazione: (2025)
Breaking the Bias Barrier in Concave Multi-Objective Reinforcement Learning
di: Ganesh, Swetha, et al.
Pubblicazione: (2026)
di: Ganesh, Swetha, et al.
Pubblicazione: (2026)
Last-Iterate Convergent Policy Gradient Primal-Dual Methods for Constrained MDPs
di: Ding, Dongsheng, et al.
Pubblicazione: (2023)
di: Ding, Dongsheng, et al.
Pubblicazione: (2023)
Augmented Lagrangian Method for Last-Iterate Convergence for Constrained MDPs
di: Lu, Michael, et al.
Pubblicazione: (2026)
di: Lu, Michael, et al.
Pubblicazione: (2026)
Achieving Tractable Minimax Optimal Regret in Average Reward MDPs
di: Boone, Victor, et al.
Pubblicazione: (2024)
di: Boone, Victor, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Last-Iterate Convergence of General Parameterized Policies in Constrained MDPs
di: Mondal, Washim Uddin, et al.
Pubblicazione: (2024) -
Regret Analysis of Unichain Average Reward Constrained MDPs with General Parameterization
di: Satheesh, Anirudh, et al.
Pubblicazione: (2026) -
Learning General Parameterized Policies for Infinite Horizon Average Reward Constrained MDPs via Primal-Dual Policy Gradient Algorithm
di: Bai, Qinbo, et al.
Pubblicazione: (2024) -
Global Convergence for Average Reward Constrained MDPs with Primal-Dual Actor Critic Algorithm
di: Xu, Yang, et al.
Pubblicazione: (2025) -
Order-Optimal Regret with Novel Policy Gradient Approaches in Infinite-Horizon Average Reward MDPs
di: Ganesh, Swetha, et al.
Pubblicazione: (2024)