Convergence of Natural Policy Gradient for a Family of Infinite-State Queueing MDPs
Fuente:
arXiv
Salvato in:
| Autori principali: | Grosof, Isaac, Maguluri, Siva Theja, Srikant, R. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Performance of NPG in Countable State-Space Average-Cost RL
di: Murthy, Yashaswini, et al.
Pubblicazione: (2024)
di: Murthy, Yashaswini, et al.
Pubblicazione: (2024)
Non-Asymptotic Convergence of Stochastic Iterative Algorithms: A Lyapunov Framework
di: Chen, Zaiwei, et al.
Pubblicazione: (2026)
di: Chen, Zaiwei, et al.
Pubblicazione: (2026)
Convergence Rate of the Join-the-Shortest-Queue System
di: Ma, Yuanzhe, et al.
Pubblicazione: (2025)
di: Ma, Yuanzhe, et al.
Pubblicazione: (2025)
Stochastic Approximation with Unbounded Markovian Noise: A General-Purpose Theorem
di: Haque, Shaan Ul, et al.
Pubblicazione: (2024)
di: Haque, Shaan Ul, et al.
Pubblicazione: (2024)
Concentration of Contractive Stochastic Approximation: Additive and Multiplicative Noise
di: Chen, Zaiwei, et al.
Pubblicazione: (2023)
di: Chen, Zaiwei, et al.
Pubblicazione: (2023)
Concentration of General Stochastic Approximation Under Heavy-Tailed Markovian Noise
di: Agrawal, Shubhada, et al.
Pubblicazione: (2026)
di: Agrawal, Shubhada, et al.
Pubblicazione: (2026)
Tail Bounds for Queues with Abandonment: Constant, Moderate, Large Deviations, and Efficient Concentration
di: Wang, Zedong, et al.
Pubblicazione: (2026)
di: Wang, Zedong, et al.
Pubblicazione: (2026)
A Heavy Traffic Theory of Matching Queues
di: Varma, Sushil Mahavir, et al.
Pubblicazione: (2021)
di: Varma, Sushil Mahavir, et al.
Pubblicazione: (2021)
Federated Stochastic Approximation under Markov Noise and Heterogeneity: Applications in Reinforcement Learning
di: Khodadadian, Sajad, et al.
Pubblicazione: (2022)
di: Khodadadian, Sajad, et al.
Pubblicazione: (2022)
Markov Chain Variance Estimation: A Stochastic Approximation Approach
di: Agrawal, Shubhada, et al.
Pubblicazione: (2024)
di: Agrawal, Shubhada, et al.
Pubblicazione: (2024)
Linear Convergence of Entropy-Regularized Natural Policy Gradient with Linear Function Approximation
di: Cayci, Semih, et al.
Pubblicazione: (2021)
di: Cayci, Semih, et al.
Pubblicazione: (2021)
Tight Finite Time Bounds of Two-Time-Scale Linear Stochastic Approximation with Markovian Noise
di: Haque, Shaan Ul, et al.
Pubblicazione: (2023)
di: Haque, Shaan Ul, et al.
Pubblicazione: (2023)
How Accurately Can a Gaussian Approximate Stochastic Approximation Iterates?
di: Haque, Shaan Ul, et al.
Pubblicazione: (2026)
di: Haque, Shaan Ul, et al.
Pubblicazione: (2026)
Steady-State Behavior of Constant-Stepsize Stochastic Approximation: Gaussian Approximation and Tail Bounds
di: Wang, Zedong, et al.
Pubblicazione: (2026)
di: Wang, Zedong, et al.
Pubblicazione: (2026)
Higher-Order Approximations of Sojourn Times in M/G/1 Queues via Stein's Method
di: Chatterjee, Bihan, et al.
Pubblicazione: (2026)
di: Chatterjee, Bihan, et al.
Pubblicazione: (2026)
Policy Gradient in Robust MDPs with Global Convergence Guarantee
di: Wang, Qiuhao, et al.
Pubblicazione: (2022)
di: Wang, Qiuhao, et al.
Pubblicazione: (2022)
A Non-Asymptotic Theory of Seminorm Lyapunov Stability: From Deterministic to Stochastic Iterative Algorithms
di: Chen, Zaiwei, et al.
Pubblicazione: (2025)
di: Chen, Zaiwei, et al.
Pubblicazione: (2025)
Dynamic Pricing and Matching for Two-Sided Queues
di: Varma, Sushil Mahavir, et al.
Pubblicazione: (2019)
di: Varma, Sushil Mahavir, et al.
Pubblicazione: (2019)
Order-Optimal Regret with Novel Policy Gradient Approaches in Infinite-Horizon Average Reward MDPs
di: Ganesh, Swetha, et al.
Pubblicazione: (2024)
di: Ganesh, Swetha, et al.
Pubblicazione: (2024)
Finite-Time Behavior of Erlang-C Model: Mixing Time, Mean Queue Length and Tail Bounds
di: Nguyen, Hoang Huy, et al.
Pubblicazione: (2025)
di: Nguyen, Hoang Huy, et al.
Pubblicazione: (2025)
On the Global Convergence of Policy Gradient in Average Reward Markov Decision Processes
di: Kumar, Navdeep, et al.
Pubblicazione: (2024)
di: Kumar, Navdeep, et al.
Pubblicazione: (2024)
Confident Natural Policy Gradient for Local Planning in $q_π$-realizable Constrained MDPs
di: Tian, Tian, et al.
Pubblicazione: (2024)
di: Tian, Tian, et al.
Pubblicazione: (2024)
Last-Iterate Convergent Policy Gradient Primal-Dual Methods for Constrained MDPs
di: Ding, Dongsheng, et al.
Pubblicazione: (2023)
di: Ding, Dongsheng, et al.
Pubblicazione: (2023)
Learning General Parameterized Policies for Infinite Horizon Average Reward Constrained MDPs via Primal-Dual Policy Gradient Algorithm
di: Bai, Qinbo, et al.
Pubblicazione: (2024)
di: Bai, Qinbo, et al.
Pubblicazione: (2024)
Rates of Convergence in the Central Limit Theorem for Markov Chains, with an Application to TD Learning
di: Srikant, R.
Pubblicazione: (2024)
di: Srikant, R.
Pubblicazione: (2024)
Stochastic Approximation for Nonlinear Discrete Stochastic Control: Finite-Sample Bounds
di: Nguyen, Hoang Huy, et al.
Pubblicazione: (2023)
di: Nguyen, Hoang Huy, et al.
Pubblicazione: (2023)
On the Convergence of Modified Policy Iteration in Risk Sensitive Exponential Cost Markov Decision Processes
di: Murthy, Yashaswini, et al.
Pubblicazione: (2023)
di: Murthy, Yashaswini, et al.
Pubblicazione: (2023)
Soft Robust MDPs and Risk-Sensitive MDPs: Equivalence, Policy Gradient, and Sample Complexity
di: Zhang, Runyu, et al.
Pubblicazione: (2023)
di: Zhang, Runyu, et al.
Pubblicazione: (2023)
Towards Principled, Practical Policy Gradient for Bandits and Tabular MDPs
di: Lu, Michael, et al.
Pubblicazione: (2024)
di: Lu, Michael, et al.
Pubblicazione: (2024)
Last-Iterate Convergence of General Parameterized Policies in Constrained MDPs
di: Mondal, Washim Uddin, et al.
Pubblicazione: (2024)
di: Mondal, Washim Uddin, et al.
Pubblicazione: (2024)
Why Policy Gradient Algorithms Work for Undiscounted Total-Reward MDPs
di: Lee, Jongmin, et al.
Pubblicazione: (2025)
di: Lee, Jongmin, et al.
Pubblicazione: (2025)
Provably Convergent Primal-Dual DPO for Constrained LLM Alignment
di: Du, Yihan, et al.
Pubblicazione: (2025)
di: Du, Yihan, et al.
Pubblicazione: (2025)
On Value Iteration Convergence in Connected MDPs
di: Mustafin, Arsenii, et al.
Pubblicazione: (2024)
di: Mustafin, Arsenii, et al.
Pubblicazione: (2024)
Reinforcement Learning for Infinite-Horizon Average-Reward Linear MDPs via Approximation by Discounted-Reward MDPs
di: Hong, Kihyuk, et al.
Pubblicazione: (2024)
di: Hong, Kihyuk, et al.
Pubblicazione: (2024)
Global Convergence of Average Reward Constrained MDPs with Neural Critic and General Policy Parameterization
di: Satheesh, Anirudh, et al.
Pubblicazione: (2026)
di: Satheesh, Anirudh, et al.
Pubblicazione: (2026)
Linear Convergence of Independent Natural Policy Gradient in Games with Entropy Regularization
di: Sun, Youbang, et al.
Pubblicazione: (2024)
di: Sun, Youbang, et al.
Pubblicazione: (2024)
Convergence of Distributionally Robust Q-Learning with Linear Function Approximation
di: Mandal, Saptarshi, et al.
Pubblicazione: (2025)
di: Mandal, Saptarshi, et al.
Pubblicazione: (2025)
A Policy Gradient Primal-Dual Algorithm for Constrained MDPs with Uniform PAC Guarantees
di: Kitamura, Toshinori, et al.
Pubblicazione: (2024)
di: Kitamura, Toshinori, et al.
Pubblicazione: (2024)
Reusing Historical Trajectories in Natural Policy Gradient via Importance Sampling: Convergence and Convergence Rate
di: Lin, Yifan, et al.
Pubblicazione: (2024)
di: Lin, Yifan, et al.
Pubblicazione: (2024)
Scalable Policy-Based RL Algorithms for POMDPs
di: Anjarlekar, Ameya, et al.
Pubblicazione: (2025)
di: Anjarlekar, Ameya, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Performance of NPG in Countable State-Space Average-Cost RL
di: Murthy, Yashaswini, et al.
Pubblicazione: (2024) -
Non-Asymptotic Convergence of Stochastic Iterative Algorithms: A Lyapunov Framework
di: Chen, Zaiwei, et al.
Pubblicazione: (2026) -
Convergence Rate of the Join-the-Shortest-Queue System
di: Ma, Yuanzhe, et al.
Pubblicazione: (2025) -
Stochastic Approximation with Unbounded Markovian Noise: A General-Purpose Theorem
di: Haque, Shaan Ul, et al.
Pubblicazione: (2024) -
Concentration of Contractive Stochastic Approximation: Additive and Multiplicative Noise
di: Chen, Zaiwei, et al.
Pubblicazione: (2023)