Natural Policy Gradient as Doubly Smoothed Policy Iteration: A Bellman-Operator Framework
Fuente:
arXiv
Salvato in:
| Autori principali: | Nanda, Phalguni, Chen, Zaiwei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies
di: Nanda, Phalguni, et al.
Pubblicazione: (2025)
di: Nanda, Phalguni, et al.
Pubblicazione: (2025)
Recurrent Natural Policy Gradient for POMDPs
di: Cayci, Semih, et al.
Pubblicazione: (2024)
di: Cayci, Semih, et al.
Pubblicazione: (2024)
From Set Convergence to Pointwise Convergence: Finite-Time Guarantees for Average-Reward Q-Learning with Adaptive Stepsizes
di: Chen, Zaiwei, et al.
Pubblicazione: (2025)
di: Chen, Zaiwei, et al.
Pubblicazione: (2025)
Last-Iterate Convergent Policy Gradient Primal-Dual Methods for Constrained MDPs
di: Ding, Dongsheng, et al.
Pubblicazione: (2023)
di: Ding, Dongsheng, et al.
Pubblicazione: (2023)
Natural Hypergradient Descent: Algorithm Design, Convergence Analysis, and Parallel Implementation
di: Kong, Deyi, et al.
Pubblicazione: (2026)
di: Kong, Deyi, et al.
Pubblicazione: (2026)
Achieving $ε^{-2}$ Sample Complexity for Single-Loop Actor-Critic under Minimal Assumptions
di: Hamza, Ishaq, et al.
Pubblicazione: (2026)
di: Hamza, Ishaq, et al.
Pubblicazione: (2026)
Global Convergence of Natural Policy Gradient with Hessian-aided Momentum Variance Reduction
di: Feng, Jie, et al.
Pubblicazione: (2024)
di: Feng, Jie, et al.
Pubblicazione: (2024)
A Non-Asymptotic Theory of Seminorm Lyapunov Stability: From Deterministic to Stochastic Iterative Algorithms
di: Chen, Zaiwei, et al.
Pubblicazione: (2025)
di: Chen, Zaiwei, et al.
Pubblicazione: (2025)
Linear Convergence of Entropy-Regularized Natural Policy Gradient with Linear Function Approximation
di: Cayci, Semih, et al.
Pubblicazione: (2021)
di: Cayci, Semih, et al.
Pubblicazione: (2021)
Demystifying SGD with Doubly Stochastic Gradients
di: Kim, Kyurae, et al.
Pubblicazione: (2024)
di: Kim, Kyurae, et al.
Pubblicazione: (2024)
Towards Efficient Risk-Sensitive Policy Gradient: An Iteration Complexity Analysis
di: Liu, Rui, et al.
Pubblicazione: (2024)
di: Liu, Rui, et al.
Pubblicazione: (2024)
Natural Policy Gradient and Actor Critic Methods for Constrained Multi-Task Reinforcement Learning
di: Zeng, Sihan, et al.
Pubblicazione: (2024)
di: Zeng, Sihan, et al.
Pubblicazione: (2024)
From Optimization to Control: Quasi Policy Iteration
di: Kolarijani, Mohammad Amin Sharifi, et al.
Pubblicazione: (2023)
di: Kolarijani, Mohammad Amin Sharifi, et al.
Pubblicazione: (2023)
Fill-and-Spill: Deep Reinforcement Learning Policy Gradient Methods for Reservoir Operation Decision and Control
di: Tabas, Sadegh Sadeghi, et al.
Pubblicazione: (2024)
di: Tabas, Sadegh Sadeghi, et al.
Pubblicazione: (2024)
Elementary Analysis of Policy Gradient Methods
di: Liu, Jiacai, et al.
Pubblicazione: (2024)
di: Liu, Jiacai, et al.
Pubblicazione: (2024)
On the Global Convergence of Risk-Averse Natural Policy Gradient Methods with Expected Conditional Risk Measures
di: Yu, Xian, et al.
Pubblicazione: (2023)
di: Yu, Xian, et al.
Pubblicazione: (2023)
Reusing Historical Trajectories in Natural Policy Gradient via Importance Sampling: Convergence and Convergence Rate
di: Lin, Yifan, et al.
Pubblicazione: (2024)
di: Lin, Yifan, et al.
Pubblicazione: (2024)
Policy Gradient Converges to the Globally Optimal Policy for Nearly Linear-Quadratic Regulators
di: Han, Yinbin, et al.
Pubblicazione: (2023)
di: Han, Yinbin, et al.
Pubblicazione: (2023)
Concentration of Contractive Stochastic Approximation: Additive and Multiplicative Noise
di: Chen, Zaiwei, et al.
Pubblicazione: (2023)
di: Chen, Zaiwei, et al.
Pubblicazione: (2023)
Linear Convergence of Independent Natural Policy Gradient in Games with Entropy Regularization
di: Sun, Youbang, et al.
Pubblicazione: (2024)
di: Sun, Youbang, et al.
Pubblicazione: (2024)
Delightful Policy Gradient
di: Osband, Ian
Pubblicazione: (2026)
di: Osband, Ian
Pubblicazione: (2026)
Structure Matters: Dynamic Policy Gradient
di: Klein, Sara, et al.
Pubblicazione: (2024)
di: Klein, Sara, et al.
Pubblicazione: (2024)
Beyond the Bellman Recursion: A Pontryagin-Guided Framework for Non-Exponential Discounting
di: Ko, Hojin, et al.
Pubblicazione: (2026)
di: Ko, Hojin, et al.
Pubblicazione: (2026)
Analysis of On-policy Policy Gradient Methods under the Distribution Mismatch
di: Wang, Weizhen, et al.
Pubblicazione: (2025)
di: Wang, Weizhen, et al.
Pubblicazione: (2025)
Sequential Bayesian Optimal Experimental Design in Infinite Dimensions via Policy Gradient Reinforcement Learning
di: Shen, Kaichen, et al.
Pubblicazione: (2026)
di: Shen, Kaichen, et al.
Pubblicazione: (2026)
Delightful Distributed Policy Gradient
di: Osband, Ian
Pubblicazione: (2026)
di: Osband, Ian
Pubblicazione: (2026)
Non-Uniform Noise-to-Signal Ratio in the REINFORCE Policy-Gradient Estimator
di: Han, Haoyu, et al.
Pubblicazione: (2026)
di: Han, Haoyu, et al.
Pubblicazione: (2026)
Beyond Stationarity: Convergence Analysis of Stochastic Softmax Policy Gradient Methods
di: Klein, Sara, et al.
Pubblicazione: (2023)
di: Klein, Sara, et al.
Pubblicazione: (2023)
Faster Gradient Methods for Highly-Smooth Stochastic Bilevel Optimization
di: Chen, Lesi, et al.
Pubblicazione: (2025)
di: Chen, Lesi, et al.
Pubblicazione: (2025)
Model-Free Output Feedback Stabilization via Policy Gradient Methods
di: Zhang, Ankang, et al.
Pubblicazione: (2026)
di: Zhang, Ankang, et al.
Pubblicazione: (2026)
Fast Last-Iterate Convergence of SGD in the Smooth Interpolation Regime
di: Attia, Amit, et al.
Pubblicazione: (2025)
di: Attia, Amit, et al.
Pubblicazione: (2025)
Directional Smoothness and Gradient Methods: Convergence and Adaptivity
di: Mishkin, Aaron, et al.
Pubblicazione: (2024)
di: Mishkin, Aaron, et al.
Pubblicazione: (2024)
Gradient-Normalized Smoothness for Optimization with Approximate Hessians
di: Semenov, Andrei, et al.
Pubblicazione: (2025)
di: Semenov, Andrei, et al.
Pubblicazione: (2025)
Is Bellman Equation Enough for Learning Control?
di: You, Haoxiang, et al.
Pubblicazione: (2025)
di: You, Haoxiang, et al.
Pubblicazione: (2025)
Policy Gradient with Second Order Momentum
di: Sun, Tianyu
Pubblicazione: (2025)
di: Sun, Tianyu
Pubblicazione: (2025)
Scalable Bi-causal Optimal Transport via KL Relaxation and Policy Gradients
di: Cao, Haoyang, et al.
Pubblicazione: (2026)
di: Cao, Haoyang, et al.
Pubblicazione: (2026)
Linear-Quadratic Mean-Field Reinforcement Learning: Convergence of Policy Gradient Methods
di: Carmona, René, et al.
Pubblicazione: (2019)
di: Carmona, René, et al.
Pubblicazione: (2019)
Policy Gradient Methods for Discrete Time Linear Quadratic Regulator With Random Parameters
di: Li, Deyue
Pubblicazione: (2023)
di: Li, Deyue
Pubblicazione: (2023)
On the Last-Iterate Convergence of Shuffling Gradient Methods
di: Liu, Zijian, et al.
Pubblicazione: (2024)
di: Liu, Zijian, et al.
Pubblicazione: (2024)
Stochastic Non-Smooth Convex Optimization with Unbounded Gradients
di: Kovalev, Dmitry
Pubblicazione: (2026)
di: Kovalev, Dmitry
Pubblicazione: (2026)
Documenti analoghi
-
A Minimal-Assumption Analysis of Q-Learning with Time-Varying Policies
di: Nanda, Phalguni, et al.
Pubblicazione: (2025) -
Recurrent Natural Policy Gradient for POMDPs
di: Cayci, Semih, et al.
Pubblicazione: (2024) -
From Set Convergence to Pointwise Convergence: Finite-Time Guarantees for Average-Reward Q-Learning with Adaptive Stepsizes
di: Chen, Zaiwei, et al.
Pubblicazione: (2025) -
Last-Iterate Convergent Policy Gradient Primal-Dual Methods for Constrained MDPs
di: Ding, Dongsheng, et al.
Pubblicazione: (2023) -
Natural Hypergradient Descent: Algorithm Design, Convergence Analysis, and Parallel Implementation
di: Kong, Deyi, et al.
Pubblicazione: (2026)