Beyond Exact Gradients: Convergence of Stochastic Soft-Max Policy Gradient Methods with Entropy Regularization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ding, Yuhao, Zhang, Junzi, Lee, Hyunin, Lavaei, Javad |
|---|---|
| Format: | Preprint |
| Publié: |
2021
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Pausing Policy Learning in Non-stationary Reinforcement Learning
par: Lee, Hyunin, et autres
Publié: (2024)
par: Lee, Hyunin, et autres
Publié: (2024)
Policy-based Primal-Dual Methods for Concave CMDP with Variance Reduction
par: Ying, Donghao, et autres
Publié: (2022)
par: Ying, Donghao, et autres
Publié: (2022)
Beyond Softmax and Entropy: Convergence Rates of Policy Gradients with f-SoftArgmax Parameterization & Coupled Regularization
par: Labbi, Safwan, et autres
Publié: (2026)
par: Labbi, Safwan, et autres
Publié: (2026)
Beyond Stationarity: Convergence Analysis of Stochastic Softmax Policy Gradient Methods
par: Klein, Sara, et autres
Publié: (2023)
par: Klein, Sara, et autres
Publié: (2023)
Global Convergence of Wasserstein Policy Gradient for Entropy-Regularized Reinforcement Learning
par: Zhu, Zhaoyu, et autres
Publié: (2026)
par: Zhu, Zhaoyu, et autres
Publié: (2026)
Linear Convergence of Independent Natural Policy Gradient in Games with Entropy Regularization
par: Sun, Youbang, et autres
Publié: (2024)
par: Sun, Youbang, et autres
Publié: (2024)
Linear Convergence of Entropy-Regularized Natural Policy Gradient with Linear Function Approximation
par: Cayci, Semih, et autres
Publié: (2021)
par: Cayci, Semih, et autres
Publié: (2021)
TRSVR: An Adaptive Stochastic Trust-Region Method with Variance Reduction
par: Fang, Yuchen, et autres
Publié: (2026)
par: Fang, Yuchen, et autres
Publié: (2026)
Matryoshka Policy Gradient for Entropy-Regularized RL: Convergence and Global Optimality
par: Ged, François, et autres
Publié: (2023)
par: Ged, François, et autres
Publié: (2023)
Reusing Historical Trajectories in Natural Policy Gradient via Importance Sampling: Convergence and Convergence Rate
par: Lin, Yifan, et autres
Publié: (2024)
par: Lin, Yifan, et autres
Publié: (2024)
Revisiting the Last-Iterate Convergence of Stochastic Gradient Methods
par: Liu, Zijian, et autres
Publié: (2023)
par: Liu, Zijian, et autres
Publié: (2023)
A CMDP-within-online framework for Meta-Safe Reinforcement Learning
par: Khattar, Vanshaj, et autres
Publié: (2024)
par: Khattar, Vanshaj, et autres
Publié: (2024)
Soft Deterministic Policy Gradient with Gaussian Smoothing
par: Na, Hyunjun, et autres
Publié: (2026)
par: Na, Hyunjun, et autres
Publié: (2026)
Last-Iterate Convergent Policy Gradient Primal-Dual Methods for Constrained MDPs
par: Ding, Dongsheng, et autres
Publié: (2023)
par: Ding, Dongsheng, et autres
Publié: (2023)
Controlling the Flow: Stability and Convergence for Stochastic Gradient Descent with Decaying Regularization
par: Kassing, Sebastian, et autres
Publié: (2025)
par: Kassing, Sebastian, et autres
Publié: (2025)
Ordering-based Conditions for Global Convergence of Policy Gradient Methods
par: Mei, Jincheng, et autres
Publié: (2025)
par: Mei, Jincheng, et autres
Publié: (2025)
Accelerated Convergence of Stochastic Heavy Ball Method under Anisotropic Gradient Noise
par: Pan, Rui, et autres
Publié: (2023)
par: Pan, Rui, et autres
Publié: (2023)
Personalized Federated Learning with Exact Stochastic Gradient Descent
par: Nikoloutsopoulos, Sotirios, et autres
Publié: (2022)
par: Nikoloutsopoulos, Sotirios, et autres
Publié: (2022)
In-Expectation Convergence of Stochastic Gradient Methods under Heavy-Tailed Noise
par: Liu, Zijian
Publié: (2026)
par: Liu, Zijian
Publié: (2026)
Almost Sure Convergence Analysis of Differentially Private Stochastic Gradient Methods
par: Mukherjee, Amartya, et autres
Publié: (2025)
par: Mukherjee, Amartya, et autres
Publié: (2025)
Exact Recovery for System Identification with More Corrupt Data than Clean Data
par: Yalcin, Baturalp, et autres
Publié: (2023)
par: Yalcin, Baturalp, et autres
Publié: (2023)
A Trust-Region Interior-Point Stochastic Sequential Quadratic Programming Method
par: Fang, Yuchen, et autres
Publié: (2026)
par: Fang, Yuchen, et autres
Publié: (2026)
Learning Optimal Deterministic Policies with Stochastic Policy Gradients
par: Montenegro, Alessandro, et autres
Publié: (2024)
par: Montenegro, Alessandro, et autres
Publié: (2024)
Global Convergence Guarantees for Federated Policy Gradient Methods with Adversaries
par: Ganesh, Swetha, et autres
Publié: (2024)
par: Ganesh, Swetha, et autres
Publié: (2024)
Why is Normalization Preferred? A Worst-Case Complexity Theory for Stochastically Preconditioned SGD under Heavy-Tailed Noise
par: Fang, Yuchen, et autres
Publié: (2026)
par: Fang, Yuchen, et autres
Publié: (2026)
Accelerated Policy Gradient: On the Convergence Rates of the Nesterov Momentum for Reinforcement Learning
par: Chen, Yen-Ju, et autres
Publié: (2023)
par: Chen, Yen-Ju, et autres
Publié: (2023)
Gradient Regularized Newton Boosting Trees with Global Convergence
par: Zozoulenko, Nikita, et autres
Publié: (2026)
par: Zozoulenko, Nikita, et autres
Publié: (2026)
On the Stochastic (Variance-Reduced) Proximal Gradient Method for Regularized Expected Reward Optimization
par: Liang, Ling, et autres
Publié: (2024)
par: Liang, Ling, et autres
Publié: (2024)
On the Convergence of Stochastic Gradient Descent with Perturbed Forward-Backward Passes
par: Kong, Boao, et autres
Publié: (2026)
par: Kong, Boao, et autres
Publié: (2026)
Reusing Trajectories in Policy Gradients Enables Fast Convergence
par: Montenegro, Alessandro, et autres
Publié: (2025)
par: Montenegro, Alessandro, et autres
Publié: (2025)
Policy Gradient in Robust MDPs with Global Convergence Guarantee
par: Wang, Qiuhao, et autres
Publié: (2022)
par: Wang, Qiuhao, et autres
Publié: (2022)
On the Second-Order Convergence of Biased Policy Gradient Algorithms
par: Mu, Siqiao, et autres
Publié: (2023)
par: Mu, Siqiao, et autres
Publié: (2023)
Fast Stochastic Policy Gradient: Negative Momentum for Reinforcement Learning
par: Zhang, Haobin, et autres
Publié: (2024)
par: Zhang, Haobin, et autres
Publié: (2024)
High Probability Complexity Bounds of Trust-Region Stochastic Sequential Quadratic Programming with Heavy-Tailed Noise
par: Fang, Yuchen, et autres
Publié: (2025)
par: Fang, Yuchen, et autres
Publié: (2025)
Linear-Quadratic Mean-Field Reinforcement Learning: Convergence of Policy Gradient Methods
par: Carmona, René, et autres
Publié: (2019)
par: Carmona, René, et autres
Publié: (2019)
Convergence Analysis of Stochastic Gradient Descent with MCMC Estimators
par: Li, Tianyou, et autres
Publié: (2023)
par: Li, Tianyou, et autres
Publié: (2023)
Convergence of Stochastic Gradient Methods for Wide Two-Layer Physics-Informed Neural Networks
par: Jin, Bangti, et autres
Publié: (2025)
par: Jin, Bangti, et autres
Publié: (2025)
The Dimension Strikes Back with Gradients: Generalization of Gradient Methods in Stochastic Convex Optimization
par: Schliserman, Matan, et autres
Publié: (2024)
par: Schliserman, Matan, et autres
Publié: (2024)
Gradient Regularized Natural Gradients
par: Dash, Satya Prakash, et autres
Publié: (2026)
par: Dash, Satya Prakash, et autres
Publié: (2026)
Beyond ReinMax: Low-Variance Gradient Estimators for Discrete Latent Variables
par: Wang, Daniel, et autres
Publié: (2026)
par: Wang, Daniel, et autres
Publié: (2026)
Documents similaires
-
Pausing Policy Learning in Non-stationary Reinforcement Learning
par: Lee, Hyunin, et autres
Publié: (2024) -
Policy-based Primal-Dual Methods for Concave CMDP with Variance Reduction
par: Ying, Donghao, et autres
Publié: (2022) -
Beyond Softmax and Entropy: Convergence Rates of Policy Gradients with f-SoftArgmax Parameterization & Coupled Regularization
par: Labbi, Safwan, et autres
Publié: (2026) -
Beyond Stationarity: Convergence Analysis of Stochastic Softmax Policy Gradient Methods
par: Klein, Sara, et autres
Publié: (2023) -
Global Convergence of Wasserstein Policy Gradient for Entropy-Regularized Reinforcement Learning
par: Zhu, Zhaoyu, et autres
Publié: (2026)