Rethinking the Global Convergence of Softmax Policy Gradient with Linear Function Approximation
Fuente:
arXiv
Salvato in:
| Autori principali: | Lin, Max Qiushi, Mei, Jincheng, Aghaei, Matin, Lu, Michael, Dai, Bo, Agarwal, Alekh, Schuurmans, Dale, Szepesvari, Csaba, Vaswani, Sharan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Ordering-based Conditions for Global Convergence of Policy Gradient Methods
di: Mei, Jincheng, et al.
Pubblicazione: (2025)
di: Mei, Jincheng, et al.
Pubblicazione: (2025)
Small steps no more: Global convergence of stochastic gradient bandits for arbitrary learning rates
di: Mei, Jincheng, et al.
Pubblicazione: (2025)
di: Mei, Jincheng, et al.
Pubblicazione: (2025)
Stochastic Gradient Succeeds for Bandits
di: Mei, Jincheng, et al.
Pubblicazione: (2024)
di: Mei, Jincheng, et al.
Pubblicazione: (2024)
Optimistic Actor-Critic with Parametric Policies for Linear Markov Decision Processes
di: Lin, Max Qiushi, et al.
Pubblicazione: (2026)
di: Lin, Max Qiushi, et al.
Pubblicazione: (2026)
Towards Principled, Practical Policy Gradient for Bandits and Tabular MDPs
di: Lu, Michael, et al.
Pubblicazione: (2024)
di: Lu, Michael, et al.
Pubblicazione: (2024)
Fast Convergence of Softmax Policy Mirror Ascent
di: Asad, Reza, et al.
Pubblicazione: (2024)
di: Asad, Reza, et al.
Pubblicazione: (2024)
Rectifying Regression in Reinforcement Learning
di: Ayoub, Alex, et al.
Pubblicazione: (2025)
di: Ayoub, Alex, et al.
Pubblicazione: (2025)
Augmented Lagrangian Method for Last-Iterate Convergence for Constrained MDPs
di: Lu, Michael, et al.
Pubblicazione: (2026)
di: Lu, Michael, et al.
Pubblicazione: (2026)
Learning to Reason Efficiently with Discounted Reinforcement Learning
di: Ayoub, Alex, et al.
Pubblicazione: (2025)
di: Ayoub, Alex, et al.
Pubblicazione: (2025)
Armijo Line-search Can Make (Stochastic) Gradient Descent Provably Faster
di: Vaswani, Sharan, et al.
Pubblicazione: (2025)
di: Vaswani, Sharan, et al.
Pubblicazione: (2025)
Beyond Expectations: Learning with Stochastic Dominance Made Practical
di: Cen, Shicong, et al.
Pubblicazione: (2024)
di: Cen, Shicong, et al.
Pubblicazione: (2024)
Confident Natural Policy Gradient for Local Planning in $q_π$-realizable Constrained MDPs
di: Tian, Tian, et al.
Pubblicazione: (2024)
di: Tian, Tian, et al.
Pubblicazione: (2024)
Target Networks and Over-parameterization Stabilize Off-policy Bootstrapping with Function Approximation
di: Che, Fengdi, et al.
Pubblicazione: (2024)
di: Che, Fengdi, et al.
Pubblicazione: (2024)
Convergence of Steepest Descent and Adam under Non-Uniform Smoothness
di: Vaswani, Sharan, et al.
Pubblicazione: (2026)
di: Vaswani, Sharan, et al.
Pubblicazione: (2026)
On Global Convergence Rates for Federated Softmax Policy Gradient under Heterogeneous Environments
di: Labbi, Safwan, et al.
Pubblicazione: (2025)
di: Labbi, Safwan, et al.
Pubblicazione: (2025)
Linear Convergence of Entropy-Regularized Natural Policy Gradient with Linear Function Approximation
di: Cayci, Semih, et al.
Pubblicazione: (2021)
di: Cayci, Semih, et al.
Pubblicazione: (2021)
Trajectory Data Suffices for Statistically Efficient Learning in Offline RL with Linear $q^π$-Realizability and Concentrability
di: Tkachuk, Volodymyr, et al.
Pubblicazione: (2024)
di: Tkachuk, Volodymyr, et al.
Pubblicazione: (2024)
Spectral Ghost in Representation Learning: from Component Analysis to Self-Supervised Learning
di: Dai, Bo, et al.
Pubblicazione: (2026)
di: Dai, Bo, et al.
Pubblicazione: (2026)
Non-Linear Reinforcement Learning in Large Action Spaces: Structural Conditions and Sample-efficiency of Posterior Sampling
di: Agarwal, Alekh, et al.
Pubblicazione: (2022)
di: Agarwal, Alekh, et al.
Pubblicazione: (2022)
Sharper Guarantees for Misspecified Kernelized Bandit Optimization
di: Maran, Davide, et al.
Pubblicazione: (2026)
di: Maran, Davide, et al.
Pubblicazione: (2026)
Towards Noise-adaptive, Problem-adaptive (Accelerated) Stochastic Gradient Descent
di: Vaswani, Sharan, et al.
Pubblicazione: (2021)
di: Vaswani, Sharan, et al.
Pubblicazione: (2021)
Faster WIND: Accelerating Iterative Best-of-$N$ Distillation for LLM Alignment
di: Yang, Tong, et al.
Pubblicazione: (2024)
di: Yang, Tong, et al.
Pubblicazione: (2024)
Sample Complexity Bounds for Linear Constrained MDPs with a Generative Model
di: Liu, Xingtu, et al.
Pubblicazione: (2025)
di: Liu, Xingtu, et al.
Pubblicazione: (2025)
Beyond Stationarity: Convergence Analysis of Stochastic Softmax Policy Gradient Methods
di: Klein, Sara, et al.
Pubblicazione: (2023)
di: Klein, Sara, et al.
Pubblicazione: (2023)
Value-Incentivized Preference Optimization: A Unified Approach to Online and Offline RLHF
di: Cen, Shicong, et al.
Pubblicazione: (2024)
di: Cen, Shicong, et al.
Pubblicazione: (2024)
NDCG-Consistent Softmax Approximation with Accelerated Convergence
di: Pu, Yuanhao, et al.
Pubblicazione: (2025)
di: Pu, Yuanhao, et al.
Pubblicazione: (2025)
Balancing optimism and pessimism in offline-to-online learning
di: Sentenac, Flore, et al.
Pubblicazione: (2025)
di: Sentenac, Flore, et al.
Pubblicazione: (2025)
Sharp analysis of linear ensemble sampling
di: Akhavan, Arya, et al.
Pubblicazione: (2026)
di: Akhavan, Arya, et al.
Pubblicazione: (2026)
Policy Gradient Converges to the Globally Optimal Policy for Nearly Linear-Quadratic Regulators
di: Han, Yinbin, et al.
Pubblicazione: (2023)
di: Han, Yinbin, et al.
Pubblicazione: (2023)
Autoregressive Large Language Models are Computationally Universal
di: Schuurmans, Dale, et al.
Pubblicazione: (2024)
di: Schuurmans, Dale, et al.
Pubblicazione: (2024)
Optimistic Policy Optimization is Provably Efficient in Non-stationary MDPs
di: Zhong, Han, et al.
Pubblicazione: (2021)
di: Zhong, Han, et al.
Pubblicazione: (2021)
When Engineering Outruns Intelligence: Rethinking Instruction-Guided Navigation
di: Aghaei, Matin, et al.
Pubblicazione: (2025)
di: Aghaei, Matin, et al.
Pubblicazione: (2025)
Dissecting Discrete Soft Actor-Critic: Limitations and Principled Alternatives
di: Asad, Reza, et al.
Pubblicazione: (2025)
di: Asad, Reza, et al.
Pubblicazione: (2025)
From Inverse Optimization to Feasibility to ERM
di: Mishra, Saurabh, et al.
Pubblicazione: (2024)
di: Mishra, Saurabh, et al.
Pubblicazione: (2024)
(Accelerated) Noise-adaptive Stochastic Heavy-Ball Momentum
di: Dang, Anh, et al.
Pubblicazione: (2024)
di: Dang, Anh, et al.
Pubblicazione: (2024)
Mitigating Preference Hacking in Policy Optimization with Pessimism
di: Gupta, Dhawal, et al.
Pubblicazione: (2025)
di: Gupta, Dhawal, et al.
Pubblicazione: (2025)
Logit Dynamics in Softmax Policy Gradient Methods
di: Li, Yingru
Pubblicazione: (2025)
di: Li, Yingru
Pubblicazione: (2025)
Ensemble sampling for linear bandits: small ensembles suffice
di: Janz, David, et al.
Pubblicazione: (2023)
di: Janz, David, et al.
Pubblicazione: (2023)
MetaLA: Unified Optimal Linear Approximation to Softmax Attention Map
di: Chou, Yuhong, et al.
Pubblicazione: (2024)
di: Chou, Yuhong, et al.
Pubblicazione: (2024)
Beyond Softmax and Entropy: Convergence Rates of Policy Gradients with f-SoftArgmax Parameterization & Coupled Regularization
di: Labbi, Safwan, et al.
Pubblicazione: (2026)
di: Labbi, Safwan, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Ordering-based Conditions for Global Convergence of Policy Gradient Methods
di: Mei, Jincheng, et al.
Pubblicazione: (2025) -
Small steps no more: Global convergence of stochastic gradient bandits for arbitrary learning rates
di: Mei, Jincheng, et al.
Pubblicazione: (2025) -
Stochastic Gradient Succeeds for Bandits
di: Mei, Jincheng, et al.
Pubblicazione: (2024) -
Optimistic Actor-Critic with Parametric Policies for Linear Markov Decision Processes
di: Lin, Max Qiushi, et al.
Pubblicazione: (2026) -
Towards Principled, Practical Policy Gradient for Bandits and Tabular MDPs
di: Lu, Michael, et al.
Pubblicazione: (2024)