A Lyapunov Analysis of Softmax Policy Gradient for Stochastic Bandits
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Lattimore, Tor |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A Diffusion Analysis of Policy Gradient for Stochastic Bandits
par: Lattimore, Tor
Publié: (2026)
par: Lattimore, Tor
Publié: (2026)
Bandit Convex Optimisation
par: Lattimore, Tor
Publié: (2024)
par: Lattimore, Tor
Publié: (2024)
Refined Detection for Gumbel Watermarking
par: Lattimore, Tor
Publié: (2026)
par: Lattimore, Tor
Publié: (2026)
Online Newton Method for Bandit Convex Optimisation
par: Fokkema, Hidde, et autres
Publié: (2024)
par: Fokkema, Hidde, et autres
Publié: (2024)
Beyond Stationarity: Convergence Analysis of Stochastic Softmax Policy Gradient Methods
par: Klein, Sara, et autres
Publié: (2023)
par: Klein, Sara, et autres
Publié: (2023)
Beyond Softmax: A New Perspective on Gradient Bandits
par: Melo, Emerson, et autres
Publié: (2025)
par: Melo, Emerson, et autres
Publié: (2025)
Beyond Statistical Learning: Exact Learning Is Essential for General Intelligence
par: György, András, et autres
Publié: (2025)
par: György, András, et autres
Publié: (2025)
Logit Dynamics in Softmax Policy Gradient Methods
par: Li, Yingru
Publié: (2025)
par: Li, Yingru
Publié: (2025)
Stochastic Gradient Succeeds for Bandits
par: Mei, Jincheng, et autres
Publié: (2024)
par: Mei, Jincheng, et autres
Publié: (2024)
Rethinking the Global Convergence of Softmax Policy Gradient with Linear Function Approximation
par: Lin, Max Qiushi, et autres
Publié: (2025)
par: Lin, Max Qiushi, et autres
Publié: (2025)
On Global Convergence Rates for Federated Softmax Policy Gradient under Heterogeneous Environments
par: Labbi, Safwan, et autres
Publié: (2025)
par: Labbi, Safwan, et autres
Publié: (2025)
Annealed Softmax Greedy in Many-Armed Bayesian Bandits
par: Overman, William, et autres
Publié: (2026)
par: Overman, William, et autres
Publié: (2026)
First-Order Softmax Weighted Switching Gradient Method for Distributed Stochastic Minimax Optimization with Stochastic Constraints
par: Luo, Zhankun, et autres
Publié: (2026)
par: Luo, Zhankun, et autres
Publié: (2026)
Beyond Softmax and Entropy: Convergence Rates of Policy Gradients with f-SoftArgmax Parameterization & Coupled Regularization
par: Labbi, Safwan, et autres
Publié: (2026)
par: Labbi, Safwan, et autres
Publié: (2026)
Online Statistical Inference for Contextual Bandits via Stochastic Gradient Descent
par: Chang, Xiangyu, et autres
Publié: (2022)
par: Chang, Xiangyu, et autres
Publié: (2022)
Towards Principled, Practical Policy Gradient for Bandits and Tabular MDPs
par: Lu, Michael, et autres
Publié: (2024)
par: Lu, Michael, et autres
Publié: (2024)
Is Softmax Loss All You Need? A Principled Analysis of Softmax-family Loss
par: Pu, Yuanhao, et autres
Publié: (2026)
par: Pu, Yuanhao, et autres
Publié: (2026)
Learning Optimal Deterministic Policies with Stochastic Policy Gradients
par: Montenegro, Alessandro, et autres
Publié: (2024)
par: Montenegro, Alessandro, et autres
Publié: (2024)
Efficient and Optimal Policy Gradient Algorithm for Corrupted Multi-armed Bandits
par: Liu, Jiayuan, et autres
Publié: (2025)
par: Liu, Jiayuan, et autres
Publié: (2025)
Fast Convergence of Softmax Policy Mirror Ascent
par: Asad, Reza, et autres
Publié: (2024)
par: Asad, Reza, et autres
Publié: (2024)
Adaptive Sparse Softmax: An Effective and Efficient Softmax Variant
par: Lv, Qi, et autres
Publié: (2025)
par: Lv, Qi, et autres
Publié: (2025)
Efficient Clustering in Stochastic Bandits
par: Chandran, G Dhinesh, et autres
Publié: (2026)
par: Chandran, G Dhinesh, et autres
Publié: (2026)
Stochastic Bandits for Egalitarian Assignment
par: Lim, Eugene, et autres
Publié: (2024)
par: Lim, Eugene, et autres
Publié: (2024)
Bayesian Bandit Algorithms with Approximate Inference in Stochastic Linear Bandits
par: Huang, Ziyi, et autres
Publié: (2024)
par: Huang, Ziyi, et autres
Publié: (2024)
HyperArm Bandit Optimization: A Novel approach to Hyperparameter Optimization and an Analysis of Bandit Algorithms in Stochastic and Adversarial Settings
par: Karroum, Samih, et autres
Publié: (2025)
par: Karroum, Samih, et autres
Publié: (2025)
A Concise Lyapunov Analysis of Nesterov's Accelerated Gradient Method
par: Liu, Jun
Publié: (2025)
par: Liu, Jun
Publié: (2025)
Gradient Flow Polarizes Softmax Outputs towards Low-Entropy Solutions
par: Varre, Aditya, et autres
Publié: (2026)
par: Varre, Aditya, et autres
Publié: (2026)
Global Optimality and Finite Sample Analysis of Softmax Off-Policy Actor Critic under State Distribution Mismatch
par: Zhang, Shangtong, et autres
Publié: (2021)
par: Zhang, Shangtong, et autres
Publié: (2021)
Are Stochastic Multi-objective Bandits Harder than Single-objective Bandits?
par: Guan, Changkun, et autres
Publié: (2026)
par: Guan, Changkun, et autres
Publié: (2026)
Fast Stochastic Policy Gradient: Negative Momentum for Reinforcement Learning
par: Zhang, Haobin, et autres
Publié: (2024)
par: Zhang, Haobin, et autres
Publié: (2024)
Score-Aware Policy-Gradient and Performance Guarantees using Local Lyapunov Stability
par: Comte, Céline, et autres
Publié: (2023)
par: Comte, Céline, et autres
Publié: (2023)
Batched Stochastic Bandit for Nondegenerate Functions
par: Liu, Yu, et autres
Publié: (2024)
par: Liu, Yu, et autres
Publié: (2024)
Stochastic Bandits Robust to Adversarial Attacks
par: Wang, Xuchuang, et autres
Publié: (2024)
par: Wang, Xuchuang, et autres
Publié: (2024)
Lipschitz Bandits with Stochastic Delayed Feedback
par: Liu, Zhongxuan, et autres
Publié: (2025)
par: Liu, Zhongxuan, et autres
Publié: (2025)
Implicit Regularization of Gradient Flow on One-Layer Softmax Attention
par: Sheen, Heejune, et autres
Publié: (2024)
par: Sheen, Heejune, et autres
Publié: (2024)
Beyond Exact Gradients: Convergence of Stochastic Soft-Max Policy Gradient Methods with Entropy Regularization
par: Ding, Yuhao, et autres
Publié: (2021)
par: Ding, Yuhao, et autres
Publié: (2021)
A Simple and Optimal Policy Design with Safety against Heavy-Tailed Risk for Stochastic Bandits
par: Simchi-Levi, David, et autres
Publié: (2022)
par: Simchi-Levi, David, et autres
Publié: (2022)
Thompson Sampling for Stochastic Bandits with Noisy Contexts: An Information-Theoretic Regret Analysis
par: Jose, Sharu Theresa, et autres
Publié: (2024)
par: Jose, Sharu Theresa, et autres
Publié: (2024)
An LP-based Sampling Policy for Multi-Armed Bandits with Side-Observations and Stochastic Availability
par: Soni, Ashutosh, et autres
Publié: (2026)
par: Soni, Ashutosh, et autres
Publié: (2026)
Stochastic $k$-Submodular Bandits with Full Bandit Feedback
par: Nie, Guanyu, et autres
Publié: (2024)
par: Nie, Guanyu, et autres
Publié: (2024)
Documents similaires
-
A Diffusion Analysis of Policy Gradient for Stochastic Bandits
par: Lattimore, Tor
Publié: (2026) -
Bandit Convex Optimisation
par: Lattimore, Tor
Publié: (2024) -
Refined Detection for Gumbel Watermarking
par: Lattimore, Tor
Publié: (2026) -
Online Newton Method for Bandit Convex Optimisation
par: Fokkema, Hidde, et autres
Publié: (2024) -
Beyond Stationarity: Convergence Analysis of Stochastic Softmax Policy Gradient Methods
par: Klein, Sara, et autres
Publié: (2023)