On the Effect of Regularization in Policy Mirror Descent
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kleuker, Jan Felix, Plaat, Aske, Moerland, Thomas |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Chargax: A JAX Accelerated EV Charging Simulator
par: Ponse, Koen, et autres
Publié: (2025)
par: Ponse, Koen, et autres
Publié: (2025)
A Unified Framework for Zero-Shot Reinforcement Learning
par: Di Ventura, Jacopo, et autres
Publié: (2025)
par: Di Ventura, Jacopo, et autres
Publié: (2025)
Reinforcement Learning for Sustainable Energy: A Survey
par: Ponse, Koen, et autres
Publié: (2024)
par: Ponse, Koen, et autres
Publié: (2024)
Slot Structured World Models
par: Collu, Jonathan, et autres
Publié: (2024)
par: Collu, Jonathan, et autres
Publié: (2024)
Towards a Practical Understanding of Lagrangian Methods in Safe Reinforcement Learning
par: Spoor, Lindsay, et autres
Publié: (2025)
par: Spoor, Lindsay, et autres
Publié: (2025)
Explicitly Disentangled Representations in Object-Centric Learning
par: Majellaro, Riccardo, et autres
Publié: (2024)
par: Majellaro, Riccardo, et autres
Publié: (2024)
EconoJax: A Fast & Scalable Economic Simulation in Jax
par: Ponse, Koen, et autres
Publié: (2024)
par: Ponse, Koen, et autres
Publié: (2024)
Mirror Mode in Fire Emblem: Beating Players at their own Game with Imitation and Reinforcement Learning
par: Smid, Yanna Elizabeth, et autres
Publié: (2025)
par: Smid, Yanna Elizabeth, et autres
Publié: (2025)
ACTIVA: Amortized Causal Effect Estimation via Transformer-based Variational Autoencoder
par: Sauter, Andreas, et autres
Publié: (2025)
par: Sauter, Andreas, et autres
Publié: (2025)
Solving Deep Reinforcement Learning Tasks with Evolution Strategies and Linear Policy Networks
par: Wong, Annie, et autres
Publié: (2024)
par: Wong, Annie, et autres
Publié: (2024)
CausalPlayground: Addressing Data-Generation Requirements in Cutting-Edge Causality Research
par: Sauter, Andreas W M, et autres
Publié: (2024)
par: Sauter, Andreas W M, et autres
Publié: (2024)
Policy Mirror Descent with Lookahead
par: Protopapas, Kimon, et autres
Publié: (2024)
par: Protopapas, Kimon, et autres
Publié: (2024)
On the Convergence of Policy in Unregularized Policy Mirror Descent
par: Lin, Dachao, et autres
Publié: (2022)
par: Lin, Dachao, et autres
Publié: (2022)
One-Step Flow Policy Mirror Descent
par: Chen, Tianyi, et autres
Publié: (2025)
par: Chen, Tianyi, et autres
Publié: (2025)
Functional Acceleration for Policy Mirror Descent
par: Chelu, Veronica, et autres
Publié: (2024)
par: Chelu, Veronica, et autres
Publié: (2024)
Approximation of Log-Partition Function in Policy Mirror Descent Induces Implicit Regularization for LLM Post-Training
par: Xu, Zhenghao, et autres
Publié: (2026)
par: Xu, Zhenghao, et autres
Publié: (2026)
Stability and Robustness via Regularization: Bandit Inference via Regularized Stochastic Mirror Descent
par: Halder, Budhaditya, et autres
Publié: (2026)
par: Halder, Budhaditya, et autres
Publié: (2026)
A Unified Approach to Controlling Implicit Regularization via Mirror Descent
par: Sun, Haoyuan, et autres
Publié: (2023)
par: Sun, Haoyuan, et autres
Publié: (2023)
Flow Matching Policy Optimization with Mirror Descent and Entropy Constraints
par: Gao, Ting, et autres
Publié: (2026)
par: Gao, Ting, et autres
Publié: (2026)
On the Convergence of Policy Mirror Descent with Temporal Difference Evaluation
par: Liu, Jiacai, et autres
Publié: (2025)
par: Liu, Jiacai, et autres
Publié: (2025)
Research Re: search & Re-search
par: Plaat, Aske
Publié: (2024)
par: Plaat, Aske
Publié: (2024)
Sample Complexity of Neural Policy Mirror Descent for Policy Optimization on Low-Dimensional Manifolds
par: Xu, Zhenghao, et autres
Publié: (2023)
par: Xu, Zhenghao, et autres
Publié: (2023)
EduGym: An Environment and Notebook Suite for Reinforcement Learning Education
par: Moerland, Thomas M., et autres
Publié: (2023)
par: Moerland, Thomas M., et autres
Publié: (2023)
Convergence of Policy Mirror Descent Beyond Compatible Function Approximation
par: Sherman, Uri, et autres
Publié: (2025)
par: Sherman, Uri, et autres
Publié: (2025)
StaQ it! Growing neural networks for Policy Mirror Descent
par: Shilova, Alena, et autres
Publié: (2025)
par: Shilova, Alena, et autres
Publié: (2025)
Beyond State-Wise Mirror Descent: Offline Policy Optimization with Parametric Policies
par: Li, Xiang, et autres
Publié: (2026)
par: Li, Xiang, et autres
Publié: (2026)
Multi-Step Reasoning with Large Language Models, a Survey
par: Plaat, Aske, et autres
Publié: (2024)
par: Plaat, Aske, et autres
Publié: (2024)
Reset-free Reinforcement Learning with World Models
par: Yang, Zhao, et autres
Publié: (2024)
par: Yang, Zhao, et autres
Publié: (2024)
CORE: Towards Scalable and Efficient Causal Discovery with Reinforcement Learning
par: Sauter, Andreas W. M., et autres
Publié: (2024)
par: Sauter, Andreas W. M., et autres
Publié: (2024)
Path-Space Mirror Descent for On-Policy Reinforcement Learning under the Generalized Schrödinger Bridge
par: Gong, Yuehu, et autres
Publié: (2026)
par: Gong, Yuehu, et autres
Publié: (2026)
Parameter-free Mirror Descent
par: Jacobsen, Andrew, et autres
Publié: (2022)
par: Jacobsen, Andrew, et autres
Publié: (2022)
Mirror Descent on Riemannian Manifolds
par: Jiang, Jiaxin, et autres
Publié: (2026)
par: Jiang, Jiaxin, et autres
Publié: (2026)
A Mirror Descent Perspective of Smoothed Sign Descent
par: Wang, Shuyang, et autres
Publié: (2024)
par: Wang, Shuyang, et autres
Publié: (2024)
Mirror Descent Policy Optimisation for Robust Constrained Markov Decision Processes
par: Bossens, David M., et autres
Publié: (2025)
par: Bossens, David M., et autres
Publié: (2025)
The Hidden Cost of Approximation in Online Mirror Descent
par: Schlisselberg, Ofir, et autres
Publié: (2025)
par: Schlisselberg, Ofir, et autres
Publié: (2025)
Reference-Sampled Boltzmann Projection for KL-Regularized RLVR: Target-Matched Weighted SFT, Finite One-Shot Gaps, and Policy Mirror Descent
par: Shu, Yao, et autres
Publié: (2026)
par: Shu, Yao, et autres
Publié: (2026)
Stochastic MeanFlow Policies: One-Step Generative Control with Entropic Mirror Descent
par: Wang, Zeyuan, et autres
Publié: (2026)
par: Wang, Zeyuan, et autres
Publié: (2026)
Never Saddle for Reparameterized Steepest Descent as Mirror Flow
par: Jacobs, Tom, et autres
Publié: (2026)
par: Jacobs, Tom, et autres
Publié: (2026)
A Novel Framework for Policy Mirror Descent with General Parameterization and Linear Convergence
par: Alfano, Carlo, et autres
Publié: (2023)
par: Alfano, Carlo, et autres
Publié: (2023)
Value Mirror Descent for Reinforcement Learning
par: Jia, Zhichao, et autres
Publié: (2026)
par: Jia, Zhichao, et autres
Publié: (2026)
Documents similaires
-
Chargax: A JAX Accelerated EV Charging Simulator
par: Ponse, Koen, et autres
Publié: (2025) -
A Unified Framework for Zero-Shot Reinforcement Learning
par: Di Ventura, Jacopo, et autres
Publié: (2025) -
Reinforcement Learning for Sustainable Energy: A Survey
par: Ponse, Koen, et autres
Publié: (2024) -
Slot Structured World Models
par: Collu, Jonathan, et autres
Publié: (2024) -
Towards a Practical Understanding of Lagrangian Methods in Safe Reinforcement Learning
par: Spoor, Lindsay, et autres
Publié: (2025)