Behind the Myth of Exploration in Policy Gradients
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Bolland, Adrien, Lambrechts, Gaspard, Ernst, Damien |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Maximum-Entropy Exploration with Future State-Action Visitation Measures
par: Bolland, Adrien, et autres
Publié: (2026)
par: Bolland, Adrien, et autres
Publié: (2026)
Off-Policy Maximum Entropy RL with Future State and Action Visitation Measures
par: Bolland, Adrien, et autres
Publié: (2024)
par: Bolland, Adrien, et autres
Publié: (2024)
Informed POMDP: Leveraging Additional Information in Model-Based RL
par: Lambrechts, Gaspard, et autres
Publié: (2023)
par: Lambrechts, Gaspard, et autres
Publié: (2023)
A Theoretical Justification for Asymmetric Actor-Critic Algorithms
par: Lambrechts, Gaspard, et autres
Publié: (2025)
par: Lambrechts, Gaspard, et autres
Publié: (2025)
Parallelizing Autoregressive Generation with Variational State Space Models
par: Lambrechts, Gaspard, et autres
Publié: (2024)
par: Lambrechts, Gaspard, et autres
Publié: (2024)
Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access
par: Ebi, Daniel, et autres
Publié: (2025)
par: Ebi, Daniel, et autres
Publié: (2025)
Cost Estimation in Unit Commitment Problems Using Simulation-Based Inference
par: Pirlet, Matthias, et autres
Publié: (2024)
par: Pirlet, Matthias, et autres
Publié: (2024)
Gym-TORAX: Open-source software for integrating reinforcement learning with plasma control simulators in tokamak research
par: Mouchamps, Antoine, et autres
Publié: (2025)
par: Mouchamps, Antoine, et autres
Publié: (2025)
Parallelizable memory recurrent units
par: De Geeter, Florent, et autres
Publié: (2026)
par: De Geeter, Florent, et autres
Publié: (2026)
Reinforcement Learning for Efficient Design and Control Co-optimisation of Energy Systems
par: Cauz, Marine, et autres
Publié: (2024)
par: Cauz, Marine, et autres
Publié: (2024)
Optimal Control of Renewable Energy Communities subject to Network Peak Fees with Model Predictive Control and Reinforcement Learning Algorithms
par: Aittahar, Samy, et autres
Publié: (2024)
par: Aittahar, Samy, et autres
Publié: (2024)
Demystifying the Mechanisms Behind Emergent Exploration in Goal-conditioned RL
par: Bastankhah, Mahsa, et autres
Publié: (2025)
par: Bastankhah, Mahsa, et autres
Publié: (2025)
Emergence of Exploration in Policy Gradient Reinforcement Learning via Retrying
par: Nishimori, Soichiro, et autres
Publié: (2026)
par: Nishimori, Soichiro, et autres
Publié: (2026)
Reinforcement Learning to improve delta robot throws for sorting scrap metal
par: Louette, Arthur, et autres
Publié: (2024)
par: Louette, Arthur, et autres
Publié: (2024)
LPPG-RL: Lexicographically Projected Policy Gradient Reinforcement Learning with Subproblem Exploration
par: Qiu, Ruiyu, et autres
Publié: (2025)
par: Qiu, Ruiyu, et autres
Publié: (2025)
Real-World Reinforcement Learning of Active Perception Behaviors
par: Hu, Edward S., et autres
Publié: (2025)
par: Hu, Edward S., et autres
Publié: (2025)
Stochastic Differential Equations models for Least-Squares Stochastic Gradient Descent
par: Schertzer, Adrien, et autres
Publié: (2024)
par: Schertzer, Adrien, et autres
Publié: (2024)
Optimal Control-Based Baseline for Guided Exploration in Policy Gradient Methods
par: Lyu, Xubo, et autres
Publié: (2020)
par: Lyu, Xubo, et autres
Publié: (2020)
Group Policy Gradient
par: Chen, Junhua, et autres
Publié: (2025)
par: Chen, Junhua, et autres
Publié: (2025)
Particle-MALA and Particle-mGRAD: Gradient-based MCMC methods for high-dimensional state-space models
par: Corenflos, Adrien, et autres
Publié: (2024)
par: Corenflos, Adrien, et autres
Publié: (2024)
Revisiting Policy Gradients for Restricted Policy Classes: Escaping Myopic Local Optima with $k$-step Policy Gradients
par: DeWeese, Alex, et autres
Publié: (2026)
par: DeWeese, Alex, et autres
Publié: (2026)
On-Policy Policy Gradient Reinforcement Learning Without On-Policy Sampling
par: Corrado, Nicholas E., et autres
Publié: (2023)
par: Corrado, Nicholas E., et autres
Publié: (2023)
Spike-based computation using classical recurrent neural networks
par: De Geeter, Florent, et autres
Publié: (2023)
par: De Geeter, Florent, et autres
Publié: (2023)
Differentially Private Policy Gradient
par: Rio, Alexandre, et autres
Publié: (2025)
par: Rio, Alexandre, et autres
Publié: (2025)
Wasserstein Proximal Policy Gradient
par: Zhu, Zhaoyu, et autres
Publié: (2026)
par: Zhu, Zhaoyu, et autres
Publié: (2026)
Functional Natural Policy Gradients
par: Bibaut, Aurelien, et autres
Publié: (2026)
par: Bibaut, Aurelien, et autres
Publié: (2026)
How to craft a deep reinforcement learning policy for wind farm flow control
par: Kadoche, Elie, et autres
Publié: (2025)
par: Kadoche, Elie, et autres
Publié: (2025)
Learning Optimal Deterministic Policies with Stochastic Policy Gradients
par: Montenegro, Alessandro, et autres
Publié: (2024)
par: Montenegro, Alessandro, et autres
Publié: (2024)
When Do Off-Policy and On-Policy Policy Gradient Methods Align?
par: Mambelli, Davide, et autres
Publié: (2024)
par: Mambelli, Davide, et autres
Publié: (2024)
Acceleration Methods
par: d'Aspremont, Alexandre, et autres
Publié: (2021)
par: d'Aspremont, Alexandre, et autres
Publié: (2021)
Decoupling Exploration and Policy Optimization: Uncertainty Guided Tree Search for Hard Exploration
par: Mhammedi, Zakaria, et autres
Publié: (2026)
par: Mhammedi, Zakaria, et autres
Publié: (2026)
Investigating simple target-covariate relationships for Chronos-2 and TabPFN-TS
par: Berthelier, Gaspard, et autres
Publié: (2026)
par: Berthelier, Gaspard, et autres
Publié: (2026)
GFlowNet Training by Policy Gradients
par: Niu, Puhua, et autres
Publié: (2024)
par: Niu, Puhua, et autres
Publié: (2024)
Policy Gradient with Active Importance Sampling
par: Papini, Matteo, et autres
Publié: (2024)
par: Papini, Matteo, et autres
Publié: (2024)
Exploration Behavior of Untrained Policies
par: Adamczyk, Jacob
Publié: (2025)
par: Adamczyk, Jacob
Publié: (2025)
Flow Matching Policy Gradients
par: McAllister, David, et autres
Publié: (2025)
par: McAllister, David, et autres
Publié: (2025)
Meta-RL Induces Exploration in Language Agents
par: Jiang, Yulun, et autres
Publié: (2025)
par: Jiang, Yulun, et autres
Publié: (2025)
Imitate Optimal Policy: Prevail and Induce Action Collapse in Policy Gradient
par: Zhou, Zhongzhu, et autres
Publié: (2025)
par: Zhou, Zhongzhu, et autres
Publié: (2025)
Learning Deterministic Policies with Policy Gradients in Constrained Markov Decision Processes
par: Montenegro, Alessandro, et autres
Publié: (2025)
par: Montenegro, Alessandro, et autres
Publié: (2025)
Learning General Policies with Policy Gradient Methods
par: Ståhlberg, Simon, et autres
Publié: (2025)
par: Ståhlberg, Simon, et autres
Publié: (2025)
Documents similaires
-
Maximum-Entropy Exploration with Future State-Action Visitation Measures
par: Bolland, Adrien, et autres
Publié: (2026) -
Off-Policy Maximum Entropy RL with Future State and Action Visitation Measures
par: Bolland, Adrien, et autres
Publié: (2024) -
Informed POMDP: Leveraging Additional Information in Model-Based RL
par: Lambrechts, Gaspard, et autres
Publié: (2023) -
A Theoretical Justification for Asymmetric Actor-Critic Algorithms
par: Lambrechts, Gaspard, et autres
Publié: (2025) -
Parallelizing Autoregressive Generation with Variational State Space Models
par: Lambrechts, Gaspard, et autres
Publié: (2024)