Learning Optimal Deterministic Policies with Stochastic Policy Gradients
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Montenegro, Alessandro, Mussi, Marco, Metelli, Alberto Maria, Papini, Matteo |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Learning Deterministic Policies with Policy Gradients in Constrained Markov Decision Processes
von: Montenegro, Alessandro, et al.
Veröffentlicht: (2025)
von: Montenegro, Alessandro, et al.
Veröffentlicht: (2025)
Last-Iterate Global Convergence of Policy Gradients for Constrained Reinforcement Learning
von: Montenegro, Alessandro, et al.
Veröffentlicht: (2024)
von: Montenegro, Alessandro, et al.
Veröffentlicht: (2024)
Reusing Trajectories in Policy Gradients Enables Fast Convergence
von: Montenegro, Alessandro, et al.
Veröffentlicht: (2025)
von: Montenegro, Alessandro, et al.
Veröffentlicht: (2025)
Policy Gradient with Active Importance Sampling
von: Papini, Matteo, et al.
Veröffentlicht: (2024)
von: Papini, Matteo, et al.
Veröffentlicht: (2024)
Best Arm Identification for Stochastic Rising Bandits
von: Mussi, Marco, et al.
Veröffentlicht: (2023)
von: Mussi, Marco, et al.
Veröffentlicht: (2023)
Statistical Analysis of Policy Space Compression Problem
von: Molaei, Majid, et al.
Veröffentlicht: (2024)
von: Molaei, Majid, et al.
Veröffentlicht: (2024)
Projection by Convolution: Optimal Sample Complexity for Reinforcement Learning in Continuous-Space MDPs
von: Maran, Davide, et al.
Veröffentlicht: (2024)
von: Maran, Davide, et al.
Veröffentlicht: (2024)
Open Problem: Tight Bounds for Kernelized Multi-Armed Bandits with Bernoulli Rewards
von: Mussi, Marco, et al.
Veröffentlicht: (2024)
von: Mussi, Marco, et al.
Veröffentlicht: (2024)
Generalized Kernelized Bandits: A Novel Self-Normalized Bernstein-Like Dimension-Free Inequality and Regret Bounds
von: Metelli, Alberto Maria, et al.
Veröffentlicht: (2025)
von: Metelli, Alberto Maria, et al.
Veröffentlicht: (2025)
A Refined Analysis of UCBVI
von: Drago, Simone, et al.
Veröffentlicht: (2025)
von: Drago, Simone, et al.
Veröffentlicht: (2025)
Local Linearity: the Key for No-regret Reinforcement Learning in Continuous MDPs
von: Maran, Davide, et al.
Veröffentlicht: (2024)
von: Maran, Davide, et al.
Veröffentlicht: (2024)
No-Regret Reinforcement Learning in Smooth MDPs
von: Maran, Davide, et al.
Veröffentlicht: (2024)
von: Maran, Davide, et al.
Veröffentlicht: (2024)
Power Grid Control with Graph-Based Distributed Reinforcement Learning
von: Fabrizio, Carlo, et al.
Veröffentlicht: (2025)
von: Fabrizio, Carlo, et al.
Veröffentlicht: (2025)
Bridging Rested and Restless Bandits with Graph-Triggering: Rising and Rotting
von: Genalti, Gianmarco, et al.
Veröffentlicht: (2024)
von: Genalti, Gianmarco, et al.
Veröffentlicht: (2024)
Actor-Critic with Active Importance Sampling
von: Molaei, Majid, et al.
Veröffentlicht: (2026)
von: Molaei, Majid, et al.
Veröffentlicht: (2026)
Thompson Sampling-like Algorithms for Stochastic Rising Bandits
von: Fiandri, Marco, et al.
Veröffentlicht: (2025)
von: Fiandri, Marco, et al.
Veröffentlicht: (2025)
How Log-Barrier Helps Exploration in Policy Optimization
von: Cesani, Leonardo, et al.
Veröffentlicht: (2026)
von: Cesani, Leonardo, et al.
Veröffentlicht: (2026)
State and Action Factorization in Power Grids
von: Losapio, Gianvito, et al.
Veröffentlicht: (2024)
von: Losapio, Gianvito, et al.
Veröffentlicht: (2024)
Truncating Trajectories in Monte Carlo Policy Evaluation: an Adaptive Approach
von: Poiani, Riccardo, et al.
Veröffentlicht: (2024)
von: Poiani, Riccardo, et al.
Veröffentlicht: (2024)
Gym4ReaL: A Suite for Benchmarking Real-World Reinforcement Learning
von: Salaorni, Davide, et al.
Veröffentlicht: (2025)
von: Salaorni, Davide, et al.
Veröffentlicht: (2025)
Soft Deterministic Policy Gradient with Gaussian Smoothing
von: Na, Hyunjun, et al.
Veröffentlicht: (2026)
von: Na, Hyunjun, et al.
Veröffentlicht: (2026)
Performance Improvement Bounds for Lipschitz Configurable Markov Decision Processes
von: Metelli, Alberto Maria
Veröffentlicht: (2024)
von: Metelli, Alberto Maria
Veröffentlicht: (2024)
Autoregressive Bandits
von: Bacchiocchi, Francesco, et al.
Veröffentlicht: (2022)
von: Bacchiocchi, Francesco, et al.
Veröffentlicht: (2022)
Deterministic Policy Gradient for Reinforcement Learning with Continuous Time and State
von: Cheng, Ziheng, et al.
Veröffentlicht: (2025)
von: Cheng, Ziheng, et al.
Veröffentlicht: (2025)
Robustness in the Face of Partial Identifiability in Reward Learning
von: Lazzati, Filippo, et al.
Veröffentlicht: (2025)
von: Lazzati, Filippo, et al.
Veröffentlicht: (2025)
Learning Utilities from Demonstrations in Markov Decision Processes
von: Lazzati, Filippo, et al.
Veröffentlicht: (2024)
von: Lazzati, Filippo, et al.
Veröffentlicht: (2024)
Fast Stochastic Policy Gradient: Negative Momentum for Reinforcement Learning
von: Zhang, Haobin, et al.
Veröffentlicht: (2024)
von: Zhang, Haobin, et al.
Veröffentlicht: (2024)
Edge Delayed Deep Deterministic Policy Gradient: efficient continuous control for edge scenarios
von: Sinigaglia, Alberto, et al.
Veröffentlicht: (2024)
von: Sinigaglia, Alberto, et al.
Veröffentlicht: (2024)
Imitation Learning as Return Distribution Matching
von: Lazzati, Filippo, et al.
Veröffentlicht: (2025)
von: Lazzati, Filippo, et al.
Veröffentlicht: (2025)
Imitate Optimal Policy: Prevail and Induce Action Collapse in Policy Gradient
von: Zhou, Zhongzhu, et al.
Veröffentlicht: (2025)
von: Zhou, Zhongzhu, et al.
Veröffentlicht: (2025)
Optimizing Drivers' Discount Order Acceptance Strategies: A Policy-Improved Deep Deterministic Policy Gradient Framework
von: Dai, Hanwen, et al.
Veröffentlicht: (2025)
von: Dai, Hanwen, et al.
Veröffentlicht: (2025)
Sliding-Window Thompson Sampling for Non-Stationary Settings
von: Fiandri, Marco, et al.
Veröffentlicht: (2024)
von: Fiandri, Marco, et al.
Veröffentlicht: (2024)
On-Policy Policy Gradient Reinforcement Learning Without On-Policy Sampling
von: Corrado, Nicholas E., et al.
Veröffentlicht: (2023)
von: Corrado, Nicholas E., et al.
Veröffentlicht: (2023)
Off-Policy Evaluation for Ranking Policies under Deterministic Logging Policies
von: Tanaka, Koichi, et al.
Veröffentlicht: (2026)
von: Tanaka, Koichi, et al.
Veröffentlicht: (2026)
Generalizing Behavior via Inverse Reinforcement Learning with Closed-Form Reward Centroids
von: Lazzati, Filippo, et al.
Veröffentlicht: (2025)
von: Lazzati, Filippo, et al.
Veröffentlicht: (2025)
Mitigating Suboptimality of Deterministic Policy Gradients in Complex Q-functions
von: Jain, Ayush, et al.
Veröffentlicht: (2024)
von: Jain, Ayush, et al.
Veröffentlicht: (2024)
Counterfactual Learning of Stochastic Policies with Continuous Actions
von: Zenati, Houssam, et al.
Veröffentlicht: (2020)
von: Zenati, Houssam, et al.
Veröffentlicht: (2020)
Policy Gradients for Optimal Parallel Tempering MCMC
von: Zhao, Daniel, et al.
Veröffentlicht: (2024)
von: Zhao, Daniel, et al.
Veröffentlicht: (2024)
ATE-SG: Alternate Through the Epochs Stochastic Gradient for Multi-Task Neural Networks
von: Bellavia, Stefania, et al.
Veröffentlicht: (2023)
von: Bellavia, Stefania, et al.
Veröffentlicht: (2023)
Optimal Strong Regret and Violation in Constrained MDPs via Policy Optimization
von: Stradi, Francesco Emanuele, et al.
Veröffentlicht: (2024)
von: Stradi, Francesco Emanuele, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Learning Deterministic Policies with Policy Gradients in Constrained Markov Decision Processes
von: Montenegro, Alessandro, et al.
Veröffentlicht: (2025) -
Last-Iterate Global Convergence of Policy Gradients for Constrained Reinforcement Learning
von: Montenegro, Alessandro, et al.
Veröffentlicht: (2024) -
Reusing Trajectories in Policy Gradients Enables Fast Convergence
von: Montenegro, Alessandro, et al.
Veröffentlicht: (2025) -
Policy Gradient with Active Importance Sampling
von: Papini, Matteo, et al.
Veröffentlicht: (2024) -
Best Arm Identification for Stochastic Rising Bandits
von: Mussi, Marco, et al.
Veröffentlicht: (2023)