Learning Deterministic Policies with Policy Gradients in Constrained Markov Decision Processes
Fuente:
arXiv
Saved in:
| Main Authors: | Montenegro, Alessandro, Cesani, Leonardo, Mussi, Marco, Papini, Matteo, Metelli, Alberto Maria |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Learning Optimal Deterministic Policies with Stochastic Policy Gradients
by: Montenegro, Alessandro, et al.
Published: (2024)
by: Montenegro, Alessandro, et al.
Published: (2024)
Last-Iterate Global Convergence of Policy Gradients for Constrained Reinforcement Learning
by: Montenegro, Alessandro, et al.
Published: (2024)
by: Montenegro, Alessandro, et al.
Published: (2024)
Reusing Trajectories in Policy Gradients Enables Fast Convergence
by: Montenegro, Alessandro, et al.
Published: (2025)
by: Montenegro, Alessandro, et al.
Published: (2025)
Policy Gradient with Active Importance Sampling
by: Papini, Matteo, et al.
Published: (2024)
by: Papini, Matteo, et al.
Published: (2024)
How Log-Barrier Helps Exploration in Policy Optimization
by: Cesani, Leonardo, et al.
Published: (2026)
by: Cesani, Leonardo, et al.
Published: (2026)
Statistical Analysis of Policy Space Compression Problem
by: Molaei, Majid, et al.
Published: (2024)
by: Molaei, Majid, et al.
Published: (2024)
Learning Utilities from Demonstrations in Markov Decision Processes
by: Lazzati, Filippo, et al.
Published: (2024)
by: Lazzati, Filippo, et al.
Published: (2024)
Performance Improvement Bounds for Lipschitz Configurable Markov Decision Processes
by: Metelli, Alberto Maria
Published: (2024)
by: Metelli, Alberto Maria
Published: (2024)
Best Arm Identification for Stochastic Rising Bandits
by: Mussi, Marco, et al.
Published: (2023)
by: Mussi, Marco, et al.
Published: (2023)
Generalized Kernelized Bandits: A Novel Self-Normalized Bernstein-Like Dimension-Free Inequality and Regret Bounds
by: Metelli, Alberto Maria, et al.
Published: (2025)
by: Metelli, Alberto Maria, et al.
Published: (2025)
A Refined Analysis of UCBVI
by: Drago, Simone, et al.
Published: (2025)
by: Drago, Simone, et al.
Published: (2025)
Open Problem: Tight Bounds for Kernelized Multi-Armed Bandits with Bernoulli Rewards
by: Mussi, Marco, et al.
Published: (2024)
by: Mussi, Marco, et al.
Published: (2024)
Local Linearity: the Key for No-regret Reinforcement Learning in Continuous MDPs
by: Maran, Davide, et al.
Published: (2024)
by: Maran, Davide, et al.
Published: (2024)
Policy Gradient for Robust Markov Decision Processes
by: Wang, Qiuhao, et al.
Published: (2024)
by: Wang, Qiuhao, et al.
Published: (2024)
No-Regret Reinforcement Learning in Smooth MDPs
by: Maran, Davide, et al.
Published: (2024)
by: Maran, Davide, et al.
Published: (2024)
Projection by Convolution: Optimal Sample Complexity for Reinforcement Learning in Continuous-Space MDPs
by: Maran, Davide, et al.
Published: (2024)
by: Maran, Davide, et al.
Published: (2024)
Robust Lagrangian and Adversarial Policy Gradient for Robust Constrained Markov Decision Processes
by: Bossens, David M.
Published: (2023)
by: Bossens, David M.
Published: (2023)
Flipping-based Policy for Chance-Constrained Markov Decision Processes
by: Shen, Xun, et al.
Published: (2024)
by: Shen, Xun, et al.
Published: (2024)
Learning Constrained Markov Decision Processes With Non-stationary Rewards and Constraints
by: Stradi, Francesco Emanuele, et al.
Published: (2024)
by: Stradi, Francesco Emanuele, et al.
Published: (2024)
Power Grid Control with Graph-Based Distributed Reinforcement Learning
by: Fabrizio, Carlo, et al.
Published: (2025)
by: Fabrizio, Carlo, et al.
Published: (2025)
On the Global Convergence of Policy Gradient in Average Reward Markov Decision Processes
by: Kumar, Navdeep, et al.
Published: (2024)
by: Kumar, Navdeep, et al.
Published: (2024)
Bridging Rested and Restless Bandits with Graph-Triggering: Rising and Rotting
by: Genalti, Gianmarco, et al.
Published: (2024)
by: Genalti, Gianmarco, et al.
Published: (2024)
Policy Gradient Algorithms with Monte Carlo Tree Learning for Non-Markov Decision Processes
by: Morimura, Tetsuro, et al.
Published: (2022)
by: Morimura, Tetsuro, et al.
Published: (2022)
Mirror Descent Policy Optimisation for Robust Constrained Markov Decision Processes
by: Bossens, David M., et al.
Published: (2025)
by: Bossens, David M., et al.
Published: (2025)
Actor-Critic with Active Importance Sampling
by: Molaei, Majid, et al.
Published: (2026)
by: Molaei, Majid, et al.
Published: (2026)
Policy Testing in Markov Decision Processes
by: Ariu, Kaito, et al.
Published: (2025)
by: Ariu, Kaito, et al.
Published: (2025)
Optimal Decision Tree Policies for Markov Decision Processes
by: Vos, Daniël, et al.
Published: (2023)
by: Vos, Daniël, et al.
Published: (2023)
State and Action Factorization in Power Grids
by: Losapio, Gianvito, et al.
Published: (2024)
by: Losapio, Gianvito, et al.
Published: (2024)
Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form
by: Kitamura, Toshinori, et al.
Published: (2024)
by: Kitamura, Toshinori, et al.
Published: (2024)
Rate-Optimal Policy Optimization for Linear Markov Decision Processes
by: Sherman, Uri, et al.
Published: (2023)
by: Sherman, Uri, et al.
Published: (2023)
Truncating Trajectories in Monte Carlo Policy Evaluation: an Adaptive Approach
by: Poiani, Riccardo, et al.
Published: (2024)
by: Poiani, Riccardo, et al.
Published: (2024)
Regret Analysis of Policy Gradient Algorithm for Infinite Horizon Average Reward Markov Decision Processes
by: Bai, Qinbo, et al.
Published: (2023)
by: Bai, Qinbo, et al.
Published: (2023)
Gym4ReaL: A Suite for Benchmarking Real-World Reinforcement Learning
by: Salaorni, Davide, et al.
Published: (2025)
by: Salaorni, Davide, et al.
Published: (2025)
Deterministic Policies for Constrained Reinforcement Learning in Polynomial Time
by: McMahan, Jeremy
Published: (2024)
by: McMahan, Jeremy
Published: (2024)
Optimistic Actor-Critic with Parametric Policies for Linear Markov Decision Processes
by: Lin, Max Qiushi, et al.
Published: (2026)
by: Lin, Max Qiushi, et al.
Published: (2026)
Optimal Posterior Sampling for Policy Identification in Tabular Markov Decision Processes
by: Kone, Cyrille, et al.
Published: (2026)
by: Kone, Cyrille, et al.
Published: (2026)
Conformal Off-Policy Evaluation in Markov Decision Processes
by: Foffano, Daniele, et al.
Published: (2023)
by: Foffano, Daniele, et al.
Published: (2023)
SPOT: Scalable Policy Optimization with Trees for Markov Decision Processes
by: Xiong, Xuyuan, et al.
Published: (2025)
by: Xiong, Xuyuan, et al.
Published: (2025)
Soft Deterministic Policy Gradient with Gaussian Smoothing
by: Na, Hyunjun, et al.
Published: (2026)
by: Na, Hyunjun, et al.
Published: (2026)
Off-Policy Evaluation in Markov Decision Processes under Weak Distributional Overlap
by: Mehrabi, Mohammad, et al.
Published: (2024)
by: Mehrabi, Mohammad, et al.
Published: (2024)
Similar Items
-
Learning Optimal Deterministic Policies with Stochastic Policy Gradients
by: Montenegro, Alessandro, et al.
Published: (2024) -
Last-Iterate Global Convergence of Policy Gradients for Constrained Reinforcement Learning
by: Montenegro, Alessandro, et al.
Published: (2024) -
Reusing Trajectories in Policy Gradients Enables Fast Convergence
by: Montenegro, Alessandro, et al.
Published: (2025) -
Policy Gradient with Active Importance Sampling
by: Papini, Matteo, et al.
Published: (2024) -
How Log-Barrier Helps Exploration in Policy Optimization
by: Cesani, Leonardo, et al.
Published: (2026)