No-Regret Reinforcement Learning in Smooth MDPs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Maran, Davide, Metelli, Alberto Maria, Papini, Matteo, Restell, Marcello |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Projection by Convolution: Optimal Sample Complexity for Reinforcement Learning in Continuous-Space MDPs
par: Maran, Davide, et autres
Publié: (2024)
par: Maran, Davide, et autres
Publié: (2024)
Local Linearity: the Key for No-regret Reinforcement Learning in Continuous MDPs
par: Maran, Davide, et autres
Publié: (2024)
par: Maran, Davide, et autres
Publié: (2024)
Statistical Analysis of Policy Space Compression Problem
par: Molaei, Majid, et autres
Publié: (2024)
par: Molaei, Majid, et autres
Publié: (2024)
Inverse Reinforcement Learning with Sub-optimal Experts
par: Poiani, Riccardo, et autres
Publié: (2024)
par: Poiani, Riccardo, et autres
Publié: (2024)
Gym4ReaL: A Suite for Benchmarking Real-World Reinforcement Learning
par: Salaorni, Davide, et autres
Publié: (2025)
par: Salaorni, Davide, et autres
Publié: (2025)
Generalizing Behavior via Inverse Reinforcement Learning with Closed-Form Reward Centroids
par: Lazzati, Filippo, et autres
Publié: (2025)
par: Lazzati, Filippo, et autres
Publié: (2025)
$(ε, u)$-Adaptive Regret Minimization in Heavy-Tailed Bandits
par: Genalti, Gianmarco, et autres
Publié: (2023)
par: Genalti, Gianmarco, et autres
Publié: (2023)
How Log-Barrier Helps Exploration in Policy Optimization
par: Cesani, Leonardo, et autres
Publié: (2026)
par: Cesani, Leonardo, et autres
Publié: (2026)
Imitation Learning as Return Distribution Matching
par: Lazzati, Filippo, et autres
Publié: (2025)
par: Lazzati, Filippo, et autres
Publié: (2025)
Last-Iterate Global Convergence of Policy Gradients for Constrained Reinforcement Learning
par: Montenegro, Alessandro, et autres
Publié: (2024)
par: Montenegro, Alessandro, et autres
Publié: (2024)
Policy Gradient with Active Importance Sampling
par: Papini, Matteo, et autres
Publié: (2024)
par: Papini, Matteo, et autres
Publié: (2024)
Do It for HER: First-Order Temporal Logic Reward Specification in Reinforcement Learning (Extended Version)
par: Olivieri, Pierriccardo, et autres
Publié: (2026)
par: Olivieri, Pierriccardo, et autres
Publié: (2026)
Actor-Critic with Active Importance Sampling
par: Molaei, Majid, et autres
Publié: (2026)
par: Molaei, Majid, et autres
Publié: (2026)
Minimax Optimal Variance-Aware Regret Bounds for Multinomial Logistic MDPs
par: Boudart, Pierre, et autres
Publié: (2026)
par: Boudart, Pierre, et autres
Publié: (2026)
Parameterized Projected Bellman Operator
par: Vincent, Théo, et autres
Publié: (2023)
par: Vincent, Théo, et autres
Publié: (2023)
Learning Optimal Deterministic Policies with Stochastic Policy Gradients
par: Montenegro, Alessandro, et autres
Publié: (2024)
par: Montenegro, Alessandro, et autres
Publié: (2024)
Regret-Free Reinforcement Learning for LTL Specifications
par: Majumdar, Rupak, et autres
Publié: (2024)
par: Majumdar, Rupak, et autres
Publié: (2024)
Regret-Based Defense in Adversarial Reinforcement Learning
par: Belaire, Roman, et autres
Publié: (2023)
par: Belaire, Roman, et autres
Publié: (2023)
Achieving $\widetilde{\mathcal{O}}(\sqrt{T})$ Regret in Average-Reward POMDPs with Known Observation Models
par: Russo, Alessio, et autres
Publié: (2025)
par: Russo, Alessio, et autres
Publié: (2025)
Sample and Oracle Efficient Reinforcement Learning for MDPs with Linearly-Realizable Value Functions
par: Mhammedi, Zakaria
Publié: (2024)
par: Mhammedi, Zakaria
Publié: (2024)
DeepAveragers: Offline Reinforcement Learning by Solving Derived Non-Parametric MDPs
par: Shrestha, Aayam, et autres
Publié: (2020)
par: Shrestha, Aayam, et autres
Publié: (2020)
Kernelized Reinforcement Learning with Order Optimal Regret Bounds
par: Vakili, Sattar, et autres
Publié: (2023)
par: Vakili, Sattar, et autres
Publié: (2023)
Toward Optimal Regret in Robust Pricing: Decoupling Corruption and Time
par: Kalupahana, Kalana, et autres
Publié: (2026)
par: Kalupahana, Kalana, et autres
Publié: (2026)
No-Regret Learning Under Adversarial Resource Constraints: A Spending Plan Is All You Need!
par: Stradi, Francesco Emanuele, et autres
Publié: (2025)
par: Stradi, Francesco Emanuele, et autres
Publié: (2025)
Improved Bayesian Regret Bounds for Thompson Sampling in Reinforcement Learning
par: Moradipari, Ahmadreza, et autres
Publié: (2023)
par: Moradipari, Ahmadreza, et autres
Publié: (2023)
Regret Bounds and Reinforcement Learning Exploration of EXP-based Algorithms
par: Xu, Mengfan, et autres
Publié: (2020)
par: Xu, Mengfan, et autres
Publié: (2020)
Provable Offline Reinforcement Learning for Structured Cyclic MDPs
par: Lee, Kyungbok, et autres
Publié: (2026)
par: Lee, Kyungbok, et autres
Publié: (2026)
Bridging Distributional and Risk-sensitive Reinforcement Learning with Provable Regret Bounds
par: Liang, Hao, et autres
Publié: (2022)
par: Liang, Hao, et autres
Publié: (2022)
Learning in Markov Decision Processes with Exogenous Dynamics
par: Maran, Davide, et autres
Publié: (2026)
par: Maran, Davide, et autres
Publié: (2026)
Information Capacity Regret Bounds for Bandits with Mediator Feedback
par: Eldowa, Khaled, et autres
Publié: (2024)
par: Eldowa, Khaled, et autres
Publié: (2024)
Efficient Solution and Learning of Robust Factored MDPs
par: Schnitzer, Yannik, et autres
Publié: (2025)
par: Schnitzer, Yannik, et autres
Publié: (2025)
Learning Deterministic Policies with Policy Gradients in Constrained Markov Decision Processes
par: Montenegro, Alessandro, et autres
Publié: (2025)
par: Montenegro, Alessandro, et autres
Publié: (2025)
Finite Sample Bounds for Non-Parametric Regression: Optimal Sample Efficiency and Space Complexity
par: Maran, Davide, et autres
Publié: (2024)
par: Maran, Davide, et autres
Publié: (2024)
Online Market Making and the Value of Observing the Order Book
par: Maran, Davide, et autres
Publié: (2026)
par: Maran, Davide, et autres
Publié: (2026)
Kernel-Based Function Approximation for Average Reward Reinforcement Learning: An Optimist No-Regret Algorithm
par: Vakili, Sattar, et autres
Publié: (2024)
par: Vakili, Sattar, et autres
Publié: (2024)
Towards Principled Unsupervised Multi-Agent Reinforcement Learning
par: Zamboni, Riccardo, et autres
Publié: (2025)
par: Zamboni, Riccardo, et autres
Publié: (2025)
DreamSmooth: Improving Model-based Reinforcement Learning via Reward Smoothing
par: Lee, Vint, et autres
Publié: (2023)
par: Lee, Vint, et autres
Publié: (2023)
Autoregressive Bandits
par: Bacchiocchi, Francesco, et autres
Publié: (2022)
par: Bacchiocchi, Francesco, et autres
Publié: (2022)
Learning Policy Committees for Effective Personalization in MDPs with Diverse Tasks
par: Ge, Luise, et autres
Publié: (2025)
par: Ge, Luise, et autres
Publié: (2025)
On-line Learning in Tree MDPs by Treating Policies as Bandit Arms
par: Shah, Anvay, et autres
Publié: (2026)
par: Shah, Anvay, et autres
Publié: (2026)
Documents similaires
-
Projection by Convolution: Optimal Sample Complexity for Reinforcement Learning in Continuous-Space MDPs
par: Maran, Davide, et autres
Publié: (2024) -
Local Linearity: the Key for No-regret Reinforcement Learning in Continuous MDPs
par: Maran, Davide, et autres
Publié: (2024) -
Statistical Analysis of Policy Space Compression Problem
par: Molaei, Majid, et autres
Publié: (2024) -
Inverse Reinforcement Learning with Sub-optimal Experts
par: Poiani, Riccardo, et autres
Publié: (2024) -
Gym4ReaL: A Suite for Benchmarking Real-World Reinforcement Learning
par: Salaorni, Davide, et autres
Publié: (2025)