Projection by Convolution: Optimal Sample Complexity for Reinforcement Learning in Continuous-Space MDPs
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Maran, Davide, Metelli, Alberto Maria, Papini, Matteo, Restelli, Marcello |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
No-Regret Reinforcement Learning in Smooth MDPs
von: Maran, Davide, et al.
Veröffentlicht: (2024)
von: Maran, Davide, et al.
Veröffentlicht: (2024)
Local Linearity: the Key for No-regret Reinforcement Learning in Continuous MDPs
von: Maran, Davide, et al.
Veröffentlicht: (2024)
von: Maran, Davide, et al.
Veröffentlicht: (2024)
Statistical Analysis of Policy Space Compression Problem
von: Molaei, Majid, et al.
Veröffentlicht: (2024)
von: Molaei, Majid, et al.
Veröffentlicht: (2024)
Finite Sample Bounds for Non-Parametric Regression: Optimal Sample Efficiency and Space Complexity
von: Maran, Davide, et al.
Veröffentlicht: (2024)
von: Maran, Davide, et al.
Veröffentlicht: (2024)
Inverse Reinforcement Learning with Sub-optimal Experts
von: Poiani, Riccardo, et al.
Veröffentlicht: (2024)
von: Poiani, Riccardo, et al.
Veröffentlicht: (2024)
How Log-Barrier Helps Exploration in Policy Optimization
von: Cesani, Leonardo, et al.
Veröffentlicht: (2026)
von: Cesani, Leonardo, et al.
Veröffentlicht: (2026)
Policy Gradient with Active Importance Sampling
von: Papini, Matteo, et al.
Veröffentlicht: (2024)
von: Papini, Matteo, et al.
Veröffentlicht: (2024)
Gym4ReaL: A Suite for Benchmarking Real-World Reinforcement Learning
von: Salaorni, Davide, et al.
Veröffentlicht: (2025)
von: Salaorni, Davide, et al.
Veröffentlicht: (2025)
Actor-Critic with Active Importance Sampling
von: Molaei, Majid, et al.
Veröffentlicht: (2026)
von: Molaei, Majid, et al.
Veröffentlicht: (2026)
Parameterized Projected Bellman Operator
von: Vincent, Théo, et al.
Veröffentlicht: (2023)
von: Vincent, Théo, et al.
Veröffentlicht: (2023)
Online Market Making and the Value of Observing the Order Book
von: Maran, Davide, et al.
Veröffentlicht: (2026)
von: Maran, Davide, et al.
Veröffentlicht: (2026)
Learning in Markov Decision Processes with Exogenous Dynamics
von: Maran, Davide, et al.
Veröffentlicht: (2026)
von: Maran, Davide, et al.
Veröffentlicht: (2026)
From Parameters to Behaviors: Unsupervised Compression of the Policy Space
von: Tenedini, Davide, et al.
Veröffentlicht: (2025)
von: Tenedini, Davide, et al.
Veröffentlicht: (2025)
Towards Principled Unsupervised Multi-Agent Reinforcement Learning
von: Zamboni, Riccardo, et al.
Veröffentlicht: (2025)
von: Zamboni, Riccardo, et al.
Veröffentlicht: (2025)
Building surrogate models using trajectories of agents trained by Reinforcement Learning
von: Cestero, Julen, et al.
Veröffentlicht: (2025)
von: Cestero, Julen, et al.
Veröffentlicht: (2025)
Generalizing Behavior via Inverse Reinforcement Learning with Closed-Form Reward Centroids
von: Lazzati, Filippo, et al.
Veröffentlicht: (2025)
von: Lazzati, Filippo, et al.
Veröffentlicht: (2025)
Efficient Learning of POMDPs with Known Observation Model in Average-Reward Setting
von: Russo, Alessio, et al.
Veröffentlicht: (2024)
von: Russo, Alessio, et al.
Veröffentlicht: (2024)
Interpetable Target-Feature Aggregation for Multi-Task Learning based on Bias-Variance Analysis
von: Bonetti, Paolo, et al.
Veröffentlicht: (2024)
von: Bonetti, Paolo, et al.
Veröffentlicht: (2024)
A Provably Efficient Option-Based Algorithm for both High-Level and Low-Level Learning
von: Drappo, Gianluca, et al.
Veröffentlicht: (2024)
von: Drappo, Gianluca, et al.
Veröffentlicht: (2024)
Unsupervised Behavioral Compression: Learning Low-Dimensional Policy Manifolds through State-Occupancy Matching
von: Fraschini, Andrea, et al.
Veröffentlicht: (2026)
von: Fraschini, Andrea, et al.
Veröffentlicht: (2026)
Imitation Learning as Return Distribution Matching
von: Lazzati, Filippo, et al.
Veröffentlicht: (2025)
von: Lazzati, Filippo, et al.
Veröffentlicht: (2025)
Autoregressive Bandits
von: Bacchiocchi, Francesco, et al.
Veröffentlicht: (2022)
von: Bacchiocchi, Francesco, et al.
Veröffentlicht: (2022)
Learning Optimal Deterministic Policies with Stochastic Policy Gradients
von: Montenegro, Alessandro, et al.
Veröffentlicht: (2024)
von: Montenegro, Alessandro, et al.
Veröffentlicht: (2024)
Achieving $\widetilde{\mathcal{O}}(\sqrt{T})$ Regret in Average-Reward POMDPs with Known Observation Models
von: Russo, Alessio, et al.
Veröffentlicht: (2025)
von: Russo, Alessio, et al.
Veröffentlicht: (2025)
Pure Exploration under Mediators' Feedback
von: Poiani, Riccardo, et al.
Veröffentlicht: (2023)
von: Poiani, Riccardo, et al.
Veröffentlicht: (2023)
Low-Rank MDPs with Continuous Action Spaces
von: Bennett, Andrew, et al.
Veröffentlicht: (2023)
von: Bennett, Andrew, et al.
Veröffentlicht: (2023)
Power Grid Control with Graph-Based Distributed Reinforcement Learning
von: Fabrizio, Carlo, et al.
Veröffentlicht: (2025)
von: Fabrizio, Carlo, et al.
Veröffentlicht: (2025)
Last-Iterate Global Convergence of Policy Gradients for Constrained Reinforcement Learning
von: Montenegro, Alessandro, et al.
Veröffentlicht: (2024)
von: Montenegro, Alessandro, et al.
Veröffentlicht: (2024)
Optimizing Energy Management of Smart Grid using Reinforcement Learning aided by Surrogate models built using Physics-informed Neural Networks
von: Cestero, Julen, et al.
Veröffentlicht: (2025)
von: Cestero, Julen, et al.
Veröffentlicht: (2025)
Sample and Oracle Efficient Reinforcement Learning for MDPs with Linearly-Realizable Value Functions
von: Mhammedi, Zakaria
Veröffentlicht: (2024)
von: Mhammedi, Zakaria
Veröffentlicht: (2024)
Optimal Multi-Fidelity Best-Arm Identification
von: Poiani, Riccardo, et al.
Veröffentlicht: (2024)
von: Poiani, Riccardo, et al.
Veröffentlicht: (2024)
How to Explore with Belief: State Entropy Maximization in POMDPs
von: Zamboni, Riccardo, et al.
Veröffentlicht: (2024)
von: Zamboni, Riccardo, et al.
Veröffentlicht: (2024)
A Reinforcement Learning Approach for Optimal Control in Microgrids
von: Salaorni, Davide, et al.
Veröffentlicht: (2025)
von: Salaorni, Davide, et al.
Veröffentlicht: (2025)
Truncating Trajectories in Monte Carlo Policy Evaluation: an Adaptive Approach
von: Poiani, Riccardo, et al.
Veröffentlicht: (2024)
von: Poiani, Riccardo, et al.
Veröffentlicht: (2024)
Do It for HER: First-Order Temporal Logic Reward Specification in Reinforcement Learning (Extended Version)
von: Olivieri, Pierriccardo, et al.
Veröffentlicht: (2026)
von: Olivieri, Pierriccardo, et al.
Veröffentlicht: (2026)
State and Action Factorization in Power Grids
von: Losapio, Gianvito, et al.
Veröffentlicht: (2024)
von: Losapio, Gianvito, et al.
Veröffentlicht: (2024)
On The Sample Complexity Bounds In Bilevel Reinforcement Learning
von: Gaur, Mudit, et al.
Veröffentlicht: (2025)
von: Gaur, Mudit, et al.
Veröffentlicht: (2025)
Realizable Abstractions: Near-Optimal Hierarchical Reinforcement Learning
von: Cipollone, Roberto, et al.
Veröffentlicht: (2025)
von: Cipollone, Roberto, et al.
Veröffentlicht: (2025)
DeepAveragers: Offline Reinforcement Learning by Solving Derived Non-Parametric MDPs
von: Shrestha, Aayam, et al.
Veröffentlicht: (2020)
von: Shrestha, Aayam, et al.
Veröffentlicht: (2020)
Information Capacity Regret Bounds for Bandits with Mediator Feedback
von: Eldowa, Khaled, et al.
Veröffentlicht: (2024)
von: Eldowa, Khaled, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
No-Regret Reinforcement Learning in Smooth MDPs
von: Maran, Davide, et al.
Veröffentlicht: (2024) -
Local Linearity: the Key for No-regret Reinforcement Learning in Continuous MDPs
von: Maran, Davide, et al.
Veröffentlicht: (2024) -
Statistical Analysis of Policy Space Compression Problem
von: Molaei, Majid, et al.
Veröffentlicht: (2024) -
Finite Sample Bounds for Non-Parametric Regression: Optimal Sample Efficiency and Space Complexity
von: Maran, Davide, et al.
Veröffentlicht: (2024) -
Inverse Reinforcement Learning with Sub-optimal Experts
von: Poiani, Riccardo, et al.
Veröffentlicht: (2024)