How does Inverse RL Scale to Large State Spaces? A Provably Efficient Approach
Fuente:
arXiv
Saved in:
| Main Authors: | Lazzati, Filippo, Mutti, Mirco, Metelli, Alberto Maria |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Offline Inverse RL: New Solution Concepts and Provably Efficient Algorithms
by: Lazzati, Filippo, et al.
Published: (2024)
by: Lazzati, Filippo, et al.
Published: (2024)
Reward Compatibility: A Framework for Inverse RL
by: Lazzati, Filippo, et al.
Published: (2025)
by: Lazzati, Filippo, et al.
Published: (2025)
Generalizing Behavior via Inverse Reinforcement Learning with Closed-Form Reward Centroids
by: Lazzati, Filippo, et al.
Published: (2025)
by: Lazzati, Filippo, et al.
Published: (2025)
Learning Utilities from Demonstrations in Markov Decision Processes
by: Lazzati, Filippo, et al.
Published: (2024)
by: Lazzati, Filippo, et al.
Published: (2024)
Robustness in the Face of Partial Identifiability in Reward Learning
by: Lazzati, Filippo, et al.
Published: (2025)
by: Lazzati, Filippo, et al.
Published: (2025)
Imitation Learning as Return Distribution Matching
by: Lazzati, Filippo, et al.
Published: (2025)
by: Lazzati, Filippo, et al.
Published: (2025)
A Provably Efficient Option-Based Algorithm for both High-Level and Low-Level Learning
by: Drappo, Gianluca, et al.
Published: (2024)
by: Drappo, Gianluca, et al.
Published: (2024)
How to Explore with Belief: State Entropy Maximization in POMDPs
by: Zamboni, Riccardo, et al.
Published: (2024)
by: Zamboni, Riccardo, et al.
Published: (2024)
Test-Time Regret Minimization in Meta Reinforcement Learning
by: Mutti, Mirco, et al.
Published: (2024)
by: Mutti, Mirco, et al.
Published: (2024)
From Parameters to Behaviors: Unsupervised Compression of the Policy Space
by: Tenedini, Davide, et al.
Published: (2025)
by: Tenedini, Davide, et al.
Published: (2025)
A Theoretical Framework for Partially Observed Reward-States in RLHF
by: Kausik, Chinmaya, et al.
Published: (2024)
by: Kausik, Chinmaya, et al.
Published: (2024)
Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story
by: De Paola, Vincenzo, et al.
Published: (2025)
by: De Paola, Vincenzo, et al.
Published: (2025)
Performance Improvement Bounds for Lipschitz Configurable Markov Decision Processes
by: Metelli, Alberto Maria
Published: (2024)
by: Metelli, Alberto Maria
Published: (2024)
Inverse Reinforcement Learning with Sub-optimal Experts
by: Poiani, Riccardo, et al.
Published: (2024)
by: Poiani, Riccardo, et al.
Published: (2024)
Towards Principled Unsupervised Multi-Agent Reinforcement Learning
by: Zamboni, Riccardo, et al.
Published: (2025)
by: Zamboni, Riccardo, et al.
Published: (2025)
A Classification View on Meta Learning Bandits
by: Mutti, Mirco, et al.
Published: (2025)
by: Mutti, Mirco, et al.
Published: (2025)
Efficient Learning of POMDPs with Known Observation Model in Average-Reward Setting
by: Russo, Alessio, et al.
Published: (2024)
by: Russo, Alessio, et al.
Published: (2024)
The Limits of Pure Exploration in POMDPs: When the Observation Entropy is Enough
by: Zamboni, Riccardo, et al.
Published: (2024)
by: Zamboni, Riccardo, et al.
Published: (2024)
Rising Rested Bandits: Lower Bounds and Efficient Algorithms
by: Fiandri, Marco, et al.
Published: (2024)
by: Fiandri, Marco, et al.
Published: (2024)
Unsupervised Behavioral Compression: Learning Low-Dimensional Policy Manifolds through State-Occupancy Matching
by: Fraschini, Andrea, et al.
Published: (2026)
by: Fraschini, Andrea, et al.
Published: (2026)
State Entropy Regularization for Robust Reinforcement Learning
by: Ashlag, Yonatan, et al.
Published: (2025)
by: Ashlag, Yonatan, et al.
Published: (2025)
Provably Efficient RL for Linear MDPs under Instantaneous Safety Constraints in Non-Convex Feature Spaces
by: Roknilamouki, Amirhossein, et al.
Published: (2025)
by: Roknilamouki, Amirhossein, et al.
Published: (2025)
Truncating Trajectories in Monte Carlo Policy Evaluation: an Adaptive Approach
by: Poiani, Riccardo, et al.
Published: (2024)
by: Poiani, Riccardo, et al.
Published: (2024)
Statistical Analysis of Policy Space Compression Problem
by: Molaei, Majid, et al.
Published: (2024)
by: Molaei, Majid, et al.
Published: (2024)
K-Myriad: Jump-starting reinforcement learning with unsupervised parallel agents
by: De Paola, Vincenzo, et al.
Published: (2026)
by: De Paola, Vincenzo, et al.
Published: (2026)
A Refined Analysis of UCBVI
by: Drago, Simone, et al.
Published: (2025)
by: Drago, Simone, et al.
Published: (2025)
Temporal Difference Calibration in Sequential Tasks: Application to Vision-Language-Action Models
by: Francis-Meretzki, Shelly, et al.
Published: (2026)
by: Francis-Meretzki, Shelly, et al.
Published: (2026)
Projection by Convolution: Optimal Sample Complexity for Reinforcement Learning in Continuous-Space MDPs
by: Maran, Davide, et al.
Published: (2024)
by: Maran, Davide, et al.
Published: (2024)
Generalized Kernelized Bandits: A Novel Self-Normalized Bernstein-Like Dimension-Free Inequality and Regret Bounds
by: Metelli, Alberto Maria, et al.
Published: (2025)
by: Metelli, Alberto Maria, et al.
Published: (2025)
Provably Efficient Exploration in Inverse Constrained Reinforcement Learning
by: Yue, Bo, et al.
Published: (2024)
by: Yue, Bo, et al.
Published: (2024)
One-Step Bellman Alignment Enables Provably Efficient Transfer in Online RL
by: Chen, Elynn, et al.
Published: (2026)
by: Chen, Elynn, et al.
Published: (2026)
Interpetable Target-Feature Aggregation for Multi-Task Learning based on Bias-Variance Analysis
by: Bonetti, Paolo, et al.
Published: (2024)
by: Bonetti, Paolo, et al.
Published: (2024)
Open Problem: Tight Bounds for Kernelized Multi-Armed Bandits with Bernoulli Rewards
by: Mussi, Marco, et al.
Published: (2024)
by: Mussi, Marco, et al.
Published: (2024)
Sliding-Window Thompson Sampling for Non-Stationary Settings
by: Fiandri, Marco, et al.
Published: (2024)
by: Fiandri, Marco, et al.
Published: (2024)
Achieving $\widetilde{\mathcal{O}}(\sqrt{T})$ Regret in Average-Reward POMDPs with Known Observation Models
by: Russo, Alessio, et al.
Published: (2025)
by: Russo, Alessio, et al.
Published: (2025)
Pure Exploration under Mediators' Feedback
by: Poiani, Riccardo, et al.
Published: (2023)
by: Poiani, Riccardo, et al.
Published: (2023)
Thompson Sampling-like Algorithms for Stochastic Rising Bandits
by: Fiandri, Marco, et al.
Published: (2025)
by: Fiandri, Marco, et al.
Published: (2025)
Exploiting Causal Graph Priors with Posterior Sampling for Reinforcement Learning
by: Mutti, Mirco, et al.
Published: (2023)
by: Mutti, Mirco, et al.
Published: (2023)
State and Action Factorization in Power Grids
by: Losapio, Gianvito, et al.
Published: (2024)
by: Losapio, Gianvito, et al.
Published: (2024)
RA-PbRL: Provably Efficient Risk-Aware Preference-Based Reinforcement Learning
by: Zhao, Yujie, et al.
Published: (2024)
by: Zhao, Yujie, et al.
Published: (2024)
Similar Items
-
Offline Inverse RL: New Solution Concepts and Provably Efficient Algorithms
by: Lazzati, Filippo, et al.
Published: (2024) -
Reward Compatibility: A Framework for Inverse RL
by: Lazzati, Filippo, et al.
Published: (2025) -
Generalizing Behavior via Inverse Reinforcement Learning with Closed-Form Reward Centroids
by: Lazzati, Filippo, et al.
Published: (2025) -
Learning Utilities from Demonstrations in Markov Decision Processes
by: Lazzati, Filippo, et al.
Published: (2024) -
Robustness in the Face of Partial Identifiability in Reward Learning
by: Lazzati, Filippo, et al.
Published: (2025)