Reward Compatibility: A Framework for Inverse RL
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lazzati, Filippo, Mutti, Mirco, Metelli, Alberto |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Offline Inverse RL: New Solution Concepts and Provably Efficient Algorithms
par: Lazzati, Filippo, et autres
Publié: (2024)
par: Lazzati, Filippo, et autres
Publié: (2024)
How does Inverse RL Scale to Large State Spaces? A Provably Efficient Approach
par: Lazzati, Filippo, et autres
Publié: (2024)
par: Lazzati, Filippo, et autres
Publié: (2024)
Generalizing Behavior via Inverse Reinforcement Learning with Closed-Form Reward Centroids
par: Lazzati, Filippo, et autres
Publié: (2025)
par: Lazzati, Filippo, et autres
Publié: (2025)
Robustness in the Face of Partial Identifiability in Reward Learning
par: Lazzati, Filippo, et autres
Publié: (2025)
par: Lazzati, Filippo, et autres
Publié: (2025)
Learning Utilities from Demonstrations in Markov Decision Processes
par: Lazzati, Filippo, et autres
Publié: (2024)
par: Lazzati, Filippo, et autres
Publié: (2024)
Imitation Learning as Return Distribution Matching
par: Lazzati, Filippo, et autres
Publié: (2025)
par: Lazzati, Filippo, et autres
Publié: (2025)
A Theoretical Framework for Partially Observed Reward-States in RLHF
par: Kausik, Chinmaya, et autres
Publié: (2024)
par: Kausik, Chinmaya, et autres
Publié: (2024)
Test-Time Regret Minimization in Meta Reinforcement Learning
par: Mutti, Mirco, et autres
Publié: (2024)
par: Mutti, Mirco, et autres
Publié: (2024)
Efficient Learning of POMDPs with Known Observation Model in Average-Reward Setting
par: Russo, Alessio, et autres
Publié: (2024)
par: Russo, Alessio, et autres
Publié: (2024)
Open Problem: Tight Bounds for Kernelized Multi-Armed Bandits with Bernoulli Rewards
par: Mussi, Marco, et autres
Publié: (2024)
par: Mussi, Marco, et autres
Publié: (2024)
Achieving $\widetilde{\mathcal{O}}(\sqrt{T})$ Regret in Average-Reward POMDPs with Known Observation Models
par: Russo, Alessio, et autres
Publié: (2025)
par: Russo, Alessio, et autres
Publié: (2025)
Towards Principled Unsupervised Multi-Agent Reinforcement Learning
par: Zamboni, Riccardo, et autres
Publié: (2025)
par: Zamboni, Riccardo, et autres
Publié: (2025)
A Classification View on Meta Learning Bandits
par: Mutti, Mirco, et autres
Publié: (2025)
par: Mutti, Mirco, et autres
Publié: (2025)
Performance Improvement Bounds for Lipschitz Configurable Markov Decision Processes
par: Metelli, Alberto Maria
Publié: (2024)
par: Metelli, Alberto Maria
Publié: (2024)
The Limits of Pure Exploration in POMDPs: When the Observation Entropy is Enough
par: Zamboni, Riccardo, et autres
Publié: (2024)
par: Zamboni, Riccardo, et autres
Publié: (2024)
Inverse Reinforcement Learning with Sub-optimal Experts
par: Poiani, Riccardo, et autres
Publié: (2024)
par: Poiani, Riccardo, et autres
Publié: (2024)
Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story
par: De Paola, Vincenzo, et autres
Publié: (2025)
par: De Paola, Vincenzo, et autres
Publié: (2025)
K-Myriad: Jump-starting reinforcement learning with unsupervised parallel agents
par: De Paola, Vincenzo, et autres
Publié: (2026)
par: De Paola, Vincenzo, et autres
Publié: (2026)
From Parameters to Behaviors: Unsupervised Compression of the Policy Space
par: Tenedini, Davide, et autres
Publié: (2025)
par: Tenedini, Davide, et autres
Publié: (2025)
How to Explore with Belief: State Entropy Maximization in POMDPs
par: Zamboni, Riccardo, et autres
Publié: (2024)
par: Zamboni, Riccardo, et autres
Publié: (2024)
Temporal Difference Calibration in Sequential Tasks: Application to Vision-Language-Action Models
par: Francis-Meretzki, Shelly, et autres
Publié: (2026)
par: Francis-Meretzki, Shelly, et autres
Publié: (2026)
Exploiting Causal Graph Priors with Posterior Sampling for Reinforcement Learning
par: Mutti, Mirco, et autres
Publié: (2023)
par: Mutti, Mirco, et autres
Publié: (2023)
A Refined Analysis of UCBVI
par: Drago, Simone, et autres
Publié: (2025)
par: Drago, Simone, et autres
Publié: (2025)
Unsupervised Behavioral Compression: Learning Low-Dimensional Policy Manifolds through State-Occupancy Matching
par: Fraschini, Andrea, et autres
Publié: (2026)
par: Fraschini, Andrea, et autres
Publié: (2026)
A Provably Efficient Option-Based Algorithm for both High-Level and Low-Level Learning
par: Drappo, Gianluca, et autres
Publié: (2024)
par: Drappo, Gianluca, et autres
Publié: (2024)
Blindfolded Experts Generalize Better: Insights from Robotic Manipulation and Videogames
par: Zisselman, Ev, et autres
Publié: (2025)
par: Zisselman, Ev, et autres
Publié: (2025)
Generalized Kernelized Bandits: A Novel Self-Normalized Bernstein-Like Dimension-Free Inequality and Regret Bounds
par: Metelli, Alberto Maria, et autres
Publié: (2025)
par: Metelli, Alberto Maria, et autres
Publié: (2025)
Geometric Active Exploration in Markov Decision Processes: the Benefit of Abstraction
par: De Santi, Riccardo, et autres
Publié: (2024)
par: De Santi, Riccardo, et autres
Publié: (2024)
Towards Improving Reward Design in RL: A Reward Alignment Metric for RL Practitioners
par: Muslimani, Calarina, et autres
Publié: (2025)
par: Muslimani, Calarina, et autres
Publié: (2025)
Thompson Sampling-like Algorithms for Stochastic Rising Bandits
par: Fiandri, Marco, et autres
Publié: (2025)
par: Fiandri, Marco, et autres
Publié: (2025)
Pure Exploration under Mediators' Feedback
par: Poiani, Riccardo, et autres
Publié: (2023)
par: Poiani, Riccardo, et autres
Publié: (2023)
Interpetable Target-Feature Aggregation for Multi-Task Learning based on Bias-Variance Analysis
par: Bonetti, Paolo, et autres
Publié: (2024)
par: Bonetti, Paolo, et autres
Publié: (2024)
Sliding-Window Thompson Sampling for Non-Stationary Settings
par: Fiandri, Marco, et autres
Publié: (2024)
par: Fiandri, Marco, et autres
Publié: (2024)
State Entropy Regularization for Robust Reinforcement Learning
par: Ashlag, Yonatan, et autres
Publié: (2025)
par: Ashlag, Yonatan, et autres
Publié: (2025)
Rising Rested Bandits: Lower Bounds and Efficient Algorithms
par: Fiandri, Marco, et autres
Publié: (2024)
par: Fiandri, Marco, et autres
Publié: (2024)
Reward Model Overoptimisation in Iterated RLHF
par: Wolf, Lorenz, et autres
Publié: (2025)
par: Wolf, Lorenz, et autres
Publié: (2025)
Catoni-Style Change Point Detection for Regret Minimization in Non-Stationary Heavy-Tailed Bandits
par: Genalti, Gianmarco, et autres
Publié: (2025)
par: Genalti, Gianmarco, et autres
Publié: (2025)
Learning Optimal Deterministic Policies with Stochastic Policy Gradients
par: Montenegro, Alessandro, et autres
Publié: (2024)
par: Montenegro, Alessandro, et autres
Publié: (2024)
Truncating Trajectories in Monte Carlo Policy Evaluation: an Adaptive Approach
par: Poiani, Riccardo, et autres
Publié: (2024)
par: Poiani, Riccardo, et autres
Publié: (2024)
Local Linearity: the Key for No-regret Reinforcement Learning in Continuous MDPs
par: Maran, Davide, et autres
Publié: (2024)
par: Maran, Davide, et autres
Publié: (2024)
Documents similaires
-
Offline Inverse RL: New Solution Concepts and Provably Efficient Algorithms
par: Lazzati, Filippo, et autres
Publié: (2024) -
How does Inverse RL Scale to Large State Spaces? A Provably Efficient Approach
par: Lazzati, Filippo, et autres
Publié: (2024) -
Generalizing Behavior via Inverse Reinforcement Learning with Closed-Form Reward Centroids
par: Lazzati, Filippo, et autres
Publié: (2025) -
Robustness in the Face of Partial Identifiability in Reward Learning
par: Lazzati, Filippo, et autres
Publié: (2025) -
Learning Utilities from Demonstrations in Markov Decision Processes
par: Lazzati, Filippo, et autres
Publié: (2024)