Robustness in the Face of Partial Identifiability in Reward Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Lazzati, Filippo, Metelli, Alberto Maria |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Generalizing Behavior via Inverse Reinforcement Learning with Closed-Form Reward Centroids
di: Lazzati, Filippo, et al.
Pubblicazione: (2025)
di: Lazzati, Filippo, et al.
Pubblicazione: (2025)
Reward Compatibility: A Framework for Inverse RL
di: Lazzati, Filippo, et al.
Pubblicazione: (2025)
di: Lazzati, Filippo, et al.
Pubblicazione: (2025)
Learning Utilities from Demonstrations in Markov Decision Processes
di: Lazzati, Filippo, et al.
Pubblicazione: (2024)
di: Lazzati, Filippo, et al.
Pubblicazione: (2024)
Imitation Learning as Return Distribution Matching
di: Lazzati, Filippo, et al.
Pubblicazione: (2025)
di: Lazzati, Filippo, et al.
Pubblicazione: (2025)
Offline Inverse RL: New Solution Concepts and Provably Efficient Algorithms
di: Lazzati, Filippo, et al.
Pubblicazione: (2024)
di: Lazzati, Filippo, et al.
Pubblicazione: (2024)
How does Inverse RL Scale to Large State Spaces? A Provably Efficient Approach
di: Lazzati, Filippo, et al.
Pubblicazione: (2024)
di: Lazzati, Filippo, et al.
Pubblicazione: (2024)
Efficient Learning of POMDPs with Known Observation Model in Average-Reward Setting
di: Russo, Alessio, et al.
Pubblicazione: (2024)
di: Russo, Alessio, et al.
Pubblicazione: (2024)
Open Problem: Tight Bounds for Kernelized Multi-Armed Bandits with Bernoulli Rewards
di: Mussi, Marco, et al.
Pubblicazione: (2024)
di: Mussi, Marco, et al.
Pubblicazione: (2024)
Achieving $\widetilde{\mathcal{O}}(\sqrt{T})$ Regret in Average-Reward POMDPs with Known Observation Models
di: Russo, Alessio, et al.
Pubblicazione: (2025)
di: Russo, Alessio, et al.
Pubblicazione: (2025)
Performance Improvement Bounds for Lipschitz Configurable Markov Decision Processes
di: Metelli, Alberto Maria
Pubblicazione: (2024)
di: Metelli, Alberto Maria
Pubblicazione: (2024)
Interpetable Target-Feature Aggregation for Multi-Task Learning based on Bias-Variance Analysis
di: Bonetti, Paolo, et al.
Pubblicazione: (2024)
di: Bonetti, Paolo, et al.
Pubblicazione: (2024)
A Provably Efficient Option-Based Algorithm for both High-Level and Low-Level Learning
di: Drappo, Gianluca, et al.
Pubblicazione: (2024)
di: Drappo, Gianluca, et al.
Pubblicazione: (2024)
Learning Optimal Deterministic Policies with Stochastic Policy Gradients
di: Montenegro, Alessandro, et al.
Pubblicazione: (2024)
di: Montenegro, Alessandro, et al.
Pubblicazione: (2024)
Local Linearity: the Key for No-regret Reinforcement Learning in Continuous MDPs
di: Maran, Davide, et al.
Pubblicazione: (2024)
di: Maran, Davide, et al.
Pubblicazione: (2024)
Last-Iterate Global Convergence of Policy Gradients for Constrained Reinforcement Learning
di: Montenegro, Alessandro, et al.
Pubblicazione: (2024)
di: Montenegro, Alessandro, et al.
Pubblicazione: (2024)
Generalized Kernelized Bandits: A Novel Self-Normalized Bernstein-Like Dimension-Free Inequality and Regret Bounds
di: Metelli, Alberto Maria, et al.
Pubblicazione: (2025)
di: Metelli, Alberto Maria, et al.
Pubblicazione: (2025)
Thompson Sampling-like Algorithms for Stochastic Rising Bandits
di: Fiandri, Marco, et al.
Pubblicazione: (2025)
di: Fiandri, Marco, et al.
Pubblicazione: (2025)
A Refined Analysis of UCBVI
di: Drago, Simone, et al.
Pubblicazione: (2025)
di: Drago, Simone, et al.
Pubblicazione: (2025)
Pure Exploration under Mediators' Feedback
di: Poiani, Riccardo, et al.
Pubblicazione: (2023)
di: Poiani, Riccardo, et al.
Pubblicazione: (2023)
Sliding-Window Thompson Sampling for Non-Stationary Settings
di: Fiandri, Marco, et al.
Pubblicazione: (2024)
di: Fiandri, Marco, et al.
Pubblicazione: (2024)
No-Regret Reinforcement Learning in Smooth MDPs
di: Maran, Davide, et al.
Pubblicazione: (2024)
di: Maran, Davide, et al.
Pubblicazione: (2024)
Inverse Reinforcement Learning with Sub-optimal Experts
di: Poiani, Riccardo, et al.
Pubblicazione: (2024)
di: Poiani, Riccardo, et al.
Pubblicazione: (2024)
Rising Rested Bandits: Lower Bounds and Efficient Algorithms
di: Fiandri, Marco, et al.
Pubblicazione: (2024)
di: Fiandri, Marco, et al.
Pubblicazione: (2024)
Projection by Convolution: Optimal Sample Complexity for Reinforcement Learning in Continuous-Space MDPs
di: Maran, Davide, et al.
Pubblicazione: (2024)
di: Maran, Davide, et al.
Pubblicazione: (2024)
Power Grid Control with Graph-Based Distributed Reinforcement Learning
di: Fabrizio, Carlo, et al.
Pubblicazione: (2025)
di: Fabrizio, Carlo, et al.
Pubblicazione: (2025)
Learning Deterministic Policies with Policy Gradients in Constrained Markov Decision Processes
di: Montenegro, Alessandro, et al.
Pubblicazione: (2025)
di: Montenegro, Alessandro, et al.
Pubblicazione: (2025)
Catoni-Style Change Point Detection for Regret Minimization in Non-Stationary Heavy-Tailed Bandits
di: Genalti, Gianmarco, et al.
Pubblicazione: (2025)
di: Genalti, Gianmarco, et al.
Pubblicazione: (2025)
Truncating Trajectories in Monte Carlo Policy Evaluation: an Adaptive Approach
di: Poiani, Riccardo, et al.
Pubblicazione: (2024)
di: Poiani, Riccardo, et al.
Pubblicazione: (2024)
Policy Gradient with Active Importance Sampling
di: Papini, Matteo, et al.
Pubblicazione: (2024)
di: Papini, Matteo, et al.
Pubblicazione: (2024)
Information Capacity Regret Bounds for Bandits with Mediator Feedback
di: Eldowa, Khaled, et al.
Pubblicazione: (2024)
di: Eldowa, Khaled, et al.
Pubblicazione: (2024)
Statistical Analysis of Policy Space Compression Problem
di: Molaei, Majid, et al.
Pubblicazione: (2024)
di: Molaei, Majid, et al.
Pubblicazione: (2024)
$(ε, u)$-Adaptive Regret Minimization in Heavy-Tailed Bandits
di: Genalti, Gianmarco, et al.
Pubblicazione: (2023)
di: Genalti, Gianmarco, et al.
Pubblicazione: (2023)
Reusing Trajectories in Policy Gradients Enables Fast Convergence
di: Montenegro, Alessandro, et al.
Pubblicazione: (2025)
di: Montenegro, Alessandro, et al.
Pubblicazione: (2025)
Optimal Multi-Fidelity Best-Arm Identification
di: Poiani, Riccardo, et al.
Pubblicazione: (2024)
di: Poiani, Riccardo, et al.
Pubblicazione: (2024)
Actor-Critic with Active Importance Sampling
di: Molaei, Majid, et al.
Pubblicazione: (2026)
di: Molaei, Majid, et al.
Pubblicazione: (2026)
Best Arm Identification for Stochastic Rising Bandits
di: Mussi, Marco, et al.
Pubblicazione: (2023)
di: Mussi, Marco, et al.
Pubblicazione: (2023)
Partial Identifiability for Domain Adaptation
di: Kong, Lingjing, et al.
Pubblicazione: (2023)
di: Kong, Lingjing, et al.
Pubblicazione: (2023)
Partial Identifiability and Misspecification in Inverse Reinforcement Learning
di: Skalse, Joar, et al.
Pubblicazione: (2024)
di: Skalse, Joar, et al.
Pubblicazione: (2024)
Learning Treatment Allocations with Risk Control Under Partial Identifiability
di: Ek, Sofia, et al.
Pubblicazione: (2025)
di: Ek, Sofia, et al.
Pubblicazione: (2025)
Reward-Preserving Attacks For Robust Reinforcement Learning
di: Schott, Lucas, et al.
Pubblicazione: (2026)
di: Schott, Lucas, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Generalizing Behavior via Inverse Reinforcement Learning with Closed-Form Reward Centroids
di: Lazzati, Filippo, et al.
Pubblicazione: (2025) -
Reward Compatibility: A Framework for Inverse RL
di: Lazzati, Filippo, et al.
Pubblicazione: (2025) -
Learning Utilities from Demonstrations in Markov Decision Processes
di: Lazzati, Filippo, et al.
Pubblicazione: (2024) -
Imitation Learning as Return Distribution Matching
di: Lazzati, Filippo, et al.
Pubblicazione: (2025) -
Offline Inverse RL: New Solution Concepts and Provably Efficient Algorithms
di: Lazzati, Filippo, et al.
Pubblicazione: (2024)