The Virtues of Pessimism in Inverse Reinforcement Learning
Fuente:
arXiv
Guardado en:
| Autores principales: | Wu, David, Swamy, Gokul, Bagnell, J. Andrew, Wu, Zhiwei Steven, Choudhury, Sanjiban |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Inverse Reinforcement Learning without Reinforcement Learning
por: Swamy, Gokul, et al.
Publicado: (2023)
por: Swamy, Gokul, et al.
Publicado: (2023)
Hybrid Inverse Reinforcement Learning
por: Ren, Juntao, et al.
Publicado: (2024)
por: Ren, Juntao, et al.
Publicado: (2024)
All Roads Lead to Likelihood: The Value of Reinforcement Learning in Fine-Tuning
por: Swamy, Gokul, et al.
Publicado: (2025)
por: Swamy, Gokul, et al.
Publicado: (2025)
Accelerating Inverse Reinforcement Learning with Expert Bootstrapping
por: Wu, David, et al.
Publicado: (2024)
por: Wu, David, et al.
Publicado: (2024)
Efficient Imitation under Misspecification
por: Espinosa-Dice, Nicolas, et al.
Publicado: (2025)
por: Espinosa-Dice, Nicolas, et al.
Publicado: (2025)
A Minimaximalist Approach to Reinforcement Learning from Human Feedback
por: Swamy, Gokul, et al.
Publicado: (2024)
por: Swamy, Gokul, et al.
Publicado: (2024)
Aligning LLMs with Domain Invariant Reward Models
por: Wu, David, et al.
Publicado: (2025)
por: Wu, David, et al.
Publicado: (2025)
Multi-Agent Imitation Learning: Value is Easy, Regret is Hard
por: Tang, Jingwu, et al.
Publicado: (2024)
por: Tang, Jingwu, et al.
Publicado: (2024)
The Importance of Online Data: Understanding Preference Fine-tuning via Coverage
por: Song, Yuda, et al.
Publicado: (2024)
por: Song, Yuda, et al.
Publicado: (2024)
From Curiosity to Caution: Mitigating Reward Hacking for Best-of-N with Pessimism
por: Yu, Zhuohao, et al.
Publicado: (2026)
por: Yu, Zhuohao, et al.
Publicado: (2026)
Gained in Translation: Privileged Pairwise Judges Enhance Multilingual Reasoning
por: Sutawika, Lintang, et al.
Publicado: (2026)
por: Sutawika, Lintang, et al.
Publicado: (2026)
Process Reward Models for LLM Agents: Practical Framework and Directions
por: Choudhury, Sanjiban
Publicado: (2025)
por: Choudhury, Sanjiban
Publicado: (2025)
A Smooth Sea Never Made a Skilled SAILOR: Robust Imitation via Learning to Search
por: Jain, Arnav Kumar, et al.
Publicado: (2025)
por: Jain, Arnav Kumar, et al.
Publicado: (2025)
Hybrid Reinforcement Learning from Offline Observation Alone
por: Song, Yuda, et al.
Publicado: (2024)
por: Song, Yuda, et al.
Publicado: (2024)
Non-Adversarial Inverse Reinforcement Learning via Successor Feature Matching
por: Jain, Arnav Kumar, et al.
Publicado: (2024)
por: Jain, Arnav Kumar, et al.
Publicado: (2024)
Back to Blackwell: Closing the Loop on Intransitivity in Multi-Objective Preference Fine-Tuning
por: Zhang, Jiahao, et al.
Publicado: (2026)
por: Zhang, Jiahao, et al.
Publicado: (2026)
REBEL: Reinforcement Learning via Regressing Relative Rewards
por: Gao, Zhaolin, et al.
Publicado: (2024)
por: Gao, Zhaolin, et al.
Publicado: (2024)
To Distill or Decide? Understanding the Algorithmic Trade-off in Partially Observable Reinforcement Learning
por: Song, Yuda, et al.
Publicado: (2025)
por: Song, Yuda, et al.
Publicado: (2025)
Better than Your Teacher: LLM Agents that learn from Privileged AI Feedback
por: Choudhury, Sanjiban, et al.
Publicado: (2024)
por: Choudhury, Sanjiban, et al.
Publicado: (2024)
Imitation Learning from a Single Temporally Misaligned Video
por: Huey, William, et al.
Publicado: (2025)
por: Huey, William, et al.
Publicado: (2025)
DROP: Distributional and Regular Optimism and Pessimism for Reinforcement Learning
por: Kobayashi, Taisuke
Publicado: (2024)
por: Kobayashi, Taisuke
Publicado: (2024)
Diffusing States and Matching Scores: A New Framework for Imitation Learning
por: Wu, Runzhe, et al.
Publicado: (2024)
por: Wu, Runzhe, et al.
Publicado: (2024)
From Foresight to Forethought: VLM-In-the-Loop Policy Steering via Latent Alignment
por: Wu, Yilin, et al.
Publicado: (2025)
por: Wu, Yilin, et al.
Publicado: (2025)
Distributional Inverse Reinforcement Learning
por: Wu, Feiyang, et al.
Publicado: (2025)
por: Wu, Feiyang, et al.
Publicado: (2025)
Pessimism Meets Risk: Risk-Sensitive Offline Reinforcement Learning
por: Zhang, Dake, et al.
Publicado: (2024)
por: Zhang, Dake, et al.
Publicado: (2024)
Expanding the Capabilities of Reinforcement Learning via Text Feedback
por: Song, Yuda, et al.
Publicado: (2026)
por: Song, Yuda, et al.
Publicado: (2026)
Distilling Realizable Students from Unrealizable Teachers
por: Kim, Yujin, et al.
Publicado: (2025)
por: Kim, Yujin, et al.
Publicado: (2025)
Pessimism Principle Can Be Effective: Towards a Framework for Zero-Shot Transfer Reinforcement Learning
por: Zhang, Chi, et al.
Publicado: (2025)
por: Zhang, Chi, et al.
Publicado: (2025)
Motion Tracks: A Unified Representation for Human-Robot Transfer in Few-Shot Imitation Learning
por: Ren, Juntao, et al.
Publicado: (2025)
por: Ren, Juntao, et al.
Publicado: (2025)
Improved Regret Bound for Safe Reinforcement Learning via Tighter Cost Pessimism and Reward Optimism
por: Yu, Kihyun, et al.
Publicado: (2024)
por: Yu, Kihyun, et al.
Publicado: (2024)
Your Learned Constraint is Secretly a Backward Reachable Tube
por: Qadri, Mohamad, et al.
Publicado: (2025)
por: Qadri, Mohamad, et al.
Publicado: (2025)
InteRACT: Transformer Models for Human Intent Prediction Conditioned on Robot Actions
por: Kedia, Kushal, et al.
Publicado: (2023)
por: Kedia, Kushal, et al.
Publicado: (2023)
Imitation Learning via Focused Satisficing
por: Shah, Rushit N., et al.
Publicado: (2025)
por: Shah, Rushit N., et al.
Publicado: (2025)
Beyond Pessimism: Offline Learning in KL-regularized Games
por: Zhang, Yuheng, et al.
Publicado: (2026)
por: Zhang, Yuheng, et al.
Publicado: (2026)
Unified PAC-Bayesian Study of Pessimism for Offline Policy Learning with Regularized Importance Sampling
por: Aouali, Imad, et al.
Publicado: (2024)
por: Aouali, Imad, et al.
Publicado: (2024)
Mitigating Preference Hacking in Policy Optimization with Pessimism
por: Gupta, Dhawal, et al.
Publicado: (2025)
por: Gupta, Dhawal, et al.
Publicado: (2025)
Provable Multi-Party Reinforcement Learning with Diverse Human Feedback
por: Zhong, Huiying, et al.
Publicado: (2024)
por: Zhong, Huiying, et al.
Publicado: (2024)
EvIL: Evolution Strategies for Generalisable Imitation Learning
por: Sapora, Silvia, et al.
Publicado: (2024)
por: Sapora, Silvia, et al.
Publicado: (2024)
Pessimism in the Face of Confounders: Provably Efficient Offline Reinforcement Learning in Partially Observable Markov Decision Processes
por: Lu, Miao, et al.
Publicado: (2022)
por: Lu, Miao, et al.
Publicado: (2022)
A Tale of Two Cities: Pessimism and Opportunism in Offline Dynamic Pricing
por: Bian, Zeyu, et al.
Publicado: (2024)
por: Bian, Zeyu, et al.
Publicado: (2024)
Ejemplares similares
-
Inverse Reinforcement Learning without Reinforcement Learning
por: Swamy, Gokul, et al.
Publicado: (2023) -
Hybrid Inverse Reinforcement Learning
por: Ren, Juntao, et al.
Publicado: (2024) -
All Roads Lead to Likelihood: The Value of Reinforcement Learning in Fine-Tuning
por: Swamy, Gokul, et al.
Publicado: (2025) -
Accelerating Inverse Reinforcement Learning with Expert Bootstrapping
por: Wu, David, et al.
Publicado: (2024) -
Efficient Imitation under Misspecification
por: Espinosa-Dice, Nicolas, et al.
Publicado: (2025)