Exploring and Addressing Reward Confusion in Offline Preference Learning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Chen, Xin, Toyer, Sam, Shkurti, Florian |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
SMAC: Score-Matched Actor-Critics for Robust Offline-to-Online Transfer
von: de Lara, Nathan Samuel, et al.
Veröffentlicht: (2026)
von: de Lara, Nathan Samuel, et al.
Veröffentlicht: (2026)
Listwise Reward Estimation for Offline Preference-based Reinforcement Learning
von: Choi, Heewoong, et al.
Veröffentlicht: (2024)
von: Choi, Heewoong, et al.
Veröffentlicht: (2024)
Generalization in VAE and Diffusion Models: A Unified Information-Theoretic Analysis
von: Chen, Qi, et al.
Veröffentlicht: (2025)
von: Chen, Qi, et al.
Veröffentlicht: (2025)
PROF: An LLM-based Reward Code Preference Optimization Framework for Offline Imitation Learning
von: Sun, Shengjie, et al.
Veröffentlicht: (2025)
von: Sun, Shengjie, et al.
Veröffentlicht: (2025)
Hindsight Preference Learning for Offline Preference-based Reinforcement Learning
von: Gao, Chen-Xiao, et al.
Veröffentlicht: (2024)
von: Gao, Chen-Xiao, et al.
Veröffentlicht: (2024)
Continual Model-Based Reinforcement Learning with Hypernetworks
von: Huang, Yizhou, et al.
Veröffentlicht: (2020)
von: Huang, Yizhou, et al.
Veröffentlicht: (2020)
Offline Reinforcement Learning with Imputed Rewards
von: Romeo, Carlo, et al.
Veröffentlicht: (2024)
von: Romeo, Carlo, et al.
Veröffentlicht: (2024)
Preference Elicitation for Offline Reinforcement Learning
von: Pace, Alizée, et al.
Veröffentlicht: (2024)
von: Pace, Alizée, et al.
Veröffentlicht: (2024)
Behavior Preference Regression for Offline Reinforcement Learning
von: Srinivasan, Padmanaba, et al.
Veröffentlicht: (2025)
von: Srinivasan, Padmanaba, et al.
Veröffentlicht: (2025)
Offline Trajectory Optimization for Offline Reinforcement Learning
von: Zhao, Ziqi, et al.
Veröffentlicht: (2024)
von: Zhao, Ziqi, et al.
Veröffentlicht: (2024)
Preferred-Action-Optimized Diffusion Policies for Offline Reinforcement Learning
von: Zhang, Tianle, et al.
Veröffentlicht: (2024)
von: Zhang, Tianle, et al.
Veröffentlicht: (2024)
Reward Learning From Preference With Ties
von: Liu, Jinsong, et al.
Veröffentlicht: (2024)
von: Liu, Jinsong, et al.
Veröffentlicht: (2024)
In-Dataset Trajectory Return Regularization for Offline Preference-based Reinforcement Learning
von: Tu, Songjun, et al.
Veröffentlicht: (2024)
von: Tu, Songjun, et al.
Veröffentlicht: (2024)
Adversarial Policy Optimization for Offline Preference-based Reinforcement Learning
von: Kang, Hyungkyu, et al.
Veröffentlicht: (2025)
von: Kang, Hyungkyu, et al.
Veröffentlicht: (2025)
Informing Acquisition Functions via Foundation Models for Molecular Discovery
von: Chen, Qi, et al.
Veröffentlicht: (2025)
von: Chen, Qi, et al.
Veröffentlicht: (2025)
Penalizing Infeasible Actions and Reward Scaling in Reinforcement Learning with Offline Data
von: Kim, Jeonghye, et al.
Veröffentlicht: (2025)
von: Kim, Jeonghye, et al.
Veröffentlicht: (2025)
LEASE: Offline Preference-based Reinforcement Learning with High Sample Efficiency
von: Liu, Xiao-Yin, et al.
Veröffentlicht: (2024)
von: Liu, Xiao-Yin, et al.
Veröffentlicht: (2024)
Should We Ever Prefer Decision Transformer for Offline Reinforcement Learning?
von: Omori, Yumi, et al.
Veröffentlicht: (2025)
von: Omori, Yumi, et al.
Veröffentlicht: (2025)
OPRIDE: Offline Preference-based Reinforcement Learning via In-Dataset Exploration
von: Yang, Yiqin, et al.
Veröffentlicht: (2026)
von: Yang, Yiqin, et al.
Veröffentlicht: (2026)
Search-Based Credit Assignment for Offline Preference-Based Reinforcement Learning
von: Gao, Xiancheng, et al.
Veröffentlicht: (2025)
von: Gao, Xiancheng, et al.
Veröffentlicht: (2025)
Two-Step Offline Preference-Based Reinforcement Learning with Constrained Actions
von: Xu, Yinglun, et al.
Veröffentlicht: (2023)
von: Xu, Yinglun, et al.
Veröffentlicht: (2023)
The Confusion is Real: GRAPHIC -- A Network Science Approach to Confusion Matrices in Deep Learning
von: Fröhlich, Johanna S., et al.
Veröffentlicht: (2026)
von: Fröhlich, Johanna S., et al.
Veröffentlicht: (2026)
Rectifying Shortcut Behaviors in Preference-based Reward Learning
von: Ye, Wenqian, et al.
Veröffentlicht: (2025)
von: Ye, Wenqian, et al.
Veröffentlicht: (2025)
OMG-RL:Offline Model-based Guided Reward Learning for Heparin Treatment
von: Lim, Yooseok, et al.
Veröffentlicht: (2024)
von: Lim, Yooseok, et al.
Veröffentlicht: (2024)
Reward Generation via Large Vision-Language Model in Offline Reinforcement Learning
von: Lee, Younghwan, et al.
Veröffentlicht: (2025)
von: Lee, Younghwan, et al.
Veröffentlicht: (2025)
Design Considerations in Offline Preference-based RL
von: Agarwal, Alekh, et al.
Veröffentlicht: (2025)
von: Agarwal, Alekh, et al.
Veröffentlicht: (2025)
Latent Adversarial Regularization for Offline Preference Optimization
von: Jiang, Enyi, et al.
Veröffentlicht: (2026)
von: Jiang, Enyi, et al.
Veröffentlicht: (2026)
Preference as Reward, Maximum Preference Optimization with Importance Sampling
von: Jiang, Zaifan, et al.
Veröffentlicht: (2023)
von: Jiang, Zaifan, et al.
Veröffentlicht: (2023)
Automatic Reward Shaping from Confounded Offline Data
von: Li, Mingxuan, et al.
Veröffentlicht: (2025)
von: Li, Mingxuan, et al.
Veröffentlicht: (2025)
Robust Offline Reinforcement learning with Heavy-Tailed Rewards
von: Zhu, Jin, et al.
Veröffentlicht: (2023)
von: Zhu, Jin, et al.
Veröffentlicht: (2023)
Enhancing Generative Auto-bidding with Offline Reward Evaluation and Policy Search
von: Mou, Zhiyu, et al.
Veröffentlicht: (2025)
von: Mou, Zhiyu, et al.
Veröffentlicht: (2025)
Preference-Guided Diffusion for Multi-Objective Offline Optimization
von: Annadani, Yashas, et al.
Veröffentlicht: (2025)
von: Annadani, Yashas, et al.
Veröffentlicht: (2025)
CROP: Conservative Reward for Model-based Offline Policy Optimization
von: Li, Hao, et al.
Veröffentlicht: (2023)
von: Li, Hao, et al.
Veröffentlicht: (2023)
SafeMIL: Learning Offline Safe Imitation Policy from Non-Preferred Trajectories
von: Burnwal, Returaj, et al.
Veröffentlicht: (2025)
von: Burnwal, Returaj, et al.
Veröffentlicht: (2025)
Residual Reward Models for Preference-based Reinforcement Learning
von: Cao, Chenyang, et al.
Veröffentlicht: (2025)
von: Cao, Chenyang, et al.
Veröffentlicht: (2025)
GAS: Enhancing Reward-Cost Balance of Generative Model-assisted Offline Safe RL
von: Liu, Zifan, et al.
Veröffentlicht: (2026)
von: Liu, Zifan, et al.
Veröffentlicht: (2026)
A Unified Linear Programming Framework for Offline Reward Learning from Human Demonstrations and Feedback
von: Kim, Kihyun, et al.
Veröffentlicht: (2024)
von: Kim, Kihyun, et al.
Veröffentlicht: (2024)
Sample-Efficient Preference-based Reinforcement Learning with Dynamics Aware Rewards
von: Metcalf, Katherine, et al.
Veröffentlicht: (2024)
von: Metcalf, Katherine, et al.
Veröffentlicht: (2024)
Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning
von: Rajaram, Sara, et al.
Veröffentlicht: (2025)
von: Rajaram, Sara, et al.
Veröffentlicht: (2025)
Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization
von: Yu, Xin, et al.
Veröffentlicht: (2026)
von: Yu, Xin, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
SMAC: Score-Matched Actor-Critics for Robust Offline-to-Online Transfer
von: de Lara, Nathan Samuel, et al.
Veröffentlicht: (2026) -
Listwise Reward Estimation for Offline Preference-based Reinforcement Learning
von: Choi, Heewoong, et al.
Veröffentlicht: (2024) -
Generalization in VAE and Diffusion Models: A Unified Information-Theoretic Analysis
von: Chen, Qi, et al.
Veröffentlicht: (2025) -
PROF: An LLM-based Reward Code Preference Optimization Framework for Offline Imitation Learning
von: Sun, Shengjie, et al.
Veröffentlicht: (2025) -
Hindsight Preference Learning for Offline Preference-based Reinforcement Learning
von: Gao, Chen-Xiao, et al.
Veröffentlicht: (2024)