Diffusion Classifier-Driven Reward for Offline Preference-based Reinforcement Learning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Pang, Teng, Wang, Bingzheng, Wu, Guoqiang, Yin, Yilong |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Value-Guidance MeanFlow for Offline Multi-Agent Reinforcement Learning
von: Pang, Teng, et al.
Veröffentlicht: (2026)
von: Pang, Teng, et al.
Veröffentlicht: (2026)
Towards Macro-AUC oriented Imbalanced Multi-Label Continual Learning
von: Zhang, Yan, et al.
Veröffentlicht: (2024)
von: Zhang, Yan, et al.
Veröffentlicht: (2024)
Efficient Hierarchical Implicit Flow Q-learning for Offline Goal-conditioned Reinforcement Learning
von: Dong, Zhiqiang, et al.
Veröffentlicht: (2026)
von: Dong, Zhiqiang, et al.
Veröffentlicht: (2026)
Listwise Reward Estimation for Offline Preference-based Reinforcement Learning
von: Choi, Heewoong, et al.
Veröffentlicht: (2024)
von: Choi, Heewoong, et al.
Veröffentlicht: (2024)
Binary Reward Labeling: Bridging Offline Preference and Reward-Based Reinforcement Learning
von: Xu, Yinglun, et al.
Veröffentlicht: (2024)
von: Xu, Yinglun, et al.
Veröffentlicht: (2024)
From Reward-Free Representations to Preferences: Rethinking Offline Preference-Based Reinforcement Learning
von: Yang, Jun-Jie, et al.
Veröffentlicht: (2026)
von: Yang, Jun-Jie, et al.
Veröffentlicht: (2026)
Hindsight Preference Learning for Offline Preference-based Reinforcement Learning
von: Gao, Chen-Xiao, et al.
Veröffentlicht: (2024)
von: Gao, Chen-Xiao, et al.
Veröffentlicht: (2024)
Offline-to-Online Reinforcement Learning with Classifier-Free Diffusion Generation
von: Huang, Xiao, et al.
Veröffentlicht: (2025)
von: Huang, Xiao, et al.
Veröffentlicht: (2025)
LEASE: Offline Preference-based Reinforcement Learning with High Sample Efficiency
von: Liu, Xiao-Yin, et al.
Veröffentlicht: (2024)
von: Liu, Xiao-Yin, et al.
Veröffentlicht: (2024)
Goal-Driven Reward by Video Diffusion Models for Reinforcement Learning
von: Wang, Qi, et al.
Veröffentlicht: (2025)
von: Wang, Qi, et al.
Veröffentlicht: (2025)
Preferred-Action-Optimized Diffusion Policies for Offline Reinforcement Learning
von: Zhang, Tianle, et al.
Veröffentlicht: (2024)
von: Zhang, Tianle, et al.
Veröffentlicht: (2024)
Offline Reinforcement Learning with Imputed Rewards
von: Romeo, Carlo, et al.
Veröffentlicht: (2024)
von: Romeo, Carlo, et al.
Veröffentlicht: (2024)
Exploring and Addressing Reward Confusion in Offline Preference Learning
von: Chen, Xin, et al.
Veröffentlicht: (2024)
von: Chen, Xin, et al.
Veröffentlicht: (2024)
Preference Elicitation for Offline Reinforcement Learning
von: Pace, Alizée, et al.
Veröffentlicht: (2024)
von: Pace, Alizée, et al.
Veröffentlicht: (2024)
OPRIDE: Offline Preference-based Reinforcement Learning via In-Dataset Exploration
von: Yang, Yiqin, et al.
Veröffentlicht: (2026)
von: Yang, Yiqin, et al.
Veröffentlicht: (2026)
Residual Reward Models for Preference-based Reinforcement Learning
von: Cao, Chenyang, et al.
Veröffentlicht: (2025)
von: Cao, Chenyang, et al.
Veröffentlicht: (2025)
Adversarial Policy Optimization for Offline Preference-based Reinforcement Learning
von: Kang, Hyungkyu, et al.
Veröffentlicht: (2025)
von: Kang, Hyungkyu, et al.
Veröffentlicht: (2025)
PROF: An LLM-based Reward Code Preference Optimization Framework for Offline Imitation Learning
von: Sun, Shengjie, et al.
Veröffentlicht: (2025)
von: Sun, Shengjie, et al.
Veröffentlicht: (2025)
Behavior Preference Regression for Offline Reinforcement Learning
von: Srinivasan, Padmanaba, et al.
Veröffentlicht: (2025)
von: Srinivasan, Padmanaba, et al.
Veröffentlicht: (2025)
In-Dataset Trajectory Return Regularization for Offline Preference-based Reinforcement Learning
von: Tu, Songjun, et al.
Veröffentlicht: (2024)
von: Tu, Songjun, et al.
Veröffentlicht: (2024)
Structural Information-based Hierarchical Diffusion for Offline Reinforcement Learning
von: Zeng, Xianghua, et al.
Veröffentlicht: (2025)
von: Zeng, Xianghua, et al.
Veröffentlicht: (2025)
Two-Step Offline Preference-Based Reinforcement Learning with Constrained Actions
von: Xu, Yinglun, et al.
Veröffentlicht: (2023)
von: Xu, Yinglun, et al.
Veröffentlicht: (2023)
Reward-Relevance-Filtered Linear Offline Reinforcement Learning
von: Zhou, Angela
Veröffentlicht: (2024)
von: Zhou, Angela
Veröffentlicht: (2024)
LLM-Driven Policy Diffusion: Enhancing Generalization in Offline Reinforcement Learning
von: Zhang, Hanping, et al.
Veröffentlicht: (2025)
von: Zhang, Hanping, et al.
Veröffentlicht: (2025)
From Novelty to Imitation: Self-Distilled Rewards for Offline Reinforcement Learning
von: Chaudhary, Gaurav, et al.
Veröffentlicht: (2025)
von: Chaudhary, Gaurav, et al.
Veröffentlicht: (2025)
Diffusion-based Episodes Augmentation for Offline Multi-Agent Reinforcement Learning
von: Oh, Jihwan, et al.
Veröffentlicht: (2024)
von: Oh, Jihwan, et al.
Veröffentlicht: (2024)
MODULI: Unlocking Preference Generalization via Diffusion Models for Offline Multi-Objective Reinforcement Learning
von: Yuan, Yifu, et al.
Veröffentlicht: (2024)
von: Yuan, Yifu, et al.
Veröffentlicht: (2024)
Equivariant Efficient Joint Discrete and Continuous MeanFlow for Molecular Graph Generation
von: Xu, Rongjian, et al.
Veröffentlicht: (2026)
von: Xu, Rongjian, et al.
Veröffentlicht: (2026)
DiffCPS: Diffusion Model based Constrained Policy Search for Offline Reinforcement Learning
von: He, Longxiang, et al.
Veröffentlicht: (2023)
von: He, Longxiang, et al.
Veröffentlicht: (2023)
Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning
von: Venugopal, Aravind, et al.
Veröffentlicht: (2026)
von: Venugopal, Aravind, et al.
Veröffentlicht: (2026)
Offline Multitask Representation Learning for Reinforcement Learning
von: Ishfaq, Haque, et al.
Veröffentlicht: (2024)
von: Ishfaq, Haque, et al.
Veröffentlicht: (2024)
Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning
von: Rajaram, Sara, et al.
Veröffentlicht: (2025)
von: Rajaram, Sara, et al.
Veröffentlicht: (2025)
Sample-Efficient Preference-based Reinforcement Learning with Dynamics Aware Rewards
von: Metcalf, Katherine, et al.
Veröffentlicht: (2024)
von: Metcalf, Katherine, et al.
Veröffentlicht: (2024)
Prior-Guided Diffusion Planning for Offline Reinforcement Learning
von: Ki, Donghyeon, et al.
Veröffentlicht: (2025)
von: Ki, Donghyeon, et al.
Veröffentlicht: (2025)
Diffusion Self-Weighted Guidance for Offline Reinforcement Learning
von: Tagle, Augusto, et al.
Veröffentlicht: (2025)
von: Tagle, Augusto, et al.
Veröffentlicht: (2025)
Diffusion Policies with Value-Conditional Optimization for Offline Reinforcement Learning
von: Ma, Yunchang, et al.
Veröffentlicht: (2025)
von: Ma, Yunchang, et al.
Veröffentlicht: (2025)
Continual Offline Reinforcement Learning via Diffusion-based Dual Generative Replay
von: Liu, Jinmei, et al.
Veröffentlicht: (2024)
von: Liu, Jinmei, et al.
Veröffentlicht: (2024)
Penalizing Infeasible Actions and Reward Scaling in Reinforcement Learning with Offline Data
von: Kim, Jeonghye, et al.
Veröffentlicht: (2025)
von: Kim, Jeonghye, et al.
Veröffentlicht: (2025)
Beyond Simple Sum of Delayed Rewards: Non-Markovian Reward Modeling for Reinforcement Learning
von: Tang, Yuting, et al.
Veröffentlicht: (2024)
von: Tang, Yuting, et al.
Veröffentlicht: (2024)
Diffusion Policies for Risk-Averse Behavior Modeling in Offline Reinforcement Learning
von: Chen, Xiaocong, et al.
Veröffentlicht: (2024)
von: Chen, Xiaocong, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Value-Guidance MeanFlow for Offline Multi-Agent Reinforcement Learning
von: Pang, Teng, et al.
Veröffentlicht: (2026) -
Towards Macro-AUC oriented Imbalanced Multi-Label Continual Learning
von: Zhang, Yan, et al.
Veröffentlicht: (2024) -
Efficient Hierarchical Implicit Flow Q-learning for Offline Goal-conditioned Reinforcement Learning
von: Dong, Zhiqiang, et al.
Veröffentlicht: (2026) -
Listwise Reward Estimation for Offline Preference-based Reinforcement Learning
von: Choi, Heewoong, et al.
Veröffentlicht: (2024) -
Binary Reward Labeling: Bridging Offline Preference and Reward-Based Reinforcement Learning
von: Xu, Yinglun, et al.
Veröffentlicht: (2024)