LEASE: Offline Preference-based Reinforcement Learning with High Sample Efficiency
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Liu, Xiao-Yin, Li, Guotao, Zhou, Xiao-Hu, Hou, Zeng-Guang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
MICRO: Model-Based Offline Reinforcement Learning with a Conservative Bellman Operator
von: Liu, Xiao-Yin, et al.
Veröffentlicht: (2023)
von: Liu, Xiao-Yin, et al.
Veröffentlicht: (2023)
Hindsight Preference Learning for Offline Preference-based Reinforcement Learning
von: Gao, Chen-Xiao, et al.
Veröffentlicht: (2024)
von: Gao, Chen-Xiao, et al.
Veröffentlicht: (2024)
Two-Step Offline Preference-Based Reinforcement Learning with Constrained Actions
von: Xu, Yinglun, et al.
Veröffentlicht: (2023)
von: Xu, Yinglun, et al.
Veröffentlicht: (2023)
CROP: Conservative Reward for Model-based Offline Policy Optimization
von: Li, Hao, et al.
Veröffentlicht: (2023)
von: Li, Hao, et al.
Veröffentlicht: (2023)
OPRIDE: Offline Preference-based Reinforcement Learning via In-Dataset Exploration
von: Yang, Yiqin, et al.
Veröffentlicht: (2026)
von: Yang, Yiqin, et al.
Veröffentlicht: (2026)
Preferred-Action-Optimized Diffusion Policies for Offline Reinforcement Learning
von: Zhang, Tianle, et al.
Veröffentlicht: (2024)
von: Zhang, Tianle, et al.
Veröffentlicht: (2024)
Preference Elicitation for Offline Reinforcement Learning
von: Pace, Alizée, et al.
Veröffentlicht: (2024)
von: Pace, Alizée, et al.
Veröffentlicht: (2024)
In-Dataset Trajectory Return Regularization for Offline Preference-based Reinforcement Learning
von: Tu, Songjun, et al.
Veröffentlicht: (2024)
von: Tu, Songjun, et al.
Veröffentlicht: (2024)
Search-Based Credit Assignment for Offline Preference-Based Reinforcement Learning
von: Gao, Xiancheng, et al.
Veröffentlicht: (2025)
von: Gao, Xiancheng, et al.
Veröffentlicht: (2025)
Listwise Reward Estimation for Offline Preference-based Reinforcement Learning
von: Choi, Heewoong, et al.
Veröffentlicht: (2024)
von: Choi, Heewoong, et al.
Veröffentlicht: (2024)
Adversarial Policy Optimization for Offline Preference-based Reinforcement Learning
von: Kang, Hyungkyu, et al.
Veröffentlicht: (2025)
von: Kang, Hyungkyu, et al.
Veröffentlicht: (2025)
DOMAIN: MilDly COnservative Model-BAsed OfflINe Reinforcement Learning
von: Liu, Xiao-Yin, et al.
Veröffentlicht: (2023)
von: Liu, Xiao-Yin, et al.
Veröffentlicht: (2023)
Behavior Preference Regression for Offline Reinforcement Learning
von: Srinivasan, Padmanaba, et al.
Veröffentlicht: (2025)
von: Srinivasan, Padmanaba, et al.
Veröffentlicht: (2025)
Offline-to-Online Reinforcement Learning with Classifier-Free Diffusion Generation
von: Huang, Xiao, et al.
Veröffentlicht: (2025)
von: Huang, Xiao, et al.
Veröffentlicht: (2025)
Dataset Distillation for Offline Reinforcement Learning
von: Light, Jonathan, et al.
Veröffentlicht: (2024)
von: Light, Jonathan, et al.
Veröffentlicht: (2024)
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning
von: Gao, Chen-Xiao, et al.
Veröffentlicht: (2025)
von: Gao, Chen-Xiao, et al.
Veröffentlicht: (2025)
Mutual Information Regularized Offline Reinforcement Learning
von: Ma, Xiao, et al.
Veröffentlicht: (2022)
von: Ma, Xiao, et al.
Veröffentlicht: (2022)
When is Offline Policy Selection Sample Efficient for Reinforcement Learning?
von: Liu, Vincent, et al.
Veröffentlicht: (2023)
von: Liu, Vincent, et al.
Veröffentlicht: (2023)
Sample Efficient Active Algorithms for Offline Reinforcement Learning
von: Roy, Soumyadeep, et al.
Veröffentlicht: (2026)
von: Roy, Soumyadeep, et al.
Veröffentlicht: (2026)
Beyond Penalization: Diffusion-based Out-of-Distribution Detection and Selective Regularization in Offline Reinforcement Learning
von: Wang, Qingjun, et al.
Veröffentlicht: (2026)
von: Wang, Qingjun, et al.
Veröffentlicht: (2026)
Should We Ever Prefer Decision Transformer for Offline Reinforcement Learning?
von: Omori, Yumi, et al.
Veröffentlicht: (2025)
von: Omori, Yumi, et al.
Veröffentlicht: (2025)
Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization
von: Liu, Zongkai, et al.
Veröffentlicht: (2024)
von: Liu, Zongkai, et al.
Veröffentlicht: (2024)
Improving Offline-to-Online Reinforcement Learning with Q Conditioned State Entropy Exploration
von: Zhang, Ziqi, et al.
Veröffentlicht: (2023)
von: Zhang, Ziqi, et al.
Veröffentlicht: (2023)
PROF: An LLM-based Reward Code Preference Optimization Framework for Offline Imitation Learning
von: Sun, Shengjie, et al.
Veröffentlicht: (2025)
von: Sun, Shengjie, et al.
Veröffentlicht: (2025)
Offline Trajectory Optimization for Offline Reinforcement Learning
von: Zhao, Ziqi, et al.
Veröffentlicht: (2024)
von: Zhao, Ziqi, et al.
Veröffentlicht: (2024)
On Sample-Efficient Offline Reinforcement Learning: Data Diversity, Posterior Sampling, and Beyond
von: Nguyen-Tang, Thanh, et al.
Veröffentlicht: (2024)
von: Nguyen-Tang, Thanh, et al.
Veröffentlicht: (2024)
Imagination-Limited Q-Learning for Offline Reinforcement Learning
von: Liu, Wenhui, et al.
Veröffentlicht: (2025)
von: Liu, Wenhui, et al.
Veröffentlicht: (2025)
Diffusion-DICE: In-Sample Diffusion Guidance for Offline Reinforcement Learning
von: Mao, Liyuan, et al.
Veröffentlicht: (2024)
von: Mao, Liyuan, et al.
Veröffentlicht: (2024)
DAWM: Diffusion Action World Models for Offline Reinforcement Learning via Action-Inferred Transitions
von: Li, Zongyue, et al.
Veröffentlicht: (2025)
von: Li, Zongyue, et al.
Veröffentlicht: (2025)
Sample-Efficient Preference-based Reinforcement Learning with Dynamics Aware Rewards
von: Metcalf, Katherine, et al.
Veröffentlicht: (2024)
von: Metcalf, Katherine, et al.
Veröffentlicht: (2024)
KAN v.s. MLP for Offline Reinforcement Learning
von: Guo, Haihong, et al.
Veröffentlicht: (2024)
von: Guo, Haihong, et al.
Veröffentlicht: (2024)
A Weight-aware-based Multi-source Unsupervised Domain Adaptation Method for Human Motion Intention Recognition
von: Liu, Xiao-Yin, et al.
Veröffentlicht: (2024)
von: Liu, Xiao-Yin, et al.
Veröffentlicht: (2024)
Improving Offline Reinforcement Learning with Inaccurate Simulators
von: Hou, Yiwen, et al.
Veröffentlicht: (2024)
von: Hou, Yiwen, et al.
Veröffentlicht: (2024)
Reinforcement Learning-based Feature Generation Algorithm for Scientific Data
von: Xiao, Meng, et al.
Veröffentlicht: (2025)
von: Xiao, Meng, et al.
Veröffentlicht: (2025)
OffSim: Offline Simulator for Model-based Offline Inverse Reinforcement Learning
von: Ahn, Woo-Jin, et al.
Veröffentlicht: (2025)
von: Ahn, Woo-Jin, et al.
Veröffentlicht: (2025)
Design Considerations in Offline Preference-based RL
von: Agarwal, Alekh, et al.
Veröffentlicht: (2025)
von: Agarwal, Alekh, et al.
Veröffentlicht: (2025)
On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures
von: Yin, Ming, et al.
Veröffentlicht: (2025)
von: Yin, Ming, et al.
Veröffentlicht: (2025)
Continual Offline Reinforcement Learning via Diffusion-based Dual Generative Replay
von: Liu, Jinmei, et al.
Veröffentlicht: (2024)
von: Liu, Jinmei, et al.
Veröffentlicht: (2024)
POLO: Preference-Guided Multi-Turn Reinforcement Learning for Lead Optimization
von: Wang, Ziqing, et al.
Veröffentlicht: (2025)
von: Wang, Ziqing, et al.
Veröffentlicht: (2025)
Task-Aware Harmony Multi-Task Decision Transformer for Offline Reinforcement Learning
von: Fan, Ziqing, et al.
Veröffentlicht: (2024)
von: Fan, Ziqing, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
MICRO: Model-Based Offline Reinforcement Learning with a Conservative Bellman Operator
von: Liu, Xiao-Yin, et al.
Veröffentlicht: (2023) -
Hindsight Preference Learning for Offline Preference-based Reinforcement Learning
von: Gao, Chen-Xiao, et al.
Veröffentlicht: (2024) -
Two-Step Offline Preference-Based Reinforcement Learning with Constrained Actions
von: Xu, Yinglun, et al.
Veröffentlicht: (2023) -
CROP: Conservative Reward for Model-based Offline Policy Optimization
von: Li, Hao, et al.
Veröffentlicht: (2023) -
OPRIDE: Offline Preference-based Reinforcement Learning via In-Dataset Exploration
von: Yang, Yiqin, et al.
Veröffentlicht: (2026)