OPRIDE: Offline Preference-based Reinforcement Learning via In-Dataset Exploration
Fuente:
arXiv
Saved in:
| Main Authors: | Yang, Yiqin, Hu, Hao, Mao, Yihuan, Zhang, Jin, Wu, Chengjie, Jiang, Yuhua, Yang, Xu, Xie, Runpeng, Fan, Yi, Liu, Bo, Gao, Yang, Xu, Bo, Zhang, Chongjie |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Fewer May Be Better: Enhancing Offline Reinforcement Learning with Reduced Dataset
by: Yang, Yiqin, et al.
Published: (2025)
by: Yang, Yiqin, et al.
Published: (2025)
Bayesian Design Principles for Offline-to-Online Reinforcement Learning
by: Hu, Hao, et al.
Published: (2024)
by: Hu, Hao, et al.
Published: (2024)
GlobeDiff: State Diffusion Process for Partial Observability in Multi-Agent Systems
by: Yang, Yiqin, et al.
Published: (2026)
by: Yang, Yiqin, et al.
Published: (2026)
CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries
by: Mu, Ni, et al.
Published: (2025)
by: Mu, Ni, et al.
Published: (2025)
DPMT: Dual Process Multi-scale Theory of Mind Framework for Real-time Human-AI Collaboration
by: Li, Xiyun, et al.
Published: (2025)
by: Li, Xiyun, et al.
Published: (2025)
Episodic Novelty Through Temporal Distance
by: Jiang, Yuhua, et al.
Published: (2025)
by: Jiang, Yuhua, et al.
Published: (2025)
DAIL: Beyond Task Ambiguity for Language-Conditioned Reinforcement Learning
by: Xie, Runpeng, et al.
Published: (2025)
by: Xie, Runpeng, et al.
Published: (2025)
S-EPOA: Overcoming the Indistinguishability of Segments with Skill-Driven Preference-Based Reinforcement Learning
by: Mu, Ni, et al.
Published: (2024)
by: Mu, Ni, et al.
Published: (2024)
STAIR: Addressing Stage Misalignment through Temporal-Aligned Preference Reinforcement Learning
by: Luan, Yao, et al.
Published: (2025)
by: Luan, Yao, et al.
Published: (2025)
Towards Robust Offline Reinforcement Learning under Diverse Data Corruption
by: Yang, Rui, et al.
Published: (2023)
by: Yang, Rui, et al.
Published: (2023)
IBGP: Imperfect Byzantine Generals Problem for Zero-Shot Robustness in Communicative Multi-Agent Systems
by: Mao, Yihuan, et al.
Published: (2024)
by: Mao, Yihuan, et al.
Published: (2024)
SC2Arena and StarEvolve: Benchmark and Self-Improvement Framework for LLMs in Complex Decision-Making Tasks
by: Shen, Pengbo, et al.
Published: (2025)
by: Shen, Pengbo, et al.
Published: (2025)
Hindsight Preference Learning for Offline Preference-based Reinforcement Learning
by: Gao, Chen-Xiao, et al.
Published: (2024)
by: Gao, Chen-Xiao, et al.
Published: (2024)
Data-Enabled Policy and Value Iteration for Continuous-Time Linear Quadratic Output Feedback Control
by: Xie, Jun, et al.
Published: (2026)
by: Xie, Jun, et al.
Published: (2026)
An Efficient Data-Driven Framework for Linear Quadratic Output Feedback Control
by: Xie, Jun, et al.
Published: (2025)
by: Xie, Jun, et al.
Published: (2025)
MrCoM: A Meta-Regularized World-Model Generalizing Across Multi-Scenarios
by: Xiong, Xuantang, et al.
Published: (2025)
by: Xiong, Xuantang, et al.
Published: (2025)
Learning to Plan Before Answering: Self-Teaching LLMs to Learn Abstract Plans for Problem Solving
by: Zhang, Jin, et al.
Published: (2025)
by: Zhang, Jin, et al.
Published: (2025)
In-Dataset Trajectory Return Regularization for Offline Preference-based Reinforcement Learning
by: Tu, Songjun, et al.
Published: (2024)
by: Tu, Songjun, et al.
Published: (2024)
ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning
by: Liu, Zeyuan, et al.
Published: (2025)
by: Liu, Zeyuan, et al.
Published: (2025)
Offline Reinforcement Learning with Imbalanced Datasets
by: Jiang, Li, et al.
Published: (2023)
by: Jiang, Li, et al.
Published: (2023)
Adaptive Advantage-Guided Policy Regularization for Offline Reinforcement Learning
by: Liu, Tenglong, et al.
Published: (2024)
by: Liu, Tenglong, et al.
Published: (2024)
Reinforced Preference Optimization for Recommendation
by: Tan, Junfei, et al.
Published: (2025)
by: Tan, Junfei, et al.
Published: (2025)
OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning
by: Ma, Xinyu, et al.
Published: (2026)
by: Ma, Xinyu, et al.
Published: (2026)
Model-Based Offline Reinforcement Learning with Adversarial Data Augmentation
by: Cao, Hongye, et al.
Published: (2025)
by: Cao, Hongye, et al.
Published: (2025)
Energy-Based Preference Model Offers Better Offline Alignment than the Bradley-Terry Preference Model
by: Hong, Yuzhong, et al.
Published: (2024)
by: Hong, Yuzhong, et al.
Published: (2024)
Diffusion-DICE: In-Sample Diffusion Guidance for Offline Reinforcement Learning
by: Mao, Liyuan, et al.
Published: (2024)
by: Mao, Liyuan, et al.
Published: (2024)
Efficient Preference-based Reinforcement Learning via Aligned Experience Estimation
by: Bai, Fengshuo, et al.
Published: (2024)
by: Bai, Fengshuo, et al.
Published: (2024)
BAFFLE: Hiding Backdoors in Offline Reinforcement Learning Datasets
by: Gong, Chen, et al.
Published: (2022)
by: Gong, Chen, et al.
Published: (2022)
DiffPoGAN: Diffusion Policies with Generative Adversarial Networks for Offline Reinforcement Learning
by: Hu, Xuemin, et al.
Published: (2024)
by: Hu, Xuemin, et al.
Published: (2024)
MAGE: Meta-Reinforcement Learning for Language Agents toward Strategic Exploration and Exploitation
by: Yang, Lu, et al.
Published: (2026)
by: Yang, Lu, et al.
Published: (2026)
Offline Reinforcement Learning for LLM Multi-Step Reasoning
by: Wang, Huaijie, et al.
Published: (2024)
by: Wang, Huaijie, et al.
Published: (2024)
Reinforcement Learning from Diverse Human Preferences
by: Xue, Wanqi, et al.
Published: (2023)
by: Xue, Wanqi, et al.
Published: (2023)
From Reward-Free Representations to Preferences: Rethinking Offline Preference-Based Reinforcement Learning
by: Yang, Jun-Jie, et al.
Published: (2026)
by: Yang, Jun-Jie, et al.
Published: (2026)
Latent Adversarial Regularization for Offline Preference Optimization
by: Jiang, Enyi, et al.
Published: (2026)
by: Jiang, Enyi, et al.
Published: (2026)
Value-Incentivized Preference Optimization: A Unified Approach to Online and Offline RLHF
by: Cen, Shicong, et al.
Published: (2024)
by: Cen, Shicong, et al.
Published: (2024)
MoMA: Model-based Mirror Ascent for Offline Reinforcement Learning
by: Hong, Mao, et al.
Published: (2024)
by: Hong, Mao, et al.
Published: (2024)
Enhancing Generative Auto-bidding with Offline Reward Evaluation and Policy Search
by: Mou, Zhiyu, et al.
Published: (2025)
by: Mou, Zhiyu, et al.
Published: (2025)
Online Preference Alignment for Language Models via Count-based Exploration
by: Bai, Chenjia, et al.
Published: (2025)
by: Bai, Chenjia, et al.
Published: (2025)
Dataset Distillation for Offline Reinforcement Learning
by: Light, Jonathan, et al.
Published: (2024)
by: Light, Jonathan, et al.
Published: (2024)
Two-Step Offline Preference-Based Reinforcement Learning with Constrained Actions
by: Xu, Yinglun, et al.
Published: (2023)
by: Xu, Yinglun, et al.
Published: (2023)
Similar Items
-
Fewer May Be Better: Enhancing Offline Reinforcement Learning with Reduced Dataset
by: Yang, Yiqin, et al.
Published: (2025) -
Bayesian Design Principles for Offline-to-Online Reinforcement Learning
by: Hu, Hao, et al.
Published: (2024) -
GlobeDiff: State Diffusion Process for Partial Observability in Multi-Agent Systems
by: Yang, Yiqin, et al.
Published: (2026) -
CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries
by: Mu, Ni, et al.
Published: (2025) -
DPMT: Dual Process Multi-scale Theory of Mind Framework for Real-time Human-AI Collaboration
by: Li, Xiyun, et al.
Published: (2025)