Online Policy Learning from Offline Preferences
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhang, Guoxi, Bao, Han, Kashima, Hisashi |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Treatment Effect Estimation with Differentiated Networked Effect on Graph Data
von: Lin, Xiaofeng, et al.
Veröffentlicht: (2026)
von: Lin, Xiaofeng, et al.
Veröffentlicht: (2026)
Enhancing Chess Reinforcement Learning with Graph Representation
von: Rigaux, Tomas, et al.
Veröffentlicht: (2024)
von: Rigaux, Tomas, et al.
Veröffentlicht: (2024)
Adaptive Discovery of Interpretable Audio Attributes with Multimodal LLMs for Low-Resource Classification
von: Yoshimura, Kosuke, et al.
Veröffentlicht: (2026)
von: Yoshimura, Kosuke, et al.
Veröffentlicht: (2026)
Hierarchical Text Classification Using Black Box Large Language Models
von: Yoshimura, Kosuke, et al.
Veröffentlicht: (2025)
von: Yoshimura, Kosuke, et al.
Veröffentlicht: (2025)
Mitigating Cognitive Biases in Multi-Criteria Crowd Assessment
von: Ito, Shun, et al.
Veröffentlicht: (2024)
von: Ito, Shun, et al.
Veröffentlicht: (2024)
Treatment Effect Estimation for Graph-Structured Targets
von: Harada, Shonosuke, et al.
Veröffentlicht: (2024)
von: Harada, Shonosuke, et al.
Veröffentlicht: (2024)
Online Bandit Learning with Offline Preference Data for Improved RLHF
von: Agnihotri, Akhil, et al.
Veröffentlicht: (2024)
von: Agnihotri, Akhil, et al.
Veröffentlicht: (2024)
Dynamic Feature Selection from Variable Feature Sets Using Features of Features
von: Takahashi, Katsumi, et al.
Veröffentlicht: (2025)
von: Takahashi, Katsumi, et al.
Veröffentlicht: (2025)
Preferred-Action-Optimized Diffusion Policies for Offline Reinforcement Learning
von: Zhang, Tianle, et al.
Veröffentlicht: (2024)
von: Zhang, Tianle, et al.
Veröffentlicht: (2024)
Unpacking the Implicit Norm Dynamics of Sharpness-Aware Minimization in Tensorized Models
von: Cao, Tianxiao, et al.
Veröffentlicht: (2025)
von: Cao, Tianxiao, et al.
Veröffentlicht: (2025)
XicorAttention: Time Series Transformer Using Attention with Nonlinear Correlation
von: Kimura, Daichi, et al.
Veröffentlicht: (2025)
von: Kimura, Daichi, et al.
Veröffentlicht: (2025)
Adversarial Policy Optimization for Offline Preference-based Reinforcement Learning
von: Kang, Hyungkyu, et al.
Veröffentlicht: (2025)
von: Kang, Hyungkyu, et al.
Veröffentlicht: (2025)
Direction-Aware Offline-to-Online Learning in Linear Contextual Bandits
von: Han, Zean, et al.
Veröffentlicht: (2026)
von: Han, Zean, et al.
Veröffentlicht: (2026)
Probability Bounding: Post-Hoc Calibration via Box-Constrained Softmax
von: Atarashi, Kyohei, et al.
Veröffentlicht: (2025)
von: Atarashi, Kyohei, et al.
Veröffentlicht: (2025)
A Non-Monolithic Policy Approach of Offline-to-Online Reinforcement Learning
von: Kim, JaeYoon, et al.
Veröffentlicht: (2024)
von: Kim, JaeYoon, et al.
Veröffentlicht: (2024)
Hindsight Preference Learning for Offline Preference-based Reinforcement Learning
von: Gao, Chen-Xiao, et al.
Veröffentlicht: (2024)
von: Gao, Chen-Xiao, et al.
Veröffentlicht: (2024)
SafeMIL: Learning Offline Safe Imitation Policy from Non-Preferred Trajectories
von: Burnwal, Returaj, et al.
Veröffentlicht: (2025)
von: Burnwal, Returaj, et al.
Veröffentlicht: (2025)
Hybrid Preference Optimization for Alignment: Provably Faster Convergence Rates by Combining Offline Preferences with Online Exploration
von: Bose, Avinandan, et al.
Veröffentlicht: (2024)
von: Bose, Avinandan, et al.
Veröffentlicht: (2024)
Residual Q-Learning: Offline and Online Policy Customization without Value
von: Li, Chenran, et al.
Veröffentlicht: (2023)
von: Li, Chenran, et al.
Veröffentlicht: (2023)
Energy-Based Preference Model Offers Better Offline Alignment than the Bradley-Terry Preference Model
von: Hong, Yuzhong, et al.
Veröffentlicht: (2024)
von: Hong, Yuzhong, et al.
Veröffentlicht: (2024)
Transfer Learning with Pre-trained Conditional Generative Models
von: Yamaguchi, Shin'ya, et al.
Veröffentlicht: (2022)
von: Yamaguchi, Shin'ya, et al.
Veröffentlicht: (2022)
Preference Elicitation for Offline Reinforcement Learning
von: Pace, Alizée, et al.
Veröffentlicht: (2024)
von: Pace, Alizée, et al.
Veröffentlicht: (2024)
Online Pre-Training for Offline-to-Online Reinforcement Learning
von: Shin, Yongjae, et al.
Veröffentlicht: (2025)
von: Shin, Yongjae, et al.
Veröffentlicht: (2025)
Robust Anomaly Detection Under Normality Distribution Shift in Dynamic Graphs
von: Xu, Xiaoyang, et al.
Veröffentlicht: (2025)
von: Xu, Xiaoyang, et al.
Veröffentlicht: (2025)
Offline Clustering of Preference Learning with Active-data Augmentation
von: Liu, Jingyuan, et al.
Veröffentlicht: (2025)
von: Liu, Jingyuan, et al.
Veröffentlicht: (2025)
COOPO: Cyclic Offline-Online Policy Optimization Algorithm
von: Liu, Qisai, et al.
Veröffentlicht: (2026)
von: Liu, Qisai, et al.
Veröffentlicht: (2026)
Fat-to-Thin Policy Optimization: Offline RL with Sparse Policies
von: Zhu, Lingwei, et al.
Veröffentlicht: (2025)
von: Zhu, Lingwei, et al.
Veröffentlicht: (2025)
Adaptive Policy Selection and Fine-Tuning under Interaction Budgets for Offline-to-Online Reinforcement Learning
von: Bozkurt, Alper Kamil, et al.
Veröffentlicht: (2026)
von: Bozkurt, Alper Kamil, et al.
Veröffentlicht: (2026)
Bayesian Design Principles for Offline-to-Online Reinforcement Learning
von: Hu, Hao, et al.
Veröffentlicht: (2024)
von: Hu, Hao, et al.
Veröffentlicht: (2024)
From Reward-Free Representations to Preferences: Rethinking Offline Preference-Based Reinforcement Learning
von: Yang, Jun-Jie, et al.
Veröffentlicht: (2026)
von: Yang, Jun-Jie, et al.
Veröffentlicht: (2026)
Behavior Preference Regression for Offline Reinforcement Learning
von: Srinivasan, Padmanaba, et al.
Veröffentlicht: (2025)
von: Srinivasan, Padmanaba, et al.
Veröffentlicht: (2025)
OLLIE: Imitation Learning from Offline Pretraining to Online Finetuning
von: Yue, Sheng, et al.
Veröffentlicht: (2024)
von: Yue, Sheng, et al.
Veröffentlicht: (2024)
Information-Directed Offline-to-Online Reinforcement Learning
von: Chen, Keru
Veröffentlicht: (2026)
von: Chen, Keru
Veröffentlicht: (2026)
Policy-labeled Preference Learning: Is Preference Enough for RLHF?
von: Cho, Taehyun, et al.
Veröffentlicht: (2025)
von: Cho, Taehyun, et al.
Veröffentlicht: (2025)
Value-Incentivized Preference Optimization: A Unified Approach to Online and Offline RLHF
von: Cen, Shicong, et al.
Veröffentlicht: (2024)
von: Cen, Shicong, et al.
Veröffentlicht: (2024)
Offline-Online Reinforcement Learning for Linear Mixture MDPs
von: Zhang, Zhongjun, et al.
Veröffentlicht: (2026)
von: Zhang, Zhongjun, et al.
Veröffentlicht: (2026)
Making Offline RL Online: Collaborative World Models for Offline Visual Reinforcement Learning
von: Wang, Qi, et al.
Veröffentlicht: (2023)
von: Wang, Qi, et al.
Veröffentlicht: (2023)
Energy-Guided Diffusion Sampling for Offline-to-Online Reinforcement Learning
von: Liu, Xu-Hui, et al.
Veröffentlicht: (2024)
von: Liu, Xu-Hui, et al.
Veröffentlicht: (2024)
Constrained Policy Optimization with Explicit Behavior Density for Offline Reinforcement Learning
von: Zhang, Jing, et al.
Veröffentlicht: (2023)
von: Zhang, Jing, et al.
Veröffentlicht: (2023)
In-Dataset Trajectory Return Regularization for Offline Preference-based Reinforcement Learning
von: Tu, Songjun, et al.
Veröffentlicht: (2024)
von: Tu, Songjun, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Treatment Effect Estimation with Differentiated Networked Effect on Graph Data
von: Lin, Xiaofeng, et al.
Veröffentlicht: (2026) -
Enhancing Chess Reinforcement Learning with Graph Representation
von: Rigaux, Tomas, et al.
Veröffentlicht: (2024) -
Adaptive Discovery of Interpretable Audio Attributes with Multimodal LLMs for Low-Resource Classification
von: Yoshimura, Kosuke, et al.
Veröffentlicht: (2026) -
Hierarchical Text Classification Using Black Box Large Language Models
von: Yoshimura, Kosuke, et al.
Veröffentlicht: (2025) -
Mitigating Cognitive Biases in Multi-Criteria Crowd Assessment
von: Ito, Shun, et al.
Veröffentlicht: (2024)