Online Policy Learning from Offline Preferences
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Guoxi, Bao, Han, Kashima, Hisashi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Treatment Effect Estimation with Differentiated Networked Effect on Graph Data
por: Lin, Xiaofeng, et al.
Publicado: (2026)
por: Lin, Xiaofeng, et al.
Publicado: (2026)
Enhancing Chess Reinforcement Learning with Graph Representation
por: Rigaux, Tomas, et al.
Publicado: (2024)
por: Rigaux, Tomas, et al.
Publicado: (2024)
Adaptive Discovery of Interpretable Audio Attributes with Multimodal LLMs for Low-Resource Classification
por: Yoshimura, Kosuke, et al.
Publicado: (2026)
por: Yoshimura, Kosuke, et al.
Publicado: (2026)
Hierarchical Text Classification Using Black Box Large Language Models
por: Yoshimura, Kosuke, et al.
Publicado: (2025)
por: Yoshimura, Kosuke, et al.
Publicado: (2025)
Mitigating Cognitive Biases in Multi-Criteria Crowd Assessment
por: Ito, Shun, et al.
Publicado: (2024)
por: Ito, Shun, et al.
Publicado: (2024)
Treatment Effect Estimation for Graph-Structured Targets
por: Harada, Shonosuke, et al.
Publicado: (2024)
por: Harada, Shonosuke, et al.
Publicado: (2024)
Online Bandit Learning with Offline Preference Data for Improved RLHF
por: Agnihotri, Akhil, et al.
Publicado: (2024)
por: Agnihotri, Akhil, et al.
Publicado: (2024)
Dynamic Feature Selection from Variable Feature Sets Using Features of Features
por: Takahashi, Katsumi, et al.
Publicado: (2025)
por: Takahashi, Katsumi, et al.
Publicado: (2025)
Preferred-Action-Optimized Diffusion Policies for Offline Reinforcement Learning
por: Zhang, Tianle, et al.
Publicado: (2024)
por: Zhang, Tianle, et al.
Publicado: (2024)
Unpacking the Implicit Norm Dynamics of Sharpness-Aware Minimization in Tensorized Models
por: Cao, Tianxiao, et al.
Publicado: (2025)
por: Cao, Tianxiao, et al.
Publicado: (2025)
XicorAttention: Time Series Transformer Using Attention with Nonlinear Correlation
por: Kimura, Daichi, et al.
Publicado: (2025)
por: Kimura, Daichi, et al.
Publicado: (2025)
Adversarial Policy Optimization for Offline Preference-based Reinforcement Learning
por: Kang, Hyungkyu, et al.
Publicado: (2025)
por: Kang, Hyungkyu, et al.
Publicado: (2025)
Direction-Aware Offline-to-Online Learning in Linear Contextual Bandits
por: Han, Zean, et al.
Publicado: (2026)
por: Han, Zean, et al.
Publicado: (2026)
Probability Bounding: Post-Hoc Calibration via Box-Constrained Softmax
por: Atarashi, Kyohei, et al.
Publicado: (2025)
por: Atarashi, Kyohei, et al.
Publicado: (2025)
A Non-Monolithic Policy Approach of Offline-to-Online Reinforcement Learning
por: Kim, JaeYoon, et al.
Publicado: (2024)
por: Kim, JaeYoon, et al.
Publicado: (2024)
Hindsight Preference Learning for Offline Preference-based Reinforcement Learning
por: Gao, Chen-Xiao, et al.
Publicado: (2024)
por: Gao, Chen-Xiao, et al.
Publicado: (2024)
SafeMIL: Learning Offline Safe Imitation Policy from Non-Preferred Trajectories
por: Burnwal, Returaj, et al.
Publicado: (2025)
por: Burnwal, Returaj, et al.
Publicado: (2025)
Hybrid Preference Optimization for Alignment: Provably Faster Convergence Rates by Combining Offline Preferences with Online Exploration
por: Bose, Avinandan, et al.
Publicado: (2024)
por: Bose, Avinandan, et al.
Publicado: (2024)
Residual Q-Learning: Offline and Online Policy Customization without Value
por: Li, Chenran, et al.
Publicado: (2023)
por: Li, Chenran, et al.
Publicado: (2023)
Energy-Based Preference Model Offers Better Offline Alignment than the Bradley-Terry Preference Model
por: Hong, Yuzhong, et al.
Publicado: (2024)
por: Hong, Yuzhong, et al.
Publicado: (2024)
Transfer Learning with Pre-trained Conditional Generative Models
por: Yamaguchi, Shin'ya, et al.
Publicado: (2022)
por: Yamaguchi, Shin'ya, et al.
Publicado: (2022)
Preference Elicitation for Offline Reinforcement Learning
por: Pace, Alizée, et al.
Publicado: (2024)
por: Pace, Alizée, et al.
Publicado: (2024)
Online Pre-Training for Offline-to-Online Reinforcement Learning
por: Shin, Yongjae, et al.
Publicado: (2025)
por: Shin, Yongjae, et al.
Publicado: (2025)
Robust Anomaly Detection Under Normality Distribution Shift in Dynamic Graphs
por: Xu, Xiaoyang, et al.
Publicado: (2025)
por: Xu, Xiaoyang, et al.
Publicado: (2025)
Offline Clustering of Preference Learning with Active-data Augmentation
por: Liu, Jingyuan, et al.
Publicado: (2025)
por: Liu, Jingyuan, et al.
Publicado: (2025)
COOPO: Cyclic Offline-Online Policy Optimization Algorithm
por: Liu, Qisai, et al.
Publicado: (2026)
por: Liu, Qisai, et al.
Publicado: (2026)
Fat-to-Thin Policy Optimization: Offline RL with Sparse Policies
por: Zhu, Lingwei, et al.
Publicado: (2025)
por: Zhu, Lingwei, et al.
Publicado: (2025)
Adaptive Policy Selection and Fine-Tuning under Interaction Budgets for Offline-to-Online Reinforcement Learning
por: Bozkurt, Alper Kamil, et al.
Publicado: (2026)
por: Bozkurt, Alper Kamil, et al.
Publicado: (2026)
Bayesian Design Principles for Offline-to-Online Reinforcement Learning
por: Hu, Hao, et al.
Publicado: (2024)
por: Hu, Hao, et al.
Publicado: (2024)
From Reward-Free Representations to Preferences: Rethinking Offline Preference-Based Reinforcement Learning
por: Yang, Jun-Jie, et al.
Publicado: (2026)
por: Yang, Jun-Jie, et al.
Publicado: (2026)
Behavior Preference Regression for Offline Reinforcement Learning
por: Srinivasan, Padmanaba, et al.
Publicado: (2025)
por: Srinivasan, Padmanaba, et al.
Publicado: (2025)
OLLIE: Imitation Learning from Offline Pretraining to Online Finetuning
por: Yue, Sheng, et al.
Publicado: (2024)
por: Yue, Sheng, et al.
Publicado: (2024)
Information-Directed Offline-to-Online Reinforcement Learning
por: Chen, Keru
Publicado: (2026)
por: Chen, Keru
Publicado: (2026)
Policy-labeled Preference Learning: Is Preference Enough for RLHF?
por: Cho, Taehyun, et al.
Publicado: (2025)
por: Cho, Taehyun, et al.
Publicado: (2025)
Value-Incentivized Preference Optimization: A Unified Approach to Online and Offline RLHF
por: Cen, Shicong, et al.
Publicado: (2024)
por: Cen, Shicong, et al.
Publicado: (2024)
Offline-Online Reinforcement Learning for Linear Mixture MDPs
por: Zhang, Zhongjun, et al.
Publicado: (2026)
por: Zhang, Zhongjun, et al.
Publicado: (2026)
Making Offline RL Online: Collaborative World Models for Offline Visual Reinforcement Learning
por: Wang, Qi, et al.
Publicado: (2023)
por: Wang, Qi, et al.
Publicado: (2023)
Energy-Guided Diffusion Sampling for Offline-to-Online Reinforcement Learning
por: Liu, Xu-Hui, et al.
Publicado: (2024)
por: Liu, Xu-Hui, et al.
Publicado: (2024)
Constrained Policy Optimization with Explicit Behavior Density for Offline Reinforcement Learning
por: Zhang, Jing, et al.
Publicado: (2023)
por: Zhang, Jing, et al.
Publicado: (2023)
In-Dataset Trajectory Return Regularization for Offline Preference-based Reinforcement Learning
por: Tu, Songjun, et al.
Publicado: (2024)
por: Tu, Songjun, et al.
Publicado: (2024)
Ejemplares similares
-
Treatment Effect Estimation with Differentiated Networked Effect on Graph Data
por: Lin, Xiaofeng, et al.
Publicado: (2026) -
Enhancing Chess Reinforcement Learning with Graph Representation
por: Rigaux, Tomas, et al.
Publicado: (2024) -
Adaptive Discovery of Interpretable Audio Attributes with Multimodal LLMs for Low-Resource Classification
por: Yoshimura, Kosuke, et al.
Publicado: (2026) -
Hierarchical Text Classification Using Black Box Large Language Models
por: Yoshimura, Kosuke, et al.
Publicado: (2025) -
Mitigating Cognitive Biases in Multi-Criteria Crowd Assessment
por: Ito, Shun, et al.
Publicado: (2024)