Reinforcement Learning from Diverse Human Preferences
Fuente:
arXiv
Guardado en:
| Autores principales: | Xue, Wanqi, An, Bo, Yan, Shuicheng, Xu, Zhongwen |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Learning to Optimize for Reinforcement Learning
por: Lan, Qingfeng, et al.
Publicado: (2023)
por: Lan, Qingfeng, et al.
Publicado: (2023)
Mutual Information Regularized Offline Reinforcement Learning
por: Ma, Xiao, et al.
Publicado: (2022)
por: Ma, Xiao, et al.
Publicado: (2022)
Policy Regularization on Globally Accessible States in Cross-Dynamics Reinforcement Learning
por: Xue, Zhenghai, et al.
Publicado: (2025)
por: Xue, Zhenghai, et al.
Publicado: (2025)
Uncertainty-Penalized Reinforcement Learning from Human Feedback with Diverse Reward LoRA Ensembles
por: Zhai, Yuanzhao, et al.
Publicado: (2023)
por: Zhai, Yuanzhao, et al.
Publicado: (2023)
Multi-turn Reinforcement Learning from Preference Human Feedback
por: Shani, Lior, et al.
Publicado: (2024)
por: Shani, Lior, et al.
Publicado: (2024)
CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries
por: Mu, Ni, et al.
Publicado: (2025)
por: Mu, Ni, et al.
Publicado: (2025)
Multi-Type Preference Learning: Empowering Preference-Based Reinforcement Learning with Equal Preferences
por: Liu, Ziang, et al.
Publicado: (2024)
por: Liu, Ziang, et al.
Publicado: (2024)
SMPLer: Taming Transformers for Monocular 3D Human Shape and Pose Estimation
por: Xu, Xiangyu, et al.
Publicado: (2024)
por: Xu, Xiangyu, et al.
Publicado: (2024)
STAIR: Addressing Stage Misalignment through Temporal-Aligned Preference Reinforcement Learning
por: Luan, Yao, et al.
Publicado: (2025)
por: Luan, Yao, et al.
Publicado: (2025)
Online Iterative Reinforcement Learning from Human Feedback with General Preference Model
por: Ye, Chenlu, et al.
Publicado: (2024)
por: Ye, Chenlu, et al.
Publicado: (2024)
Adaptive Preference Scaling for Reinforcement Learning with Human Feedback
por: Hong, Ilgee, et al.
Publicado: (2024)
por: Hong, Ilgee, et al.
Publicado: (2024)
Swap-guided Preference Learning for Personalized Reinforcement Learning from Human Feedback
por: Kim, Gihoon, et al.
Publicado: (2026)
por: Kim, Gihoon, et al.
Publicado: (2026)
Cogito, Ergo Ludo: An Agent that Learns to Play by Reasoning and Planning
por: Wang, Sai, et al.
Publicado: (2025)
por: Wang, Sai, et al.
Publicado: (2025)
OPRIDE: Offline Preference-based Reinforcement Learning via In-Dataset Exploration
por: Yang, Yiqin, et al.
Publicado: (2026)
por: Yang, Yiqin, et al.
Publicado: (2026)
Single-stream Policy Optimization
por: Xu, Zhongwen, et al.
Publicado: (2025)
por: Xu, Zhongwen, et al.
Publicado: (2025)
Understanding Tool-Integrated Reasoning
por: Lin, Heng, et al.
Publicado: (2025)
por: Lin, Heng, et al.
Publicado: (2025)
MoE++: Accelerating Mixture-of-Experts Methods with Zero-Computation Experts
por: Jin, Peng, et al.
Publicado: (2024)
por: Jin, Peng, et al.
Publicado: (2024)
Efficient Reinforcement Learning from Human Feedback via Bayesian Preference Inference
por: Cercola, Matteo, et al.
Publicado: (2025)
por: Cercola, Matteo, et al.
Publicado: (2025)
Personalizing Reinforcement Learning from Human Feedback with Variational Preference Learning
por: Poddar, Sriyash, et al.
Publicado: (2024)
por: Poddar, Sriyash, et al.
Publicado: (2024)
Preference Conditioned Multi-Objective Reinforcement Learning: Decomposed, Diversity-Driven Policy Optimization
por: Ambadkar, Tanmay, et al.
Publicado: (2026)
por: Ambadkar, Tanmay, et al.
Publicado: (2026)
Combinatorial Reinforcement Learning with Preference Feedback
por: Lee, Joongkyu, et al.
Publicado: (2025)
por: Lee, Joongkyu, et al.
Publicado: (2025)
Reinforcement Learning from Adversarial Preferences in Tabular MDPs
por: Tsuchiya, Taira, et al.
Publicado: (2025)
por: Tsuchiya, Taira, et al.
Publicado: (2025)
Preference VLM: Leveraging VLMs for Scalable Preference-Based Reinforcement Learning
por: Ghosh, Udita, et al.
Publicado: (2025)
por: Ghosh, Udita, et al.
Publicado: (2025)
Hindsight Preference Learning for Offline Preference-based Reinforcement Learning
por: Gao, Chen-Xiao, et al.
Publicado: (2024)
por: Gao, Chen-Xiao, et al.
Publicado: (2024)
General Preference Reinforcement Learning
por: Umer, Muhammad, et al.
Publicado: (2026)
por: Umer, Muhammad, et al.
Publicado: (2026)
Provable Multi-Party Reinforcement Learning with Diverse Human Feedback
por: Zhong, Huiying, et al.
Publicado: (2024)
por: Zhong, Huiying, et al.
Publicado: (2024)
Preference-based Multi-Objective Reinforcement Learning
por: Mu, Ni, et al.
Publicado: (2025)
por: Mu, Ni, et al.
Publicado: (2025)
Preference-Guided Reinforcement Learning for Efficient Exploration
por: Wang, Guojian, et al.
Publicado: (2024)
por: Wang, Guojian, et al.
Publicado: (2024)
Binary Reward Labeling: Bridging Offline Preference and Reward-Based Reinforcement Learning
por: Xu, Yinglun, et al.
Publicado: (2024)
por: Xu, Yinglun, et al.
Publicado: (2024)
Efficient Preference-based Reinforcement Learning via Aligned Experience Estimation
por: Bai, Fengshuo, et al.
Publicado: (2024)
por: Bai, Fengshuo, et al.
Publicado: (2024)
Large Language Model-Enhanced Reinforcement Learning for Diverse and Novel Recommendations
por: Woo, Jiin, et al.
Publicado: (2025)
por: Woo, Jiin, et al.
Publicado: (2025)
Sample Efficient Myopic Exploration Through Multitask Reinforcement Learning with Diverse Tasks
por: Xu, Ziping, et al.
Publicado: (2024)
por: Xu, Ziping, et al.
Publicado: (2024)
Leveraging Error Diversity in Group Rollouts for Reinforcement Learning
por: Liu, Wenpu, et al.
Publicado: (2026)
por: Liu, Wenpu, et al.
Publicado: (2026)
From Reward-Free Representations to Preferences: Rethinking Offline Preference-Based Reinforcement Learning
por: Yang, Jun-Jie, et al.
Publicado: (2026)
por: Yang, Jun-Jie, et al.
Publicado: (2026)
Query-Policy Misalignment in Preference-Based Reinforcement Learning
por: Hu, Xiao, et al.
Publicado: (2023)
por: Hu, Xiao, et al.
Publicado: (2023)
MoH: Multi-Head Attention as Mixture-of-Head Attention
por: Jin, Peng, et al.
Publicado: (2024)
por: Jin, Peng, et al.
Publicado: (2024)
Preference Elicitation for Offline Reinforcement Learning
por: Pace, Alizée, et al.
Publicado: (2024)
por: Pace, Alizée, et al.
Publicado: (2024)
Regret Bounds for Reinforcement Learning from Multi-Source Imperfect Preferences
por: Shi, Ming, et al.
Publicado: (2026)
por: Shi, Ming, et al.
Publicado: (2026)
MaxMin-RLHF: Alignment with Diverse Human Preferences
por: Chakraborty, Souradip, et al.
Publicado: (2024)
por: Chakraborty, Souradip, et al.
Publicado: (2024)
Deep Reinforcement Learning from Hierarchical Preference Design
por: Bukharin, Alexander, et al.
Publicado: (2023)
por: Bukharin, Alexander, et al.
Publicado: (2023)
Ejemplares similares
-
Learning to Optimize for Reinforcement Learning
por: Lan, Qingfeng, et al.
Publicado: (2023) -
Mutual Information Regularized Offline Reinforcement Learning
por: Ma, Xiao, et al.
Publicado: (2022) -
Policy Regularization on Globally Accessible States in Cross-Dynamics Reinforcement Learning
por: Xue, Zhenghai, et al.
Publicado: (2025) -
Uncertainty-Penalized Reinforcement Learning from Human Feedback with Diverse Reward LoRA Ensembles
por: Zhai, Yuanzhao, et al.
Publicado: (2023) -
Multi-turn Reinforcement Learning from Preference Human Feedback
por: Shani, Lior, et al.
Publicado: (2024)