Reinforcement Learning from Human Feedback
Fuente:
arXiv
Gespeichert in:
| 1. Verfasser: | Lambert, Nathan |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
The Alignment Ceiling: Objective Mismatch in Reinforcement Learning from Human Feedback
von: Lambert, Nathan, et al.
Veröffentlicht: (2023)
von: Lambert, Nathan, et al.
Veröffentlicht: (2023)
Strategyproof Reinforcement Learning from Human Feedback
von: Buening, Thomas Kleine, et al.
Veröffentlicht: (2025)
von: Buening, Thomas Kleine, et al.
Veröffentlicht: (2025)
Robust Reinforcement Learning from Corrupted Human Feedback
von: Bukharin, Alexander, et al.
Veröffentlicht: (2024)
von: Bukharin, Alexander, et al.
Veröffentlicht: (2024)
Dual Active Learning for Reinforcement Learning from Human Feedback
von: Liu, Pangpang, et al.
Veröffentlicht: (2024)
von: Liu, Pangpang, et al.
Veröffentlicht: (2024)
Reinforcement Learning from Multi-level and Episodic Human Feedback
von: Elahi, Muhammad Qasim, et al.
Veröffentlicht: (2025)
von: Elahi, Muhammad Qasim, et al.
Veröffentlicht: (2025)
Reinforcement Learning from Human Feedback: A Statistical Perspective
von: Liu, Pangpang, et al.
Veröffentlicht: (2026)
von: Liu, Pangpang, et al.
Veröffentlicht: (2026)
A Minimaximalist Approach to Reinforcement Learning from Human Feedback
von: Swamy, Gokul, et al.
Veröffentlicht: (2024)
von: Swamy, Gokul, et al.
Veröffentlicht: (2024)
Dense Reward for Free in Reinforcement Learning from Human Feedback
von: Chan, Alex J., et al.
Veröffentlicht: (2024)
von: Chan, Alex J., et al.
Veröffentlicht: (2024)
Multi-turn Reinforcement Learning from Preference Human Feedback
von: Shani, Lior, et al.
Veröffentlicht: (2024)
von: Shani, Lior, et al.
Veröffentlicht: (2024)
The Power of Active Multi-Task Learning in Reinforcement Learning from Human Feedback
von: Chen, Ruitao, et al.
Veröffentlicht: (2024)
von: Chen, Ruitao, et al.
Veröffentlicht: (2024)
Provable Reinforcement Learning from Human Feedback with an Unknown Link Function
von: Zhang, Qining, et al.
Veröffentlicht: (2025)
von: Zhang, Qining, et al.
Veröffentlicht: (2025)
Low-Rank Contextual Reinforcement Learning from Heterogeneous Human Feedback
von: Lee, Seong Jin, et al.
Veröffentlicht: (2024)
von: Lee, Seong Jin, et al.
Veröffentlicht: (2024)
Data-dependent Exploration for Online Reinforcement Learning from Human Feedback
von: Zhang, Zhen-Yu, et al.
Veröffentlicht: (2026)
von: Zhang, Zhen-Yu, et al.
Veröffentlicht: (2026)
A Survey of Reinforcement Learning from Human Feedback
von: Kaufmann, Timo, et al.
Veröffentlicht: (2023)
von: Kaufmann, Timo, et al.
Veröffentlicht: (2023)
A Unified View on Solving Objective Mismatch in Model-Based Reinforcement Learning
von: Wei, Ran, et al.
Veröffentlicht: (2023)
von: Wei, Ran, et al.
Veröffentlicht: (2023)
TIC-GRPO: Provable and Efficient Optimization for Reinforcement Learning from Human Feedback
von: Pang, Lei, et al.
Veröffentlicht: (2025)
von: Pang, Lei, et al.
Veröffentlicht: (2025)
Exploring Data Scaling Trends and Effects in Reinforcement Learning from Human Feedback
von: Shen, Wei, et al.
Veröffentlicht: (2025)
von: Shen, Wei, et al.
Veröffentlicht: (2025)
Online Iterative Reinforcement Learning from Human Feedback with General Preference Model
von: Ye, Chenlu, et al.
Veröffentlicht: (2024)
von: Ye, Chenlu, et al.
Veröffentlicht: (2024)
Parameter Efficient Reinforcement Learning from Human Feedback
von: Sidahmed, Hakim, et al.
Veröffentlicht: (2024)
von: Sidahmed, Hakim, et al.
Veröffentlicht: (2024)
Adaptive Preference Scaling for Reinforcement Learning with Human Feedback
von: Hong, Ilgee, et al.
Veröffentlicht: (2024)
von: Hong, Ilgee, et al.
Veröffentlicht: (2024)
Corruption Robust Offline Reinforcement Learning with Human Feedback
von: Mandal, Debmalya, et al.
Veröffentlicht: (2024)
von: Mandal, Debmalya, et al.
Veröffentlicht: (2024)
Swap-guided Preference Learning for Personalized Reinforcement Learning from Human Feedback
von: Kim, Gihoon, et al.
Veröffentlicht: (2026)
von: Kim, Gihoon, et al.
Veröffentlicht: (2026)
Distributionally Robust Reinforcement Learning with Human Feedback
von: Mandal, Debmalya, et al.
Veröffentlicht: (2025)
von: Mandal, Debmalya, et al.
Veröffentlicht: (2025)
Sample-Efficient Reinforcement Learning from Human Feedback via Information-Directed Sampling
von: Qi, Han, et al.
Veröffentlicht: (2025)
von: Qi, Han, et al.
Veröffentlicht: (2025)
Privacy-Preserving Reinforcement Learning from Human Feedback via Decoupled Reward Modeling
von: Cho, Young Hyun, et al.
Veröffentlicht: (2026)
von: Cho, Young Hyun, et al.
Veröffentlicht: (2026)
PARL: A Unified Framework for Policy Alignment in Reinforcement Learning from Human Feedback
von: Chakraborty, Souradip, et al.
Veröffentlicht: (2023)
von: Chakraborty, Souradip, et al.
Veröffentlicht: (2023)
Policy Gradient Primal-Dual Method for Safe Reinforcement Learning from Human Feedback
von: Liu, Qiang, et al.
Veröffentlicht: (2026)
von: Liu, Qiang, et al.
Veröffentlicht: (2026)
RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback
von: Lee, Harrison, et al.
Veröffentlicht: (2023)
von: Lee, Harrison, et al.
Veröffentlicht: (2023)
Towards User-level Private Reinforcement Learning with Human Feedback
von: Zhang, Jiaming, et al.
Veröffentlicht: (2025)
von: Zhang, Jiaming, et al.
Veröffentlicht: (2025)
Corruption-robust Offline Multi-agent Reinforcement Learning From Human Feedback
von: Nika, Andi, et al.
Veröffentlicht: (2026)
von: Nika, Andi, et al.
Veröffentlicht: (2026)
Reinforcement Learning with Segment Feedback
von: Du, Yihan, et al.
Veröffentlicht: (2025)
von: Du, Yihan, et al.
Veröffentlicht: (2025)
Uncertainty-Penalized Reinforcement Learning from Human Feedback with Diverse Reward LoRA Ensembles
von: Zhai, Yuanzhao, et al.
Veröffentlicht: (2023)
von: Zhai, Yuanzhao, et al.
Veröffentlicht: (2023)
Zeroth-Order Policy Gradient for Reinforcement Learning from Human Feedback without Reward Inference
von: Zhang, Qining, et al.
Veröffentlicht: (2024)
von: Zhang, Qining, et al.
Veröffentlicht: (2024)
A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback
von: Laleh, Alireza Rashidi, et al.
Veröffentlicht: (2024)
von: Laleh, Alireza Rashidi, et al.
Veröffentlicht: (2024)
Reinforcement Learning from Human Feedback with Active Queries
von: Ji, Kaixuan, et al.
Veröffentlicht: (2024)
von: Ji, Kaixuan, et al.
Veröffentlicht: (2024)
REBEL: Reward Regularization-Based Approach for Robotic Reinforcement Learning from Human Feedback
von: Chakraborty, Souradip, et al.
Veröffentlicht: (2023)
von: Chakraborty, Souradip, et al.
Veröffentlicht: (2023)
Flexible Blood Glucose Control: Offline Reinforcement Learning from Human Feedback
von: Emerson, Harry, et al.
Veröffentlicht: (2025)
von: Emerson, Harry, et al.
Veröffentlicht: (2025)
Efficient Reinforcement Learning from Human Feedback via Bayesian Preference Inference
von: Cercola, Matteo, et al.
Veröffentlicht: (2025)
von: Cercola, Matteo, et al.
Veröffentlicht: (2025)
Personalizing Reinforcement Learning from Human Feedback with Variational Preference Learning
von: Poddar, Sriyash, et al.
Veröffentlicht: (2024)
von: Poddar, Sriyash, et al.
Veröffentlicht: (2024)
Provable Multi-Party Reinforcement Learning with Diverse Human Feedback
von: Zhong, Huiying, et al.
Veröffentlicht: (2024)
von: Zhong, Huiying, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
The Alignment Ceiling: Objective Mismatch in Reinforcement Learning from Human Feedback
von: Lambert, Nathan, et al.
Veröffentlicht: (2023) -
Strategyproof Reinforcement Learning from Human Feedback
von: Buening, Thomas Kleine, et al.
Veröffentlicht: (2025) -
Robust Reinforcement Learning from Corrupted Human Feedback
von: Bukharin, Alexander, et al.
Veröffentlicht: (2024) -
Dual Active Learning for Reinforcement Learning from Human Feedback
von: Liu, Pangpang, et al.
Veröffentlicht: (2024) -
Reinforcement Learning from Multi-level and Episodic Human Feedback
von: Elahi, Muhammad Qasim, et al.
Veröffentlicht: (2025)