Reinforcement Learning from Human Feedback without Reward Inference: Model-Free Algorithm and Instance-Dependent Analysis
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhang, Qining, Wei, Honghao, Ying, Lei |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Zeroth-Order Policy Gradient for Reinforcement Learning from Human Feedback without Reward Inference
von: Zhang, Qining, et al.
Veröffentlicht: (2024)
von: Zhang, Qining, et al.
Veröffentlicht: (2024)
Provable Reinforcement Learning from Human Feedback with an Unknown Link Function
von: Zhang, Qining, et al.
Veröffentlicht: (2025)
von: Zhang, Qining, et al.
Veröffentlicht: (2025)
Fast and Regret Optimal Best Arm Identification: Fundamental Limits and Low-Complexity Algorithms
von: Zhang, Qining, et al.
Veröffentlicht: (2023)
von: Zhang, Qining, et al.
Veröffentlicht: (2023)
Dense Reward for Free in Reinforcement Learning from Human Feedback
von: Chan, Alex J., et al.
Veröffentlicht: (2024)
von: Chan, Alex J., et al.
Veröffentlicht: (2024)
Model-Free, Regret-Optimal Best Policy Identification in Online CMDPs
von: Zhou, Zihan, et al.
Veröffentlicht: (2023)
von: Zhou, Zihan, et al.
Veröffentlicht: (2023)
Privacy-Preserving Reinforcement Learning from Human Feedback via Decoupled Reward Modeling
von: Cho, Young Hyun, et al.
Veröffentlicht: (2026)
von: Cho, Young Hyun, et al.
Veröffentlicht: (2026)
Uncertainty-Penalized Reinforcement Learning from Human Feedback with Diverse Reward LoRA Ensembles
von: Zhai, Yuanzhao, et al.
Veröffentlicht: (2023)
von: Zhai, Yuanzhao, et al.
Veröffentlicht: (2023)
Cost Aware Best Arm Identification
von: Kanarios, Kellen, et al.
Veröffentlicht: (2024)
von: Kanarios, Kellen, et al.
Veröffentlicht: (2024)
Efficient Federated RLHF via Zeroth-Order Policy Optimization
von: Wang, Deyi, et al.
Veröffentlicht: (2026)
von: Wang, Deyi, et al.
Veröffentlicht: (2026)
A Reward-Free Viewpoint on Multi-Objective Reinforcement Learning
von: Chen, Ying-Tu, et al.
Veröffentlicht: (2026)
von: Chen, Ying-Tu, et al.
Veröffentlicht: (2026)
Improving Reinforcement Learning from Human Feedback with Efficient Reward Model Ensemble
von: Zhang, Shun, et al.
Veröffentlicht: (2024)
von: Zhang, Shun, et al.
Veröffentlicht: (2024)
Enhancing Safety in Reinforcement Learning with Human Feedback via Rectified Policy Optimization
von: Peng, Xiyue, et al.
Veröffentlicht: (2024)
von: Peng, Xiyue, et al.
Veröffentlicht: (2024)
Off-Policy Corrected Reward Modeling for Reinforcement Learning from Human Feedback
von: Ackermann, Johannes, et al.
Veröffentlicht: (2025)
von: Ackermann, Johannes, et al.
Veröffentlicht: (2025)
Online Iterative Reinforcement Learning from Human Feedback with General Preference Model
von: Ye, Chenlu, et al.
Veröffentlicht: (2024)
von: Ye, Chenlu, et al.
Veröffentlicht: (2024)
Scaling Reward Modeling without Human Supervision
von: Fan, Jingxuan, et al.
Veröffentlicht: (2026)
von: Fan, Jingxuan, et al.
Veröffentlicht: (2026)
Policy Learning from Large Vision-Language Model Feedback without Reward Modeling
von: Luu, Tung M., et al.
Veröffentlicht: (2025)
von: Luu, Tung M., et al.
Veröffentlicht: (2025)
REBEL: Reward Regularization-Based Approach for Robotic Reinforcement Learning from Human Feedback
von: Chakraborty, Souradip, et al.
Veröffentlicht: (2023)
von: Chakraborty, Souradip, et al.
Veröffentlicht: (2023)
Uncertainty Quantification for Large Language Model Reward Learning under Heterogeneous Human Feedback
von: Liu, Pangpang, et al.
Veröffentlicht: (2025)
von: Liu, Pangpang, et al.
Veröffentlicht: (2025)
Constrained Reinforcement Learning with Average Reward Objective: Model-Based and Model-Free Algorithms
von: Aggarwal, Vaneet, et al.
Veröffentlicht: (2024)
von: Aggarwal, Vaneet, et al.
Veröffentlicht: (2024)
Gradient Regularization Prevents Reward Hacking in Reinforcement Learning from Human Feedback and Verifiable Rewards
von: Ackermann, Johannes, et al.
Veröffentlicht: (2026)
von: Ackermann, Johannes, et al.
Veröffentlicht: (2026)
Dual Active Learning for Reinforcement Learning from Human Feedback
von: Liu, Pangpang, et al.
Veröffentlicht: (2024)
von: Liu, Pangpang, et al.
Veröffentlicht: (2024)
Reinforcement Learning from Human Feedback
von: Lambert, Nathan
Veröffentlicht: (2025)
von: Lambert, Nathan
Veröffentlicht: (2025)
Tackling Heavy-Tailed Rewards in Reinforcement Learning with Function Approximation: Minimax Optimal and Instance-Dependent Regret Bounds
von: Huang, Jiayi, et al.
Veröffentlicht: (2023)
von: Huang, Jiayi, et al.
Veröffentlicht: (2023)
Reinforcement Learning from Human Feedback: A Statistical Perspective
von: Liu, Pangpang, et al.
Veröffentlicht: (2026)
von: Liu, Pangpang, et al.
Veröffentlicht: (2026)
Which Rewards Matter? Reward Selection for Reinforcement Learning under Limited Feedback
von: Chaudhari, Shreyas, et al.
Veröffentlicht: (2025)
von: Chaudhari, Shreyas, et al.
Veröffentlicht: (2025)
Robust Reinforcement Learning from Corrupted Human Feedback
von: Bukharin, Alexander, et al.
Veröffentlicht: (2024)
von: Bukharin, Alexander, et al.
Veröffentlicht: (2024)
TIC-GRPO: Provable and Efficient Optimization for Reinforcement Learning from Human Feedback
von: Pang, Lei, et al.
Veröffentlicht: (2025)
von: Pang, Lei, et al.
Veröffentlicht: (2025)
Reinforcement Learning without Human Feedback for Last Mile Fine-Tuning of Large Language Models
von: Solway, Alec
Veröffentlicht: (2024)
von: Solway, Alec
Veröffentlicht: (2024)
Efficient Reinforcement Learning from Human Feedback via Bayesian Preference Inference
von: Cercola, Matteo, et al.
Veröffentlicht: (2025)
von: Cercola, Matteo, et al.
Veröffentlicht: (2025)
Constraints as Rewards: Reinforcement Learning for Robots without Reward Functions
von: Ishihara, Yu, et al.
Veröffentlicht: (2025)
von: Ishihara, Yu, et al.
Veröffentlicht: (2025)
Low-Rank Contextual Reinforcement Learning from Heterogeneous Human Feedback
von: Lee, Seong Jin, et al.
Veröffentlicht: (2024)
von: Lee, Seong Jin, et al.
Veröffentlicht: (2024)
Strategyproof Reinforcement Learning from Human Feedback
von: Buening, Thomas Kleine, et al.
Veröffentlicht: (2025)
von: Buening, Thomas Kleine, et al.
Veröffentlicht: (2025)
Using Human Feedback to Fine-tune Diffusion Models without Any Reward Model
von: Yang, Kai, et al.
Veröffentlicht: (2023)
von: Yang, Kai, et al.
Veröffentlicht: (2023)
Adaptive Querying for Reward Learning from Human Feedback
von: Anand, Yashwanthi, et al.
Veröffentlicht: (2024)
von: Anand, Yashwanthi, et al.
Veröffentlicht: (2024)
A Large Language Model-Driven Reward Design Framework via Dynamic Feedback for Reinforcement Learning
von: Sun, Shengjie, et al.
Veröffentlicht: (2024)
von: Sun, Shengjie, et al.
Veröffentlicht: (2024)
Data-dependent Exploration for Online Reinforcement Learning from Human Feedback
von: Zhang, Zhen-Yu, et al.
Veröffentlicht: (2026)
von: Zhang, Zhen-Yu, et al.
Veröffentlicht: (2026)
Towards User-level Private Reinforcement Learning with Human Feedback
von: Zhang, Jiaming, et al.
Veröffentlicht: (2025)
von: Zhang, Jiaming, et al.
Veröffentlicht: (2025)
Instance-Dependent Continuous-Time Reinforcement Learning via Maximum Likelihood Estimation
von: Zhao, Runze, et al.
Veröffentlicht: (2025)
von: Zhao, Runze, et al.
Veröffentlicht: (2025)
Instance Selection for Dynamic Algorithm Configuration with Reinforcement Learning: Improving Generalization
von: Benjamins, Carolin, et al.
Veröffentlicht: (2024)
von: Benjamins, Carolin, et al.
Veröffentlicht: (2024)
Policy Gradient Primal-Dual Method for Safe Reinforcement Learning from Human Feedback
von: Liu, Qiang, et al.
Veröffentlicht: (2026)
von: Liu, Qiang, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Zeroth-Order Policy Gradient for Reinforcement Learning from Human Feedback without Reward Inference
von: Zhang, Qining, et al.
Veröffentlicht: (2024) -
Provable Reinforcement Learning from Human Feedback with an Unknown Link Function
von: Zhang, Qining, et al.
Veröffentlicht: (2025) -
Fast and Regret Optimal Best Arm Identification: Fundamental Limits and Low-Complexity Algorithms
von: Zhang, Qining, et al.
Veröffentlicht: (2023) -
Dense Reward for Free in Reinforcement Learning from Human Feedback
von: Chan, Alex J., et al.
Veröffentlicht: (2024) -
Model-Free, Regret-Optimal Best Policy Identification in Online CMDPs
von: Zhou, Zihan, et al.
Veröffentlicht: (2023)