Online Iterative Reinforcement Learning from Human Feedback with General Preference Model
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Ye, Chenlu, Xiong, Wei, Zhang, Yuheng, Dong, Hanze, Jiang, Nan, Zhang, Tong |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Iterative Preference Learning from Human Feedback: Bridging Theory and Practice for RLHF under KL-Constraint
von: Xiong, Wei, et al.
Veröffentlicht: (2023)
von: Xiong, Wei, et al.
Veröffentlicht: (2023)
Logarithmic Regret for Online KL-Regularized Reinforcement Learning
von: Zhao, Heyang, et al.
Veröffentlicht: (2025)
von: Zhao, Heyang, et al.
Veröffentlicht: (2025)
Reinforce-Ada: An Adaptive Sampling Framework under Non-linear RL Objectives
von: Xiong, Wei, et al.
Veröffentlicht: (2025)
von: Xiong, Wei, et al.
Veröffentlicht: (2025)
Corruption-Robust Offline Reinforcement Learning with General Function Approximation
von: Ye, Chenlu, et al.
Veröffentlicht: (2023)
von: Ye, Chenlu, et al.
Veröffentlicht: (2023)
Towards Robust Model-Based Reinforcement Learning Against Adversarial Corruption
von: Ye, Chenlu, et al.
Veröffentlicht: (2024)
von: Ye, Chenlu, et al.
Veröffentlicht: (2024)
Self-rewarding correction for mathematical reasoning
von: Xiong, Wei, et al.
Veröffentlicht: (2025)
von: Xiong, Wei, et al.
Veröffentlicht: (2025)
RLHF Workflow: From Reward Modeling to Online RLHF
von: Dong, Hanze, et al.
Veröffentlicht: (2024)
von: Dong, Hanze, et al.
Veröffentlicht: (2024)
Rethinking Importance Sampling in LLM Policy Optimization: A Cumulative Token Perspective
von: Zhang, Yuheng, et al.
Veröffentlicht: (2026)
von: Zhang, Yuheng, et al.
Veröffentlicht: (2026)
Contextual Online Uncertainty-Aware Preference Learning for Human Feedback
von: Lu, Nan, et al.
Veröffentlicht: (2025)
von: Lu, Nan, et al.
Veröffentlicht: (2025)
Iterative Nash Policy Optimization: Aligning LLMs with General Preferences via No-Regret Learning
von: Zhang, Yuheng, et al.
Veröffentlicht: (2024)
von: Zhang, Yuheng, et al.
Veröffentlicht: (2024)
Corruption-Robust Algorithms with Uncertainty Weighting for Nonlinear Contextual Bandits and Markov Decision Processes
von: Ye, Chenlu, et al.
Veröffentlicht: (2022)
von: Ye, Chenlu, et al.
Veröffentlicht: (2022)
Data-dependent Exploration for Online Reinforcement Learning from Human Feedback
von: Zhang, Zhen-Yu, et al.
Veröffentlicht: (2026)
von: Zhang, Zhen-Yu, et al.
Veröffentlicht: (2026)
Optimizing Chain-of-Thought Reasoners via Gradient Variance Minimization in Rejection Sampling and RL
von: Yao, Jiarui, et al.
Veröffentlicht: (2025)
von: Yao, Jiarui, et al.
Veröffentlicht: (2025)
Improving LLM General Preference Alignment via Optimistic Online Mirror Descent
von: Zhang, Yuheng, et al.
Veröffentlicht: (2025)
von: Zhang, Yuheng, et al.
Veröffentlicht: (2025)
Adaptive Preference Scaling for Reinforcement Learning with Human Feedback
von: Hong, Ilgee, et al.
Veröffentlicht: (2024)
von: Hong, Ilgee, et al.
Veröffentlicht: (2024)
Online Preference-based Reinforcement Learning with Self-augmented Feedback from Large Language Model
von: Tu, Songjun, et al.
Veröffentlicht: (2024)
von: Tu, Songjun, et al.
Veröffentlicht: (2024)
A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce
von: Xiong, Wei, et al.
Veröffentlicht: (2025)
von: Xiong, Wei, et al.
Veröffentlicht: (2025)
Multi-turn Reinforcement Learning from Preference Human Feedback
von: Shani, Lior, et al.
Veröffentlicht: (2024)
von: Shani, Lior, et al.
Veröffentlicht: (2024)
Robust Reinforcement Learning from Corrupted Human Feedback
von: Bukharin, Alexander, et al.
Veröffentlicht: (2024)
von: Bukharin, Alexander, et al.
Veröffentlicht: (2024)
DOPL: Direct Online Preference Learning for Restless Bandits with Preference Feedback
von: Xiong, Guojun, et al.
Veröffentlicht: (2024)
von: Xiong, Guojun, et al.
Veröffentlicht: (2024)
Self-Hinting Language Models Enhance Reinforcement Learning
von: Liao, Baohao, et al.
Veröffentlicht: (2026)
von: Liao, Baohao, et al.
Veröffentlicht: (2026)
Extragradient Preference Optimization (EGPO): Beyond Last-Iterate Convergence for Nash Learning from Human Feedback
von: Zhou, Runlong, et al.
Veröffentlicht: (2025)
von: Zhou, Runlong, et al.
Veröffentlicht: (2025)
Building Math Agents with Multi-Turn Iterative Preference Learning
von: Xiong, Wei, et al.
Veröffentlicht: (2024)
von: Xiong, Wei, et al.
Veröffentlicht: (2024)
Automatic Curriculum Expert Iteration for Reliable LLM Reasoning
von: Zhao, Zirui, et al.
Veröffentlicht: (2024)
von: Zhao, Zirui, et al.
Veröffentlicht: (2024)
Combinatorial Reinforcement Learning with Preference Feedback
von: Lee, Joongkyu, et al.
Veröffentlicht: (2025)
von: Lee, Joongkyu, et al.
Veröffentlicht: (2025)
Swap-guided Preference Learning for Personalized Reinforcement Learning from Human Feedback
von: Kim, Gihoon, et al.
Veröffentlicht: (2026)
von: Kim, Gihoon, et al.
Veröffentlicht: (2026)
Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models
von: Hao, Yifan, et al.
Veröffentlicht: (2025)
von: Hao, Yifan, et al.
Veröffentlicht: (2025)
Reinforcement Learning from Human Feedback without Reward Inference: Model-Free Algorithm and Instance-Dependent Analysis
von: Zhang, Qining, et al.
Veröffentlicht: (2024)
von: Zhang, Qining, et al.
Veröffentlicht: (2024)
Personalizing Reinforcement Learning from Human Feedback with Variational Preference Learning
von: Poddar, Sriyash, et al.
Veröffentlicht: (2024)
von: Poddar, Sriyash, et al.
Veröffentlicht: (2024)
On the Curses of Future and History in Future-dependent Value Functions for Off-policy Evaluation
von: Zhang, Yuheng, et al.
Veröffentlicht: (2024)
von: Zhang, Yuheng, et al.
Veröffentlicht: (2024)
Statistical Tractability of Off-policy Evaluation of History-dependent Policies in POMDPs
von: Zhang, Yuheng, et al.
Veröffentlicht: (2025)
von: Zhang, Yuheng, et al.
Veröffentlicht: (2025)
Efficient Reinforcement Learning from Human Feedback via Bayesian Preference Inference
von: Cercola, Matteo, et al.
Veröffentlicht: (2025)
von: Cercola, Matteo, et al.
Veröffentlicht: (2025)
Dual Active Learning for Reinforcement Learning from Human Feedback
von: Liu, Pangpang, et al.
Veröffentlicht: (2024)
von: Liu, Pangpang, et al.
Veröffentlicht: (2024)
Sharp Analysis for KL-Regularized Contextual Bandits and RLHF
von: Zhao, Heyang, et al.
Veröffentlicht: (2024)
von: Zhao, Heyang, et al.
Veröffentlicht: (2024)
Catoni Contextual Bandits are Robust to Heavy-tailed Rewards
von: Ye, Chenlu, et al.
Veröffentlicht: (2025)
von: Ye, Chenlu, et al.
Veröffentlicht: (2025)
Provable Reinforcement Learning from Human Feedback with an Unknown Link Function
von: Zhang, Qining, et al.
Veröffentlicht: (2025)
von: Zhang, Qining, et al.
Veröffentlicht: (2025)
Iterative Refinement of Flow Policies in Probability Space for Online Reinforcement Learning
von: Sun, Mingyang, et al.
Veröffentlicht: (2025)
von: Sun, Mingyang, et al.
Veröffentlicht: (2025)
Reinforcement Learning from Human Feedback
von: Lambert, Nathan
Veröffentlicht: (2025)
von: Lambert, Nathan
Veröffentlicht: (2025)
Reinforcement Learning from Human Feedback: A Statistical Perspective
von: Liu, Pangpang, et al.
Veröffentlicht: (2026)
von: Liu, Pangpang, et al.
Veröffentlicht: (2026)
Privacy-Preserving Reinforcement Learning from Human Feedback via Decoupled Reward Modeling
von: Cho, Young Hyun, et al.
Veröffentlicht: (2026)
von: Cho, Young Hyun, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Iterative Preference Learning from Human Feedback: Bridging Theory and Practice for RLHF under KL-Constraint
von: Xiong, Wei, et al.
Veröffentlicht: (2023) -
Logarithmic Regret for Online KL-Regularized Reinforcement Learning
von: Zhao, Heyang, et al.
Veröffentlicht: (2025) -
Reinforce-Ada: An Adaptive Sampling Framework under Non-linear RL Objectives
von: Xiong, Wei, et al.
Veröffentlicht: (2025) -
Corruption-Robust Offline Reinforcement Learning with General Function Approximation
von: Ye, Chenlu, et al.
Veröffentlicht: (2023) -
Towards Robust Model-Based Reinforcement Learning Against Adversarial Corruption
von: Ye, Chenlu, et al.
Veröffentlicht: (2024)