Online Iterative Reinforcement Learning from Human Feedback with General Preference Model
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ye, Chenlu, Xiong, Wei, Zhang, Yuheng, Dong, Hanze, Jiang, Nan, Zhang, Tong |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Iterative Preference Learning from Human Feedback: Bridging Theory and Practice for RLHF under KL-Constraint
par: Xiong, Wei, et autres
Publié: (2023)
par: Xiong, Wei, et autres
Publié: (2023)
Logarithmic Regret for Online KL-Regularized Reinforcement Learning
par: Zhao, Heyang, et autres
Publié: (2025)
par: Zhao, Heyang, et autres
Publié: (2025)
Reinforce-Ada: An Adaptive Sampling Framework under Non-linear RL Objectives
par: Xiong, Wei, et autres
Publié: (2025)
par: Xiong, Wei, et autres
Publié: (2025)
Corruption-Robust Offline Reinforcement Learning with General Function Approximation
par: Ye, Chenlu, et autres
Publié: (2023)
par: Ye, Chenlu, et autres
Publié: (2023)
Towards Robust Model-Based Reinforcement Learning Against Adversarial Corruption
par: Ye, Chenlu, et autres
Publié: (2024)
par: Ye, Chenlu, et autres
Publié: (2024)
Self-rewarding correction for mathematical reasoning
par: Xiong, Wei, et autres
Publié: (2025)
par: Xiong, Wei, et autres
Publié: (2025)
RLHF Workflow: From Reward Modeling to Online RLHF
par: Dong, Hanze, et autres
Publié: (2024)
par: Dong, Hanze, et autres
Publié: (2024)
Rethinking Importance Sampling in LLM Policy Optimization: A Cumulative Token Perspective
par: Zhang, Yuheng, et autres
Publié: (2026)
par: Zhang, Yuheng, et autres
Publié: (2026)
Contextual Online Uncertainty-Aware Preference Learning for Human Feedback
par: Lu, Nan, et autres
Publié: (2025)
par: Lu, Nan, et autres
Publié: (2025)
Iterative Nash Policy Optimization: Aligning LLMs with General Preferences via No-Regret Learning
par: Zhang, Yuheng, et autres
Publié: (2024)
par: Zhang, Yuheng, et autres
Publié: (2024)
Corruption-Robust Algorithms with Uncertainty Weighting for Nonlinear Contextual Bandits and Markov Decision Processes
par: Ye, Chenlu, et autres
Publié: (2022)
par: Ye, Chenlu, et autres
Publié: (2022)
Data-dependent Exploration for Online Reinforcement Learning from Human Feedback
par: Zhang, Zhen-Yu, et autres
Publié: (2026)
par: Zhang, Zhen-Yu, et autres
Publié: (2026)
Optimizing Chain-of-Thought Reasoners via Gradient Variance Minimization in Rejection Sampling and RL
par: Yao, Jiarui, et autres
Publié: (2025)
par: Yao, Jiarui, et autres
Publié: (2025)
Improving LLM General Preference Alignment via Optimistic Online Mirror Descent
par: Zhang, Yuheng, et autres
Publié: (2025)
par: Zhang, Yuheng, et autres
Publié: (2025)
Adaptive Preference Scaling for Reinforcement Learning with Human Feedback
par: Hong, Ilgee, et autres
Publié: (2024)
par: Hong, Ilgee, et autres
Publié: (2024)
Online Preference-based Reinforcement Learning with Self-augmented Feedback from Large Language Model
par: Tu, Songjun, et autres
Publié: (2024)
par: Tu, Songjun, et autres
Publié: (2024)
A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce
par: Xiong, Wei, et autres
Publié: (2025)
par: Xiong, Wei, et autres
Publié: (2025)
Multi-turn Reinforcement Learning from Preference Human Feedback
par: Shani, Lior, et autres
Publié: (2024)
par: Shani, Lior, et autres
Publié: (2024)
Robust Reinforcement Learning from Corrupted Human Feedback
par: Bukharin, Alexander, et autres
Publié: (2024)
par: Bukharin, Alexander, et autres
Publié: (2024)
DOPL: Direct Online Preference Learning for Restless Bandits with Preference Feedback
par: Xiong, Guojun, et autres
Publié: (2024)
par: Xiong, Guojun, et autres
Publié: (2024)
Self-Hinting Language Models Enhance Reinforcement Learning
par: Liao, Baohao, et autres
Publié: (2026)
par: Liao, Baohao, et autres
Publié: (2026)
Extragradient Preference Optimization (EGPO): Beyond Last-Iterate Convergence for Nash Learning from Human Feedback
par: Zhou, Runlong, et autres
Publié: (2025)
par: Zhou, Runlong, et autres
Publié: (2025)
Building Math Agents with Multi-Turn Iterative Preference Learning
par: Xiong, Wei, et autres
Publié: (2024)
par: Xiong, Wei, et autres
Publié: (2024)
Automatic Curriculum Expert Iteration for Reliable LLM Reasoning
par: Zhao, Zirui, et autres
Publié: (2024)
par: Zhao, Zirui, et autres
Publié: (2024)
Combinatorial Reinforcement Learning with Preference Feedback
par: Lee, Joongkyu, et autres
Publié: (2025)
par: Lee, Joongkyu, et autres
Publié: (2025)
Swap-guided Preference Learning for Personalized Reinforcement Learning from Human Feedback
par: Kim, Gihoon, et autres
Publié: (2026)
par: Kim, Gihoon, et autres
Publié: (2026)
Transformers as Multi-task Learners: Decoupling Features in Hidden Markov Models
par: Hao, Yifan, et autres
Publié: (2025)
par: Hao, Yifan, et autres
Publié: (2025)
Reinforcement Learning from Human Feedback without Reward Inference: Model-Free Algorithm and Instance-Dependent Analysis
par: Zhang, Qining, et autres
Publié: (2024)
par: Zhang, Qining, et autres
Publié: (2024)
Personalizing Reinforcement Learning from Human Feedback with Variational Preference Learning
par: Poddar, Sriyash, et autres
Publié: (2024)
par: Poddar, Sriyash, et autres
Publié: (2024)
On the Curses of Future and History in Future-dependent Value Functions for Off-policy Evaluation
par: Zhang, Yuheng, et autres
Publié: (2024)
par: Zhang, Yuheng, et autres
Publié: (2024)
Statistical Tractability of Off-policy Evaluation of History-dependent Policies in POMDPs
par: Zhang, Yuheng, et autres
Publié: (2025)
par: Zhang, Yuheng, et autres
Publié: (2025)
Efficient Reinforcement Learning from Human Feedback via Bayesian Preference Inference
par: Cercola, Matteo, et autres
Publié: (2025)
par: Cercola, Matteo, et autres
Publié: (2025)
Dual Active Learning for Reinforcement Learning from Human Feedback
par: Liu, Pangpang, et autres
Publié: (2024)
par: Liu, Pangpang, et autres
Publié: (2024)
Sharp Analysis for KL-Regularized Contextual Bandits and RLHF
par: Zhao, Heyang, et autres
Publié: (2024)
par: Zhao, Heyang, et autres
Publié: (2024)
Catoni Contextual Bandits are Robust to Heavy-tailed Rewards
par: Ye, Chenlu, et autres
Publié: (2025)
par: Ye, Chenlu, et autres
Publié: (2025)
Provable Reinforcement Learning from Human Feedback with an Unknown Link Function
par: Zhang, Qining, et autres
Publié: (2025)
par: Zhang, Qining, et autres
Publié: (2025)
Iterative Refinement of Flow Policies in Probability Space for Online Reinforcement Learning
par: Sun, Mingyang, et autres
Publié: (2025)
par: Sun, Mingyang, et autres
Publié: (2025)
Reinforcement Learning from Human Feedback
par: Lambert, Nathan
Publié: (2025)
par: Lambert, Nathan
Publié: (2025)
Reinforcement Learning from Human Feedback: A Statistical Perspective
par: Liu, Pangpang, et autres
Publié: (2026)
par: Liu, Pangpang, et autres
Publié: (2026)
Privacy-Preserving Reinforcement Learning from Human Feedback via Decoupled Reward Modeling
par: Cho, Young Hyun, et autres
Publié: (2026)
par: Cho, Young Hyun, et autres
Publié: (2026)
Documents similaires
-
Iterative Preference Learning from Human Feedback: Bridging Theory and Practice for RLHF under KL-Constraint
par: Xiong, Wei, et autres
Publié: (2023) -
Logarithmic Regret for Online KL-Regularized Reinforcement Learning
par: Zhao, Heyang, et autres
Publié: (2025) -
Reinforce-Ada: An Adaptive Sampling Framework under Non-linear RL Objectives
par: Xiong, Wei, et autres
Publié: (2025) -
Corruption-Robust Offline Reinforcement Learning with General Function Approximation
par: Ye, Chenlu, et autres
Publié: (2023) -
Towards Robust Model-Based Reinforcement Learning Against Adversarial Corruption
par: Ye, Chenlu, et autres
Publié: (2024)