Exploration-Driven Policy Optimization in RLHF: Theoretical Insights on Efficient Data Utilization
Fuente:
arXiv
Salvato in:
| Autori principali: | Du, Yihan, Winnicki, Anna, Dalal, Gal, Mannor, Shie, Srikant, R. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Reinforcement Learning with Segment Feedback
di: Du, Yihan, et al.
Pubblicazione: (2025)
di: Du, Yihan, et al.
Pubblicazione: (2025)
Tree Search-Based Policy Optimization under Stochastic Execution Delay
di: Valensi, David, et al.
Pubblicazione: (2024)
di: Valensi, David, et al.
Pubblicazione: (2024)
Policy Gradient with Tree Expansion
di: Dalal, Gal, et al.
Pubblicazione: (2023)
di: Dalal, Gal, et al.
Pubblicazione: (2023)
Representation-Driven Reinforcement Learning
di: Nabati, Ofir, et al.
Pubblicazione: (2023)
di: Nabati, Ofir, et al.
Pubblicazione: (2023)
MinMaxMin $Q$-learning
di: Soffair, Nitsan, et al.
Pubblicazione: (2024)
di: Soffair, Nitsan, et al.
Pubblicazione: (2024)
Conservative DDPG -- Pessimistic RL without Ensemble
di: Soffair, Nitsan, et al.
Pubblicazione: (2024)
di: Soffair, Nitsan, et al.
Pubblicazione: (2024)
Implementing Reinforcement Learning Datacenter Congestion Control in NVIDIA NICs
di: Fuhrer, Benjamin, et al.
Pubblicazione: (2022)
di: Fuhrer, Benjamin, et al.
Pubblicazione: (2022)
Dataset Reset Policy Optimization for RLHF
di: Chang, Jonathan D., et al.
Pubblicazione: (2024)
di: Chang, Jonathan D., et al.
Pubblicazione: (2024)
Regressing the Relative Future: Efficient Policy Optimization for Multi-turn RLHF
di: Gao, Zhaolin, et al.
Pubblicazione: (2024)
di: Gao, Zhaolin, et al.
Pubblicazione: (2024)
Controlling False Discovery in Arbitrarily Structured Hypothesis Spaces via Reproducing Kernels
di: Perets, Binyamin, et al.
Pubblicazione: (2026)
di: Perets, Binyamin, et al.
Pubblicazione: (2026)
Sobolev Space Regularised Pre Density Models
di: Kozdoba, Mark, et al.
Pubblicazione: (2023)
di: Kozdoba, Mark, et al.
Pubblicazione: (2023)
Active Preference Optimization for Sample Efficient RLHF
di: Das, Nirjhar, et al.
Pubblicazione: (2024)
di: Das, Nirjhar, et al.
Pubblicazione: (2024)
RL in Latent MDPs is Tractable: Online Guarantees via Off-Policy Evaluation
di: Kwon, Jeongyeol, et al.
Pubblicazione: (2024)
di: Kwon, Jeongyeol, et al.
Pubblicazione: (2024)
General Exploratory Bonus for Optimistic Exploration in RLHF
di: Li, Wendi, et al.
Pubblicazione: (2025)
di: Li, Wendi, et al.
Pubblicazione: (2025)
Information-Theoretic Reward Decomposition for Generalizable RLHF
di: Mao, Liyuan, et al.
Pubblicazione: (2025)
di: Mao, Liyuan, et al.
Pubblicazione: (2025)
Simulus: Combining Improvements in Sample-Efficient World Model Agents
di: Cohen, Lior, et al.
Pubblicazione: (2025)
di: Cohen, Lior, et al.
Pubblicazione: (2025)
Asynchronous RLHF: Faster and More Efficient Off-Policy RL for Language Models
di: Noukhovitch, Michael, et al.
Pubblicazione: (2024)
di: Noukhovitch, Michael, et al.
Pubblicazione: (2024)
Improving Token-Based World Models with Parallel Observation Prediction
di: Cohen, Lior, et al.
Pubblicazione: (2024)
di: Cohen, Lior, et al.
Pubblicazione: (2024)
Exploratory Preference Optimization: Harnessing Implicit Q*-Approximation for Sample-Efficient RLHF
di: Xie, Tengyang, et al.
Pubblicazione: (2024)
di: Xie, Tengyang, et al.
Pubblicazione: (2024)
Policy Gradient with Tree Search: Avoiding Local Optimas through Lookahead
di: Koren, Uri, et al.
Pubblicazione: (2025)
di: Koren, Uri, et al.
Pubblicazione: (2025)
WPO: Enhancing RLHF with Weighted Preference Optimization
di: Zhou, Wenxuan, et al.
Pubblicazione: (2024)
di: Zhou, Wenxuan, et al.
Pubblicazione: (2024)
SQT -- std $Q$-target
di: Soffair, Nitsan, et al.
Pubblicazione: (2024)
di: Soffair, Nitsan, et al.
Pubblicazione: (2024)
Policy Optimized Text-to-Image Pipeline Design
di: Gadot, Uri, et al.
Pubblicazione: (2025)
di: Gadot, Uri, et al.
Pubblicazione: (2025)
It Takes Two: On the Seamlessness between Reward and Policy Model in RLHF
di: Lu, Taiming, et al.
Pubblicazione: (2024)
di: Lu, Taiming, et al.
Pubblicazione: (2024)
RLHF Workflow: From Reward Modeling to Online RLHF
di: Dong, Hanze, et al.
Pubblicazione: (2024)
di: Dong, Hanze, et al.
Pubblicazione: (2024)
DPO Meets PPO: Reinforced Token Optimization for RLHF
di: Zhong, Han, et al.
Pubblicazione: (2024)
di: Zhong, Han, et al.
Pubblicazione: (2024)
CausalRM: Causal-Theoretic Reward Modeling for RLHF from Observational User Feedbacks
di: Wang, Hao, et al.
Pubblicazione: (2026)
di: Wang, Hao, et al.
Pubblicazione: (2026)
OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework
di: Hu, Jian, et al.
Pubblicazione: (2024)
di: Hu, Jian, et al.
Pubblicazione: (2024)
Iterative Data Smoothing: Mitigating Reward Overfitting and Overoptimization in RLHF
di: Zhu, Banghua, et al.
Pubblicazione: (2024)
di: Zhu, Banghua, et al.
Pubblicazione: (2024)
VLM-Guided Experience Replay
di: Sharony, Elad, et al.
Pubblicazione: (2026)
di: Sharony, Elad, et al.
Pubblicazione: (2026)
Towards Data-Centric RLHF: Simple Metrics for Preference Dataset Comparison
di: Shen, Judy Hanwen, et al.
Pubblicazione: (2024)
di: Shen, Judy Hanwen, et al.
Pubblicazione: (2024)
RLHF Can Speak Many Languages: Unlocking Multilingual Preference Optimization for LLMs
di: Dang, John, et al.
Pubblicazione: (2024)
di: Dang, John, et al.
Pubblicazione: (2024)
RLHF and IIA: Perverse Incentives
di: Xu, Wanqiao, et al.
Pubblicazione: (2023)
di: Xu, Wanqiao, et al.
Pubblicazione: (2023)
Reward-Robust RLHF in LLMs
di: Yan, Yuzi, et al.
Pubblicazione: (2024)
di: Yan, Yuzi, et al.
Pubblicazione: (2024)
RLHF in an SFT Way: From Optimal Solution to Reward-Weighted Alignment
di: Du, Yuhao, et al.
Pubblicazione: (2025)
di: Du, Yuhao, et al.
Pubblicazione: (2025)
Learning Multiple Initial Solutions to Optimization Problems
di: Sharony, Elad, et al.
Pubblicazione: (2024)
di: Sharony, Elad, et al.
Pubblicazione: (2024)
Reward Model Overoptimisation in Iterated RLHF
di: Wolf, Lorenz, et al.
Pubblicazione: (2025)
di: Wolf, Lorenz, et al.
Pubblicazione: (2025)
How to Evaluate Reward Models for RLHF
di: Frick, Evan, et al.
Pubblicazione: (2024)
di: Frick, Evan, et al.
Pubblicazione: (2024)
EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training
di: Pan, Chengjun, et al.
Pubblicazione: (2026)
di: Pan, Chengjun, et al.
Pubblicazione: (2026)
PlaMo: Plan and Move in Rich 3D Physical Environments
di: Hallak, Assaf, et al.
Pubblicazione: (2024)
di: Hallak, Assaf, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Reinforcement Learning with Segment Feedback
di: Du, Yihan, et al.
Pubblicazione: (2025) -
Tree Search-Based Policy Optimization under Stochastic Execution Delay
di: Valensi, David, et al.
Pubblicazione: (2024) -
Policy Gradient with Tree Expansion
di: Dalal, Gal, et al.
Pubblicazione: (2023) -
Representation-Driven Reinforcement Learning
di: Nabati, Ofir, et al.
Pubblicazione: (2023) -
MinMaxMin $Q$-learning
di: Soffair, Nitsan, et al.
Pubblicazione: (2024)