Avoiding $\mathbf{exp(R_{max})}$ scaling in RLHF through Preference-based Exploration
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Mingyu, Chen, Yiding, Sun, Wen, Zhang, Xuezhou |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Scale-free Adversarial Reinforcement Learning
di: Chen, Mingyu, et al.
Pubblicazione: (2024)
di: Chen, Mingyu, et al.
Pubblicazione: (2024)
State-free Reinforcement Learning
di: Chen, Mingyu, et al.
Pubblicazione: (2024)
di: Chen, Mingyu, et al.
Pubblicazione: (2024)
Accelerating RL for LLM Reasoning with Optimal Advantage Regression
di: Brantley, Kianté, et al.
Pubblicazione: (2025)
di: Brantley, Kianté, et al.
Pubblicazione: (2025)
Policy-labeled Preference Learning: Is Preference Enough for RLHF?
di: Cho, Taehyun, et al.
Pubblicazione: (2025)
di: Cho, Taehyun, et al.
Pubblicazione: (2025)
Efficient Reinforcement Learning in Probabilistic Reward Machines
di: Lin, Xiaofeng, et al.
Pubblicazione: (2024)
di: Lin, Xiaofeng, et al.
Pubblicazione: (2024)
RLHF from Heterogeneous Feedback via Personalization and Preference Aggregation
di: Park, Chanwoo, et al.
Pubblicazione: (2024)
di: Park, Chanwoo, et al.
Pubblicazione: (2024)
The Hidden Link Between RLHF and Contrastive Learning
di: Lv, Xufei, et al.
Pubblicazione: (2025)
di: Lv, Xufei, et al.
Pubblicazione: (2025)
Adaptive Margin RLHF via Preference over Preferences
di: Chittepu, Yaswanth, et al.
Pubblicazione: (2025)
di: Chittepu, Yaswanth, et al.
Pubblicazione: (2025)
WPO: Enhancing RLHF with Weighted Preference Optimization
di: Zhou, Wenxuan, et al.
Pubblicazione: (2024)
di: Zhou, Wenxuan, et al.
Pubblicazione: (2024)
Sharpe Ratio-Guided Active Learning for Preference Optimization in RLHF
di: Belakaria, Syrine, et al.
Pubblicazione: (2025)
di: Belakaria, Syrine, et al.
Pubblicazione: (2025)
Distributional Preference Learning: Understanding and Accounting for Hidden Context in RLHF
di: Siththaranjan, Anand, et al.
Pubblicazione: (2023)
di: Siththaranjan, Anand, et al.
Pubblicazione: (2023)
Active Preference Optimization for Sample Efficient RLHF
di: Das, Nirjhar, et al.
Pubblicazione: (2024)
di: Das, Nirjhar, et al.
Pubblicazione: (2024)
APPA: Adaptive Preference Pluralistic Alignment for Fair Federated RLHF of LLMs
di: Srewa, Mahmoud, et al.
Pubblicazione: (2026)
di: Srewa, Mahmoud, et al.
Pubblicazione: (2026)
General Exploratory Bonus for Optimistic Exploration in RLHF
di: Li, Wendi, et al.
Pubblicazione: (2025)
di: Li, Wendi, et al.
Pubblicazione: (2025)
Value-Incentivized Preference Optimization: A Unified Approach to Online and Offline RLHF
di: Cen, Shicong, et al.
Pubblicazione: (2024)
di: Cen, Shicong, et al.
Pubblicazione: (2024)
Influencing Humans to Conform to Preference Models for RLHF
di: Hatgis-Kessell, Stephane, et al.
Pubblicazione: (2025)
di: Hatgis-Kessell, Stephane, et al.
Pubblicazione: (2025)
Iterative Preference Learning from Human Feedback: Bridging Theory and Practice for RLHF under KL-Constraint
di: Xiong, Wei, et al.
Pubblicazione: (2023)
di: Xiong, Wei, et al.
Pubblicazione: (2023)
Debunk the Myth of SFT Generalization
di: Lin, Xiaofeng, et al.
Pubblicazione: (2025)
di: Lin, Xiaofeng, et al.
Pubblicazione: (2025)
ROCM: RLHF on consistency models
di: Shekhar, Shivanshu, et al.
Pubblicazione: (2025)
di: Shekhar, Shivanshu, et al.
Pubblicazione: (2025)
Scaling In-Context Online Learning Capability of LLMs via Cross-Episode Meta-RL
di: Lin, Xiaofeng, et al.
Pubblicazione: (2026)
di: Lin, Xiaofeng, et al.
Pubblicazione: (2026)
OPRIDE: Offline Preference-based Reinforcement Learning via In-Dataset Exploration
di: Yang, Yiqin, et al.
Pubblicazione: (2026)
di: Yang, Yiqin, et al.
Pubblicazione: (2026)
MaxMin-RLHF: Alignment with Diverse Human Preferences
di: Chakraborty, Souradip, et al.
Pubblicazione: (2024)
di: Chakraborty, Souradip, et al.
Pubblicazione: (2024)
Democratic Preference Alignment via Sortition-Weighted RLHF
di: Sana, Suvadip, et al.
Pubblicazione: (2026)
di: Sana, Suvadip, et al.
Pubblicazione: (2026)
Efficient Controllable Diffusion via Optimal Classifier Guidance
di: Oertell, Owen, et al.
Pubblicazione: (2025)
di: Oertell, Owen, et al.
Pubblicazione: (2025)
Generalisation of RLHF under Reward Shift and Clipped KL Regularisation
di: Tang, Kenton, et al.
Pubblicazione: (2026)
di: Tang, Kenton, et al.
Pubblicazione: (2026)
OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework
di: Hu, Jian, et al.
Pubblicazione: (2024)
di: Hu, Jian, et al.
Pubblicazione: (2024)
Towards Data-Centric RLHF: Simple Metrics for Preference Dataset Comparison
di: Shen, Judy Hanwen, et al.
Pubblicazione: (2024)
di: Shen, Judy Hanwen, et al.
Pubblicazione: (2024)
Dataset Reset Policy Optimization for RLHF
di: Chang, Jonathan D., et al.
Pubblicazione: (2024)
di: Chang, Jonathan D., et al.
Pubblicazione: (2024)
Towards Reward Fairness in RLHF: From a Resource Allocation Perspective
di: Ouyang, Sheng, et al.
Pubblicazione: (2025)
di: Ouyang, Sheng, et al.
Pubblicazione: (2025)
Hindsight Preference Learning for Offline Preference-based Reinforcement Learning
di: Gao, Chen-Xiao, et al.
Pubblicazione: (2024)
di: Gao, Chen-Xiao, et al.
Pubblicazione: (2024)
RLHF Workflow: From Reward Modeling to Online RLHF
di: Dong, Hanze, et al.
Pubblicazione: (2024)
di: Dong, Hanze, et al.
Pubblicazione: (2024)
Exploratory Preference Optimization: Harnessing Implicit Q*-Approximation for Sample-Efficient RLHF
di: Xie, Tengyang, et al.
Pubblicazione: (2024)
di: Xie, Tengyang, et al.
Pubblicazione: (2024)
RLHF Can Speak Many Languages: Unlocking Multilingual Preference Optimization for LLMs
di: Dang, John, et al.
Pubblicazione: (2024)
di: Dang, John, et al.
Pubblicazione: (2024)
ODIN: Disentangled Reward Mitigates Hacking in RLHF
di: Chen, Lichang, et al.
Pubblicazione: (2024)
di: Chen, Lichang, et al.
Pubblicazione: (2024)
Exploration-Driven Policy Optimization in RLHF: Theoretical Insights on Efficient Data Utilization
di: Du, Yihan, et al.
Pubblicazione: (2024)
di: Du, Yihan, et al.
Pubblicazione: (2024)
RLHF and IIA: Perverse Incentives
di: Xu, Wanqiao, et al.
Pubblicazione: (2023)
di: Xu, Wanqiao, et al.
Pubblicazione: (2023)
Rethinking KL Regularization in RLHF: From Value Estimation to Gradient Optimization
di: Liu, Kezhao, et al.
Pubblicazione: (2025)
di: Liu, Kezhao, et al.
Pubblicazione: (2025)
In-Dataset Trajectory Return Regularization for Offline Preference-based Reinforcement Learning
di: Tu, Songjun, et al.
Pubblicazione: (2024)
di: Tu, Songjun, et al.
Pubblicazione: (2024)
Mitigating Reward Over-Optimization in RLHF via Behavior-Supported Regularization
di: Dai, Juntao, et al.
Pubblicazione: (2025)
di: Dai, Juntao, et al.
Pubblicazione: (2025)
Boosting Deductive Reasoning with Step Signals In RLHF
di: Li, Jialian, et al.
Pubblicazione: (2024)
di: Li, Jialian, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Scale-free Adversarial Reinforcement Learning
di: Chen, Mingyu, et al.
Pubblicazione: (2024) -
State-free Reinforcement Learning
di: Chen, Mingyu, et al.
Pubblicazione: (2024) -
Accelerating RL for LLM Reasoning with Optimal Advantage Regression
di: Brantley, Kianté, et al.
Pubblicazione: (2025) -
Policy-labeled Preference Learning: Is Preference Enough for RLHF?
di: Cho, Taehyun, et al.
Pubblicazione: (2025) -
Efficient Reinforcement Learning in Probabilistic Reward Machines
di: Lin, Xiaofeng, et al.
Pubblicazione: (2024)