Improving Reinforcement Learning from Human Feedback with Efficient Reward Model Ensemble
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Shun, Chen, Zhenfang, Chen, Sunli, Shen, Yikang, Sun, Zhiqing, Gan, Chuang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SALMON: Self-Alignment with Instructable Reward Models
por: Sun, Zhiqing, et al.
Publicado: (2023)
por: Sun, Zhiqing, et al.
Publicado: (2023)
Easy-to-Hard Generalization: Scalable Alignment Beyond Human Supervision
por: Sun, Zhiqing, et al.
Publicado: (2024)
por: Sun, Zhiqing, et al.
Publicado: (2024)
Off-Policy Corrected Reward Modeling for Reinforcement Learning from Human Feedback
por: Ackermann, Johannes, et al.
Publicado: (2025)
por: Ackermann, Johannes, et al.
Publicado: (2025)
Parameter Efficient Reinforcement Learning from Human Feedback
por: Sidahmed, Hakim, et al.
Publicado: (2024)
por: Sidahmed, Hakim, et al.
Publicado: (2024)
Gradient Regularization Prevents Reward Hacking in Reinforcement Learning from Human Feedback and Verifiable Rewards
por: Ackermann, Johannes, et al.
Publicado: (2026)
por: Ackermann, Johannes, et al.
Publicado: (2026)
Reward Modeling with Ordinal Feedback: Wisdom of the Crowd
por: Liu, Shang, et al.
Publicado: (2024)
por: Liu, Shang, et al.
Publicado: (2024)
Distributionally Robust Reinforcement Learning with Human Feedback
por: Mandal, Debmalya, et al.
Publicado: (2025)
por: Mandal, Debmalya, et al.
Publicado: (2025)
Language Models Can Learn from Verbal Feedback Without Scalar Rewards
por: Luo, Renjie, et al.
Publicado: (2025)
por: Luo, Renjie, et al.
Publicado: (2025)
Stabilizing Long-term Multi-turn Reinforcement Learning with Gated Rewards
por: Sun, Zetian, et al.
Publicado: (2025)
por: Sun, Zetian, et al.
Publicado: (2025)
RLBFF: Binary Flexible Feedback to bridge between Human Feedback & Verifiable Rewards
por: Wang, Zhilin, et al.
Publicado: (2025)
por: Wang, Zhilin, et al.
Publicado: (2025)
Text2Reward: Reward Shaping with Language Models for Reinforcement Learning
por: Xie, Tianbao, et al.
Publicado: (2023)
por: Xie, Tianbao, et al.
Publicado: (2023)
Towards Efficient Online Exploration for Reinforcement Learning with Human Feedback
por: Li, Gen, et al.
Publicado: (2025)
por: Li, Gen, et al.
Publicado: (2025)
Improving Reinforcement Learning from Human Feedback Using Contrastive Rewards
por: Shen, Wei, et al.
Publicado: (2024)
por: Shen, Wei, et al.
Publicado: (2024)
RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback
por: Lee, Harrison, et al.
Publicado: (2023)
por: Lee, Harrison, et al.
Publicado: (2023)
CHAI for LLMs: Improving Code-Mixed Translation in Large Language Models through Reinforcement Learning with AI Feedback
por: Zhang, Wenbo, et al.
Publicado: (2024)
por: Zhang, Wenbo, et al.
Publicado: (2024)
Process Reinforcement through Implicit Rewards
por: Cui, Ganqu, et al.
Publicado: (2025)
por: Cui, Ganqu, et al.
Publicado: (2025)
Scaling Stick-Breaking Attention: An Efficient Implementation and In-depth Study
por: Tan, Shawn, et al.
Publicado: (2024)
por: Tan, Shawn, et al.
Publicado: (2024)
Personalizing Reinforcement Learning from Human Feedback with Variational Preference Learning
por: Poddar, Sriyash, et al.
Publicado: (2024)
por: Poddar, Sriyash, et al.
Publicado: (2024)
Reinforcement Learning with Backtracking Feedback
por: Sel, Bilgehan, et al.
Publicado: (2026)
por: Sel, Bilgehan, et al.
Publicado: (2026)
Reinforcement Learning with Conditional Expectation Reward
por: Xiao, Changyi, et al.
Publicado: (2026)
por: Xiao, Changyi, et al.
Publicado: (2026)
Reward Models in Deep Reinforcement Learning: A Survey
por: Yu, Rui, et al.
Publicado: (2025)
por: Yu, Rui, et al.
Publicado: (2025)
CausalRM: Causal-Theoretic Reward Modeling for RLHF from Observational User Feedbacks
por: Wang, Hao, et al.
Publicado: (2026)
por: Wang, Hao, et al.
Publicado: (2026)
EMORL: Ensemble Multi-Objective Reinforcement Learning for Efficient and Flexible LLM Fine-Tuning
por: Kong, Lingxiao, et al.
Publicado: (2025)
por: Kong, Lingxiao, et al.
Publicado: (2025)
Hindsight-Anchored Policy Optimization: Turning Failure into Feedback in Sparse Reward Settings
por: Wu, Yuning, et al.
Publicado: (2026)
por: Wu, Yuning, et al.
Publicado: (2026)
RLHF Deciphered: A Critical Analysis of Reinforcement Learning from Human Feedback for LLMs
por: Chaudhari, Shreyas, et al.
Publicado: (2024)
por: Chaudhari, Shreyas, et al.
Publicado: (2024)
Beyond Introspection: Reinforcing Thinking via Externalist Behavioral Feedback
por: Yang, Diji, et al.
Publicado: (2024)
por: Yang, Diji, et al.
Publicado: (2024)
Reinforcement Learning from Human Feedback with Active Queries
por: Ji, Kaixuan, et al.
Publicado: (2024)
por: Ji, Kaixuan, et al.
Publicado: (2024)
Reviving The Classics: Active Reward Modeling in Large Language Model Alignment
por: Shen, Yunyi, et al.
Publicado: (2025)
por: Shen, Yunyi, et al.
Publicado: (2025)
Feedback Loops With Language Models Drive In-Context Reward Hacking
por: Pan, Alexander, et al.
Publicado: (2024)
por: Pan, Alexander, et al.
Publicado: (2024)
Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints
por: Chittepu, Yaswanth, et al.
Publicado: (2025)
por: Chittepu, Yaswanth, et al.
Publicado: (2025)
Alignment Tampering: How Reinforcement Learning from Human Feedback Is Exploited to Optimize Misaligned Biases
por: Hahm, Dongyoon, et al.
Publicado: (2026)
por: Hahm, Dongyoon, et al.
Publicado: (2026)
Cost-Effective Proxy Reward Model Construction with On-Policy and Active Learning
por: Chen, Yifang, et al.
Publicado: (2024)
por: Chen, Yifang, et al.
Publicado: (2024)
Learning Personalized Agents from Human Feedback
por: Liang, Kaiqu, et al.
Publicado: (2026)
por: Liang, Kaiqu, et al.
Publicado: (2026)
Using Large Language Models to Automate and Expedite Reinforcement Learning with Reward Machine
por: Alsadat, Shayan Meshkat, et al.
Publicado: (2024)
por: Alsadat, Shayan Meshkat, et al.
Publicado: (2024)
Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models
por: Maura-Rivero, Roberto-Rafael, et al.
Publicado: (2025)
por: Maura-Rivero, Roberto-Rafael, et al.
Publicado: (2025)
Improving Data Efficiency for LLM Reinforcement Fine-tuning Through Difficulty-targeted Online Data Selection and Rollout Replay
por: Sun, Yifan, et al.
Publicado: (2025)
por: Sun, Yifan, et al.
Publicado: (2025)
ConsistRM: Improving Generative Reward Models via Consistency-Aware Self-Training
por: Liang, Yu, et al.
Publicado: (2026)
por: Liang, Yu, et al.
Publicado: (2026)
Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains
por: Gunjal, Anisha, et al.
Publicado: (2025)
por: Gunjal, Anisha, et al.
Publicado: (2025)
Decoupling Reasoning and Confidence: Resurrecting Calibration in Reinforcement Learning from Verifiable Rewards
por: Ma, Zhengzhao, et al.
Publicado: (2026)
por: Ma, Zhengzhao, et al.
Publicado: (2026)
Scaling Autonomous Agents via Automatic Reward Modeling And Planning
por: Chen, Zhenfang, et al.
Publicado: (2025)
por: Chen, Zhenfang, et al.
Publicado: (2025)
Ejemplares similares
-
SALMON: Self-Alignment with Instructable Reward Models
por: Sun, Zhiqing, et al.
Publicado: (2023) -
Easy-to-Hard Generalization: Scalable Alignment Beyond Human Supervision
por: Sun, Zhiqing, et al.
Publicado: (2024) -
Off-Policy Corrected Reward Modeling for Reinforcement Learning from Human Feedback
por: Ackermann, Johannes, et al.
Publicado: (2025) -
Parameter Efficient Reinforcement Learning from Human Feedback
por: Sidahmed, Hakim, et al.
Publicado: (2024) -
Gradient Regularization Prevents Reward Hacking in Reinforcement Learning from Human Feedback and Verifiable Rewards
por: Ackermann, Johannes, et al.
Publicado: (2026)