Prototypical Reward Network for Data-Efficient RLHF
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Jinghan, Wang, Xiting, Jin, Yiqiao, Chen, Changyu, Zhang, Xinhao, Liu, Kunpeng |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Entropy-based Exploration Conduction for Multi-step Reasoning
par: Zhang, Jinghan, et autres
Publié: (2025)
par: Zhang, Jinghan, et autres
Publié: (2025)
Diversity-oriented Data Augmentation with Large Language Models
par: Wang, Zaitian, et autres
Publié: (2025)
par: Wang, Zaitian, et autres
Publié: (2025)
RLHF Workflow: From Reward Modeling to Online RLHF
par: Dong, Hanze, et autres
Publié: (2024)
par: Dong, Hanze, et autres
Publié: (2024)
Reward Difference Optimization For Sample Reweighting In Offline RLHF
par: Wang, Shiqi, et autres
Publié: (2024)
par: Wang, Shiqi, et autres
Publié: (2024)
Reward-Robust RLHF in LLMs
par: Yan, Yuzi, et autres
Publié: (2024)
par: Yan, Yuzi, et autres
Publié: (2024)
Information-Theoretic Reward Decomposition for Generalizable RLHF
par: Mao, Liyuan, et autres
Publié: (2025)
par: Mao, Liyuan, et autres
Publié: (2025)
Reward Shaping to Mitigate Reward Hacking in RLHF
par: Fu, Jiayi, et autres
Publié: (2025)
par: Fu, Jiayi, et autres
Publié: (2025)
The Accuracy Paradox in RLHF: When Better Reward Models Don't Yield Better Language Models
par: Chen, Yanjun, et autres
Publié: (2024)
par: Chen, Yanjun, et autres
Publié: (2024)
ODIN: Disentangled Reward Mitigates Hacking in RLHF
par: Chen, Lichang, et autres
Publié: (2024)
par: Chen, Lichang, et autres
Publié: (2024)
How to Evaluate Reward Models for RLHF
par: Frick, Evan, et autres
Publié: (2024)
par: Frick, Evan, et autres
Publié: (2024)
Segmenting Text and Learning Their Rewards for Improved RLHF in Language Model
par: Yin, Yueqin, et autres
Publié: (2025)
par: Yin, Yueqin, et autres
Publié: (2025)
Iterative Data Smoothing: Mitigating Reward Overfitting and Overoptimization in RLHF
par: Zhu, Banghua, et autres
Publié: (2024)
par: Zhu, Banghua, et autres
Publié: (2024)
Reward Model Overoptimisation in Iterated RLHF
par: Wolf, Lorenz, et autres
Publié: (2025)
par: Wolf, Lorenz, et autres
Publié: (2025)
Sequence to Sequence Reward Modeling: Improving RLHF by Language Feedback
par: Zhou, Jiayi, et autres
Publié: (2024)
par: Zhou, Jiayi, et autres
Publié: (2024)
Quantile Regression for Distributional Reward Models in RLHF
par: Dorka, Nicolai
Publié: (2024)
par: Dorka, Nicolai
Publié: (2024)
It Takes Two: On the Seamlessness between Reward and Policy Model in RLHF
par: Lu, Taiming, et autres
Publié: (2024)
par: Lu, Taiming, et autres
Publié: (2024)
CausalRM: Causal-Theoretic Reward Modeling for RLHF from Observational User Feedbacks
par: Wang, Hao, et autres
Publié: (2026)
par: Wang, Hao, et autres
Publié: (2026)
RLHF in an SFT Way: From Optimal Solution to Reward-Weighted Alignment
par: Du, Yuhao, et autres
Publié: (2025)
par: Du, Yuhao, et autres
Publié: (2025)
Reward Generalization in RLHF: A Topological Perspective
par: Qiu, Tianyi, et autres
Publié: (2024)
par: Qiu, Tianyi, et autres
Publié: (2024)
Mitigating Reward Hacking in RLHF via Advantage Sign Robustness
par: Ono, Shinnosuke, et autres
Publié: (2026)
par: Ono, Shinnosuke, et autres
Publié: (2026)
OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework
par: Hu, Jian, et autres
Publié: (2024)
par: Hu, Jian, et autres
Publié: (2024)
Scoring with Large Language Models: A Study on Measuring Empathy of Responses in Dialogues
par: Xie, Henry J., et autres
Publié: (2024)
par: Xie, Henry J., et autres
Publié: (2024)
Distilling Empathy from Large Language Models
par: Xie, Henry J., et autres
Publié: (2025)
par: Xie, Henry J., et autres
Publié: (2025)
Implicit Cross-Lingual Rewarding for Efficient Multilingual Preference Alignment
par: Yang, Wen, et autres
Publié: (2025)
par: Yang, Wen, et autres
Publié: (2025)
Enhancing Safety of Large Language Models via Embedding Space Separation
par: Zhao, Xu, et autres
Publié: (2026)
par: Zhao, Xu, et autres
Publié: (2026)
Exploration-Driven Policy Optimization in RLHF: Theoretical Insights on Efficient Data Utilization
par: Du, Yihan, et autres
Publié: (2024)
par: Du, Yihan, et autres
Publié: (2024)
The Art of Efficient Reasoning: Data, Reward, and Optimization
par: Wu, Taiqiang, et autres
Publié: (2026)
par: Wu, Taiqiang, et autres
Publié: (2026)
Active Preference Optimization for Sample Efficient RLHF
par: Das, Nirjhar, et autres
Publié: (2024)
par: Das, Nirjhar, et autres
Publié: (2024)
InfoDensity: Rewarding Information-Dense Traces for Efficient Reasoning
par: Wei, Chengwei, et autres
Publié: (2026)
par: Wei, Chengwei, et autres
Publié: (2026)
Overthinking Reduction with Decoupled Rewards and Curriculum Data Scheduling
par: Jiang, Shuyang, et autres
Publié: (2025)
par: Jiang, Shuyang, et autres
Publié: (2025)
RATT: A Thought Structure for Coherent and Correct LLM Reasoning
par: Zhang, Jinghan, et autres
Publié: (2024)
par: Zhang, Jinghan, et autres
Publié: (2024)
An Efficient and Precise Training Data Construction Framework for Process-supervised Reward Model in Mathematical Reasoning
par: Sun, Wei, et autres
Publié: (2025)
par: Sun, Wei, et autres
Publié: (2025)
The Perfect Blend: Redefining RLHF with Mixture of Judges
par: Xu, Tengyu, et autres
Publié: (2024)
par: Xu, Tengyu, et autres
Publié: (2024)
END: Early Noise Dropping for Efficient and Effective Context Denoising
par: Jin, Hongye, et autres
Publié: (2025)
par: Jin, Hongye, et autres
Publié: (2025)
Enhancing Risk Assessment in Transformers with Loss-at-Risk Functions
par: Zhang, Jinghan, et autres
Publié: (2024)
par: Zhang, Jinghan, et autres
Publié: (2024)
Continual SFT Matches Multimodal RLHF with Negative Supervision
par: Zhu, Ke, et autres
Publié: (2024)
par: Zhu, Ke, et autres
Publié: (2024)
PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference
par: Ji, Jiaming, et autres
Publié: (2024)
par: Ji, Jiaming, et autres
Publié: (2024)
Sample-Efficient Alignment for LLMs
par: Liu, Zichen, et autres
Publié: (2024)
par: Liu, Zichen, et autres
Publié: (2024)
Masked Thought: Simply Masking Partial Reasoning Steps Can Improve Mathematical Reasoning Learning of Language Models
par: Chen, Changyu, et autres
Publié: (2024)
par: Chen, Changyu, et autres
Publié: (2024)
MASCOT: Towards Multi-Agent Socio-Collaborative Companion Systems
par: Wang, Yiyang, et autres
Publié: (2026)
par: Wang, Yiyang, et autres
Publié: (2026)
Documents similaires
-
Entropy-based Exploration Conduction for Multi-step Reasoning
par: Zhang, Jinghan, et autres
Publié: (2025) -
Diversity-oriented Data Augmentation with Large Language Models
par: Wang, Zaitian, et autres
Publié: (2025) -
RLHF Workflow: From Reward Modeling to Online RLHF
par: Dong, Hanze, et autres
Publié: (2024) -
Reward Difference Optimization For Sample Reweighting In Offline RLHF
par: Wang, Shiqi, et autres
Publié: (2024) -
Reward-Robust RLHF in LLMs
par: Yan, Yuzi, et autres
Publié: (2024)