Secrets of RLHF in Large Language Models Part II: Reward Modeling
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Binghai, Zheng, Rui, Chen, Lu, Liu, Yan, Dou, Shihan, Huang, Caishuang, Shen, Wei, Jin, Senjie, Zhou, Enyu, Shi, Chenyu, Gao, Songyang, Xu, Nuo, Zhou, Yuhao, Fan, Xiaoran, Xi, Zhiheng, Zhao, Jun, Wang, Xiao, Ji, Tao, Yan, Hang, Shen, Lixing, Chen, Zhan, Gui, Tao, Zhang, Qi, Qiu, Xipeng, Huang, Xuanjing, Wu, Zuxuan, Jiang, Yu-Gang |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Self-Polish: Enhance Reasoning in Large Language Models via Problem Refinement
par: Xi, Zhiheng, et autres
Publié: (2023)
par: Xi, Zhiheng, et autres
Publié: (2023)
StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback
par: Dou, Shihan, et autres
Publié: (2024)
par: Dou, Shihan, et autres
Publié: (2024)
LoRAMoE: Alleviate World Knowledge Forgetting in Large Language Models via MoE-Style Plugin
par: Dou, Shihan, et autres
Publié: (2023)
par: Dou, Shihan, et autres
Publié: (2023)
MouSi: Poly-Visual-Expert Vision-Language Models
par: Fan, Xiaoran, et autres
Publié: (2024)
par: Fan, Xiaoran, et autres
Publié: (2024)
ToolEyes: Fine-Grained Evaluation for Tool Learning Capabilities of Large Language Models in Real-world Scenarios
par: Ye, Junjie, et autres
Publié: (2024)
par: Ye, Junjie, et autres
Publié: (2024)
VRPO: Rethinking Value Modeling for Robust RL Training under Noisy Supervision
par: Zhu, Dingwei, et autres
Publié: (2025)
par: Zhu, Dingwei, et autres
Publié: (2025)
RMB: Comprehensively Benchmarking Reward Models in LLM Alignment
par: Zhou, Enyu, et autres
Publié: (2024)
par: Zhou, Enyu, et autres
Publié: (2024)
JFTA-Bench: Evaluate LLM's Ability of Tracking and Analyzing Malfunctions Using Fault Trees
par: Wang, Yuhui, et autres
Publié: (2026)
par: Wang, Yuhui, et autres
Publié: (2026)
Advancing Translation Preference Modeling with RLHF: A Step Towards Cost-Effective Solution
par: Xu, Nuo, et autres
Publié: (2024)
par: Xu, Nuo, et autres
Publié: (2024)
MM-Doc-R1: Training Agents for Long Document Visual Question Answering through Multi-turn Reinforcement Learning
par: Lin, Jiahang, et autres
Publié: (2026)
par: Lin, Jiahang, et autres
Publié: (2026)
CodeChameleon: Personalized Encryption Framework for Jailbreaking Large Language Models
par: Lv, Huijie, et autres
Publié: (2024)
par: Lv, Huijie, et autres
Publié: (2024)
Why Reinforcement Fine-Tuning Enables MLLMs Preserve Prior Knowledge Better: A Data Perspective
par: Zhang, Zhihao, et autres
Publié: (2025)
par: Zhang, Zhihao, et autres
Publié: (2025)
RoTBench: A Multi-Level Benchmark for Evaluating the Robustness of Large Language Models in Tool Learning
par: Ye, Junjie, et autres
Publié: (2024)
par: Ye, Junjie, et autres
Publié: (2024)
AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress
par: Xi, Zhiheng, et autres
Publié: (2025)
par: Xi, Zhiheng, et autres
Publié: (2025)
EliteKV: Scalable KV Cache Compression via RoPE Frequency Selection and Joint Low-Rank Projection
par: Zhou, Yuhao, et autres
Publié: (2025)
par: Zhou, Yuhao, et autres
Publié: (2025)
Steering LLMs via Scalable Interactive Oversight
par: Zhou, Enyu, et autres
Publié: (2026)
par: Zhou, Enyu, et autres
Publié: (2026)
ToolSword: Unveiling Safety Issues of Large Language Models in Tool Learning Across Three Stages
par: Ye, Junjie, et autres
Publié: (2024)
par: Ye, Junjie, et autres
Publié: (2024)
Pre-Trained Policy Discriminators are General Reward Models
par: Dou, Shihan, et autres
Publié: (2025)
par: Dou, Shihan, et autres
Publié: (2025)
Unlocking the Essence of Beauty: Advanced Aesthetic Reasoning with Relative-Absolute Policy Optimization
par: Liu, Boyang, et autres
Publié: (2025)
par: Liu, Boyang, et autres
Publié: (2025)
MHA2MLA-VLM: Enabling DeepSeek's Economical Multi-Head Latent Attention across Vision-Language Models
par: Fan, Xiaoran, et autres
Publié: (2026)
par: Fan, Xiaoran, et autres
Publié: (2026)
Training Large Language Models for Reasoning through Reverse Curriculum Reinforcement Learning
par: Xi, Zhiheng, et autres
Publié: (2024)
par: Xi, Zhiheng, et autres
Publié: (2024)
SafeAligner: Safety Alignment against Jailbreak Attacks via Response Disparity Guidance
par: Huang, Caishuang, et autres
Publié: (2024)
par: Huang, Caishuang, et autres
Publié: (2024)
EasyJailbreak: A Unified Framework for Jailbreaking Large Language Models
par: Zhou, Weikang, et autres
Publié: (2024)
par: Zhou, Weikang, et autres
Publié: (2024)
Subspace Defense: Discarding Adversarial Perturbations by Learning a Subspace for Clean Signals
par: Zheng, Rui, et autres
Publié: (2024)
par: Zheng, Rui, et autres
Publié: (2024)
The Role of Entropy in Visual Grounding: Analysis and Optimization
par: Li, Shuo, et autres
Publié: (2025)
par: Li, Shuo, et autres
Publié: (2025)
FRoM-W1: Towards General Humanoid Whole-Body Control with Language Instructions
par: Li, Peng, et autres
Publié: (2026)
par: Li, Peng, et autres
Publié: (2026)
MetaRM: Shifted Distributions Alignment via Meta-Learning
par: Dou, Shihan, et autres
Publié: (2024)
par: Dou, Shihan, et autres
Publié: (2024)
TransferTOD: A Generalizable Chinese Multi-Domain Task-Oriented Dialogue System with Transfer Capabilities
par: Zhang, Ming, et autres
Publié: (2024)
par: Zhang, Ming, et autres
Publié: (2024)
DFPO: Scaling Value Modeling via Distributional Flow towards Robust and Generalizable LLM Post-Training
par: Zhu, Dingwei, et autres
Publié: (2026)
par: Zhu, Dingwei, et autres
Publié: (2026)
Beyond Scaling: Measuring and Predicting the Upper Bound of Knowledge Retention in Language Model Pre-Training
par: Jiang, Changhao, et autres
Publié: (2025)
par: Jiang, Changhao, et autres
Publié: (2025)
Parrot: A Training Pipeline Enhances Both Program CoT and Natural Language CoT for Reasoning
par: Jin, Senjie, et autres
Publié: (2025)
par: Jin, Senjie, et autres
Publié: (2025)
DVPO: Distributional Value Modeling-based Policy Optimization for LLM Post-Training
par: Zhu, Dingwei, et autres
Publié: (2025)
par: Zhu, Dingwei, et autres
Publié: (2025)
Inverse-Q*: Token Level Reinforcement Learning for Aligning Large Language Models Without Preference Data
par: Xia, Han, et autres
Publié: (2024)
par: Xia, Han, et autres
Publié: (2024)
EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training
par: Pan, Chengjun, et autres
Publié: (2026)
par: Pan, Chengjun, et autres
Publié: (2026)
LLM-DA: Data Augmentation via Large Language Models for Few-Shot Named Entity Recognition
par: Ye, Junjie, et autres
Publié: (2024)
par: Ye, Junjie, et autres
Publié: (2024)
Aligning Large Language Models from Self-Reference AI Feedback with one General Principle
par: Bao, Rong, et autres
Publié: (2024)
par: Bao, Rong, et autres
Publié: (2024)
LongHeads: Multi-Head Attention is Secretly a Long Context Processor
par: Lu, Yi, et autres
Publié: (2024)
par: Lu, Yi, et autres
Publié: (2024)
What's Wrong with Your Code Generated by Large Language Models? An Extensive Study
par: Dou, Shihan, et autres
Publié: (2024)
par: Dou, Shihan, et autres
Publié: (2024)
Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses
par: Lin, Jiahang, et autres
Publié: (2026)
par: Lin, Jiahang, et autres
Publié: (2026)
Improving RL Exploration for LLM Reasoning through Retrospective Replay
par: Dou, Shihan, et autres
Publié: (2025)
par: Dou, Shihan, et autres
Publié: (2025)
Documents similaires
-
Self-Polish: Enhance Reasoning in Large Language Models via Problem Refinement
par: Xi, Zhiheng, et autres
Publié: (2023) -
StepCoder: Improve Code Generation with Reinforcement Learning from Compiler Feedback
par: Dou, Shihan, et autres
Publié: (2024) -
LoRAMoE: Alleviate World Knowledge Forgetting in Large Language Models via MoE-Style Plugin
par: Dou, Shihan, et autres
Publié: (2023) -
MouSi: Poly-Visual-Expert Vision-Language Models
par: Fan, Xiaoran, et autres
Publié: (2024) -
ToolEyes: Fine-Grained Evaluation for Tool Learning Capabilities of Large Language Models in Real-world Scenarios
par: Ye, Junjie, et autres
Publié: (2024)