The Accuracy Paradox in RLHF: When Better Reward Models Don't Yield Better Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Chen, Yanjun, Zhu, Dawei, Sun, Yirong, Chen, Xinghao, Zhang, Wei, Shen, Xiaoyu |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Fine-Grained and Multi-Dimensional Metrics for Document-Level Machine Translation
von: Sun, Yirong, et al.
Veröffentlicht: (2024)
von: Sun, Yirong, et al.
Veröffentlicht: (2024)
Multimodal Language Models See Better When They Look Shallower
von: Chen, Haoran, et al.
Veröffentlicht: (2025)
von: Chen, Haoran, et al.
Veröffentlicht: (2025)
Do Retrieval Augmented Language Models Know When They Don't Know?
von: Zhou, Youchao, et al.
Veröffentlicht: (2025)
von: Zhou, Youchao, et al.
Veröffentlicht: (2025)
Segmenting Text and Learning Their Rewards for Improved RLHF in Language Model
von: Yin, Yueqin, et al.
Veröffentlicht: (2025)
von: Yin, Yueqin, et al.
Veröffentlicht: (2025)
Don't Forget Your Reward Values: Language Model Alignment via Value-based Calibration
von: Mao, Xin, et al.
Veröffentlicht: (2024)
von: Mao, Xin, et al.
Veröffentlicht: (2024)
LLaSO: A Foundational Framework for Reproducible Research in Large Language and Speech Model
von: Sun, Yirong, et al.
Veröffentlicht: (2025)
von: Sun, Yirong, et al.
Veröffentlicht: (2025)
CausalEval: Towards Better Causal Reasoning in Language Models
von: Yu, Longxuan, et al.
Veröffentlicht: (2024)
von: Yu, Longxuan, et al.
Veröffentlicht: (2024)
How to Evaluate Reward Models for RLHF
von: Frick, Evan, et al.
Veröffentlicht: (2024)
von: Frick, Evan, et al.
Veröffentlicht: (2024)
RLHF Workflow: From Reward Modeling to Online RLHF
von: Dong, Hanze, et al.
Veröffentlicht: (2024)
von: Dong, Hanze, et al.
Veröffentlicht: (2024)
The Real, the Better: Aligning Large Language Models with Online Human Behaviors
von: Jiang, Guanying, et al.
Veröffentlicht: (2024)
von: Jiang, Guanying, et al.
Veröffentlicht: (2024)
Reasoning about Uncertainty: Do Reasoning Models Know When They Don't Know?
von: Mei, Zhiting, et al.
Veröffentlicht: (2025)
von: Mei, Zhiting, et al.
Veröffentlicht: (2025)
It Takes Two: On the Seamlessness between Reward and Policy Model in RLHF
von: Lu, Taiming, et al.
Veröffentlicht: (2024)
von: Lu, Taiming, et al.
Veröffentlicht: (2024)
Language Models Don't Learn the Physical Manifestation of Language
von: Lee, Bruce W., et al.
Veröffentlicht: (2024)
von: Lee, Bruce W., et al.
Veröffentlicht: (2024)
Mixed Distillation Helps Smaller Language Model Better Reasoning
von: Li, Chenglin, et al.
Veröffentlicht: (2023)
von: Li, Chenglin, et al.
Veröffentlicht: (2023)
Timo: Towards Better Temporal Reasoning for Language Models
von: Su, Zhaochen, et al.
Veröffentlicht: (2024)
von: Su, Zhaochen, et al.
Veröffentlicht: (2024)
Sequence to Sequence Reward Modeling: Improving RLHF by Language Feedback
von: Zhou, Jiayi, et al.
Veröffentlicht: (2024)
von: Zhou, Jiayi, et al.
Veröffentlicht: (2024)
Reasoning Models Reason Well, Until They Don't
von: Rameshkumar, Revanth, et al.
Veröffentlicht: (2025)
von: Rameshkumar, Revanth, et al.
Veröffentlicht: (2025)
ProgRM: Build Better GUI Agents with Progress Rewards
von: Zhang, Danyang, et al.
Veröffentlicht: (2025)
von: Zhang, Danyang, et al.
Veröffentlicht: (2025)
Active Confusion Expression in Large Language Models: Leveraging World Models toward Better Social Reasoning
von: Du, Jialu, et al.
Veröffentlicht: (2025)
von: Du, Jialu, et al.
Veröffentlicht: (2025)
Supervised Knowledge Makes Large Language Models Better In-context Learners
von: Yang, Linyi, et al.
Veröffentlicht: (2023)
von: Yang, Linyi, et al.
Veröffentlicht: (2023)
Prototypical Reward Network for Data-Efficient RLHF
von: Zhang, Jinghan, et al.
Veröffentlicht: (2024)
von: Zhang, Jinghan, et al.
Veröffentlicht: (2024)
Don't Take Things Out of Context: Attention Intervention for Enhancing Chain-of-Thought Reasoning in Large Language Models
von: Yan, Shaotian, et al.
Veröffentlicht: (2025)
von: Yan, Shaotian, et al.
Veröffentlicht: (2025)
Learning to Self-Verify Makes Language Models Better Reasoners
von: Chen, Yuxin, et al.
Veröffentlicht: (2026)
von: Chen, Yuxin, et al.
Veröffentlicht: (2026)
Abstraction-of-Thought Makes Language Models Better Reasoners
von: Hong, Ruixin, et al.
Veröffentlicht: (2024)
von: Hong, Ruixin, et al.
Veröffentlicht: (2024)
Honest AI: Fine-Tuning "Small" Language Models to Say "I Don't Know", and Reducing Hallucination in RAG
von: Chen, Xinxi, et al.
Veröffentlicht: (2024)
von: Chen, Xinxi, et al.
Veröffentlicht: (2024)
ODIN: Disentangled Reward Mitigates Hacking in RLHF
von: Chen, Lichang, et al.
Veröffentlicht: (2024)
von: Chen, Lichang, et al.
Veröffentlicht: (2024)
Reward Model Overoptimisation in Iterated RLHF
von: Wolf, Lorenz, et al.
Veröffentlicht: (2025)
von: Wolf, Lorenz, et al.
Veröffentlicht: (2025)
Reward-Robust RLHF in LLMs
von: Yan, Yuzi, et al.
Veröffentlicht: (2024)
von: Yan, Yuzi, et al.
Veröffentlicht: (2024)
Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment
von: Zhang, Jiazheng, et al.
Veröffentlicht: (2025)
von: Zhang, Jiazheng, et al.
Veröffentlicht: (2025)
Don't Think of the White Bear: Ironic Negation in Transformer Models Under Cognitive Load
von: Mann, Logan, et al.
Veröffentlicht: (2025)
von: Mann, Logan, et al.
Veröffentlicht: (2025)
Quantile Regression for Distributional Reward Models in RLHF
von: Dorka, Nicolai
Veröffentlicht: (2024)
von: Dorka, Nicolai
Veröffentlicht: (2024)
Rephrase and Respond: Let Large Language Models Ask Better Questions for Themselves
von: Deng, Yihe, et al.
Veröffentlicht: (2023)
von: Deng, Yihe, et al.
Veröffentlicht: (2023)
Don't Change My View: Ideological Bias Auditing in Large Language Models
von: Kröger, Paul, et al.
Veröffentlicht: (2025)
von: Kröger, Paul, et al.
Veröffentlicht: (2025)
CodeArt: Better Code Models by Attention Regularization When Symbols Are Lacking
von: Su, Zian, et al.
Veröffentlicht: (2024)
von: Su, Zian, et al.
Veröffentlicht: (2024)
Can AI Assistants Know What They Don't Know?
von: Cheng, Qinyuan, et al.
Veröffentlicht: (2024)
von: Cheng, Qinyuan, et al.
Veröffentlicht: (2024)
Countering Catastrophic Forgetting of Large Language Models for Better Instruction Following via Weight-Space Model Merging
von: Lyu, Mengxian, et al.
Veröffentlicht: (2026)
von: Lyu, Mengxian, et al.
Veröffentlicht: (2026)
Instruction-tuned Language Models are Better Knowledge Learners
von: Jiang, Zhengbao, et al.
Veröffentlicht: (2024)
von: Jiang, Zhengbao, et al.
Veröffentlicht: (2024)
Inverse Scaling: When Bigger Isn't Better
von: McKenzie, Ian R., et al.
Veröffentlicht: (2023)
von: McKenzie, Ian R., et al.
Veröffentlicht: (2023)
Don't Pay Attention
von: Hammoud, Mohammad, et al.
Veröffentlicht: (2025)
von: Hammoud, Mohammad, et al.
Veröffentlicht: (2025)
Reasoning Models Don't Always Say What They Think
von: Chen, Yanda, et al.
Veröffentlicht: (2025)
von: Chen, Yanda, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Fine-Grained and Multi-Dimensional Metrics for Document-Level Machine Translation
von: Sun, Yirong, et al.
Veröffentlicht: (2024) -
Multimodal Language Models See Better When They Look Shallower
von: Chen, Haoran, et al.
Veröffentlicht: (2025) -
Do Retrieval Augmented Language Models Know When They Don't Know?
von: Zhou, Youchao, et al.
Veröffentlicht: (2025) -
Segmenting Text and Learning Their Rewards for Improved RLHF in Language Model
von: Yin, Yueqin, et al.
Veröffentlicht: (2025) -
Don't Forget Your Reward Values: Language Model Alignment via Value-based Calibration
von: Mao, Xin, et al.
Veröffentlicht: (2024)