Self-Generated Critiques Boost Reward Modeling for Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yu, Yue, Chen, Zhengxing, Zhang, Aston, Tan, Liang, Zhu, Chenguang, Pang, Richard Yuanzhe, Qian, Yundi, Wang, Xuewei, Gururangan, Suchin, Zhang, Chao, Kambadur, Melanie, Mahajan, Dhruv, Hou, Rui |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Law of the Weakest Link: Cross Capabilities of Large Language Models
par: Zhong, Ming, et autres
Publié: (2024)
par: Zhong, Ming, et autres
Publié: (2024)
A Systematic Examination of Preference Learning through the Lens of Instruction-Following
par: Kim, Joongwon, et autres
Publié: (2024)
par: Kim, Joongwon, et autres
Publié: (2024)
Time is Encoded in the Weights of Finetuned Language Models
par: Nylund, Kai, et autres
Publié: (2023)
par: Nylund, Kai, et autres
Publié: (2023)
Diversity-driven Data Selection for Language Model Tuning through Sparse Autoencoder
par: Yang, Xianjun, et autres
Publié: (2025)
par: Yang, Xianjun, et autres
Publié: (2025)
Self-Rewarding Language Models
par: Yuan, Weizhe, et autres
Publié: (2024)
par: Yuan, Weizhe, et autres
Publié: (2024)
LESS: Selecting Influential Data for Targeted Instruction Tuning
par: Xia, Mengzhou, et autres
Publié: (2024)
par: Xia, Mengzhou, et autres
Publié: (2024)
Breaking the Curse of Multilinguality with Cross-lingual Expert Language Models
par: Blevins, Terra, et autres
Publié: (2024)
par: Blevins, Terra, et autres
Publié: (2024)
SILO Language Models: Isolating Legal Risk In a Nonparametric Datastore
par: Min, Sewon, et autres
Publié: (2023)
par: Min, Sewon, et autres
Publié: (2023)
AboutMe: Using Self-Descriptions in Webpages to Document the Effects of English Pretraining Data Filters
par: Lucy, Li, et autres
Publié: (2024)
par: Lucy, Li, et autres
Publié: (2024)
Critique-out-Loud Reward Models
par: Ankner, Zachary, et autres
Publié: (2024)
par: Ankner, Zachary, et autres
Publié: (2024)
Improving Reward Models with Synthetic Critiques
par: Ye, Zihuiwen, et autres
Publié: (2024)
par: Ye, Zihuiwen, et autres
Publié: (2024)
Compute as Teacher: Turning Inference Compute Into Reference-Free Supervision
par: Jayalath, Dulhan, et autres
Publié: (2025)
par: Jayalath, Dulhan, et autres
Publié: (2025)
Boosting LLM Reasoning via Spontaneous Self-Correction
par: Zhao, Xutong, et autres
Publié: (2025)
par: Zhao, Xutong, et autres
Publié: (2025)
Critiques of World Models
par: Xing, Eric, et autres
Publié: (2025)
par: Xing, Eric, et autres
Publié: (2025)
Preference Poisoning Attacks on Reward Model Learning
par: Wu, Junlin, et autres
Publié: (2024)
par: Wu, Junlin, et autres
Publié: (2024)
Information Flow Control in Machine Learning through Modular Model Architecture
par: Tiwari, Trishita, et autres
Publié: (2023)
par: Tiwari, Trishita, et autres
Publié: (2023)
ReLAM: Learning Anticipation Model for Rewarding Visual Robotic Manipulation
par: Tang, Nan, et autres
Publié: (2025)
par: Tang, Nan, et autres
Publié: (2025)
Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models
par: Zhou, Xin, et autres
Publié: (2025)
par: Zhou, Xin, et autres
Publié: (2025)
Bootstrapping Language Models with DPO Implicit Rewards
par: Chen, Changyu, et autres
Publié: (2024)
par: Chen, Changyu, et autres
Publié: (2024)
Dancing with Critiques: Enhancing LLM Reasoning with Stepwise Natural Language Self-Critique
par: Li, Yansi, et autres
Publié: (2025)
par: Li, Yansi, et autres
Publié: (2025)
Rethinking Thinking Tokens: LLMs as Improvement Operators
par: Madaan, Lovish, et autres
Publié: (2025)
par: Madaan, Lovish, et autres
Publié: (2025)
LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training
par: Wu, Bo, et autres
Publié: (2025)
par: Wu, Bo, et autres
Publié: (2025)
You Only Look at Screens: Multimodal Chain-of-Action Agents
par: Zhang, Zhuosheng, et autres
Publié: (2023)
par: Zhang, Zhuosheng, et autres
Publié: (2023)
VR-Thinker: Boosting Video Reward Models through Thinking-with-Image Reasoning
par: Wang, Qunzhong, et autres
Publié: (2025)
par: Wang, Qunzhong, et autres
Publié: (2025)
ALAS: Autonomous Learning Agent for Self-Updating Language Models
par: Atreja, Dhruv
Publié: (2025)
par: Atreja, Dhruv
Publié: (2025)
TLDR: Token-Level Detective Reward Model for Large Vision Language Models
par: Fu, Deqing, et autres
Publié: (2024)
par: Fu, Deqing, et autres
Publié: (2024)
Training Language Model to Critique for Better Refinement
par: Yu, Tianshu, et autres
Publié: (2025)
par: Yu, Tianshu, et autres
Publié: (2025)
Process-based Self-Rewarding Language Models
par: Zhang, Shimao, et autres
Publié: (2025)
par: Zhang, Shimao, et autres
Publié: (2025)
Reconstruct or Generate: Exploring the Spectrum of Generative Modeling for Cardiac MRI
par: Bubeck, Niklas, et autres
Publié: (2025)
par: Bubeck, Niklas, et autres
Publié: (2025)
Self-Evolving Critique Abilities in Large Language Models
par: Tang, Zhengyang, et autres
Publié: (2025)
par: Tang, Zhengyang, et autres
Publié: (2025)
SUDER: Self-Improving Unified Large Multimodal Models for Understanding and Generation with Dual Self-Rewards
par: Hong, Jixiang, et autres
Publié: (2025)
par: Hong, Jixiang, et autres
Publié: (2025)
Reward-SQL: Boosting Text-to-SQL via Stepwise Reasoning and Process-Supervised Rewards
par: Zhang, Yuxin, et autres
Publié: (2025)
par: Zhang, Yuxin, et autres
Publié: (2025)
Beyond Sparse Rewards: Enhancing Reinforcement Learning with Language Model Critique in Text Generation
par: Cao, Meng, et autres
Publié: (2024)
par: Cao, Meng, et autres
Publié: (2024)
VAR: Visual Analysis for Rashomon Set of Machine Learning Models' Performance
par: Jin, Yuanzhe
Publié: (2025)
par: Jin, Yuanzhe
Publié: (2025)
NN-Based Joint Mitigation of IQ Imbalance and PA Nonlinearity With Multiple States
par: Zhang, Yundi, et autres
Publié: (2025)
par: Zhang, Yundi, et autres
Publié: (2025)
Unsupervised whole-heart function assessment
par: Zhang, Yundi, et autres
Publié: (2025)
par: Zhang, Yundi, et autres
Publié: (2025)
NN-Based Frequency Domain DPD for OFDM Massive MIMO Transmitters With Multiple States
par: Zhang, Yundi, et autres
Publié: (2025)
par: Zhang, Yundi, et autres
Publié: (2025)
Self-Rewarding PPO: Aligning Large Language Models with Demonstrations Only
par: Zhang, Qingru, et autres
Publié: (2025)
par: Zhang, Qingru, et autres
Publié: (2025)
Critique-RL: Training Language Models for Critiquing through Two-Stage Reinforcement Learning
par: Xi, Zhiheng, et autres
Publié: (2025)
par: Xi, Zhiheng, et autres
Publié: (2025)
ReflectRM: Boosting Generative Reward Models via Self-Reflection within a Unified Judgment Framework
par: Qin, Kai, et autres
Publié: (2026)
par: Qin, Kai, et autres
Publié: (2026)
Documents similaires
-
Law of the Weakest Link: Cross Capabilities of Large Language Models
par: Zhong, Ming, et autres
Publié: (2024) -
A Systematic Examination of Preference Learning through the Lens of Instruction-Following
par: Kim, Joongwon, et autres
Publié: (2024) -
Time is Encoded in the Weights of Finetuned Language Models
par: Nylund, Kai, et autres
Publié: (2023) -
Diversity-driven Data Selection for Language Model Tuning through Sparse Autoencoder
par: Yang, Xianjun, et autres
Publié: (2025) -
Self-Rewarding Language Models
par: Yuan, Weizhe, et autres
Publié: (2024)