Better Language Model-Based Judging Reward Modeling through Scaling Comprehension Boundaries
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ning, Meiling, Zhang, Zhongbao, Ye, Junda, Guo, Jiabao, Guan, Qingyuan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
R-Align: Enhancing Generative Reward Models through Rationale-Centric Meta-Judging
par: Lai, Yanlin, et autres
Publié: (2026)
par: Lai, Yanlin, et autres
Publié: (2026)
Checklists Are Better Than Reward Models For Aligning Language Models
par: Viswanathan, Vijay, et autres
Publié: (2025)
par: Viswanathan, Vijay, et autres
Publié: (2025)
The Accuracy Paradox in RLHF: When Better Reward Models Don't Yield Better Language Models
par: Chen, Yanjun, et autres
Publié: (2024)
par: Chen, Yanjun, et autres
Publié: (2024)
Advancing Text Classification with Large Language Models and Neural Attention Mechanisms
par: Lyu, Ning, et autres
Publié: (2025)
par: Lyu, Ning, et autres
Publié: (2025)
Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models
par: Ding, Meidan, et autres
Publié: (2025)
par: Ding, Meidan, et autres
Publié: (2025)
AdaJudge: Adaptive Multi-Perspective Judging for Reward Modeling
par: Miao, Yongliang, et autres
Publié: (2026)
par: Miao, Yongliang, et autres
Publié: (2026)
Language Models that Think, Chat Better
par: Bhaskar, Adithya, et autres
Publié: (2025)
par: Bhaskar, Adithya, et autres
Publié: (2025)
IF-RewardBench: Benchmarking Judge Models for Instruction-Following Evaluation
par: Wen, Bosi, et autres
Publié: (2026)
par: Wen, Bosi, et autres
Publié: (2026)
Knowledge-Augmented Large Language Model Agents for Explainable Financial Decision-Making
par: Zhang, Qingyuan, et autres
Publié: (2025)
par: Zhang, Qingyuan, et autres
Publié: (2025)
Judge as A Judge: Improving the Evaluation of Retrieval-Augmented Generation through the Judge-Consistency of Large Language Models
par: Liu, Shuliang, et autres
Publié: (2025)
par: Liu, Shuliang, et autres
Publié: (2025)
Judging the Judges: Can Large Vision-Language Models Fairly Evaluate Chart Comprehension and Reasoning?
par: Laskar, Md Tahmid Rahman, et autres
Publié: (2025)
par: Laskar, Md Tahmid Rahman, et autres
Publié: (2025)
FedJudge: Federated Legal Large Language Model
par: Yue, Linan, et autres
Publié: (2023)
par: Yue, Linan, et autres
Publié: (2023)
Ensembling Large Language Models with Process Reward-Guided Tree Search for Better Complex Reasoning
par: Park, Sungjin, et autres
Publié: (2024)
par: Park, Sungjin, et autres
Publié: (2024)
LLM-as-a-Judge & Reward Model: What They Can and Cannot Do
par: Son, Guijin, et autres
Publié: (2024)
par: Son, Guijin, et autres
Publié: (2024)
Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge
par: Wu, Tianhao, et autres
Publié: (2024)
par: Wu, Tianhao, et autres
Publié: (2024)
Energy-Based Reward Models for Robust Language Model Alignment
par: Lochab, Anamika, et autres
Publié: (2025)
par: Lochab, Anamika, et autres
Publié: (2025)
Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey
par: Liu, Qiyuan, et autres
Publié: (2025)
par: Liu, Qiyuan, et autres
Publié: (2025)
CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards
par: Zhang, Taolin, et autres
Publié: (2025)
par: Zhang, Taolin, et autres
Publié: (2025)
Better Process Supervision with Bi-directional Rewarding Signals
par: Chen, Wenxiang, et autres
Publié: (2025)
par: Chen, Wenxiang, et autres
Publié: (2025)
RMB: Comprehensively Benchmarking Reward Models in LLM Alignment
par: Zhou, Enyu, et autres
Publié: (2024)
par: Zhou, Enyu, et autres
Publié: (2024)
Making Large Language Models Perform Better in Knowledge Graph Completion
par: Zhang, Yichi, et autres
Publié: (2023)
par: Zhang, Yichi, et autres
Publié: (2023)
Beyond Scalar Reward Model: Learning Generative Judge from Preference Data
par: Ye, Ziyi, et autres
Publié: (2024)
par: Ye, Ziyi, et autres
Publié: (2024)
Igniting Creative Writing in Small Language Models: LLM-as-a-Judge versus Multi-Agent Refined Rewards
par: Wei, Xiaolong, et autres
Publié: (2025)
par: Wei, Xiaolong, et autres
Publié: (2025)
Debate Helps Weak Judges Reward Stronger Models
par: Elasky, Ethan, et autres
Publié: (2026)
par: Elasky, Ethan, et autres
Publié: (2026)
LongRM: Revealing and Unlocking the Context Boundary of Reward Modeling
par: Tang, Zecheng, et autres
Publié: (2025)
par: Tang, Zecheng, et autres
Publié: (2025)
S2J: Bridging the Gap Between Solving and Judging Ability in Generative Reward Models
par: Sun, Shaoning, et autres
Publié: (2025)
par: Sun, Shaoning, et autres
Publié: (2025)
Limited Preference Data? Learning Better Reward Model with Latent Space Synthesis
par: Tao, Leitian, et autres
Publié: (2025)
par: Tao, Leitian, et autres
Publié: (2025)
Smaller Language Models Are Better Instruction Evolvers
par: Hui, Tingfeng, et autres
Publié: (2024)
par: Hui, Tingfeng, et autres
Publié: (2024)
Sentence-level Reward Model can Generalize Better for Aligning LLM from Human Preference
par: Qiu, Wenjie, et autres
Publié: (2025)
par: Qiu, Wenjie, et autres
Publié: (2025)
Advancing the Robustness of Large Language Models through Self-Denoised Smoothing
par: Ji, Jiabao, et autres
Publié: (2024)
par: Ji, Jiabao, et autres
Publié: (2024)
Training Language Model to Critique for Better Refinement
par: Yu, Tianshu, et autres
Publié: (2025)
par: Yu, Tianshu, et autres
Publié: (2025)
Continual Learning Using Only Large Language Model Prompting
par: Qiu, Jiabao, et autres
Publié: (2024)
par: Qiu, Jiabao, et autres
Publié: (2024)
MM-Eval: A Multilingual Meta-Evaluation Benchmark for LLM-as-a-Judge and Reward Models
par: Son, Guijin, et autres
Publié: (2024)
par: Son, Guijin, et autres
Publié: (2024)
Rule or Story, Which is a Better Commonsense Expression for Talking with Large Language Models?
par: Bian, Ning, et autres
Publié: (2024)
par: Bian, Ning, et autres
Publié: (2024)
Reward Modeling with Weak Supervision for Language Models
par: Hauptvogel, Ben, et autres
Publié: (2024)
par: Hauptvogel, Ben, et autres
Publié: (2024)
Advancing Block Diffusion Language Models for Test-Time Scaling
par: Lu, Yi, et autres
Publié: (2026)
par: Lu, Yi, et autres
Publié: (2026)
TLDR: Token-Level Detective Reward Model for Large Vision Language Models
par: Fu, Deqing, et autres
Publié: (2024)
par: Fu, Deqing, et autres
Publié: (2024)
RARE: Retrieval-Augmented Reasoning Enhancement for Large Language Models
par: Tran, Hieu, et autres
Publié: (2024)
par: Tran, Hieu, et autres
Publié: (2024)
MT-RewardTree: A Comprehensive Framework for Advancing LLM-Based Machine Translation via Reward Modeling
par: Feng, Zhaopeng, et autres
Publié: (2025)
par: Feng, Zhaopeng, et autres
Publié: (2025)
Dynamic Scaling of Unit Tests for Code Reward Modeling
par: Ma, Zeyao, et autres
Publié: (2025)
par: Ma, Zeyao, et autres
Publié: (2025)
Documents similaires
-
R-Align: Enhancing Generative Reward Models through Rationale-Centric Meta-Judging
par: Lai, Yanlin, et autres
Publié: (2026) -
Checklists Are Better Than Reward Models For Aligning Language Models
par: Viswanathan, Vijay, et autres
Publié: (2025) -
The Accuracy Paradox in RLHF: When Better Reward Models Don't Yield Better Language Models
par: Chen, Yanjun, et autres
Publié: (2024) -
Advancing Text Classification with Large Language Models and Neural Attention Mechanisms
par: Lyu, Ning, et autres
Publié: (2025) -
Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models
par: Ding, Meidan, et autres
Publié: (2025)