Reward Models are Metrics in a Trench Coat
Fuente:
arXiv
Gespeichert in:
| 1. Verfasser: | Gehrmann, Sebastian |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
T-RAG: Lessons from the LLM Trenches
von: Fatehkia, Masoomali, et al.
Veröffentlicht: (2024)
von: Fatehkia, Masoomali, et al.
Veröffentlicht: (2024)
Reward Model Perspectives: Whose Opinions Do Reward Models Reward?
von: Elle
Veröffentlicht: (2025)
von: Elle
Veröffentlicht: (2025)
Beyond Overlap Metrics: Rewarding Reasoning and Preferences for Faithful Multi-Role Dialogue Summarization
von: Mei, Xiaoyong, et al.
Veröffentlicht: (2026)
von: Mei, Xiaoyong, et al.
Veröffentlicht: (2026)
Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs
von: Liu, Chris Yuhao, et al.
Veröffentlicht: (2024)
von: Liu, Chris Yuhao, et al.
Veröffentlicht: (2024)
Tiny Reward Models
von: Pan, Sarah
Veröffentlicht: (2025)
von: Pan, Sarah
Veröffentlicht: (2025)
GRAM: A Generative Foundation Reward Model for Reward Generalization
von: Wang, Chenglong, et al.
Veröffentlicht: (2025)
von: Wang, Chenglong, et al.
Veröffentlicht: (2025)
ANLS* -- A Universal Document Processing Metric for Generative Large Language Models
von: Peer, David, et al.
Veröffentlicht: (2024)
von: Peer, David, et al.
Veröffentlicht: (2024)
WildReward: Learning Reward Models from In-the-Wild Human Interactions
von: Peng, Hao, et al.
Veröffentlicht: (2026)
von: Peng, Hao, et al.
Veröffentlicht: (2026)
M-RewardBench: Evaluating Reward Models in Multilingual Settings
von: Gureja, Srishti, et al.
Veröffentlicht: (2024)
von: Gureja, Srishti, et al.
Veröffentlicht: (2024)
Self-Rewarding Language Models
von: Yuan, Weizhe, et al.
Veröffentlicht: (2024)
von: Yuan, Weizhe, et al.
Veröffentlicht: (2024)
MemoryRewardBench: Benchmarking Reward Models for Long-Term Memory Management in Large Language Models
von: Tang, Zecheng, et al.
Veröffentlicht: (2026)
von: Tang, Zecheng, et al.
Veröffentlicht: (2026)
PARM: Pipeline-Adapted Reward Model
von: Fan, Xingyu, et al.
Veröffentlicht: (2026)
von: Fan, Xingyu, et al.
Veröffentlicht: (2026)
Exploring Reasoning Reward Model for Agents
von: Fan, Kaixuan, et al.
Veröffentlicht: (2026)
von: Fan, Kaixuan, et al.
Veröffentlicht: (2026)
Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision
von: Pala, Tej Deep, et al.
Veröffentlicht: (2025)
von: Pala, Tej Deep, et al.
Veröffentlicht: (2025)
Agentic Reward Modeling: Integrating Human Preferences with Verifiable Correctness Signals for Reliable Reward Systems
von: Peng, Hao, et al.
Veröffentlicht: (2025)
von: Peng, Hao, et al.
Veröffentlicht: (2025)
One Bias After Another: Mechanistic Reward Shaping and Persistent Biases in Language Reward Models
von: Fein, Daniel, et al.
Veröffentlicht: (2026)
von: Fein, Daniel, et al.
Veröffentlicht: (2026)
West-of-N: Synthetic Preferences for Self-Improving Reward Models
von: Pace, Alizée, et al.
Veröffentlicht: (2024)
von: Pace, Alizée, et al.
Veröffentlicht: (2024)
Process-based Self-Rewarding Language Models
von: Zhang, Shimao, et al.
Veröffentlicht: (2025)
von: Zhang, Shimao, et al.
Veröffentlicht: (2025)
CAMEL: Confidence-Gated Reflection for Reward Modeling
von: Zhu, Zirui, et al.
Veröffentlicht: (2026)
von: Zhu, Zirui, et al.
Veröffentlicht: (2026)
Process Reward Model with Q-Value Rankings
von: Li, Wendi, et al.
Veröffentlicht: (2024)
von: Li, Wendi, et al.
Veröffentlicht: (2024)
Retell, Reward, Repeat: Reinforcement Learning for Narrative Theory-Informed Story Generation
von: Liu, David Y., et al.
Veröffentlicht: (2026)
von: Liu, David Y., et al.
Veröffentlicht: (2026)
A Systematic Analysis of Base Model Choice for Reward Modeling
von: Ahrabian, Kian, et al.
Veröffentlicht: (2025)
von: Ahrabian, Kian, et al.
Veröffentlicht: (2025)
Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents
von: Men, Tianyi, et al.
Veröffentlicht: (2025)
von: Men, Tianyi, et al.
Veröffentlicht: (2025)
MT-RewardTree: A Comprehensive Framework for Advancing LLM-Based Machine Translation via Reward Modeling
von: Feng, Zhaopeng, et al.
Veröffentlicht: (2025)
von: Feng, Zhaopeng, et al.
Veröffentlicht: (2025)
LLMR: Knowledge Distillation with a Large Language Model-Induced Reward
von: Li, Dongheng, et al.
Veröffentlicht: (2024)
von: Li, Dongheng, et al.
Veröffentlicht: (2024)
SAFER: Probing Safety in Reward Models with Sparse Autoencoder
von: Shi, Wei, et al.
Veröffentlicht: (2025)
von: Shi, Wei, et al.
Veröffentlicht: (2025)
Detecting Prefix Bias in LLM-based Reward Models
von: Kumar, Ashwin, et al.
Veröffentlicht: (2025)
von: Kumar, Ashwin, et al.
Veröffentlicht: (2025)
Rubric-Guided Process Reward for Stepwise Model Routing
von: Ye, Shenghao, et al.
Veröffentlicht: (2026)
von: Ye, Shenghao, et al.
Veröffentlicht: (2026)
Cross-lingual Transfer of Reward Models in Multilingual Alignment
von: Hong, Jiwoo, et al.
Veröffentlicht: (2024)
von: Hong, Jiwoo, et al.
Veröffentlicht: (2024)
RATE: Causal Explainability of Reward Models with Imperfect Counterfactuals
von: Reber, David, et al.
Veröffentlicht: (2024)
von: Reber, David, et al.
Veröffentlicht: (2024)
RewardAnything: Generalizable Principle-Following Reward Models
von: Yu, Zhuohao, et al.
Veröffentlicht: (2025)
von: Yu, Zhuohao, et al.
Veröffentlicht: (2025)
Evaluating and Improving Cultural Awareness of Reward Models for LLM Alignment
von: Zhang, Hongbin, et al.
Veröffentlicht: (2025)
von: Zhang, Hongbin, et al.
Veröffentlicht: (2025)
Segmenting Text and Learning Their Rewards for Improved RLHF in Language Model
von: Yin, Yueqin, et al.
Veröffentlicht: (2025)
von: Yin, Yueqin, et al.
Veröffentlicht: (2025)
ToolRM: Towards Agentic Tool-Use Reward Modeling
von: Li, Renhao, et al.
Veröffentlicht: (2025)
von: Li, Renhao, et al.
Veröffentlicht: (2025)
Best-of-L: Cross-Lingual Reward Modeling for Mathematical Reasoning
von: Rajaee, Sara, et al.
Veröffentlicht: (2025)
von: Rajaee, Sara, et al.
Veröffentlicht: (2025)
LongRM: Revealing and Unlocking the Context Boundary of Reward Modeling
von: Tang, Zecheng, et al.
Veröffentlicht: (2025)
von: Tang, Zecheng, et al.
Veröffentlicht: (2025)
Logical Reasoning with Outcome Reward Models for Test-Time Scaling
von: Thatikonda, Ramya Keerthy, et al.
Veröffentlicht: (2025)
von: Thatikonda, Ramya Keerthy, et al.
Veröffentlicht: (2025)
Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning
von: Turpin, Miles, et al.
Veröffentlicht: (2025)
von: Turpin, Miles, et al.
Veröffentlicht: (2025)
StoryAlign: Evaluating and Training Reward Models for Story Generation
von: Xia, Haotian, et al.
Veröffentlicht: (2026)
von: Xia, Haotian, et al.
Veröffentlicht: (2026)
Sequence to Sequence Reward Modeling: Improving RLHF by Language Feedback
von: Zhou, Jiayi, et al.
Veröffentlicht: (2024)
von: Zhou, Jiayi, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
T-RAG: Lessons from the LLM Trenches
von: Fatehkia, Masoomali, et al.
Veröffentlicht: (2024) -
Reward Model Perspectives: Whose Opinions Do Reward Models Reward?
von: Elle
Veröffentlicht: (2025) -
Beyond Overlap Metrics: Rewarding Reasoning and Preferences for Faithful Multi-Role Dialogue Summarization
von: Mei, Xiaoyong, et al.
Veröffentlicht: (2026) -
Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs
von: Liu, Chris Yuhao, et al.
Veröffentlicht: (2024) -
Tiny Reward Models
von: Pan, Sarah
Veröffentlicht: (2025)