Agentic Reward Modeling: Integrating Human Preferences with Verifiable Correctness Signals for Reliable Reward Systems
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Peng, Hao, Qi, Yunjia, Wang, Xiaozhi, Yao, Zijun, Xu, Bin, Hou, Lei, Li, Juanzi |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
WildReward: Learning Reward Models from In-the-Wild Human Interactions
von: Peng, Hao, et al.
Veröffentlicht: (2026)
von: Peng, Hao, et al.
Veröffentlicht: (2026)
StoryAlign: Evaluating and Training Reward Models for Story Generation
von: Xia, Haotian, et al.
Veröffentlicht: (2026)
von: Xia, Haotian, et al.
Veröffentlicht: (2026)
Constraint Back-translation Improves Complex Instruction Following of Large Language Models
von: Qi, Yunjia, et al.
Veröffentlicht: (2024)
von: Qi, Yunjia, et al.
Veröffentlicht: (2024)
AGENTIF: Benchmarking Instruction Following of Large Language Models in Agentic Scenarios
von: Qi, Yunjia, et al.
Veröffentlicht: (2025)
von: Qi, Yunjia, et al.
Veröffentlicht: (2025)
VerIF: Verification Engineering for Reinforcement Learning in Instruction Following
von: Peng, Hao, et al.
Veröffentlicht: (2025)
von: Peng, Hao, et al.
Veröffentlicht: (2025)
StoryWriter: A Multi-Agent Framework for Long Story Generation
von: Xia, Haotian, et al.
Veröffentlicht: (2025)
von: Xia, Haotian, et al.
Veröffentlicht: (2025)
ADELIE: Aligning Large Language Models on Information Extraction
von: Qi, Yunjia, et al.
Veröffentlicht: (2024)
von: Qi, Yunjia, et al.
Veröffentlicht: (2024)
MAVEN-Fact: A Large-scale Event Factuality Detection Dataset
von: Li, Chunyang, et al.
Veröffentlicht: (2024)
von: Li, Chunyang, et al.
Veröffentlicht: (2024)
RM-Bench: Benchmarking Reward Models of Language Models with Subtlety and Style
von: Liu, Yantao, et al.
Veröffentlicht: (2024)
von: Liu, Yantao, et al.
Veröffentlicht: (2024)
Towards Understanding Safety Alignment: A Mechanistic Perspective from Safety Neurons
von: Chen, Jianhui, et al.
Veröffentlicht: (2024)
von: Chen, Jianhui, et al.
Veröffentlicht: (2024)
AgentV-RL: Scaling Reward Modeling with Agentic Verifier
von: Zhang, Jiazheng, et al.
Veröffentlicht: (2026)
von: Zhang, Jiazheng, et al.
Veröffentlicht: (2026)
Guiding LLM Post-training Data Engineering with Model Internals from Sparse Autoencoders
von: Jing, Yi, et al.
Veröffentlicht: (2026)
von: Jing, Yi, et al.
Veröffentlicht: (2026)
On the Paradoxical Interference between Instruction-Following and Task Solving
von: Qi, Yunjia, et al.
Veröffentlicht: (2026)
von: Qi, Yunjia, et al.
Veröffentlicht: (2026)
LLMAEL: Large Language Models are Good Context Augmenters for Entity Linking
von: Xin, Amy, et al.
Veröffentlicht: (2024)
von: Xin, Amy, et al.
Veröffentlicht: (2024)
Pre-training Distillation for Large Language Models: A Design Space Exploration
von: Peng, Hao, et al.
Veröffentlicht: (2024)
von: Peng, Hao, et al.
Veröffentlicht: (2024)
Auxiliary Metrics Help Decoding Skill Neurons in the Wild
von: Zhao, Yixiu, et al.
Veröffentlicht: (2025)
von: Zhao, Yixiu, et al.
Veröffentlicht: (2025)
Beyond Outcome Verification: Verifiable Process Reward Models for Structured Reasoning
von: Pronesti, Massimiliano, et al.
Veröffentlicht: (2026)
von: Pronesti, Massimiliano, et al.
Veröffentlicht: (2026)
Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs
von: Wen, Xumeng, et al.
Veröffentlicht: (2025)
von: Wen, Xumeng, et al.
Veröffentlicht: (2025)
VerifyBench: Benchmarking Reference-based Reward Systems for Large Language Models
von: Yan, Yuchen, et al.
Veröffentlicht: (2025)
von: Yan, Yuchen, et al.
Veröffentlicht: (2025)
Gradient Regularization Prevents Reward Hacking in Reinforcement Learning from Human Feedback and Verifiable Rewards
von: Ackermann, Johannes, et al.
Veröffentlicht: (2026)
von: Ackermann, Johannes, et al.
Veröffentlicht: (2026)
Rewarding Creativity: A Human-Aligned Generative Reward Model for Reinforcement Learning in Storytelling
von: Li, Zhaoyan, et al.
Veröffentlicht: (2026)
von: Li, Zhaoyan, et al.
Veröffentlicht: (2026)
Inference-Time Scaling for Generalist Reward Modeling
von: Liu, Zijun, et al.
Veröffentlicht: (2025)
von: Liu, Zijun, et al.
Veröffentlicht: (2025)
Event-level Knowledge Editing
von: Peng, Hao, et al.
Veröffentlicht: (2024)
von: Peng, Hao, et al.
Veröffentlicht: (2024)
MRCEval: A Comprehensive, Challenging and Accessible Machine Reading Comprehension Benchmark
von: Ma, Shengkun, et al.
Veröffentlicht: (2025)
von: Ma, Shengkun, et al.
Veröffentlicht: (2025)
No Verifiable Reward for Prosody: Toward Preference-Guided Prosody Learning in TTS
von: Shin, Seungyoun, et al.
Veröffentlicht: (2025)
von: Shin, Seungyoun, et al.
Veröffentlicht: (2025)
LinguaLens: Towards Interpreting Linguistic Mechanisms of Large Language Models via Sparse Auto-Encoder
von: Jing, Yi, et al.
Veröffentlicht: (2025)
von: Jing, Yi, et al.
Veröffentlicht: (2025)
ChatLog: Carefully Evaluating the Evolution of ChatGPT Across Time
von: Tu, Shangqing, et al.
Veröffentlicht: (2023)
von: Tu, Shangqing, et al.
Veröffentlicht: (2023)
Process Rewards with Learned Reliability
von: Li, Jinyuan, et al.
Veröffentlicht: (2026)
von: Li, Jinyuan, et al.
Veröffentlicht: (2026)
Trust, But Verify: A Self-Verification Approach to Reinforcement Learning with Verifiable Rewards
von: Liu, Xiaoyuan, et al.
Veröffentlicht: (2025)
von: Liu, Xiaoyuan, et al.
Veröffentlicht: (2025)
Difficulty-Based Preference Data Selection by DPO Implicit Reward Gap
von: Qi, Xuan, et al.
Veröffentlicht: (2025)
von: Qi, Xuan, et al.
Veröffentlicht: (2025)
RewardFlow: Topology-Aware Reward Propagation on State Graphs for Agentic RL with Large Language Models
von: Feng, Xiao, et al.
Veröffentlicht: (2026)
von: Feng, Xiao, et al.
Veröffentlicht: (2026)
OpenEP: Open-Ended Future Event Prediction
von: Guan, Yong, et al.
Veröffentlicht: (2024)
von: Guan, Yong, et al.
Veröffentlicht: (2024)
A Cause-Effect Look at Alleviating Hallucination of Knowledge-grounded Dialogue Generation
von: Yu, Jifan, et al.
Veröffentlicht: (2024)
von: Yu, Jifan, et al.
Veröffentlicht: (2024)
Evaluating Generative Language Models in Information Extraction as Subjective Question Correction
von: Fan, Yuchen, et al.
Veröffentlicht: (2024)
von: Fan, Yuchen, et al.
Veröffentlicht: (2024)
VRM: Teaching Reward Models to Understand Authentic Human Preferences
von: Liu, Biao, et al.
Veröffentlicht: (2026)
von: Liu, Biao, et al.
Veröffentlicht: (2026)
Verifiable Process Rewards for Agentic Reasoning
von: Yuan, Huining, et al.
Veröffentlicht: (2026)
von: Yuan, Huining, et al.
Veröffentlicht: (2026)
Auditing Data Membership in Reinforcement Learning With Verifiable Rewards
von: Liu, Yule, et al.
Veröffentlicht: (2025)
von: Liu, Yule, et al.
Veröffentlicht: (2025)
Reward Shaping to Mitigate Reward Hacking in RLHF
von: Fu, Jiayi, et al.
Veröffentlicht: (2025)
von: Fu, Jiayi, et al.
Veröffentlicht: (2025)
Aligning Teacher with Student Preferences for Tailored Training Data Generation
von: Liu, Yantao, et al.
Veröffentlicht: (2024)
von: Liu, Yantao, et al.
Veröffentlicht: (2024)
RAG-RewardBench: Benchmarking Reward Models in Retrieval Augmented Generation for Preference Alignment
von: Jin, Zhuoran, et al.
Veröffentlicht: (2024)
von: Jin, Zhuoran, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
WildReward: Learning Reward Models from In-the-Wild Human Interactions
von: Peng, Hao, et al.
Veröffentlicht: (2026) -
StoryAlign: Evaluating and Training Reward Models for Story Generation
von: Xia, Haotian, et al.
Veröffentlicht: (2026) -
Constraint Back-translation Improves Complex Instruction Following of Large Language Models
von: Qi, Yunjia, et al.
Veröffentlicht: (2024) -
AGENTIF: Benchmarking Instruction Following of Large Language Models in Agentic Scenarios
von: Qi, Yunjia, et al.
Veröffentlicht: (2025) -
VerIF: Verification Engineering for Reinforcement Learning in Instruction Following
von: Peng, Hao, et al.
Veröffentlicht: (2025)