Sailing by the Stars: A Survey on Reward Models and Learning Strategies for Learning from Rewards
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Wu, Xiaobao |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
WildReward: Learning Reward Models from In-the-Wild Human Interactions
par: Peng, Hao, et autres
Publié: (2026)
par: Peng, Hao, et autres
Publié: (2026)
OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning
par: Hu, Ziyou, et autres
Publié: (2025)
par: Hu, Ziyou, et autres
Publié: (2025)
Text2Reward: Reward Shaping with Language Models for Reinforcement Learning
par: Xie, Tianbao, et autres
Publié: (2023)
par: Xie, Tianbao, et autres
Publié: (2023)
A Survey on Progress in LLM Alignment from the Perspective of Reward Design
par: Ji, Miaomiao, et autres
Publié: (2025)
par: Ji, Miaomiao, et autres
Publié: (2025)
Agentic Reinforcement Learning with Implicit Step Rewards
par: Liu, Xiaoqian, et autres
Publié: (2025)
par: Liu, Xiaoqian, et autres
Publié: (2025)
R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning
par: Zhang, Yi-Fan, et autres
Publié: (2025)
par: Zhang, Yi-Fan, et autres
Publié: (2025)
Preference Poisoning Attacks on Reward Model Learning
par: Wu, Junlin, et autres
Publié: (2024)
par: Wu, Junlin, et autres
Publié: (2024)
Reward Reasoning Model
par: Guo, Jiaxin, et autres
Publié: (2025)
par: Guo, Jiaxin, et autres
Publié: (2025)
Libra: Assessing and Improving Reward Model by Learning to Think
par: Zhou, Meng, et autres
Publié: (2025)
par: Zhou, Meng, et autres
Publié: (2025)
Learning Goal-Conditioned Representations for Language Reward Models
par: Nath, Vaskar, et autres
Publié: (2024)
par: Nath, Vaskar, et autres
Publié: (2024)
Learning Ordinal Probabilistic Reward from Preferences
par: Chen, Longze, et autres
Publié: (2026)
par: Chen, Longze, et autres
Publié: (2026)
Reward Model Perspectives: Whose Opinions Do Reward Models Reward?
par: Elle
Publié: (2025)
par: Elle
Publié: (2025)
RRM: Robust Reward Model Training Mitigates Reward Hacking
par: Liu, Tianqi, et autres
Publié: (2024)
par: Liu, Tianqi, et autres
Publié: (2024)
RewardBench 2: Advancing Reward Model Evaluation
par: Malik, Saumya, et autres
Publié: (2025)
par: Malik, Saumya, et autres
Publié: (2025)
Full-Step-DPO: Self-Supervised Preference Optimization with Step-wise Rewards for Mathematical Reasoning
par: Xu, Huimin, et autres
Publié: (2025)
par: Xu, Huimin, et autres
Publié: (2025)
Reuse Your Rewards: Reward Model Transfer for Zero-Shot Cross-Lingual Alignment
par: Wu, Zhaofeng, et autres
Publié: (2024)
par: Wu, Zhaofeng, et autres
Publié: (2024)
Rewarding Creativity: A Human-Aligned Generative Reward Model for Reinforcement Learning in Storytelling
par: Li, Zhaoyan, et autres
Publié: (2026)
par: Li, Zhaoyan, et autres
Publié: (2026)
Tool-Augmented Reward Modeling
par: Li, Lei, et autres
Publié: (2023)
par: Li, Lei, et autres
Publié: (2023)
Reward Models Can Improve Themselves: Reward-Guided Adversarial Failure Mode Discovery for Robust Reward Modeling
par: Pathmanathan, Pankayaraj, et autres
Publié: (2025)
par: Pathmanathan, Pankayaraj, et autres
Publié: (2025)
Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey
par: Liu, Qiyuan, et autres
Publié: (2025)
par: Liu, Qiyuan, et autres
Publié: (2025)
Dynamic Reward Adjustment in Multi-Reward Reinforcement Learning for Counselor Reflection Generation
par: Min, Do June, et autres
Publié: (2024)
par: Min, Do June, et autres
Publié: (2024)
Generalizing Reward Modeling for Out-of-Distribution Preference Learning
par: Jia, Chen
Publié: (2024)
par: Jia, Chen
Publié: (2024)
Remedy: Learning Machine Translation Evaluation from Human Preferences with Reward Modeling
par: Tan, Shaomu, et autres
Publié: (2025)
par: Tan, Shaomu, et autres
Publié: (2025)
IFDECORATOR: Wrapping Instruction Following Reinforcement Learning with Verifiable Rewards
par: Guo, Xu, et autres
Publié: (2025)
par: Guo, Xu, et autres
Publié: (2025)
DocReward: A Document Reward Model for Structuring and Stylizing
par: Liu, Junpeng, et autres
Publié: (2025)
par: Liu, Junpeng, et autres
Publié: (2025)
GRAM: A Generative Foundation Reward Model for Reward Generalization
par: Wang, Chenglong, et autres
Publié: (2025)
par: Wang, Chenglong, et autres
Publié: (2025)
Learning to Reason without External Rewards
par: Zhao, Xuandong, et autres
Publié: (2025)
par: Zhao, Xuandong, et autres
Publié: (2025)
Self-Evolved Reward Learning for LLMs
par: Huang, Chenghua, et autres
Publié: (2024)
par: Huang, Chenghua, et autres
Publié: (2024)
Multi-Objective and Mixed-Reward Reinforcement Learning via Reward-Decorrelated Policy Optimization
par: Bai, Yang, et autres
Publié: (2026)
par: Bai, Yang, et autres
Publié: (2026)
Towards Robust Process Reward Modeling via Noise-aware Learning
par: Xie, Bin, et autres
Publié: (2026)
par: Xie, Bin, et autres
Publié: (2026)
Process Rewards with Learned Reliability
par: Li, Jinyuan, et autres
Publié: (2026)
par: Li, Jinyuan, et autres
Publié: (2026)
Reinforcement Learning Amplifies Emergent Misalignment from Harmless Rewards
par: Jørgenvåg, Magnus, et autres
Publié: (2026)
par: Jørgenvåg, Magnus, et autres
Publié: (2026)
Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs
par: Liu, Chris Yuhao, et autres
Publié: (2024)
par: Liu, Chris Yuhao, et autres
Publié: (2024)
Rethinking Sample Polarity in Reinforcement Learning with Verifiable Rewards
par: Tang, Xinyu, et autres
Publié: (2025)
par: Tang, Xinyu, et autres
Publié: (2025)
A Comprehensive Survey of Reward Models: Taxonomy, Applications, Challenges, and Future
par: Zhong, Jialun, et autres
Publié: (2025)
par: Zhong, Jialun, et autres
Publié: (2025)
Reward Auditor: Inference on Reward Modeling Suitability in Real-World Perturbed Scenarios
par: Zang, Jianxiang, et autres
Publié: (2025)
par: Zang, Jianxiang, et autres
Publié: (2025)
ENCORE: Entropy-guided Reward Composition for Multi-head Safety Reward Models
par: Li, Xiaomin, et autres
Publié: (2025)
par: Li, Xiaomin, et autres
Publié: (2025)
Long-form RewardBench: Evaluating Reward Models for Long-form Generation
par: Huang, Hui, et autres
Publié: (2026)
par: Huang, Hui, et autres
Publié: (2026)
Segmenting Text and Learning Their Rewards for Improved RLHF in Language Model
par: Yin, Yueqin, et autres
Publié: (2025)
par: Yin, Yueqin, et autres
Publié: (2025)
Bayesian Preference Learning for Test-Time Steerable Reward Models
par: Hong, Jiwoo, et autres
Publié: (2026)
par: Hong, Jiwoo, et autres
Publié: (2026)
Documents similaires
-
WildReward: Learning Reward Models from In-the-Wild Human Interactions
par: Peng, Hao, et autres
Publié: (2026) -
OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning
par: Hu, Ziyou, et autres
Publié: (2025) -
Text2Reward: Reward Shaping with Language Models for Reinforcement Learning
par: Xie, Tianbao, et autres
Publié: (2023) -
A Survey on Progress in LLM Alignment from the Perspective of Reward Design
par: Ji, Miaomiao, et autres
Publié: (2025) -
Agentic Reinforcement Learning with Implicit Step Rewards
par: Liu, Xiaoqian, et autres
Publié: (2025)