Salvato in:
| Autore principale: | Wu, Xiaobao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2505.02686 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
WildReward: Learning Reward Models from In-the-Wild Human Interactions
di: Peng, Hao, et al.
Pubblicazione: (2026)
di: Peng, Hao, et al.
Pubblicazione: (2026)
Text2Reward: Reward Shaping with Language Models for Reinforcement Learning
di: Xie, Tianbao, et al.
Pubblicazione: (2023)
di: Xie, Tianbao, et al.
Pubblicazione: (2023)
OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning
di: Hu, Ziyou, et al.
Pubblicazione: (2025)
di: Hu, Ziyou, et al.
Pubblicazione: (2025)
A Survey on Progress in LLM Alignment from the Perspective of Reward Design
di: Ji, Miaomiao, et al.
Pubblicazione: (2025)
di: Ji, Miaomiao, et al.
Pubblicazione: (2025)
Preference Poisoning Attacks on Reward Model Learning
di: Wu, Junlin, et al.
Pubblicazione: (2024)
di: Wu, Junlin, et al.
Pubblicazione: (2024)
R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning
di: Zhang, Yi-Fan, et al.
Pubblicazione: (2025)
di: Zhang, Yi-Fan, et al.
Pubblicazione: (2025)
Agentic Reinforcement Learning with Implicit Step Rewards
di: Liu, Xiaoqian, et al.
Pubblicazione: (2025)
di: Liu, Xiaoqian, et al.
Pubblicazione: (2025)
Reward Reasoning Model
di: Guo, Jiaxin, et al.
Pubblicazione: (2025)
di: Guo, Jiaxin, et al.
Pubblicazione: (2025)
Reward Model Perspectives: Whose Opinions Do Reward Models Reward?
di: Elle
Pubblicazione: (2025)
di: Elle
Pubblicazione: (2025)
Full-Step-DPO: Self-Supervised Preference Optimization with Step-wise Rewards for Mathematical Reasoning
di: Xu, Huimin, et al.
Pubblicazione: (2025)
di: Xu, Huimin, et al.
Pubblicazione: (2025)
Libra: Assessing and Improving Reward Model by Learning to Think
di: Zhou, Meng, et al.
Pubblicazione: (2025)
di: Zhou, Meng, et al.
Pubblicazione: (2025)
RRM: Robust Reward Model Training Mitigates Reward Hacking
di: Liu, Tianqi, et al.
Pubblicazione: (2024)
di: Liu, Tianqi, et al.
Pubblicazione: (2024)
Learning Goal-Conditioned Representations for Language Reward Models
di: Nath, Vaskar, et al.
Pubblicazione: (2024)
di: Nath, Vaskar, et al.
Pubblicazione: (2024)
Learning Ordinal Probabilistic Reward from Preferences
di: Chen, Longze, et al.
Pubblicazione: (2026)
di: Chen, Longze, et al.
Pubblicazione: (2026)
Rewarding Creativity: A Human-Aligned Generative Reward Model for Reinforcement Learning in Storytelling
di: Li, Zhaoyan, et al.
Pubblicazione: (2026)
di: Li, Zhaoyan, et al.
Pubblicazione: (2026)
RewardBench 2: Advancing Reward Model Evaluation
di: Malik, Saumya, et al.
Pubblicazione: (2025)
di: Malik, Saumya, et al.
Pubblicazione: (2025)
Reuse Your Rewards: Reward Model Transfer for Zero-Shot Cross-Lingual Alignment
di: Wu, Zhaofeng, et al.
Pubblicazione: (2024)
di: Wu, Zhaofeng, et al.
Pubblicazione: (2024)
Tool-Augmented Reward Modeling
di: Li, Lei, et al.
Pubblicazione: (2023)
di: Li, Lei, et al.
Pubblicazione: (2023)
Dynamic Reward Adjustment in Multi-Reward Reinforcement Learning for Counselor Reflection Generation
di: Min, Do June, et al.
Pubblicazione: (2024)
di: Min, Do June, et al.
Pubblicazione: (2024)
DocReward: A Document Reward Model for Structuring and Stylizing
di: Liu, Junpeng, et al.
Pubblicazione: (2025)
di: Liu, Junpeng, et al.
Pubblicazione: (2025)
Reward Models Can Improve Themselves: Reward-Guided Adversarial Failure Mode Discovery for Robust Reward Modeling
di: Pathmanathan, Pankayaraj, et al.
Pubblicazione: (2025)
di: Pathmanathan, Pankayaraj, et al.
Pubblicazione: (2025)
Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey
di: Liu, Qiyuan, et al.
Pubblicazione: (2025)
di: Liu, Qiyuan, et al.
Pubblicazione: (2025)
GRAM: A Generative Foundation Reward Model for Reward Generalization
di: Wang, Chenglong, et al.
Pubblicazione: (2025)
di: Wang, Chenglong, et al.
Pubblicazione: (2025)
Generalizing Reward Modeling for Out-of-Distribution Preference Learning
di: Jia, Chen
Pubblicazione: (2024)
di: Jia, Chen
Pubblicazione: (2024)
Process Rewards with Learned Reliability
di: Li, Jinyuan, et al.
Pubblicazione: (2026)
di: Li, Jinyuan, et al.
Pubblicazione: (2026)
Learning to Reason without External Rewards
di: Zhao, Xuandong, et al.
Pubblicazione: (2025)
di: Zhao, Xuandong, et al.
Pubblicazione: (2025)
Self-Evolved Reward Learning for LLMs
di: Huang, Chenghua, et al.
Pubblicazione: (2024)
di: Huang, Chenghua, et al.
Pubblicazione: (2024)
Multi-Objective and Mixed-Reward Reinforcement Learning via Reward-Decorrelated Policy Optimization
di: Bai, Yang, et al.
Pubblicazione: (2026)
di: Bai, Yang, et al.
Pubblicazione: (2026)
Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs
di: Liu, Chris Yuhao, et al.
Pubblicazione: (2024)
di: Liu, Chris Yuhao, et al.
Pubblicazione: (2024)
IFDECORATOR: Wrapping Instruction Following Reinforcement Learning with Verifiable Rewards
di: Guo, Xu, et al.
Pubblicazione: (2025)
di: Guo, Xu, et al.
Pubblicazione: (2025)
EditReward: A Human-Aligned Reward Model for Instruction-Guided Image Editing
di: Wu, Keming, et al.
Pubblicazione: (2025)
di: Wu, Keming, et al.
Pubblicazione: (2025)
A Survey on Neural Topic Models: Methods, Applications, and Challenges
di: Wu, Xiaobao, et al.
Pubblicazione: (2024)
di: Wu, Xiaobao, et al.
Pubblicazione: (2024)
Remedy: Learning Machine Translation Evaluation from Human Preferences with Reward Modeling
di: Tan, Shaomu, et al.
Pubblicazione: (2025)
di: Tan, Shaomu, et al.
Pubblicazione: (2025)
A Comprehensive Survey of Reward Models: Taxonomy, Applications, Challenges, and Future
di: Zhong, Jialun, et al.
Pubblicazione: (2025)
di: Zhong, Jialun, et al.
Pubblicazione: (2025)
Towards Robust Process Reward Modeling via Noise-aware Learning
di: Xie, Bin, et al.
Pubblicazione: (2026)
di: Xie, Bin, et al.
Pubblicazione: (2026)
Reinforcement Learning Amplifies Emergent Misalignment from Harmless Rewards
di: Jørgenvåg, Magnus, et al.
Pubblicazione: (2026)
di: Jørgenvåg, Magnus, et al.
Pubblicazione: (2026)
Segmenting Text and Learning Their Rewards for Improved RLHF in Language Model
di: Yin, Yueqin, et al.
Pubblicazione: (2025)
di: Yin, Yueqin, et al.
Pubblicazione: (2025)
Bayesian Preference Learning for Test-Time Steerable Reward Models
di: Hong, Jiwoo, et al.
Pubblicazione: (2026)
di: Hong, Jiwoo, et al.
Pubblicazione: (2026)
Gradient Regularization Prevents Reward Hacking in Reinforcement Learning from Human Feedback and Verifiable Rewards
di: Ackermann, Johannes, et al.
Pubblicazione: (2026)
di: Ackermann, Johannes, et al.
Pubblicazione: (2026)
Rethinking Sample Polarity in Reinforcement Learning with Verifiable Rewards
di: Tang, Xinyu, et al.
Pubblicazione: (2025)
di: Tang, Xinyu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
WildReward: Learning Reward Models from In-the-Wild Human Interactions
di: Peng, Hao, et al.
Pubblicazione: (2026) -
Text2Reward: Reward Shaping with Language Models for Reinforcement Learning
di: Xie, Tianbao, et al.
Pubblicazione: (2023) -
OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning
di: Hu, Ziyou, et al.
Pubblicazione: (2025) -
A Survey on Progress in LLM Alignment from the Perspective of Reward Design
di: Ji, Miaomiao, et al.
Pubblicazione: (2025) -
Preference Poisoning Attacks on Reward Model Learning
di: Wu, Junlin, et al.
Pubblicazione: (2024)