Personalized RewardBench: Evaluating Reward Models with Human Aligned Personalization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ma, Qiyao, Gao, Dechen, Cai, Rui, Zhao, Boqi, Zhou, Hanchu, Zhang, Junshan, Zhao, Zhe |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
M-RewardBench: Evaluating Reward Models in Multilingual Settings
par: Gureja, Srishti, et autres
Publié: (2024)
par: Gureja, Srishti, et autres
Publié: (2024)
RewardBench 2: Advancing Reward Model Evaluation
par: Malik, Saumya, et autres
Publié: (2025)
par: Malik, Saumya, et autres
Publié: (2025)
RewardBench: Evaluating Reward Models for Language Modeling
par: Lambert, Nathan, et autres
Publié: (2024)
par: Lambert, Nathan, et autres
Publié: (2024)
Long-form RewardBench: Evaluating Reward Models for Long-form Generation
par: Huang, Hui, et autres
Publié: (2026)
par: Huang, Hui, et autres
Publié: (2026)
IF-RewardBench: Benchmarking Judge Models for Instruction-Following Evaluation
par: Wen, Bosi, et autres
Publié: (2026)
par: Wen, Bosi, et autres
Publié: (2026)
CMI-RewardBench: Evaluating Music Reward Models with Compositional Multimodal Instruction
par: Ma, Yinghao, et autres
Publié: (2026)
par: Ma, Yinghao, et autres
Publié: (2026)
Multimodal RewardBench 2: Evaluating Omni Reward Models for Interleaved Text and Image
par: Hu, Yushi, et autres
Publié: (2025)
par: Hu, Yushi, et autres
Publié: (2025)
RAG-RewardBench: Benchmarking Reward Models in Retrieval Augmented Generation for Preference Alignment
par: Jin, Zhuoran, et autres
Publié: (2024)
par: Jin, Zhuoran, et autres
Publié: (2024)
VL-RewardBench: A Challenging Benchmark for Vision-Language Generative Reward Models
par: Li, Lei, et autres
Publié: (2024)
par: Li, Lei, et autres
Publié: (2024)
Tree Reward-Aligned Search for TReASURe in Masked Diffusion Language Models
par: Yu, Zichao, et autres
Publié: (2025)
par: Yu, Zichao, et autres
Publié: (2025)
Sentence-level Reward Model can Generalize Better for Aligning LLM from Human Preference
par: Qiu, Wenjie, et autres
Publié: (2025)
par: Qiu, Wenjie, et autres
Publié: (2025)
Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models
par: Ding, Meidan, et autres
Publié: (2025)
par: Ding, Meidan, et autres
Publié: (2025)
From Faithfulness to Correctness: Generative Reward Models that Think Critically
par: Ma, Qiyao, et autres
Publié: (2025)
par: Ma, Qiyao, et autres
Publié: (2025)
Reward Collapse in Aligning Large Language Models
par: Song, Ziang, et autres
Publié: (2023)
par: Song, Ziang, et autres
Publié: (2023)
LoRe: Personalizing LLMs via Low-Rank Reward Modeling
par: Bose, Avinandan, et autres
Publié: (2025)
par: Bose, Avinandan, et autres
Publié: (2025)
Self-Rewarding PPO: Aligning Large Language Models with Demonstrations Only
par: Zhang, Qingru, et autres
Publié: (2025)
par: Zhang, Qingru, et autres
Publié: (2025)
Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents
par: Men, Tianyi, et autres
Publié: (2025)
par: Men, Tianyi, et autres
Publié: (2025)
AgentRewardBench: Evaluating Automatic Evaluations of Web Agent Trajectories
par: Lù, Xing Han, et autres
Publié: (2025)
par: Lù, Xing Han, et autres
Publié: (2025)
Entropy-Regularized Process Reward Model
par: Zhang, Hanning, et autres
Publié: (2024)
par: Zhang, Hanning, et autres
Publié: (2024)
ReMoDetect: Reward Models Recognize Aligned LLM's Generations
par: Lee, Hyunseok, et autres
Publié: (2024)
par: Lee, Hyunseok, et autres
Publié: (2024)
Rethinking Reward Model Evaluation Through the Lens of Reward Overoptimization
par: Kim, Sunghwan, et autres
Publié: (2025)
par: Kim, Sunghwan, et autres
Publié: (2025)
RewardAnything: Generalizable Principle-Following Reward Models
par: Yu, Zhuohao, et autres
Publié: (2025)
par: Yu, Zhuohao, et autres
Publié: (2025)
Multi-Objective and Mixed-Reward Reinforcement Learning via Reward-Decorrelated Policy Optimization
par: Bai, Yang, et autres
Publié: (2026)
par: Bai, Yang, et autres
Publié: (2026)
Personalized Language Modeling from Personalized Human Feedback
par: Li, Xinyu, et autres
Publié: (2024)
par: Li, Xinyu, et autres
Publié: (2024)
Reward Shaping to Mitigate Reward Hacking in RLHF
par: Fu, Jiayi, et autres
Publié: (2025)
par: Fu, Jiayi, et autres
Publié: (2025)
GRAM-R$^2$: Self-Training Generative Foundation Reward Models for Reward Reasoning
par: Wang, Chenglong, et autres
Publié: (2025)
par: Wang, Chenglong, et autres
Publié: (2025)
Interpretable Preferences via Multi-Objective Reward Modeling and Mixture-of-Experts
par: Wang, Haoxiang, et autres
Publié: (2024)
par: Wang, Haoxiang, et autres
Publié: (2024)
SDiaReward: Modeling and Benchmarking Spoken Dialogue Rewards with Modality and Colloquialness
par: Lu, Jingyu, et autres
Publié: (2026)
par: Lu, Jingyu, et autres
Publié: (2026)
T-REG: Preference Optimization with Token-Level Reward Regularization
par: Zhou, Wenxuan, et autres
Publié: (2024)
par: Zhou, Wenxuan, et autres
Publié: (2024)
Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward
par: Tang, Xinyu, et autres
Publié: (2025)
par: Tang, Xinyu, et autres
Publié: (2025)
ALaRM: Align Language Models via Hierarchical Rewards Modeling
par: Lai, Yuhang, et autres
Publié: (2024)
par: Lai, Yuhang, et autres
Publié: (2024)
Learning to Reason without External Rewards
par: Zhao, Xuandong, et autres
Publié: (2025)
par: Zhao, Xuandong, et autres
Publié: (2025)
MJ-Bench: Is Your Multimodal Reward Model Really a Good Judge for Text-to-Image Generation?
par: Chen, Zhaorun, et autres
Publié: (2024)
par: Chen, Zhaorun, et autres
Publié: (2024)
VITA: Vision-to-Action Flow Matching Policy
par: Gao, Dechen, et autres
Publié: (2025)
par: Gao, Dechen, et autres
Publié: (2025)
Pre-Trained Policy Discriminators are General Reward Models
par: Dou, Shihan, et autres
Publié: (2025)
par: Dou, Shihan, et autres
Publié: (2025)
How to Evaluate Reward Models for RLHF
par: Frick, Evan, et autres
Publié: (2024)
par: Frick, Evan, et autres
Publié: (2024)
Text2Reward: Reward Shaping with Language Models for Reinforcement Learning
par: Xie, Tianbao, et autres
Publié: (2023)
par: Xie, Tianbao, et autres
Publié: (2023)
Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning
par: Lyu, Chengqi, et autres
Publié: (2025)
par: Lyu, Chengqi, et autres
Publié: (2025)
TDRM: Smooth Reward Models with Temporal Difference for LLM RL and Inference
par: Zhang, Dan, et autres
Publié: (2025)
par: Zhang, Dan, et autres
Publié: (2025)
RLHF Workflow: From Reward Modeling to Online RLHF
par: Dong, Hanze, et autres
Publié: (2024)
par: Dong, Hanze, et autres
Publié: (2024)
Documents similaires
-
M-RewardBench: Evaluating Reward Models in Multilingual Settings
par: Gureja, Srishti, et autres
Publié: (2024) -
RewardBench 2: Advancing Reward Model Evaluation
par: Malik, Saumya, et autres
Publié: (2025) -
RewardBench: Evaluating Reward Models for Language Modeling
par: Lambert, Nathan, et autres
Publié: (2024) -
Long-form RewardBench: Evaluating Reward Models for Long-form Generation
par: Huang, Hui, et autres
Publié: (2026) -
IF-RewardBench: Benchmarking Judge Models for Instruction-Following Evaluation
par: Wen, Bosi, et autres
Publié: (2026)