Enregistré dans:
| Auteurs principaux: | Hong, Jiwoo, Tang, Shao, Wang, Zhipeng |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2602.08819 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
On the Robustness of Reward Models for Language Model Alignment
par: Hong, Jiwoo, et autres
Publié: (2025)
par: Hong, Jiwoo, et autres
Publié: (2025)
Preference Poisoning Attacks on Reward Model Learning
par: Wu, Junlin, et autres
Publié: (2024)
par: Wu, Junlin, et autres
Publié: (2024)
Generalizing Reward Modeling for Out-of-Distribution Preference Learning
par: Jia, Chen
Publié: (2024)
par: Jia, Chen
Publié: (2024)
Duel-Evolve: Reward-Free Test-Time Scaling via LLM Self-Preferences
par: Karlekar, Sweta, et autres
Publié: (2026)
par: Karlekar, Sweta, et autres
Publié: (2026)
Pragmatic Feature Preferences: Learning Reward-Relevant Preferences from Human Input
par: Peng, Andi, et autres
Publié: (2024)
par: Peng, Andi, et autres
Publié: (2024)
Robust Preference Optimization through Reward Model Distillation
par: Fisch, Adam, et autres
Publié: (2024)
par: Fisch, Adam, et autres
Publié: (2024)
Deep Bayesian Active Learning for Preference Modeling in Large Language Models
par: Melo, Luckeciano C., et autres
Publié: (2024)
par: Melo, Luckeciano C., et autres
Publié: (2024)
Interpretable Preferences via Multi-Objective Reward Modeling and Mixture-of-Experts
par: Wang, Haoxiang, et autres
Publié: (2024)
par: Wang, Haoxiang, et autres
Publié: (2024)
Adaptive Test-Time Reasoning via Reward-Guided Dual-Phase Search
par: Cui, Yingqian, et autres
Publié: (2025)
par: Cui, Yingqian, et autres
Publié: (2025)
On the Limited Generalization Capability of the Implicit Reward Model Induced by Direct Preference Optimization
par: Lin, Yong, et autres
Publié: (2024)
par: Lin, Yong, et autres
Publié: (2024)
Reward-aware Preference Optimization: A Unified Mathematical Framework for Model Alignment
par: Sun, Shengyang, et autres
Publié: (2025)
par: Sun, Shengyang, et autres
Publié: (2025)
RFG: Test-Time Scaling for Diffusion Large Language Model Reasoning with Reward-Free Guidance
par: Chen, Tianlang, et autres
Publié: (2025)
par: Chen, Tianlang, et autres
Publié: (2025)
Beyond Scalar Reward Model: Learning Generative Judge from Preference Data
par: Ye, Ziyi, et autres
Publié: (2024)
par: Ye, Ziyi, et autres
Publié: (2024)
C2: Scalable Rubric-Augmented Reward Modeling from Binary Preferences
par: Kawabata, Akira, et autres
Publié: (2026)
par: Kawabata, Akira, et autres
Publié: (2026)
Exploring Chain-of-Thought Reasoning for Steerable Pluralistic Alignment
par: Zhang, Yunfan, et autres
Publié: (2025)
par: Zhang, Yunfan, et autres
Publié: (2025)
Simultaneous Reward Distillation and Preference Learning: Get You a Language Model Who Can Do Both
par: Nath, Abhijnan, et autres
Publié: (2024)
par: Nath, Abhijnan, et autres
Publié: (2024)
Group Robust Preference Optimization in Reward-free RLHF
par: Ramesh, Shyam Sundhar, et autres
Publié: (2024)
par: Ramesh, Shyam Sundhar, et autres
Publié: (2024)
Entropy Centroids as Intrinsic Rewards for Test-Time Scaling
par: Zhao, Wenshuo, et autres
Publié: (2026)
par: Zhao, Wenshuo, et autres
Publié: (2026)
Tool Calling is Linearly Readable and Steerable in Language Models
par: Wu, Zekun, et autres
Publié: (2026)
par: Wu, Zekun, et autres
Publié: (2026)
Larger or Smaller Reward Margins to Select Preferences for Alignment?
par: Huang, Kexin, et autres
Publié: (2025)
par: Huang, Kexin, et autres
Publié: (2025)
West-of-N: Synthetic Preferences for Self-Improving Reward Models
par: Pace, Alizée, et autres
Publié: (2024)
par: Pace, Alizée, et autres
Publié: (2024)
EVALUESTEER: Measuring Reward Model Steerability Towards Values and Preferences
par: Ghate, Kshitish, et autres
Publié: (2025)
par: Ghate, Kshitish, et autres
Publié: (2025)
AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning
par: Wang, Tevin, et autres
Publié: (2025)
par: Wang, Tevin, et autres
Publié: (2025)
When In-Distribution Gains Fail: Evaluating Weak-to-Strong Reward Models under Preference Shift
par: Le, Khoi, et autres
Publié: (2026)
par: Le, Khoi, et autres
Publié: (2026)
Sentence-level Reward Model can Generalize Better for Aligning LLM from Human Preference
par: Qiu, Wenjie, et autres
Publié: (2025)
par: Qiu, Wenjie, et autres
Publié: (2025)
Reinforcement Learning Teachers of Test Time Scaling
par: Cetin, Edoardo, et autres
Publié: (2025)
par: Cetin, Edoardo, et autres
Publié: (2025)
AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization
par: Wu, Junkang, et autres
Publié: (2024)
par: Wu, Junkang, et autres
Publié: (2024)
The Geometric Canary: Predicting Steerability and Detecting Drift via Representational Stability
par: Raju, Prashant C.
Publié: (2026)
par: Raju, Prashant C.
Publié: (2026)
Direct Preference Optimization: Your Language Model is Secretly a Reward Model
par: Rafailov, Rafael, et autres
Publié: (2023)
par: Rafailov, Rafael, et autres
Publié: (2023)
DreamReward: Text-to-3D Generation with Human Preference
par: Ye, Junliang, et autres
Publié: (2024)
par: Ye, Junliang, et autres
Publié: (2024)
SimPO: Simple Preference Optimization with a Reference-Free Reward
par: Meng, Yu, et autres
Publié: (2024)
par: Meng, Yu, et autres
Publié: (2024)
On the Power of (Approximate) Reward Models for Inference-Time Scaling
par: Zhu, Youheng, et autres
Publié: (2026)
par: Zhu, Youheng, et autres
Publié: (2026)
Arithmetic Control of LLMs for Diverse User Preferences: Directional Preference Alignment with Multi-Objective Rewards
par: Wang, Haoxiang, et autres
Publié: (2024)
par: Wang, Haoxiang, et autres
Publié: (2024)
VerifierQ: Enhancing LLM Test Time Compute with Q-Learning-based Verifiers
par: Qi, Jianing, et autres
Publié: (2024)
par: Qi, Jianing, et autres
Publié: (2024)
Energy-Based Preference Model Offers Better Offline Alignment than the Bradley-Terry Preference Model
par: Hong, Yuzhong, et autres
Publié: (2024)
par: Hong, Yuzhong, et autres
Publié: (2024)
Integrating Time Series into LLMs via Multi-layer Steerable Embedding Fusion for Enhanced Forecasting
par: Chen, Zhuomin, et autres
Publié: (2025)
par: Chen, Zhuomin, et autres
Publié: (2025)
Alternating Reinforcement Learning for Rubric-Based Reward Modeling in Non-Verifiable LLM Post-Training
par: Xu, Ran, et autres
Publié: (2026)
par: Xu, Ran, et autres
Publié: (2026)
Test-Time Scaling with Reflective Generative Model
par: Wang, Zixiao, et autres
Publié: (2025)
par: Wang, Zixiao, et autres
Publié: (2025)
Inference-Time Scaling for Generalist Reward Modeling
par: Liu, Zijun, et autres
Publié: (2025)
par: Liu, Zijun, et autres
Publié: (2025)
A Course Correction in Steerability Evaluation: Revealing Miscalibration and Side Effects in LLMs
par: Chang, Trenton, et autres
Publié: (2025)
par: Chang, Trenton, et autres
Publié: (2025)
Documents similaires
-
On the Robustness of Reward Models for Language Model Alignment
par: Hong, Jiwoo, et autres
Publié: (2025) -
Preference Poisoning Attacks on Reward Model Learning
par: Wu, Junlin, et autres
Publié: (2024) -
Generalizing Reward Modeling for Out-of-Distribution Preference Learning
par: Jia, Chen
Publié: (2024) -
Duel-Evolve: Reward-Free Test-Time Scaling via LLM Self-Preferences
par: Karlekar, Sweta, et autres
Publié: (2026) -
Pragmatic Feature Preferences: Learning Reward-Relevant Preferences from Human Input
par: Peng, Andi, et autres
Publié: (2024)