West-of-N: Synthetic Preferences for Self-Improving Reward Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Pace, Alizée, Mallinson, Jonathan, Malmi, Eric, Krause, Sebastian, Severyn, Aliaksei |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Small Language Models Improve Giants by Rewriting Their Outputs
von: Vernikos, Giorgos, et al.
Veröffentlicht: (2023)
von: Vernikos, Giorgos, et al.
Veröffentlicht: (2023)
Direct Preference Optimization: Your Language Model is Secretly a Reward Model
von: Rafailov, Rafael, et al.
Veröffentlicht: (2023)
von: Rafailov, Rafael, et al.
Veröffentlicht: (2023)
Preference Poisoning Attacks on Reward Model Learning
von: Wu, Junlin, et al.
Veröffentlicht: (2024)
von: Wu, Junlin, et al.
Veröffentlicht: (2024)
Preference Elicitation for Offline Reinforcement Learning
von: Pace, Alizée, et al.
Veröffentlicht: (2024)
von: Pace, Alizée, et al.
Veröffentlicht: (2024)
RewardUQ: A Unified Framework for Uncertainty-Aware Reward Models
von: Yang, Daniel, et al.
Veröffentlicht: (2026)
von: Yang, Daniel, et al.
Veröffentlicht: (2026)
Duel-Evolve: Reward-Free Test-Time Scaling via LLM Self-Preferences
von: Karlekar, Sweta, et al.
Veröffentlicht: (2026)
von: Karlekar, Sweta, et al.
Veröffentlicht: (2026)
Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences
von: Rosset, Corby, et al.
Veröffentlicht: (2024)
von: Rosset, Corby, et al.
Veröffentlicht: (2024)
ConsistRM: Improving Generative Reward Models via Consistency-Aware Self-Training
von: Liang, Yu, et al.
Veröffentlicht: (2026)
von: Liang, Yu, et al.
Veröffentlicht: (2026)
AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning
von: Wang, Tevin, et al.
Veröffentlicht: (2025)
von: Wang, Tevin, et al.
Veröffentlicht: (2025)
BOND: Aligning LLMs with Best-of-N Distillation
von: Sessa, Pier Giuseppe, et al.
Veröffentlicht: (2024)
von: Sessa, Pier Giuseppe, et al.
Veröffentlicht: (2024)
Beyond Scalar Reward Model: Learning Generative Judge from Preference Data
von: Ye, Ziyi, et al.
Veröffentlicht: (2024)
von: Ye, Ziyi, et al.
Veröffentlicht: (2024)
Rewards-in-Context: Multi-objective Alignment of Foundation Models with Dynamic Preference Adjustment
von: Yang, Rui, et al.
Veröffentlicht: (2024)
von: Yang, Rui, et al.
Veröffentlicht: (2024)
SALMON: Self-Alignment with Instructable Reward Models
von: Sun, Zhiqing, et al.
Veröffentlicht: (2023)
von: Sun, Zhiqing, et al.
Veröffentlicht: (2023)
T-REG: Preference Optimization with Token-Level Reward Regularization
von: Zhou, Wenxuan, et al.
Veröffentlicht: (2024)
von: Zhou, Wenxuan, et al.
Veröffentlicht: (2024)
Larger or Smaller Reward Margins to Select Preferences for Alignment?
von: Huang, Kexin, et al.
Veröffentlicht: (2025)
von: Huang, Kexin, et al.
Veröffentlicht: (2025)
Improving Context-Aware Preference Modeling for Language Models
von: Pitis, Silviu, et al.
Veröffentlicht: (2024)
von: Pitis, Silviu, et al.
Veröffentlicht: (2024)
Arithmetic Control of LLMs for Diverse User Preferences: Directional Preference Alignment with Multi-Objective Rewards
von: Wang, Haoxiang, et al.
Veröffentlicht: (2024)
von: Wang, Haoxiang, et al.
Veröffentlicht: (2024)
Self-Generated Critiques Boost Reward Modeling for Language Models
von: Yu, Yue, et al.
Veröffentlicht: (2024)
von: Yu, Yue, et al.
Veröffentlicht: (2024)
AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization
von: Wu, Junkang, et al.
Veröffentlicht: (2024)
von: Wu, Junkang, et al.
Veröffentlicht: (2024)
PerPO: Perceptual Preference Optimization via Discriminative Rewarding
von: Zhu, Zining, et al.
Veröffentlicht: (2025)
von: Zhu, Zining, et al.
Veröffentlicht: (2025)
Course-Correction: Safety Alignment Using Synthetic Preferences
von: Xu, Rongwu, et al.
Veröffentlicht: (2024)
von: Xu, Rongwu, et al.
Veröffentlicht: (2024)
M-RewardBench: Evaluating Reward Models in Multilingual Settings
von: Gureja, Srishti, et al.
Veröffentlicht: (2024)
von: Gureja, Srishti, et al.
Veröffentlicht: (2024)
Self-Play Preference Optimization for Language Model Alignment
von: Wu, Yue, et al.
Veröffentlicht: (2024)
von: Wu, Yue, et al.
Veröffentlicht: (2024)
Uncertainty-Penalized Direct Preference Optimization
von: Houliston, Sam, et al.
Veröffentlicht: (2024)
von: Houliston, Sam, et al.
Veröffentlicht: (2024)
Selective Preference Optimization via Token-Level Reward Function Estimation
von: Yang, Kailai, et al.
Veröffentlicht: (2024)
von: Yang, Kailai, et al.
Veröffentlicht: (2024)
Difficulty-Based Preference Data Selection by DPO Implicit Reward Gap
von: Qi, Xuan, et al.
Veröffentlicht: (2025)
von: Qi, Xuan, et al.
Veröffentlicht: (2025)
Self-Taught Optimizer (STOP): Recursively Self-Improving Code Generation
von: Zelikman, Eric, et al.
Veröffentlicht: (2023)
von: Zelikman, Eric, et al.
Veröffentlicht: (2023)
Self-Consistency Preference Optimization
von: Prasad, Archiki, et al.
Veröffentlicht: (2024)
von: Prasad, Archiki, et al.
Veröffentlicht: (2024)
TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization
von: Zhu, Mingkang, et al.
Veröffentlicht: (2025)
von: Zhu, Mingkang, et al.
Veröffentlicht: (2025)
Self-Rewarding PPO: Aligning Large Language Models with Demonstrations Only
von: Zhang, Qingru, et al.
Veröffentlicht: (2025)
von: Zhang, Qingru, et al.
Veröffentlicht: (2025)
Improving Reinforcement Learning from Human Feedback with Efficient Reward Model Ensemble
von: Zhang, Shun, et al.
Veröffentlicht: (2024)
von: Zhang, Shun, et al.
Veröffentlicht: (2024)
AMPO: Active Multi-Preference Optimization for Self-play Preference Selection
von: Gupta, Taneesh, et al.
Veröffentlicht: (2025)
von: Gupta, Taneesh, et al.
Veröffentlicht: (2025)
FSPO: Few-Shot Optimization of Synthetic Preferences Personalizes to Real Users
von: Singh, Anikait, et al.
Veröffentlicht: (2025)
von: Singh, Anikait, et al.
Veröffentlicht: (2025)
Skywork-Reward-V2: Scaling Preference Data Curation via Human-AI Synergy
von: Liu, Chris Yuhao, et al.
Veröffentlicht: (2025)
von: Liu, Chris Yuhao, et al.
Veröffentlicht: (2025)
Principled Fine-tuning of LLMs from User-Edits: A Medley of Preference, Supervision, and Reward
von: Misra, Dipendra, et al.
Veröffentlicht: (2026)
von: Misra, Dipendra, et al.
Veröffentlicht: (2026)
ActiveUltraFeedback: Efficient Preference Data Generation using Active Learning
von: Melikidze, Davit, et al.
Veröffentlicht: (2026)
von: Melikidze, Davit, et al.
Veröffentlicht: (2026)
Enhancing Clinical Documentation with Synthetic Data: Leveraging Generative Models for Improved Accuracy
von: Biswas, Anjanava, et al.
Veröffentlicht: (2024)
von: Biswas, Anjanava, et al.
Veröffentlicht: (2024)
Self-Evolved Preference Optimization for Enhancing Mathematical Reasoning in Small Language Models
von: Singh, Joykirat, et al.
Veröffentlicht: (2025)
von: Singh, Joykirat, et al.
Veröffentlicht: (2025)
RewardAnything: Generalizable Principle-Following Reward Models
von: Yu, Zhuohao, et al.
Veröffentlicht: (2025)
von: Yu, Zhuohao, et al.
Veröffentlicht: (2025)
Combee: Scaling Prompt Learning for Self-Improving Language Model Agents
von: Li, Hanchen, et al.
Veröffentlicht: (2026)
von: Li, Hanchen, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Small Language Models Improve Giants by Rewriting Their Outputs
von: Vernikos, Giorgos, et al.
Veröffentlicht: (2023) -
Direct Preference Optimization: Your Language Model is Secretly a Reward Model
von: Rafailov, Rafael, et al.
Veröffentlicht: (2023) -
Preference Poisoning Attacks on Reward Model Learning
von: Wu, Junlin, et al.
Veröffentlicht: (2024) -
Preference Elicitation for Offline Reinforcement Learning
von: Pace, Alizée, et al.
Veröffentlicht: (2024) -
RewardUQ: A Unified Framework for Uncertainty-Aware Reward Models
von: Yang, Daniel, et al.
Veröffentlicht: (2026)