Direct Preference Optimization: Your Language Model is Secretly a Reward Model
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Rafailov, Rafael, Sharma, Archit, Mitchell, Eric, Ermon, Stefano, Manning, Christopher D., Finn, Chelsea |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2023
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Disentangling Length from Quality in Direct Preference Optimization
von: Park, Ryan, et al.
Veröffentlicht: (2024)
von: Park, Ryan, et al.
Veröffentlicht: (2024)
FSPO: Few-Shot Optimization of Synthetic Preferences Personalizes to Real Users
von: Singh, Anikait, et al.
Veröffentlicht: (2025)
von: Singh, Anikait, et al.
Veröffentlicht: (2025)
Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms
von: Rafailov, Rafael, et al.
Veröffentlicht: (2024)
von: Rafailov, Rafael, et al.
Veröffentlicht: (2024)
A Critical Evaluation of AI Feedback for Aligning Large Language Models
von: Sharma, Archit, et al.
Veröffentlicht: (2024)
von: Sharma, Archit, et al.
Veröffentlicht: (2024)
RLVF: Learning from Verbal Feedback without Overgeneralization
von: Stephan, Moritz, et al.
Veröffentlicht: (2024)
von: Stephan, Moritz, et al.
Veröffentlicht: (2024)
Calibrating Language Models with Adaptive Temperature Scaling
von: Xie, Johnathan, et al.
Veröffentlicht: (2024)
von: Xie, Johnathan, et al.
Veröffentlicht: (2024)
From $r$ to $Q^*$: Your Language Model is Secretly a Q-Function
von: Rafailov, Rafael, et al.
Veröffentlicht: (2024)
von: Rafailov, Rafael, et al.
Veröffentlicht: (2024)
Your Language Model Secretly Contains Personality Subnetworks
von: Ye, Ruimeng, et al.
Veröffentlicht: (2026)
von: Ye, Ruimeng, et al.
Veröffentlicht: (2026)
Self-supervised Preference Optimization: Enhance Your Language Model with Preference Degree Awareness
von: Li, Jian, et al.
Veröffentlicht: (2024)
von: Li, Jian, et al.
Veröffentlicht: (2024)
Aligning Modalities in Vision Large Language Models via Preference Fine-tuning
von: Zhou, Yiyang, et al.
Veröffentlicht: (2024)
von: Zhou, Yiyang, et al.
Veröffentlicht: (2024)
Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator
von: Chen, Zhuotong, et al.
Veröffentlicht: (2025)
von: Chen, Zhuotong, et al.
Veröffentlicht: (2025)
Drop Dropout on Single-Epoch Language Model Pretraining
von: Liu, Houjun, et al.
Veröffentlicht: (2025)
von: Liu, Houjun, et al.
Veröffentlicht: (2025)
SelfElicit: Your Language Model Secretly Knows Where is the Relevant Evidence
von: Liu, Zhining, et al.
Veröffentlicht: (2025)
von: Liu, Zhining, et al.
Veröffentlicht: (2025)
Knowledge Editing in Language Models via Adapted Direct Preference Optimization
von: Rozner, Amit, et al.
Veröffentlicht: (2024)
von: Rozner, Amit, et al.
Veröffentlicht: (2024)
Towards Data-Centric RLHF: Simple Metrics for Preference Dataset Comparison
von: Shen, Judy Hanwen, et al.
Veröffentlicht: (2024)
von: Shen, Judy Hanwen, et al.
Veröffentlicht: (2024)
Grounding by Trying: LLMs with Reinforcement Learning-Enhanced Retrieval
von: Hsu, Sheryl, et al.
Veröffentlicht: (2024)
von: Hsu, Sheryl, et al.
Veröffentlicht: (2024)
AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization
von: Wu, Junkang, et al.
Veröffentlicht: (2024)
von: Wu, Junkang, et al.
Veröffentlicht: (2024)
Preference Fine-Tuning of LLMs Should Leverage Suboptimal, On-Policy Data
von: Tajwar, Fahim, et al.
Veröffentlicht: (2024)
von: Tajwar, Fahim, et al.
Veröffentlicht: (2024)
MOTO: Offline Pre-training to Online Fine-tuning for Model-based Robot Learning
von: Rafailov, Rafael, et al.
Veröffentlicht: (2024)
von: Rafailov, Rafael, et al.
Veröffentlicht: (2024)
Clarify: Improving Model Robustness With Natural Language Corrections
von: Lee, Yoonho, et al.
Veröffentlicht: (2024)
von: Lee, Yoonho, et al.
Veröffentlicht: (2024)
Fine Tuning Large Language Models for Medicine: The Role and Importance of Direct Preference Optimization
von: Savage, Thomas, et al.
Veröffentlicht: (2024)
von: Savage, Thomas, et al.
Veröffentlicht: (2024)
Contrastive Preference Learning: Learning from Human Feedback without RL
von: Hejna, Joey, et al.
Veröffentlicht: (2023)
von: Hejna, Joey, et al.
Veröffentlicht: (2023)
Beyond Pairs: Your Language Model is Secretly Optimizing a Preference Graph
von: Liu, Ning, et al.
Veröffentlicht: (2026)
von: Liu, Ning, et al.
Veröffentlicht: (2026)
Why is Your Language Model a Poor Implicit Reward Model?
von: Razin, Noam, et al.
Veröffentlicht: (2025)
von: Razin, Noam, et al.
Veröffentlicht: (2025)
Preference Packing: Efficient Preference Optimization for Large Language Models
von: Cho, Jaekyung
Veröffentlicht: (2026)
von: Cho, Jaekyung
Veröffentlicht: (2026)
Semiparametric Preference Optimization: Your Language Model is Secretly a Single-Index Model
von: Kallus, Nathan
Veröffentlicht: (2025)
von: Kallus, Nathan
Veröffentlicht: (2025)
Yell At Your Robot: Improving On-the-Fly from Language Corrections
von: Shi, Lucy Xiaoyang, et al.
Veröffentlicht: (2024)
von: Shi, Lucy Xiaoyang, et al.
Veröffentlicht: (2024)
West-of-N: Synthetic Preferences for Self-Improving Reward Models
von: Pace, Alizée, et al.
Veröffentlicht: (2024)
von: Pace, Alizée, et al.
Veröffentlicht: (2024)
Large Language Models are Geographically Biased
von: Manvi, Rohin, et al.
Veröffentlicht: (2024)
von: Manvi, Rohin, et al.
Veröffentlicht: (2024)
TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization
von: Zhu, Mingkang, et al.
Veröffentlicht: (2025)
von: Zhu, Mingkang, et al.
Veröffentlicht: (2025)
Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences
von: Rosset, Corby, et al.
Veröffentlicht: (2024)
von: Rosset, Corby, et al.
Veröffentlicht: (2024)
Towards Robust Alignment of Language Models: Distributionally Robustifying Direct Preference Optimization
von: Wu, Junkang, et al.
Veröffentlicht: (2024)
von: Wu, Junkang, et al.
Veröffentlicht: (2024)
Your Absorbing Discrete Diffusion Secretly Models the Bayesian Posterior
von: Doyle, Cooper
Veröffentlicht: (2025)
von: Doyle, Cooper
Veröffentlicht: (2025)
Don't Forget Your Reward Values: Language Model Alignment via Value-based Calibration
von: Mao, Xin, et al.
Veröffentlicht: (2024)
von: Mao, Xin, et al.
Veröffentlicht: (2024)
Your Language Model Can Secretly Write Like Humans: Contrastive Paraphrase Attacks on LLM-Generated Text Detectors
von: Fang, Hao, et al.
Veröffentlicht: (2025)
von: Fang, Hao, et al.
Veröffentlicht: (2025)
From Words to Numbers: Your Large Language Model Is Secretly A Capable Regressor When Given In-Context Examples
von: Vacareanu, Robert, et al.
Veröffentlicht: (2024)
von: Vacareanu, Robert, et al.
Veröffentlicht: (2024)
Weights-Rotated Preference Optimization for Large Language Models
von: Yang, Chenxu, et al.
Veröffentlicht: (2025)
von: Yang, Chenxu, et al.
Veröffentlicht: (2025)
RLearner-LLM: Balancing Logical Grounding and Fluency in Large Language Models via Hybrid Direct Preference Optimization
von: Bao, Qiming, et al.
Veröffentlicht: (2026)
von: Bao, Qiming, et al.
Veröffentlicht: (2026)
MrT5: Dynamic Token Merging for Efficient Byte-level Language Models
von: Kallini, Julie, et al.
Veröffentlicht: (2024)
von: Kallini, Julie, et al.
Veröffentlicht: (2024)
Towards Understanding the Influence of Reward Margin on Preference Model Performance
von: Qin, Bowen, et al.
Veröffentlicht: (2024)
von: Qin, Bowen, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Disentangling Length from Quality in Direct Preference Optimization
von: Park, Ryan, et al.
Veröffentlicht: (2024) -
FSPO: Few-Shot Optimization of Synthetic Preferences Personalizes to Real Users
von: Singh, Anikait, et al.
Veröffentlicht: (2025) -
Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms
von: Rafailov, Rafael, et al.
Veröffentlicht: (2024) -
A Critical Evaluation of AI Feedback for Aligning Large Language Models
von: Sharma, Archit, et al.
Veröffentlicht: (2024) -
RLVF: Learning from Verbal Feedback without Overgeneralization
von: Stephan, Moritz, et al.
Veröffentlicht: (2024)