Understanding the Impact of Sampling Quality in Direct Preference Optimization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kim, Kyung Rok, Bai, Yumo, Wang, Chonghuan, Chen, Guanting |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Collaborative Prediction: To Join or To Disjoin Datasets
par: Kim, Kyung Rok, et autres
Publié: (2025)
par: Kim, Kyung Rok, et autres
Publié: (2025)
What Matters in Data for DPO?
par: Pan, Yu, et autres
Publié: (2025)
par: Pan, Yu, et autres
Publié: (2025)
Understanding Reference Policies in Direct Preference Optimization
par: Liu, Yixin, et autres
Publié: (2024)
par: Liu, Yixin, et autres
Publié: (2024)
Lightweight Robust Direct Preference Optimization
par: Kim, Cheol Woo, et autres
Publié: (2025)
par: Kim, Cheol Woo, et autres
Publié: (2025)
Length Desensitization in Direct Preference Optimization
par: Liu, Wei, et autres
Publié: (2024)
par: Liu, Wei, et autres
Publié: (2024)
Choosing the Better Bandit Algorithm under Data Sharing: When Do A/B Experiments Work?
par: Li, Shuangning, et autres
Publié: (2025)
par: Li, Shuangning, et autres
Publié: (2025)
Adaptive Batch-Wise Sample Scheduling for Direct Preference Optimization
par: Huang, Zixuan, et autres
Publié: (2025)
par: Huang, Zixuan, et autres
Publié: (2025)
Disentangling Length from Quality in Direct Preference Optimization
par: Park, Ryan, et autres
Publié: (2024)
par: Park, Ryan, et autres
Publié: (2024)
Improving the Estimation of Lifetime Effects in A/B Testing via Treatment Locality
par: Chen, Shuze, et autres
Publié: (2024)
par: Chen, Shuze, et autres
Publié: (2024)
Preference Optimization with Multi-Sample Comparisons
par: Wang, Chaoqi, et autres
Publié: (2024)
par: Wang, Chaoqi, et autres
Publié: (2024)
Understand What LLM Needs: Dual Preference Alignment for Retrieval-Augmented Generation
par: Dong, Guanting, et autres
Publié: (2024)
par: Dong, Guanting, et autres
Publié: (2024)
Distributed Direct Preference Optimization
par: Jiang, Zhanhong
Publié: (2026)
par: Jiang, Zhanhong
Publié: (2026)
ActiveDPO: Active Direct Preference Optimization for Sample-Efficient Alignment
par: Lin, Xiaoqiang, et autres
Publié: (2025)
par: Lin, Xiaoqiang, et autres
Publié: (2025)
ADPO: Anchored Direct Preference Optimization
par: Zixian, Wang
Publié: (2025)
par: Zixian, Wang
Publié: (2025)
Direct Preference Optimization With Unobserved Preference Heterogeneity: The Necessity of Ternary Preferences
par: Chidambaram, Keertana, et autres
Publié: (2024)
par: Chidambaram, Keertana, et autres
Publié: (2024)
Importance Sampling for Multi-Negative Multimodal Direct Preference Optimization
par: Li, Xintong, et autres
Publié: (2025)
par: Li, Xintong, et autres
Publié: (2025)
Gradient Imbalance in Direct Preference Optimization
par: Ma, Qinwei, et autres
Publié: (2025)
par: Ma, Qinwei, et autres
Publié: (2025)
Active Learning for Direct Preference Optimization
par: Kveton, Branislav, et autres
Publié: (2025)
par: Kveton, Branislav, et autres
Publié: (2025)
A Survey of Direct Preference Optimization
par: Liu, Shunyu, et autres
Publié: (2025)
par: Liu, Shunyu, et autres
Publié: (2025)
Direct Preference Optimization for Adaptive Concept-based Explanations
par: Teneggi, Jacopo, et autres
Publié: (2025)
par: Teneggi, Jacopo, et autres
Publié: (2025)
Accelerating Direct Preference Optimization with Prefix Sharing
par: Wang, Franklin, et autres
Publié: (2024)
par: Wang, Franklin, et autres
Publié: (2024)
Orthogonal Finetuning for Direct Preference Optimization
par: Yang, Chenxu, et autres
Publié: (2024)
par: Yang, Chenxu, et autres
Publié: (2024)
Towards Better Understanding of In-Context Learning Ability from In-Context Uncertainty Quantification
par: Liu, Shang, et autres
Publié: (2024)
par: Liu, Shang, et autres
Publié: (2024)
Preference as Reward, Maximum Preference Optimization with Importance Sampling
par: Jiang, Zaifan, et autres
Publié: (2023)
par: Jiang, Zaifan, et autres
Publié: (2023)
SafeDPO: A Simple Approach to Direct Preference Optimization with Enhanced Safety
par: Kim, Geon-Hyeong, et autres
Publié: (2025)
par: Kim, Geon-Hyeong, et autres
Publié: (2025)
Continuous-Utility Direct Preference Optimization
par: Mohsin, Muhammad Ahmed, et autres
Publié: (2026)
par: Mohsin, Muhammad Ahmed, et autres
Publié: (2026)
Direct Preference Optimization-Enhanced Multi-Guided Diffusion Model for Traffic Scenario Generation
par: Yu, Seungjun, et autres
Publié: (2025)
par: Yu, Seungjun, et autres
Publié: (2025)
Antigen-Specific Antibody Design via Direct Energy-based Preference Optimization
par: Zhou, Xiangxin, et autres
Publié: (2024)
par: Zhou, Xiangxin, et autres
Publié: (2024)
Filtered Direct Preference Optimization
par: Morimura, Tetsuro, et autres
Publié: (2024)
par: Morimura, Tetsuro, et autres
Publié: (2024)
Direct Preference Optimization with an Offset
par: Amini, Afra, et autres
Publié: (2024)
par: Amini, Afra, et autres
Publié: (2024)
Direct Multi-Turn Preference Optimization for Language Agents
par: Shi, Wentao, et autres
Publié: (2024)
par: Shi, Wentao, et autres
Publié: (2024)
Right Now, Wrong Then: Non-Stationary Direct Preference Optimization under Preference Drift
par: Son, Seongho, et autres
Publié: (2024)
par: Son, Seongho, et autres
Publié: (2024)
$β$-DPO: Direct Preference Optimization with Dynamic $β$
par: Wu, Junkang, et autres
Publié: (2024)
par: Wu, Junkang, et autres
Publié: (2024)
Uncertainty-Penalized Direct Preference Optimization
par: Houliston, Sam, et autres
Publié: (2024)
par: Houliston, Sam, et autres
Publié: (2024)
Aligning CodeLLMs with Direct Preference Optimization
par: Miao, Yibo, et autres
Publié: (2024)
par: Miao, Yibo, et autres
Publié: (2024)
Risk Profiling and Modulation for LLMs
par: Wang, Yikai, et autres
Publié: (2025)
par: Wang, Yikai, et autres
Publié: (2025)
Entropy Controllable Direct Preference Optimization
par: Omura, Motoki, et autres
Publié: (2024)
par: Omura, Motoki, et autres
Publié: (2024)
$ξ$-DPO: Direct Preference Optimization via Ratio Reward Margin
par: Fan, Zhengyuan, et autres
Publié: (2026)
par: Fan, Zhengyuan, et autres
Publié: (2026)
Calibrating conditional risk
par: Vasilyev, Andrey, et autres
Publié: (2026)
par: Vasilyev, Andrey, et autres
Publié: (2026)
Learning to Make Adherence-Aware Advice
par: Chen, Guanting, et autres
Publié: (2023)
par: Chen, Guanting, et autres
Publié: (2023)
Documents similaires
-
Collaborative Prediction: To Join or To Disjoin Datasets
par: Kim, Kyung Rok, et autres
Publié: (2025) -
What Matters in Data for DPO?
par: Pan, Yu, et autres
Publié: (2025) -
Understanding Reference Policies in Direct Preference Optimization
par: Liu, Yixin, et autres
Publié: (2024) -
Lightweight Robust Direct Preference Optimization
par: Kim, Cheol Woo, et autres
Publié: (2025) -
Length Desensitization in Direct Preference Optimization
par: Liu, Wei, et autres
Publié: (2024)