SP^2DPO: An LLM-assisted Semantic Per-Pair DPO Generalization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | He, Chaoyue, Zhou, Xin, Wang, Di, Xu, Hong, Liu, Wei, Miao, Chunyan |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
daDPO: Distribution-Aware DPO for Distilling Conversational Abilities
par: Zhang, Zhengze, et autres
Publié: (2025)
par: Zhang, Zhengze, et autres
Publié: (2025)
DPO Meets PPO: Reinforced Token Optimization for RLHF
par: Zhong, Han, et autres
Publié: (2024)
par: Zhong, Han, et autres
Publié: (2024)
Sem-DPO: Mitigating Semantic Inconsistency in Preference Optimization for Prompt Engineering
par: Mohamed, Anas, et autres
Publié: (2025)
par: Mohamed, Anas, et autres
Publié: (2025)
AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization
par: Wu, Junkang, et autres
Publié: (2024)
par: Wu, Junkang, et autres
Publié: (2024)
3D-Properties: Identifying Challenges in DPO and Charting a Path Forward
par: Yan, Yuzi, et autres
Publié: (2024)
par: Yan, Yuzi, et autres
Publié: (2024)
Multi-Preference Optimization: Generalizing DPO via Set-Level Contrasts
par: Gupta, Taneesh, et autres
Publié: (2024)
par: Gupta, Taneesh, et autres
Publié: (2024)
Difficulty-Based Preference Data Selection by DPO Implicit Reward Gap
par: Qi, Xuan, et autres
Publié: (2025)
par: Qi, Xuan, et autres
Publié: (2025)
MixDPO: Modeling Preference Strength for Pluralistic Alignment
par: Imai, Saki, et autres
Publié: (2026)
par: Imai, Saki, et autres
Publié: (2026)
Online DPO: Online Direct Preference Optimization with Fast-Slow Chasing
par: Qi, Biqing, et autres
Publié: (2024)
par: Qi, Biqing, et autres
Publié: (2024)
Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs
par: Lai, Xin, et autres
Publié: (2024)
par: Lai, Xin, et autres
Publié: (2024)
Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections
par: Wang, Bo, et autres
Publié: (2025)
par: Wang, Bo, et autres
Publié: (2025)
Improving LLM Safety and Helpfulness using SFT and DPO: A Study on OPT-350M
par: Pant, Piyush
Publié: (2025)
par: Pant, Piyush
Publié: (2025)
Smaug: Fixing Failure Modes of Preference Optimisation with DPO-Positive
par: Pal, Arka, et autres
Publié: (2024)
par: Pal, Arka, et autres
Publié: (2024)
Curry-DPO: Enhancing Alignment using Curriculum Learning & Ranked Preferences
par: Pattnaik, Pulkit, et autres
Publié: (2024)
par: Pattnaik, Pulkit, et autres
Publié: (2024)
Mix- and MoE-DPO: A Variational Inference Approach to Direct Preference Optimization
par: Bohne, Jason, et autres
Publié: (2025)
par: Bohne, Jason, et autres
Publié: (2025)
DPO Kernels: A Semantically-Aware, Kernel-Enhanced, and Divergence-Rich Paradigm for Direct Preference Optimization
par: Das, Amitava, et autres
Publié: (2025)
par: Das, Amitava, et autres
Publié: (2025)
mDPO: Conditional Preference Optimization for Multimodal Large Language Models
par: Wang, Fei, et autres
Publié: (2024)
par: Wang, Fei, et autres
Publié: (2024)
Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO
par: Tong, Chengzhuo, et autres
Publié: (2025)
par: Tong, Chengzhuo, et autres
Publié: (2025)
What Matters in Data for DPO?
par: Pan, Yu, et autres
Publié: (2025)
par: Pan, Yu, et autres
Publié: (2025)
Uni-DPO: A Unified Paradigm for Dynamic Preference Optimization of LLMs
par: Peng, Shangpin, et autres
Publié: (2025)
par: Peng, Shangpin, et autres
Publié: (2025)
VideoDPO: Omni-Preference Alignment for Video Diffusion Generation
par: Liu, Runtao, et autres
Publié: (2024)
par: Liu, Runtao, et autres
Publié: (2024)
C2-DPO: Constrained Controlled Direct Preference Optimization
par: Asadi, Kavosh, et autres
Publié: (2025)
par: Asadi, Kavosh, et autres
Publié: (2025)
$β$-DPO: Direct Preference Optimization with Dynamic $β$
par: Wu, Junkang, et autres
Publié: (2024)
par: Wu, Junkang, et autres
Publié: (2024)
The Viscosity of Logic: Phase Transitions and Hysteresis in DPO Alignment
par: Pollanen, Marco
Publié: (2026)
par: Pollanen, Marco
Publié: (2026)
DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory
par: Zhou, Wenxuan, et autres
Publié: (2025)
par: Zhou, Wenxuan, et autres
Publié: (2025)
GFRIEND: Generative Few-shot Reward Inference through EfficieNt DPO
par: Zhao, Yiyang, et autres
Publié: (2025)
par: Zhao, Yiyang, et autres
Publié: (2025)
Conditional Equivalence of DPO and RLHF: Implicit Assumption, Failure Modes, and Provable Alignment
par: Yang, Zhiqin, et autres
Publié: (2026)
par: Yang, Zhiqin, et autres
Publié: (2026)
SePer: Measure Retrieval Utility Through The Lens Of Semantic Perplexity Reduction
par: Dai, Lu, et autres
Publié: (2025)
par: Dai, Lu, et autres
Publié: (2025)
ESGenius: Benchmarking LLMs on Environmental, Social, and Governance (ESG) and Sustainability Knowledge
par: He, Chaoyue, et autres
Publié: (2025)
par: He, Chaoyue, et autres
Publié: (2025)
A Unified Theoretical Analysis of Private and Robust Offline Alignment: from RLHF to DPO
par: Zhou, Xingyu, et autres
Publié: (2025)
par: Zhou, Xingyu, et autres
Publié: (2025)
RS-DPO: A Hybrid Rejection Sampling and Direct Preference Optimization Method for Alignment of Large Language Models
par: Khaki, Saeed, et autres
Publié: (2024)
par: Khaki, Saeed, et autres
Publié: (2024)
$ξ$-DPO: Direct Preference Optimization via Ratio Reward Margin
par: Fan, Zhengyuan, et autres
Publié: (2026)
par: Fan, Zhengyuan, et autres
Publié: (2026)
Random Is Hard to Beat: Active Selection in online DPO with Modern LLMs
par: Oh, Giyeong, et autres
Publié: (2026)
par: Oh, Giyeong, et autres
Publié: (2026)
ActiveDPO: Active Direct Preference Optimization for Sample-Efficient Alignment
par: Lin, Xiaoqiang, et autres
Publié: (2025)
par: Lin, Xiaoqiang, et autres
Publié: (2025)
Cat-DPO: Category-Adaptive Safety Alignment
par: Yang, Tiankai, et autres
Publié: (2026)
par: Yang, Tiankai, et autres
Publié: (2026)
SafeDPO: A Simple Approach to Direct Preference Optimization with Enhanced Safety
par: Kim, Geon-Hyeong, et autres
Publié: (2025)
par: Kim, Geon-Hyeong, et autres
Publié: (2025)
Margin Adaptive DPO: Leveraging Reward Model for Granular Control in Preference Optimization
par: Rho, Hyung Gyu
Publié: (2025)
par: Rho, Hyung Gyu
Publié: (2025)
Aligning Compound AI Systems via System-level DPO
par: Wang, Xiangwen, et autres
Publié: (2025)
par: Wang, Xiangwen, et autres
Publié: (2025)
2D-DPO: Scaling Direct Preference Optimization with 2-Dimensional Supervision
par: Li, Shilong, et autres
Publié: (2024)
par: Li, Shilong, et autres
Publié: (2024)
Provably Mitigating Corruption, Overoptimization, and Verbosity Simultaneously in Offline and Online RLHF/DPO Alignment
par: Chen, Ziyi, et autres
Publié: (2025)
par: Chen, Ziyi, et autres
Publié: (2025)
Documents similaires
-
daDPO: Distribution-Aware DPO for Distilling Conversational Abilities
par: Zhang, Zhengze, et autres
Publié: (2025) -
DPO Meets PPO: Reinforced Token Optimization for RLHF
par: Zhong, Han, et autres
Publié: (2024) -
Sem-DPO: Mitigating Semantic Inconsistency in Preference Optimization for Prompt Engineering
par: Mohamed, Anas, et autres
Publié: (2025) -
AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization
par: Wu, Junkang, et autres
Publié: (2024) -
3D-Properties: Identifying Challenges in DPO and Charting a Path Forward
par: Yan, Yuzi, et autres
Publié: (2024)