AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization
Fuente:
arXiv
Guardado en:
| Autores principales: | Wu, Junkang, Wang, Xue, Yang, Zhengyi, Wu, Jiancan, Gao, Jinyang, Ding, Bolin, Wang, Xiang, He, Xiangnan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
$β$-DPO: Direct Preference Optimization with Dynamic $β$
por: Wu, Junkang, et al.
Publicado: (2024)
por: Wu, Junkang, et al.
Publicado: (2024)
Larger or Smaller Reward Margins to Select Preferences for Alignment?
por: Huang, Kexin, et al.
Publicado: (2025)
por: Huang, Kexin, et al.
Publicado: (2025)
Towards Robust Alignment of Language Models: Distributionally Robustifying Direct Preference Optimization
por: Wu, Junkang, et al.
Publicado: (2024)
por: Wu, Junkang, et al.
Publicado: (2024)
RePO: Understanding Preference Learning Through ReLU-Based Optimization
por: Wu, Junkang, et al.
Publicado: (2025)
por: Wu, Junkang, et al.
Publicado: (2025)
bi-GRPO: Bidirectional Optimization for Jailbreak Backdoor Injection on LLMs
por: Ji, Wence, et al.
Publicado: (2025)
por: Ji, Wence, et al.
Publicado: (2025)
Robust Preference Optimization via Dynamic Target Margins
por: Sun, Jie, et al.
Publicado: (2025)
por: Sun, Jie, et al.
Publicado: (2025)
$ξ$-DPO: Direct Preference Optimization via Ratio Reward Margin
por: Fan, Zhengyuan, et al.
Publicado: (2026)
por: Fan, Zhengyuan, et al.
Publicado: (2026)
Enhancing Temporal Sensitivity of Large Language Model for Recommendation with Counterfactual Tuning
por: Liu, Yutian, et al.
Publicado: (2025)
por: Liu, Yutian, et al.
Publicado: (2025)
AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization
por: Lu, Jinda, et al.
Publicado: (2025)
por: Lu, Jinda, et al.
Publicado: (2025)
Quantile Advantage Estimation: Stabilizing RLVR for LLM Reasoning
por: Wu, Junkang, et al.
Publicado: (2025)
por: Wu, Junkang, et al.
Publicado: (2025)
On the Direction of RLVR Updates for LLM Reasoning: Identification and Exploitation
por: Huang, Kexin, et al.
Publicado: (2026)
por: Huang, Kexin, et al.
Publicado: (2026)
On Negative-aware Preference Optimization for Recommendation
por: Ding, Chenlu, et al.
Publicado: (2025)
por: Ding, Chenlu, et al.
Publicado: (2025)
2D-DPO: Scaling Direct Preference Optimization with 2-Dimensional Supervision
por: Li, Shilong, et al.
Publicado: (2024)
por: Li, Shilong, et al.
Publicado: (2024)
Margin Adaptive DPO: Leveraging Reward Model for Granular Control in Preference Optimization
por: Rho, Hyung Gyu
Publicado: (2025)
por: Rho, Hyung Gyu
Publicado: (2025)
Online DPO: Online Direct Preference Optimization with Fast-Slow Chasing
por: Qi, Biqing, et al.
Publicado: (2024)
por: Qi, Biqing, et al.
Publicado: (2024)
R^2-Mem: Reflective Experience for Memory Search
por: Wang, Xinyuan, et al.
Publicado: (2026)
por: Wang, Xinyuan, et al.
Publicado: (2026)
Direct Multi-Turn Preference Optimization for Language Agents
por: Shi, Wentao, et al.
Publicado: (2024)
por: Shi, Wentao, et al.
Publicado: (2024)
Difficulty-Based Preference Data Selection by DPO Implicit Reward Gap
por: Qi, Xuan, et al.
Publicado: (2025)
por: Qi, Xuan, et al.
Publicado: (2025)
Towards Understanding the Influence of Reward Margin on Preference Model Performance
por: Qin, Bowen, et al.
Publicado: (2024)
por: Qin, Bowen, et al.
Publicado: (2024)
Act-Adaptive Margin: Dynamically Calibrating Reward Models for Subjective Ambiguity
por: Fang, Feiteng, et al.
Publicado: (2025)
por: Fang, Feiteng, et al.
Publicado: (2025)
Uni-DPO: A Unified Paradigm for Dynamic Preference Optimization of LLMs
por: Peng, Shangpin, et al.
Publicado: (2025)
por: Peng, Shangpin, et al.
Publicado: (2025)
Mix- and MoE-DPO: A Variational Inference Approach to Direct Preference Optimization
por: Bohne, Jason, et al.
Publicado: (2025)
por: Bohne, Jason, et al.
Publicado: (2025)
Incentivizing Strong Reasoning from Weak Supervision
por: Yuan, Yige, et al.
Publicado: (2025)
por: Yuan, Yige, et al.
Publicado: (2025)
Cat-DPO: Category-Adaptive Safety Alignment
por: Yang, Tiankai, et al.
Publicado: (2026)
por: Yang, Tiankai, et al.
Publicado: (2026)
AlphaEdit: Null-Space Constrained Knowledge Editing for Language Models
por: Fang, Junfeng, et al.
Publicado: (2024)
por: Fang, Junfeng, et al.
Publicado: (2024)
DPO-Shift: Shifting the Distribution of Direct Preference Optimization
por: Yang, Xiliang, et al.
Publicado: (2025)
por: Yang, Xiliang, et al.
Publicado: (2025)
Full-Step-DPO: Self-Supervised Preference Optimization with Step-wise Rewards for Mathematical Reasoning
por: Xu, Huimin, et al.
Publicado: (2025)
por: Xu, Huimin, et al.
Publicado: (2025)
Sem-DPO: Mitigating Semantic Inconsistency in Preference Optimization for Prompt Engineering
por: Mohamed, Anas, et al.
Publicado: (2025)
por: Mohamed, Anas, et al.
Publicado: (2025)
Implicit Cross-Lingual Rewarding for Efficient Multilingual Preference Alignment
por: Yang, Wen, et al.
Publicado: (2025)
por: Yang, Wen, et al.
Publicado: (2025)
TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization
por: Zhu, Mingkang, et al.
Publicado: (2025)
por: Zhu, Mingkang, et al.
Publicado: (2025)
AlpsBench: An LLM Personalization Benchmark for Real-Dialogue Memorization and Preference Alignment
por: Xiao, Jianfei, et al.
Publicado: (2026)
por: Xiao, Jianfei, et al.
Publicado: (2026)
Orthogonal Finetuning for Direct Preference Optimization
por: Yang, Chenxu, et al.
Publicado: (2024)
por: Yang, Chenxu, et al.
Publicado: (2024)
Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs
por: Lai, Xin, et al.
Publicado: (2024)
por: Lai, Xin, et al.
Publicado: (2024)
Token-level Direct Preference Optimization
por: Zeng, Yongcheng, et al.
Publicado: (2024)
por: Zeng, Yongcheng, et al.
Publicado: (2024)
AdaDPO: Self-Adaptive Direct Preference Optimization with Balanced Gradient Updates
por: Chen, Shaolong, et al.
Publicado: (2026)
por: Chen, Shaolong, et al.
Publicado: (2026)
Adaptive Margin RLHF via Preference over Preferences
por: Chittepu, Yaswanth, et al.
Publicado: (2025)
por: Chittepu, Yaswanth, et al.
Publicado: (2025)
DPO Kernels: A Semantically-Aware, Kernel-Enhanced, and Divergence-Rich Paradigm for Direct Preference Optimization
por: Das, Amitava, et al.
Publicado: (2025)
por: Das, Amitava, et al.
Publicado: (2025)
Multi-Preference Optimization: Generalizing DPO via Set-Level Contrasts
por: Gupta, Taneesh, et al.
Publicado: (2024)
por: Gupta, Taneesh, et al.
Publicado: (2024)
RS-DPO: A Hybrid Rejection Sampling and Direct Preference Optimization Method for Alignment of Large Language Models
por: Khaki, Saeed, et al.
Publicado: (2024)
por: Khaki, Saeed, et al.
Publicado: (2024)
mDPO: Conditional Preference Optimization for Multimodal Large Language Models
por: Wang, Fei, et al.
Publicado: (2024)
por: Wang, Fei, et al.
Publicado: (2024)
Ejemplares similares
-
$β$-DPO: Direct Preference Optimization with Dynamic $β$
por: Wu, Junkang, et al.
Publicado: (2024) -
Larger or Smaller Reward Margins to Select Preferences for Alignment?
por: Huang, Kexin, et al.
Publicado: (2025) -
Towards Robust Alignment of Language Models: Distributionally Robustifying Direct Preference Optimization
por: Wu, Junkang, et al.
Publicado: (2024) -
RePO: Understanding Preference Learning Through ReLU-Based Optimization
por: Wu, Junkang, et al.
Publicado: (2025) -
bi-GRPO: Bidirectional Optimization for Jailbreak Backdoor Injection on LLMs
por: Ji, Wence, et al.
Publicado: (2025)