DGPO: Beyond Pairwise Preferences with Directional Consistent Groupwise Optimization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Deng, Mengyi, Li, Zhiwei, Li, Xin, Zhu, Tingyu, Yuan, Yulan, Guo, Zhijiang, Wang, Wei |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
When Inverse Data Outperforms: Exploring the Pitfalls of Mixed Data in Multi-Stage Fine-Tuning
par: Deng, Mengyi, et autres
Publié: (2025)
par: Deng, Mengyi, et autres
Publié: (2025)
Bridging and Modeling Correlations in Pairwise Data for Direct Preference Optimization
par: Jiang, Yuxin, et autres
Publié: (2024)
par: Jiang, Yuxin, et autres
Publié: (2024)
Length-Controlled Margin-Based Preference Optimization without Reference Model
par: Li, Gengxu, et autres
Publié: (2025)
par: Li, Gengxu, et autres
Publié: (2025)
Aligning with Human Judgement: The Role of Pairwise Preference in Large Language Model Evaluators
par: Liu, Yinhong, et autres
Publié: (2024)
par: Liu, Yinhong, et autres
Publié: (2024)
PrefPO: Pairwise Preference Prompt Optimization
par: Singhal, Rahul, et autres
Publié: (2026)
par: Singhal, Rahul, et autres
Publié: (2026)
Eliminating Biased Length Reliance of Direct Preference Optimization via Down-Sampled KL Divergence
par: Lu, Junru, et autres
Publié: (2024)
par: Lu, Junru, et autres
Publié: (2024)
PhyGDPO: Physics-Aware Groupwise Direct Preference Optimization for Physically Consistent Text-to-Video Generation
par: Cai, Yuanhao, et autres
Publié: (2025)
par: Cai, Yuanhao, et autres
Publié: (2025)
Self-Training with Direct Preference Optimization Improves Chain-of-Thought Reasoning
par: Wang, Tianduo, et autres
Publié: (2024)
par: Wang, Tianduo, et autres
Publié: (2024)
Aligning with Logic: Measuring, Evaluating and Improving Logical Preference Consistency in Large Language Models
par: Liu, Yinhong, et autres
Publié: (2024)
par: Liu, Yinhong, et autres
Publié: (2024)
Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment
par: Xiao, Teng, et autres
Publié: (2024)
par: Xiao, Teng, et autres
Publié: (2024)
BPO: Revisiting Preference Modeling in Direct Preference Optimization
par: Sun, Lin, et autres
Publié: (2025)
par: Sun, Lin, et autres
Publié: (2025)
Probability-Consistent Preference Optimization for Enhanced LLM Reasoning
par: Yang, Yunqiao, et autres
Publié: (2025)
par: Yang, Yunqiao, et autres
Publié: (2025)
Direct Judgement Preference Optimization
par: Wang, Peifeng, et autres
Publié: (2024)
par: Wang, Peifeng, et autres
Publié: (2024)
Beyond Hallucinations: Enhancing LVLMs through Hallucination-Aware Direct Preference Optimization
par: Zhao, Zhiyuan, et autres
Publié: (2023)
par: Zhao, Zhiyuan, et autres
Publié: (2023)
Token-weighted Direct Preference Optimization with Attention
par: Huang, Chengyu, et autres
Publié: (2026)
par: Huang, Chengyu, et autres
Publié: (2026)
Weak-to-Strong Preference Optimization: Stealing Reward from Weak Aligned Model
par: Zhu, Wenhong, et autres
Publié: (2024)
par: Zhu, Wenhong, et autres
Publié: (2024)
Self-Consistency Preference Optimization
par: Prasad, Archiki, et autres
Publié: (2024)
par: Prasad, Archiki, et autres
Publié: (2024)
EnvFactory: Scaling Tool-Use Agents via Executable Environments Synthesis and Robust RL
par: Xu, Minrui, et autres
Publié: (2026)
par: Xu, Minrui, et autres
Publié: (2026)
Length Desensitization in Direct Preference Optimization
par: Liu, Wei, et autres
Publié: (2024)
par: Liu, Wei, et autres
Publié: (2024)
Direct Preference Knowledge Distillation for Large Language Models
par: Li, Yixing, et autres
Publié: (2024)
par: Li, Yixing, et autres
Publié: (2024)
Direct Multi-Turn Preference Optimization for Language Agents
par: Shi, Wentao, et autres
Publié: (2024)
par: Shi, Wentao, et autres
Publié: (2024)
DPO-Shift: Shifting the Distribution of Direct Preference Optimization
par: Yang, Xiliang, et autres
Publié: (2025)
par: Yang, Xiliang, et autres
Publié: (2025)
Calibrating LLMs with Preference Optimization on Thought Trees for Generating Rationale in Science Question Scoring
par: Li, Jiazheng, et autres
Publié: (2024)
par: Li, Jiazheng, et autres
Publié: (2024)
Ambiguity Awareness Optimization: Towards Semantic Disambiguation for Direct Preference Optimization
par: Li, Jian, et autres
Publié: (2025)
par: Li, Jian, et autres
Publié: (2025)
Atomic Consistency Preference Optimization for Long-Form Question Answering
par: Chen, Jingfeng, et autres
Publié: (2025)
par: Chen, Jingfeng, et autres
Publié: (2025)
TSO: Self-Training with Scaled Preference Optimization
par: Chen, Kaihui, et autres
Publié: (2024)
par: Chen, Kaihui, et autres
Publié: (2024)
New Desiderata for Direct Preference Optimization
par: Hu, Xiangkun, et autres
Publié: (2024)
par: Hu, Xiangkun, et autres
Publié: (2024)
LLM Optimization Unlocks Real-Time Pairwise Reranking
par: Wu, Jingyu, et autres
Publié: (2025)
par: Wu, Jingyu, et autres
Publié: (2025)
SDPO: Segment-Level Direct Preference Optimization for Social Agents
par: Kong, Aobo, et autres
Publié: (2025)
par: Kong, Aobo, et autres
Publié: (2025)
Less is More: Resource-Efficient Low-Rank Adaptation
par: Tian, Chunlin, et autres
Publié: (2025)
par: Tian, Chunlin, et autres
Publié: (2025)
Beyond Pass@1: Self-Play with Variational Problem Synthesis Sustains RLVR
par: Liang, Xiao, et autres
Publié: (2025)
par: Liang, Xiao, et autres
Publié: (2025)
On the Role of Preference Variance in Preference Optimization
par: Guo, Jiacheng, et autres
Publié: (2025)
par: Guo, Jiacheng, et autres
Publié: (2025)
Token-level Direct Preference Optimization
par: Zeng, Yongcheng, et autres
Publié: (2024)
par: Zeng, Yongcheng, et autres
Publié: (2024)
Earlier Tokens Contribute More: Learning Direct Preference Optimization From Temporal Decay Perspective
par: Shao, Ruichen, et autres
Publié: (2025)
par: Shao, Ruichen, et autres
Publié: (2025)
Accelerating Direct Preference Optimization with Prefix Sharing
par: Wang, Franklin, et autres
Publié: (2024)
par: Wang, Franklin, et autres
Publié: (2024)
The Comparative Trap: Pairwise Comparisons Amplifies Biased Preferences of LLM Evaluators
par: Jeong, Hawon, et autres
Publié: (2024)
par: Jeong, Hawon, et autres
Publié: (2024)
Improving Factual Consistency of News Summarization by Contrastive Preference Optimization
par: Feng, Huawen, et autres
Publié: (2023)
par: Feng, Huawen, et autres
Publié: (2023)
2D-DPO: Scaling Direct Preference Optimization with 2-Dimensional Supervision
par: Li, Shilong, et autres
Publié: (2024)
par: Li, Shilong, et autres
Publié: (2024)
Some things are more CRINGE than others: Iterative Preference Optimization with the Pairwise Cringe Loss
par: Xu, Jing, et autres
Publié: (2023)
par: Xu, Jing, et autres
Publié: (2023)
ICDPO: Effectively Borrowing Alignment Capability of Others via In-context Direct Preference Optimization
par: Song, Feifan, et autres
Publié: (2024)
par: Song, Feifan, et autres
Publié: (2024)
Documents similaires
-
When Inverse Data Outperforms: Exploring the Pitfalls of Mixed Data in Multi-Stage Fine-Tuning
par: Deng, Mengyi, et autres
Publié: (2025) -
Bridging and Modeling Correlations in Pairwise Data for Direct Preference Optimization
par: Jiang, Yuxin, et autres
Publié: (2024) -
Length-Controlled Margin-Based Preference Optimization without Reference Model
par: Li, Gengxu, et autres
Publié: (2025) -
Aligning with Human Judgement: The Role of Pairwise Preference in Large Language Model Evaluators
par: Liu, Yinhong, et autres
Publié: (2024) -
PrefPO: Pairwise Preference Prompt Optimization
par: Singhal, Rahul, et autres
Publié: (2026)