APO: Alpha-Divergence Preference Optimization
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Zixian, Wang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ADPO: Anchored Direct Preference Optimization
par: Zixian, Wang
Publié: (2025)
par: Zixian, Wang
Publié: (2025)
Orthogonalized Policy Optimization:Policy Optimization as Orthogonal Projection in Hilbert Space
par: Zixian, Wang
Publié: (2026)
par: Zixian, Wang
Publié: (2026)
Group Orthogonalized Policy Optimization:Group Policy Optimization as Orthogonal Projection in Hilbert Space
par: Zixian, Wang
Publié: (2026)
par: Zixian, Wang
Publié: (2026)
AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization
par: Wu, Junkang, et autres
Publié: (2024)
par: Wu, Junkang, et autres
Publié: (2024)
APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization
par: Hong, Minjie, et autres
Publié: (2025)
par: Hong, Minjie, et autres
Publié: (2025)
Attention Saturation and Gradient Suppression at Inflection Layers: Diagnosing and Mitigating Bottlenecks in Transformer Adaptation
par: Zixian, Wang
Publié: (2025)
par: Zixian, Wang
Publié: (2025)
Divergence-Augmented Policy Optimization
par: Wang, Qing, et autres
Publié: (2025)
par: Wang, Qing, et autres
Publié: (2025)
Thinking Preference Optimization
par: Yang, Wang, et autres
Publié: (2025)
par: Yang, Wang, et autres
Publié: (2025)
Beyond KL Divergence: Policy Optimization with Flexible Bregman Divergences for LLM Reasoning
par: Yuan, Rui, et autres
Publié: (2026)
par: Yuan, Rui, et autres
Publié: (2026)
Preference as Reward, Maximum Preference Optimization with Importance Sampling
par: Jiang, Zaifan, et autres
Publié: (2023)
par: Jiang, Zaifan, et autres
Publié: (2023)
On the Role of Preference Variance in Preference Optimization
par: Guo, Jiacheng, et autres
Publié: (2025)
par: Guo, Jiacheng, et autres
Publié: (2025)
AlphaZero-Edu: Democratizing Access to AlphaZero
par: Li, Ruitong, et autres
Publié: (2025)
par: Li, Ruitong, et autres
Publié: (2025)
Hindsight Preference Optimization for Financial Time Series Advisory
par: Cui, Yanwei, et autres
Publié: (2026)
par: Cui, Yanwei, et autres
Publié: (2026)
Continuous-Utility Direct Preference Optimization
par: Mohsin, Muhammad Ahmed, et autres
Publié: (2026)
par: Mohsin, Muhammad Ahmed, et autres
Publié: (2026)
Meta-Learning Objectives for Preference Optimization
par: Alfano, Carlo, et autres
Publié: (2024)
par: Alfano, Carlo, et autres
Publié: (2024)
Self-Improving Robust Preference Optimization
par: Choi, Eugene, et autres
Publié: (2024)
par: Choi, Eugene, et autres
Publié: (2024)
Mitigating Mismatch within Reference-based Preference Optimization
par: Yuan, Suqin, et autres
Publié: (2026)
par: Yuan, Suqin, et autres
Publié: (2026)
$β$-DPO: Direct Preference Optimization with Dynamic $β$
par: Wu, Junkang, et autres
Publié: (2024)
par: Wu, Junkang, et autres
Publié: (2024)
Omniwise: Predicting GPU Kernels Performance with LLMs
par: Wang, Zixian, et autres
Publié: (2025)
par: Wang, Zixian, et autres
Publié: (2025)
Radiology Report Generation via Multi-objective Preference Optimization
par: Xiao, Ting, et autres
Publié: (2024)
par: Xiao, Ting, et autres
Publié: (2024)
Adaptive Divergence Regularized Policy Optimization for Fine-tuning Generative Models
par: Fan, Jiajun, et autres
Publié: (2025)
par: Fan, Jiajun, et autres
Publié: (2025)
Aligning Diffusion Language Models via Unpaired Preference Optimization
par: Jindal, Vaibhav, et autres
Publié: (2025)
par: Jindal, Vaibhav, et autres
Publié: (2025)
SIPO: Stabilized and Improved Preference Optimization for Aligning Diffusion Models
par: Yang, Xiaomeng, et autres
Publié: (2025)
par: Yang, Xiaomeng, et autres
Publié: (2025)
AlphaLab: Autonomous Multi-Agent Research Across Optimization Domains with Frontier LLMs
par: Hogan, Brendan R., et autres
Publié: (2026)
par: Hogan, Brendan R., et autres
Publié: (2026)
Beyond One-Preference-Fits-All Alignment: Multi-Objective Direct Preference Optimization
par: Zhou, Zhanhui, et autres
Publié: (2023)
par: Zhou, Zhanhui, et autres
Publié: (2023)
Adaptive Batch-Wise Sample Scheduling for Direct Preference Optimization
par: Huang, Zixuan, et autres
Publié: (2025)
par: Huang, Zixuan, et autres
Publié: (2025)
Semi-Supervised Preference Optimization with Limited Feedback
par: Lee, Seonggyun, et autres
Publié: (2025)
par: Lee, Seonggyun, et autres
Publié: (2025)
Mitigating Preference Hacking in Policy Optimization with Pessimism
par: Gupta, Dhawal, et autres
Publié: (2025)
par: Gupta, Dhawal, et autres
Publié: (2025)
Efficient Exploration for Iterative Nash Preference Optimization
par: Nan, Tianlong, et autres
Publié: (2026)
par: Nan, Tianlong, et autres
Publié: (2026)
Latent Adversarial Regularization for Offline Preference Optimization
par: Jiang, Enyi, et autres
Publié: (2026)
par: Jiang, Enyi, et autres
Publié: (2026)
Aligning CodeLLMs with Direct Preference Optimization
par: Miao, Yibo, et autres
Publié: (2024)
par: Miao, Yibo, et autres
Publié: (2024)
Un-mixing Test-time Adaptation under Heterogeneous Data Streams
par: Su, Zixian, et autres
Publié: (2024)
par: Su, Zixian, et autres
Publié: (2024)
RePO: Understanding Preference Learning Through ReLU-Based Optimization
par: Wu, Junkang, et autres
Publié: (2025)
par: Wu, Junkang, et autres
Publié: (2025)
DPO Kernels: A Semantically-Aware, Kernel-Enhanced, and Divergence-Rich Paradigm for Direct Preference Optimization
par: Das, Amitava, et autres
Publié: (2025)
par: Das, Amitava, et autres
Publié: (2025)
Risk-aware Direct Preference Optimization under Nested Risk Measure
par: Zhang, Lijun, et autres
Publié: (2025)
par: Zhang, Lijun, et autres
Publié: (2025)
Towards Disentangled Preference Optimization Dynamics: Suppress the Loser, Preserve the Winner
par: Chen, Wei, et autres
Publié: (2026)
par: Chen, Wei, et autres
Publié: (2026)
Preference-Guided Diffusion for Multi-Objective Offline Optimization
par: Annadani, Yashas, et autres
Publié: (2025)
par: Annadani, Yashas, et autres
Publié: (2025)
On Symmetric Losses for Robust Policy Optimization with Noisy Preferences
par: Nishimori, Soichiro, et autres
Publié: (2025)
par: Nishimori, Soichiro, et autres
Publié: (2025)
Bootstrapping LLMs via Preference-Based Policy Optimization
par: Jia, Chen
Publié: (2025)
par: Jia, Chen
Publié: (2025)
POLO: Preference-Guided Multi-Turn Reinforcement Learning for Lead Optimization
par: Wang, Ziqing, et autres
Publié: (2025)
par: Wang, Ziqing, et autres
Publié: (2025)
Documents similaires
-
ADPO: Anchored Direct Preference Optimization
par: Zixian, Wang
Publié: (2025) -
Orthogonalized Policy Optimization:Policy Optimization as Orthogonal Projection in Hilbert Space
par: Zixian, Wang
Publié: (2026) -
Group Orthogonalized Policy Optimization:Group Policy Optimization as Orthogonal Projection in Hilbert Space
par: Zixian, Wang
Publié: (2026) -
AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization
par: Wu, Junkang, et autres
Publié: (2024) -
APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization
par: Hong, Minjie, et autres
Publié: (2025)