Linear Preference Optimization: Decoupled Gradient Control via Absolute Regularization
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Rui, Sun, Qianguo, Song, Chao, Wu, Junlong, Chen, Tianrong, Zeng, Zhiyun, Li, Yu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information
por: Wang, Rui, et al.
Publicado: (2025)
por: Wang, Rui, et al.
Publicado: (2025)
Demystifying Reinforcement Learning for Long-Horizon Tool-Using Agents: A Comprehensive Recipe
por: Wu, Xixi, et al.
Publicado: (2026)
por: Wu, Xixi, et al.
Publicado: (2026)
Absolute Policy Optimization
por: Zhao, Weiye, et al.
Publicado: (2023)
por: Zhao, Weiye, et al.
Publicado: (2023)
Decoupling and Damping: Structurally-Regularized Gradient Matching for Multimodal Graph Condensation
por: Shen, Lian, et al.
Publicado: (2025)
por: Shen, Lian, et al.
Publicado: (2025)
Optimal Control Theoretic Neural Optimizer: From Backpropagation to Dynamic Programming
por: Liu, Guan-Horng, et al.
Publicado: (2025)
por: Liu, Guan-Horng, et al.
Publicado: (2025)
Decoupled Orthogonal Dynamics: Regularization for Deep Network Optimizers
por: Chen, Hao, et al.
Publicado: (2026)
por: Chen, Hao, et al.
Publicado: (2026)
Absolute State-wise Constrained Policy Optimization: High-Probability State-wise Constraints Satisfaction
por: Zhao, Weiye, et al.
Publicado: (2024)
por: Zhao, Weiye, et al.
Publicado: (2024)
Gradient Imbalance in Direct Preference Optimization
por: Ma, Qinwei, et al.
Publicado: (2025)
por: Ma, Qinwei, et al.
Publicado: (2025)
KL Penalty Control via Perturbation for Direct Preference Optimization
por: Lee, Sangkyu, et al.
Publicado: (2025)
por: Lee, Sangkyu, et al.
Publicado: (2025)
Personalized Steering of Large Language Models: Versatile Steering Vectors Through Bi-directional Preference Optimization
por: Cao, Yuanpu, et al.
Publicado: (2024)
por: Cao, Yuanpu, et al.
Publicado: (2024)
Knowledge Gradient for Preference Learning
por: Wu, Kaiwen, et al.
Publicado: (2026)
por: Wu, Kaiwen, et al.
Publicado: (2026)
On Generalization and Regularization via Wasserstein Distributionally Robust Optimization
por: Wu, Qinyu, et al.
Publicado: (2022)
por: Wu, Qinyu, et al.
Publicado: (2022)
Orthogonal Finetuning for Direct Preference Optimization
por: Yang, Chenxu, et al.
Publicado: (2024)
por: Yang, Chenxu, et al.
Publicado: (2024)
Global Convergence of Wasserstein Policy Gradient for Entropy-Regularized Reinforcement Learning
por: Zhu, Zhaoyu, et al.
Publicado: (2026)
por: Zhu, Zhaoyu, et al.
Publicado: (2026)
Regularized Conditional Diffusion Model for Multi-Task Preference Alignment
por: Yu, Xudong, et al.
Publicado: (2024)
por: Yu, Xudong, et al.
Publicado: (2024)
Gradient Regularized Natural Gradients
por: Dash, Satya Prakash, et al.
Publicado: (2026)
por: Dash, Satya Prakash, et al.
Publicado: (2026)
Towards Improved Preference Optimization Pipeline: from Data Generation to Budget-Controlled Regularization
por: Chen, Zhuotong, et al.
Publicado: (2024)
por: Chen, Zhuotong, et al.
Publicado: (2024)
Latent Adversarial Regularization for Offline Preference Optimization
por: Jiang, Enyi, et al.
Publicado: (2026)
por: Jiang, Enyi, et al.
Publicado: (2026)
Linear Convergence of Independent Natural Policy Gradient in Games with Entropy Regularization
por: Sun, Youbang, et al.
Publicado: (2024)
por: Sun, Youbang, et al.
Publicado: (2024)
Forward KL Regularized Preference Optimization for Aligning Diffusion Policies
por: Shan, Zhao, et al.
Publicado: (2024)
por: Shan, Zhao, et al.
Publicado: (2024)
Linear Convergence of Entropy-Regularized Natural Policy Gradient with Linear Function Approximation
por: Cayci, Semih, et al.
Publicado: (2021)
por: Cayci, Semih, et al.
Publicado: (2021)
Linear Gradient Prediction with Control Variates
por: Ciosek, Kamil, et al.
Publicado: (2025)
por: Ciosek, Kamil, et al.
Publicado: (2025)
Risk Comparisons in Linear Regression: Implicit Regularization Dominates Explicit Regularization
por: Wu, Jingfeng, et al.
Publicado: (2025)
por: Wu, Jingfeng, et al.
Publicado: (2025)
AMPS: Adaptive Modality Preference Steering via Functional Entropy
por: Huang, Zihan, et al.
Publicado: (2026)
por: Huang, Zihan, et al.
Publicado: (2026)
COPR: Continual Human Preference Learning via Optimal Policy Regularization
por: Zhang, Han, et al.
Publicado: (2024)
por: Zhang, Han, et al.
Publicado: (2024)
Linear Discriminant Analysis with Gradient Optimization
por: Shen, Cencheng, et al.
Publicado: (2025)
por: Shen, Cencheng, et al.
Publicado: (2025)
Gradient-Gated DPO: Stabilizing Preference Optimization in Language Models
por: Mouiche, Inoussa
Publicado: (2026)
por: Mouiche, Inoussa
Publicado: (2026)
Preconditioning for Accelerated Gradient Descent Optimization and Regularization
por: Ye, Qiang
Publicado: (2024)
por: Ye, Qiang
Publicado: (2024)
Adaptive Gradient Regularization: A Faster and Generalizable Optimization Technique for Deep Neural Networks
por: Jiang, Huixiu, et al.
Publicado: (2024)
por: Jiang, Huixiu, et al.
Publicado: (2024)
Knowledge Gradient for Multi-Objective Bayesian Optimization with Decoupled Evaluations
por: Buckingham, Jack M., et al.
Publicado: (2023)
por: Buckingham, Jack M., et al.
Publicado: (2023)
BOPO: Neural Combinatorial Optimization via Best-anchored and Objective-guided Preference Optimization
por: Liao, Zijun, et al.
Publicado: (2025)
por: Liao, Zijun, et al.
Publicado: (2025)
Preference as Reward, Maximum Preference Optimization with Importance Sampling
por: Jiang, Zaifan, et al.
Publicado: (2023)
por: Jiang, Zaifan, et al.
Publicado: (2023)
Active Learning for Direct Preference Optimization
por: Kveton, Branislav, et al.
Publicado: (2025)
por: Kveton, Branislav, et al.
Publicado: (2025)
DRPO: Efficient Reasoning via Decoupled Reward Policy Optimization
por: Li, Gang, et al.
Publicado: (2025)
por: Li, Gang, et al.
Publicado: (2025)
PromptFix: Few-shot Backdoor Removal via Adversarial Prompt Tuning
por: Zhang, Tianrong, et al.
Publicado: (2024)
por: Zhang, Tianrong, et al.
Publicado: (2024)
Local LMO: Constrained Gradient Optimization via a Local Linear Minimization Oracle
por: Richtárik, Peter, et al.
Publicado: (2026)
por: Richtárik, Peter, et al.
Publicado: (2026)
Asymptotics of Stochastic Gradient Descent with Dropout Regularization in Linear Models
por: Li, Jiaqi, et al.
Publicado: (2024)
por: Li, Jiaqi, et al.
Publicado: (2024)
Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization
por: Yu, Xin, et al.
Publicado: (2026)
por: Yu, Xin, et al.
Publicado: (2026)
Regularized Multi-output Gaussian Convolution Process with Domain Adaptation
por: Xinming, Wang, et al.
Publicado: (2024)
por: Xinming, Wang, et al.
Publicado: (2024)
Sobolev Regularized MMD Gradient Flow
por: Tian, Chenyang, et al.
Publicado: (2026)
por: Tian, Chenyang, et al.
Publicado: (2026)
Ejemplares similares
-
UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information
por: Wang, Rui, et al.
Publicado: (2025) -
Demystifying Reinforcement Learning for Long-Horizon Tool-Using Agents: A Comprehensive Recipe
por: Wu, Xixi, et al.
Publicado: (2026) -
Absolute Policy Optimization
por: Zhao, Weiye, et al.
Publicado: (2023) -
Decoupling and Damping: Structurally-Regularized Gradient Matching for Multimodal Graph Condensation
por: Shen, Lian, et al.
Publicado: (2025) -
Optimal Control Theoretic Neural Optimizer: From Backpropagation to Dynamic Programming
por: Liu, Guan-Horng, et al.
Publicado: (2025)