Salvato in:
| Autore principale: | Zixian, Wang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2512.22953 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ADPO: Anchored Direct Preference Optimization
di: Zixian, Wang
Pubblicazione: (2025)
di: Zixian, Wang
Pubblicazione: (2025)
Orthogonalized Policy Optimization:Policy Optimization as Orthogonal Projection in Hilbert Space
di: Zixian, Wang
Pubblicazione: (2026)
di: Zixian, Wang
Pubblicazione: (2026)
Group Orthogonalized Policy Optimization:Group Policy Optimization as Orthogonal Projection in Hilbert Space
di: Zixian, Wang
Pubblicazione: (2026)
di: Zixian, Wang
Pubblicazione: (2026)
APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization
di: Hong, Minjie, et al.
Pubblicazione: (2025)
di: Hong, Minjie, et al.
Pubblicazione: (2025)
AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization
di: Wu, Junkang, et al.
Pubblicazione: (2024)
di: Wu, Junkang, et al.
Pubblicazione: (2024)
Attention Saturation and Gradient Suppression at Inflection Layers: Diagnosing and Mitigating Bottlenecks in Transformer Adaptation
di: Zixian, Wang
Pubblicazione: (2025)
di: Zixian, Wang
Pubblicazione: (2025)
Divergence-Augmented Policy Optimization
di: Wang, Qing, et al.
Pubblicazione: (2025)
di: Wang, Qing, et al.
Pubblicazione: (2025)
Thinking Preference Optimization
di: Yang, Wang, et al.
Pubblicazione: (2025)
di: Yang, Wang, et al.
Pubblicazione: (2025)
Beyond KL Divergence: Policy Optimization with Flexible Bregman Divergences for LLM Reasoning
di: Yuan, Rui, et al.
Pubblicazione: (2026)
di: Yuan, Rui, et al.
Pubblicazione: (2026)
On the Role of Preference Variance in Preference Optimization
di: Guo, Jiacheng, et al.
Pubblicazione: (2025)
di: Guo, Jiacheng, et al.
Pubblicazione: (2025)
Preference as Reward, Maximum Preference Optimization with Importance Sampling
di: Jiang, Zaifan, et al.
Pubblicazione: (2023)
di: Jiang, Zaifan, et al.
Pubblicazione: (2023)
AlphaZero-Edu: Democratizing Access to AlphaZero
di: Li, Ruitong, et al.
Pubblicazione: (2025)
di: Li, Ruitong, et al.
Pubblicazione: (2025)
Omniwise: Predicting GPU Kernels Performance with LLMs
di: Wang, Zixian, et al.
Pubblicazione: (2025)
di: Wang, Zixian, et al.
Pubblicazione: (2025)
Hindsight Preference Optimization for Financial Time Series Advisory
di: Cui, Yanwei, et al.
Pubblicazione: (2026)
di: Cui, Yanwei, et al.
Pubblicazione: (2026)
Un-mixing Test-time Adaptation under Heterogeneous Data Streams
di: Su, Zixian, et al.
Pubblicazione: (2024)
di: Su, Zixian, et al.
Pubblicazione: (2024)
DPO Kernels: A Semantically-Aware, Kernel-Enhanced, and Divergence-Rich Paradigm for Direct Preference Optimization
di: Das, Amitava, et al.
Pubblicazione: (2025)
di: Das, Amitava, et al.
Pubblicazione: (2025)
Continuous-Utility Direct Preference Optimization
di: Mohsin, Muhammad Ahmed, et al.
Pubblicazione: (2026)
di: Mohsin, Muhammad Ahmed, et al.
Pubblicazione: (2026)
Meta-Learning Objectives for Preference Optimization
di: Alfano, Carlo, et al.
Pubblicazione: (2024)
di: Alfano, Carlo, et al.
Pubblicazione: (2024)
Self-Improving Robust Preference Optimization
di: Choi, Eugene, et al.
Pubblicazione: (2024)
di: Choi, Eugene, et al.
Pubblicazione: (2024)
Mitigating Mismatch within Reference-based Preference Optimization
di: Yuan, Suqin, et al.
Pubblicazione: (2026)
di: Yuan, Suqin, et al.
Pubblicazione: (2026)
$β$-DPO: Direct Preference Optimization with Dynamic $β$
di: Wu, Junkang, et al.
Pubblicazione: (2024)
di: Wu, Junkang, et al.
Pubblicazione: (2024)
Radiology Report Generation via Multi-objective Preference Optimization
di: Xiao, Ting, et al.
Pubblicazione: (2024)
di: Xiao, Ting, et al.
Pubblicazione: (2024)
Adaptive Divergence Regularized Policy Optimization for Fine-tuning Generative Models
di: Fan, Jiajun, et al.
Pubblicazione: (2025)
di: Fan, Jiajun, et al.
Pubblicazione: (2025)
Aligning Diffusion Language Models via Unpaired Preference Optimization
di: Jindal, Vaibhav, et al.
Pubblicazione: (2025)
di: Jindal, Vaibhav, et al.
Pubblicazione: (2025)
AlphaLab: Autonomous Multi-Agent Research Across Optimization Domains with Frontier LLMs
di: Hogan, Brendan R., et al.
Pubblicazione: (2026)
di: Hogan, Brendan R., et al.
Pubblicazione: (2026)
SIPO: Stabilized and Improved Preference Optimization for Aligning Diffusion Models
di: Yang, Xiaomeng, et al.
Pubblicazione: (2025)
di: Yang, Xiaomeng, et al.
Pubblicazione: (2025)
Beyond One-Preference-Fits-All Alignment: Multi-Objective Direct Preference Optimization
di: Zhou, Zhanhui, et al.
Pubblicazione: (2023)
di: Zhou, Zhanhui, et al.
Pubblicazione: (2023)
Adaptive Batch-Wise Sample Scheduling for Direct Preference Optimization
di: Huang, Zixuan, et al.
Pubblicazione: (2025)
di: Huang, Zixuan, et al.
Pubblicazione: (2025)
Semi-Supervised Preference Optimization with Limited Feedback
di: Lee, Seonggyun, et al.
Pubblicazione: (2025)
di: Lee, Seonggyun, et al.
Pubblicazione: (2025)
Mitigating Preference Hacking in Policy Optimization with Pessimism
di: Gupta, Dhawal, et al.
Pubblicazione: (2025)
di: Gupta, Dhawal, et al.
Pubblicazione: (2025)
Efficient Exploration for Iterative Nash Preference Optimization
di: Nan, Tianlong, et al.
Pubblicazione: (2026)
di: Nan, Tianlong, et al.
Pubblicazione: (2026)
Latent Adversarial Regularization for Offline Preference Optimization
di: Jiang, Enyi, et al.
Pubblicazione: (2026)
di: Jiang, Enyi, et al.
Pubblicazione: (2026)
Aligning CodeLLMs with Direct Preference Optimization
di: Miao, Yibo, et al.
Pubblicazione: (2024)
di: Miao, Yibo, et al.
Pubblicazione: (2024)
Geometric-Averaged Preference Optimization for Soft Preference Labels
di: Furuta, Hiroki, et al.
Pubblicazione: (2024)
di: Furuta, Hiroki, et al.
Pubblicazione: (2024)
RePO: Understanding Preference Learning Through ReLU-Based Optimization
di: Wu, Junkang, et al.
Pubblicazione: (2025)
di: Wu, Junkang, et al.
Pubblicazione: (2025)
Risk-aware Direct Preference Optimization under Nested Risk Measure
di: Zhang, Lijun, et al.
Pubblicazione: (2025)
di: Zhang, Lijun, et al.
Pubblicazione: (2025)
Towards Disentangled Preference Optimization Dynamics: Suppress the Loser, Preserve the Winner
di: Chen, Wei, et al.
Pubblicazione: (2026)
di: Chen, Wei, et al.
Pubblicazione: (2026)
Rethinking Spectral Graph Neural Networks with Spatially Adaptive Filtering
di: Guo, Jingwei, et al.
Pubblicazione: (2024)
di: Guo, Jingwei, et al.
Pubblicazione: (2024)
Preference-Guided Diffusion for Multi-Objective Offline Optimization
di: Annadani, Yashas, et al.
Pubblicazione: (2025)
di: Annadani, Yashas, et al.
Pubblicazione: (2025)
On Symmetric Losses for Robust Policy Optimization with Noisy Preferences
di: Nishimori, Soichiro, et al.
Pubblicazione: (2025)
di: Nishimori, Soichiro, et al.
Pubblicazione: (2025)
Documenti analoghi
-
ADPO: Anchored Direct Preference Optimization
di: Zixian, Wang
Pubblicazione: (2025) -
Orthogonalized Policy Optimization:Policy Optimization as Orthogonal Projection in Hilbert Space
di: Zixian, Wang
Pubblicazione: (2026) -
Group Orthogonalized Policy Optimization:Group Policy Optimization as Orthogonal Projection in Hilbert Space
di: Zixian, Wang
Pubblicazione: (2026) -
APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization
di: Hong, Minjie, et al.
Pubblicazione: (2025) -
AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization
di: Wu, Junkang, et al.
Pubblicazione: (2024)