Token-Importance Guided Direct Preference Optimization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yang, Ning, Lin, Hai, Liu, Yibo, Tian, Baoliang, Liu, Guoqing, Zhang, Haijun |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Token-level Direct Preference Optimization
par: Zeng, Yongcheng, et autres
Publié: (2024)
par: Zeng, Yongcheng, et autres
Publié: (2024)
CompilerKV: Risk-Adaptive KV Compression via Offline Experience Compilation
par: Yang, Ning, et autres
Publié: (2026)
par: Yang, Ning, et autres
Publié: (2026)
Aligning CodeLLMs with Direct Preference Optimization
par: Miao, Yibo, et autres
Publié: (2024)
par: Miao, Yibo, et autres
Publié: (2024)
LinearARD: Linear-Memory Attention Distillation for RoPE Restoration
par: Yang, Ning, et autres
Publié: (2026)
par: Yang, Ning, et autres
Publié: (2026)
EnerBridge-DPO: Energy-Guided Protein Inverse Folding with Markov Bridges and Direct Preference Optimization
par: Rong, Dingyi, et autres
Publié: (2025)
par: Rong, Dingyi, et autres
Publié: (2025)
Offline Policy Optimization with Posterior Sampling
par: Lin, Hongqiang, et autres
Publié: (2026)
par: Lin, Hongqiang, et autres
Publié: (2026)
Preference as Reward, Maximum Preference Optimization with Importance Sampling
par: Jiang, Zaifan, et autres
Publié: (2023)
par: Jiang, Zaifan, et autres
Publié: (2023)
SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment
par: Zhu, Wenqiao, et autres
Publié: (2025)
par: Zhu, Wenqiao, et autres
Publié: (2025)
Fine Tuning Large Language Models for Medicine: The Role and Importance of Direct Preference Optimization
par: Savage, Thomas, et autres
Publié: (2024)
par: Savage, Thomas, et autres
Publié: (2024)
POLO: Preference-Guided Multi-Turn Reinforcement Learning for Lead Optimization
par: Wang, Ziqing, et autres
Publié: (2025)
par: Wang, Ziqing, et autres
Publié: (2025)
Breaking the MoE LLM Trilemma: Dynamic Expert Clustering with Structured Compression
par: Zhu, Peijun, et autres
Publié: (2025)
par: Zhu, Peijun, et autres
Publié: (2025)
LLMdoctor: Token-Level Flow-Guided Preference Optimization for Efficient Test-Time Alignment of Large Language Models
par: Shen, Tiesunlong, et autres
Publié: (2026)
par: Shen, Tiesunlong, et autres
Publié: (2026)
On Softmax Direct Preference Optimization for Recommendation
par: Chen, Yuxin, et autres
Publié: (2024)
par: Chen, Yuxin, et autres
Publié: (2024)
Direct Preference-Based Evolutionary Multi-Objective Optimization with Dueling Bandit
par: Huang, Tian, et autres
Publié: (2023)
par: Huang, Tian, et autres
Publié: (2023)
GIPO: Gaussian Importance Sampling Policy Optimization
par: Lu, Chengxuan, et autres
Publié: (2026)
par: Lu, Chengxuan, et autres
Publié: (2026)
Preference Diffusion for Recommendation
par: Liu, Shuo, et autres
Publié: (2024)
par: Liu, Shuo, et autres
Publié: (2024)
Autoregressive Direct Preference Optimization
par: Oi, Masanari, et autres
Publié: (2026)
par: Oi, Masanari, et autres
Publié: (2026)
Beyond One-Preference-Fits-All Alignment: Multi-Objective Direct Preference Optimization
par: Zhou, Zhanhui, et autres
Publié: (2023)
par: Zhou, Zhanhui, et autres
Publié: (2023)
Direct Preference Optimization with Unobserved Preference Heterogeneity: The Necessity of Ternary Preferences
par: Chidambaram, Keertana, et autres
Publié: (2025)
par: Chidambaram, Keertana, et autres
Publié: (2025)
TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization
par: Zhu, Mingkang, et autres
Publié: (2025)
par: Zhu, Mingkang, et autres
Publié: (2025)
Selective Preference Optimization via Token-Level Reward Function Estimation
par: Yang, Kailai, et autres
Publié: (2024)
par: Yang, Kailai, et autres
Publié: (2024)
Risk-aware Direct Preference Optimization under Nested Risk Measure
par: Zhang, Lijun, et autres
Publié: (2025)
par: Zhang, Lijun, et autres
Publié: (2025)
MDPO: Multi-Granularity Direct Preference Optimization for Mathematical Reasoning
par: Lin, Yunze
Publié: (2025)
par: Lin, Yunze
Publié: (2025)
Mobile GUI Agent Privacy Personalization with Trajectory Induced Preference Optimization
par: Lin, Zhixin, et autres
Publié: (2026)
par: Lin, Zhixin, et autres
Publié: (2026)
Orthogonal Finetuning for Direct Preference Optimization
par: Yang, Chenxu, et autres
Publié: (2024)
par: Yang, Chenxu, et autres
Publié: (2024)
Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation
par: Liu, Jingyu, et autres
Publié: (2025)
par: Liu, Jingyu, et autres
Publié: (2025)
PGPO: Enhancing Agent Reasoning via Pseudocode-style Planning Guided Preference Optimization
par: Cao, Zouying, et autres
Publié: (2025)
par: Cao, Zouying, et autres
Publié: (2025)
MetaGDPO: Alleviating Catastrophic Forgetting with Metacognitive Knowledge through Group Direct Preference Optimization
par: Zhang, Lanxue, et autres
Publié: (2025)
par: Zhang, Lanxue, et autres
Publié: (2025)
Reward-Augmented Data Enhances Direct Preference Alignment of LLMs
par: Zhang, Shenao, et autres
Publié: (2024)
par: Zhang, Shenao, et autres
Publié: (2024)
Rethinking Importance Sampling in LLM Policy Optimization: A Cumulative Token Perspective
par: Zhang, Yuheng, et autres
Publié: (2026)
par: Zhang, Yuheng, et autres
Publié: (2026)
Latent Adversarial Regularization for Offline Preference Optimization
par: Jiang, Enyi, et autres
Publié: (2026)
par: Jiang, Enyi, et autres
Publié: (2026)
TokenRatio: Principled Token-Level Preference Optimization via Ratio Matching
par: Nguyen, Truong, et autres
Publié: (2026)
par: Nguyen, Truong, et autres
Publié: (2026)
T-REG: Preference Optimization with Token-Level Reward Regularization
par: Zhou, Wenxuan, et autres
Publié: (2024)
par: Zhou, Wenxuan, et autres
Publié: (2024)
Towards Realistic Personalization: Evaluating Long-Horizon Preference Following in Personalized User-LLM Interactions
par: Guo, Qianyun, et autres
Publié: (2026)
par: Guo, Qianyun, et autres
Publié: (2026)
TokenButler: Token Importance is Predictable
par: Akhauri, Yash, et autres
Publié: (2025)
par: Akhauri, Yash, et autres
Publié: (2025)
ADPO: Anchored Direct Preference Optimization
par: Zixian, Wang
Publié: (2025)
par: Zixian, Wang
Publié: (2025)
Continuous-Utility Direct Preference Optimization
par: Mohsin, Muhammad Ahmed, et autres
Publié: (2026)
par: Mohsin, Muhammad Ahmed, et autres
Publié: (2026)
SDPO: Segment-Level Direct Preference Optimization for Social Agents
par: Kong, Aobo, et autres
Publié: (2025)
par: Kong, Aobo, et autres
Publié: (2025)
$β$-DPO: Direct Preference Optimization with Dynamic $β$
par: Wu, Junkang, et autres
Publié: (2024)
par: Wu, Junkang, et autres
Publié: (2024)
DSTC: Direct Preference Learning with Only Self-Generated Tests and Code to Improve Code LMs
par: Liu, Zhihan, et autres
Publié: (2024)
par: Liu, Zhihan, et autres
Publié: (2024)
Documents similaires
-
Token-level Direct Preference Optimization
par: Zeng, Yongcheng, et autres
Publié: (2024) -
CompilerKV: Risk-Adaptive KV Compression via Offline Experience Compilation
par: Yang, Ning, et autres
Publié: (2026) -
Aligning CodeLLMs with Direct Preference Optimization
par: Miao, Yibo, et autres
Publié: (2024) -
LinearARD: Linear-Memory Attention Distillation for RoPE Restoration
par: Yang, Ning, et autres
Publié: (2026) -
EnerBridge-DPO: Energy-Guided Protein Inverse Folding with Markov Bridges and Direct Preference Optimization
par: Rong, Dingyi, et autres
Publié: (2025)