Token-level Direct Preference Optimization
Fuente:
arXiv
Guardado en:
| Autores principales: | Zeng, Yongcheng, Liu, Guoqing, Ma, Weiyu, Yang, Ning, Zhang, Haifeng, Wang, Jun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Token-Importance Guided Direct Preference Optimization
por: Yang, Ning, et al.
Publicado: (2025)
por: Yang, Ning, et al.
Publicado: (2025)
Optimal Transport-Based Token Weighting scheme for Enhanced Preference Optimization
por: Li, Meng, et al.
Publicado: (2025)
por: Li, Meng, et al.
Publicado: (2025)
TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization
por: Zhu, Mingkang, et al.
Publicado: (2025)
por: Zhu, Mingkang, et al.
Publicado: (2025)
SDPO: Segment-Level Direct Preference Optimization for Social Agents
por: Kong, Aobo, et al.
Publicado: (2025)
por: Kong, Aobo, et al.
Publicado: (2025)
TokenRatio: Principled Token-Level Preference Optimization via Ratio Matching
por: Nguyen, Truong, et al.
Publicado: (2026)
por: Nguyen, Truong, et al.
Publicado: (2026)
Orthogonal Finetuning for Direct Preference Optimization
por: Yang, Chenxu, et al.
Publicado: (2024)
por: Yang, Chenxu, et al.
Publicado: (2024)
Data-efficient Targeted Token-level Preference Optimization for LLM-based Text-to-Speech
por: Kotoge, Rikuto, et al.
Publicado: (2025)
por: Kotoge, Rikuto, et al.
Publicado: (2025)
One Token Is Enough: Improving Diffusion Language Models with a Sink Token
por: Zhang, Zihou, et al.
Publicado: (2026)
por: Zhang, Zihou, et al.
Publicado: (2026)
ICDPO: Effectively Borrowing Alignment Capability of Others via In-context Direct Preference Optimization
por: Song, Feifan, et al.
Publicado: (2024)
por: Song, Feifan, et al.
Publicado: (2024)
Selective Preference Optimization via Token-Level Reward Function Estimation
por: Yang, Kailai, et al.
Publicado: (2024)
por: Yang, Kailai, et al.
Publicado: (2024)
T-REG: Preference Optimization with Token-Level Reward Regularization
por: Zhou, Wenxuan, et al.
Publicado: (2024)
por: Zhou, Wenxuan, et al.
Publicado: (2024)
2D-DPO: Scaling Direct Preference Optimization with 2-Dimensional Supervision
por: Li, Shilong, et al.
Publicado: (2024)
por: Li, Shilong, et al.
Publicado: (2024)
Filtered Direct Preference Optimization
por: Morimura, Tetsuro, et al.
Publicado: (2024)
por: Morimura, Tetsuro, et al.
Publicado: (2024)
Direct Preference Optimization with an Offset
por: Amini, Afra, et al.
Publicado: (2024)
por: Amini, Afra, et al.
Publicado: (2024)
Fine Tuning Large Language Models for Medicine: The Role and Importance of Direct Preference Optimization
por: Savage, Thomas, et al.
Publicado: (2024)
por: Savage, Thomas, et al.
Publicado: (2024)
AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization
por: Wu, Junkang, et al.
Publicado: (2024)
por: Wu, Junkang, et al.
Publicado: (2024)
Direct Multi-Token Decoding
por: Luo, Xuan, et al.
Publicado: (2025)
por: Luo, Xuan, et al.
Publicado: (2025)
Entropy Controllable Direct Preference Optimization
por: Omura, Motoki, et al.
Publicado: (2024)
por: Omura, Motoki, et al.
Publicado: (2024)
Is On-Policy Data always the Best Choice for Direct Preference Optimization-based LM Alignment?
por: Sun, Zetian, et al.
Publicado: (2025)
por: Sun, Zetian, et al.
Publicado: (2025)
Direct Value Optimization: Improving Chain-of-Thought Reasoning in LLMs with Refined Values
por: Zhang, Hongbo, et al.
Publicado: (2025)
por: Zhang, Hongbo, et al.
Publicado: (2025)
Knowledge Editing in Language Models via Adapted Direct Preference Optimization
por: Rozner, Amit, et al.
Publicado: (2024)
por: Rozner, Amit, et al.
Publicado: (2024)
Enhancing Multilingual Counterfactual Generation through Alignment-as-Preference Optimization
por: Wang, Yilong, et al.
Publicado: (2026)
por: Wang, Yilong, et al.
Publicado: (2026)
Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks
por: Xu, Tianze, et al.
Publicado: (2026)
por: Xu, Tianze, et al.
Publicado: (2026)
Step-level Value Preference Optimization for Mathematical Reasoning
por: Chen, Guoxin, et al.
Publicado: (2024)
por: Chen, Guoxin, et al.
Publicado: (2024)
Preference Orchestrator: Prompt-Aware Multi-Objective Alignment for Large Language Models
por: Liu, Biao, et al.
Publicado: (2025)
por: Liu, Biao, et al.
Publicado: (2025)
TokenSeek: Memory Efficient Fine Tuning via Instance-Aware Token Ditching
por: Zeng, Runjia, et al.
Publicado: (2026)
por: Zeng, Runjia, et al.
Publicado: (2026)
Towards Robust Alignment of Language Models: Distributionally Robustifying Direct Preference Optimization
por: Wu, Junkang, et al.
Publicado: (2024)
por: Wu, Junkang, et al.
Publicado: (2024)
Effectively Steer LLM To Follow Preference via Building Confident Directions
por: Song, Bingqing, et al.
Publicado: (2025)
por: Song, Bingqing, et al.
Publicado: (2025)
SparsePO: Controlling Preference Alignment of LLMs via Sparse Token Masks
por: Christopoulou, Fenia, et al.
Publicado: (2024)
por: Christopoulou, Fenia, et al.
Publicado: (2024)
Unintentional Unalignment: Likelihood Displacement in Direct Preference Optimization
por: Razin, Noam, et al.
Publicado: (2024)
por: Razin, Noam, et al.
Publicado: (2024)
PGPO: Enhancing Agent Reasoning via Pseudocode-style Planning Guided Preference Optimization
por: Cao, Zouying, et al.
Publicado: (2025)
por: Cao, Zouying, et al.
Publicado: (2025)
Online DPO: Online Direct Preference Optimization with Fast-Slow Chasing
por: Qi, Biqing, et al.
Publicado: (2024)
por: Qi, Biqing, et al.
Publicado: (2024)
FocalPO: Enhancing Preference Optimizing by Focusing on Correct Preference Rankings
por: Liu, Tong, et al.
Publicado: (2025)
por: Liu, Tong, et al.
Publicado: (2025)
Persona-judge: Personalized Alignment of Large Language Models via Token-level Self-judgment
por: Zhang, Xiaotian, et al.
Publicado: (2025)
por: Zhang, Xiaotian, et al.
Publicado: (2025)
Personalizing LLMs with Binary Feedback: A Preference-Corrected Optimization Framework
por: Ma, Xilai, et al.
Publicado: (2026)
por: Ma, Xilai, et al.
Publicado: (2026)
Alignment through Meta-Weighted Online Sampling: Bridging the Gap between Data Generation and Preference Optimization
por: Yang, Junming, et al.
Publicado: (2025)
por: Yang, Junming, et al.
Publicado: (2025)
Full-ECE: A Metric For Token-level Calibration on Large Language Models
por: Liu, Han, et al.
Publicado: (2024)
por: Liu, Han, et al.
Publicado: (2024)
Self-supervised Preference Optimization: Enhance Your Language Model with Preference Degree Awareness
por: Li, Jian, et al.
Publicado: (2024)
por: Li, Jian, et al.
Publicado: (2024)
LRHP: Learning Representations for Human Preferences via Preference Pairs
por: Wang, Chenglong, et al.
Publicado: (2024)
por: Wang, Chenglong, et al.
Publicado: (2024)
Multiplayer Nash Preference Optimization
por: Wu, Fang, et al.
Publicado: (2025)
por: Wu, Fang, et al.
Publicado: (2025)
Ejemplares similares
-
Token-Importance Guided Direct Preference Optimization
por: Yang, Ning, et al.
Publicado: (2025) -
Optimal Transport-Based Token Weighting scheme for Enhanced Preference Optimization
por: Li, Meng, et al.
Publicado: (2025) -
TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization
por: Zhu, Mingkang, et al.
Publicado: (2025) -
SDPO: Segment-Level Direct Preference Optimization for Social Agents
por: Kong, Aobo, et al.
Publicado: (2025) -
TokenRatio: Principled Token-Level Preference Optimization via Ratio Matching
por: Nguyen, Truong, et al.
Publicado: (2026)