Accelerating Direct Preference Optimization with Prefix Sharing
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Franklin, Hegde, Sumanth |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
PEDAL: Enhancing Greedy Decoding with Large Language Models using Diverse Exemplars
por: Prabhu, Sumanth
Publicado: (2024)
por: Prabhu, Sumanth
Publicado: (2024)
Length Desensitization in Direct Preference Optimization
por: Liu, Wei, et al.
Publicado: (2024)
por: Liu, Wei, et al.
Publicado: (2024)
Direct Multi-Turn Preference Optimization for Language Agents
por: Shi, Wentao, et al.
Publicado: (2024)
por: Shi, Wentao, et al.
Publicado: (2024)
PrefixQuant: Eliminating Outliers by Prefixed Tokens for Large Language Models Quantization
por: Chen, Mengzhao, et al.
Publicado: (2024)
por: Chen, Mengzhao, et al.
Publicado: (2024)
Understanding Reference Policies in Direct Preference Optimization
por: Liu, Yixin, et al.
Publicado: (2024)
por: Liu, Yixin, et al.
Publicado: (2024)
Filtered Direct Preference Optimization
por: Morimura, Tetsuro, et al.
Publicado: (2024)
por: Morimura, Tetsuro, et al.
Publicado: (2024)
Direct Preference Optimization with an Offset
por: Amini, Afra, et al.
Publicado: (2024)
por: Amini, Afra, et al.
Publicado: (2024)
The Crucial Role of Samplers in Online Direct Preference Optimization
por: Shi, Ruizhe, et al.
Publicado: (2024)
por: Shi, Ruizhe, et al.
Publicado: (2024)
Disentangling Length from Quality in Direct Preference Optimization
por: Park, Ryan, et al.
Publicado: (2024)
por: Park, Ryan, et al.
Publicado: (2024)
Orthogonal Finetuning for Direct Preference Optimization
por: Yang, Chenxu, et al.
Publicado: (2024)
por: Yang, Chenxu, et al.
Publicado: (2024)
Enhancing LLM Safety via Constrained Direct Preference Optimization
por: Liu, Zixuan, et al.
Publicado: (2024)
por: Liu, Zixuan, et al.
Publicado: (2024)
Entropy Controllable Direct Preference Optimization
por: Omura, Motoki, et al.
Publicado: (2024)
por: Omura, Motoki, et al.
Publicado: (2024)
On the Limited Generalization Capability of the Implicit Reward Model Induced by Direct Preference Optimization
por: Lin, Yong, et al.
Publicado: (2024)
por: Lin, Yong, et al.
Publicado: (2024)
Refined Direct Preference Optimization with Synthetic Data for Behavioral Alignment of LLMs
por: Gallego, Víctor
Publicado: (2024)
por: Gallego, Víctor
Publicado: (2024)
Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment
por: Xiao, Teng, et al.
Publicado: (2024)
por: Xiao, Teng, et al.
Publicado: (2024)
AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization
por: Wu, Junkang, et al.
Publicado: (2024)
por: Wu, Junkang, et al.
Publicado: (2024)
AdaDPO: Self-Adaptive Direct Preference Optimization with Balanced Gradient Updates
por: Chen, Shaolong, et al.
Publicado: (2026)
por: Chen, Shaolong, et al.
Publicado: (2026)
Accelerated Preference Optimization for Large Language Model Alignment
por: He, Jiafan, et al.
Publicado: (2024)
por: He, Jiafan, et al.
Publicado: (2024)
Reliable Chain-of-Thought via Prefix Consistency
por: Iwase, Naoto, et al.
Publicado: (2026)
por: Iwase, Naoto, et al.
Publicado: (2026)
BatchLLM: Optimizing Large Batched LLM Inference with Global Prefix Sharing and Throughput-oriented Token Batching
por: Zheng, Zhen, et al.
Publicado: (2024)
por: Zheng, Zhen, et al.
Publicado: (2024)
DreamDPO: Aligning Text-to-3D Generation with Human Preferences via Direct Preference Optimization
por: Zhou, Zhenglin, et al.
Publicado: (2025)
por: Zhou, Zhenglin, et al.
Publicado: (2025)
Unintentional Unalignment: Likelihood Displacement in Direct Preference Optimization
por: Razin, Noam, et al.
Publicado: (2024)
por: Razin, Noam, et al.
Publicado: (2024)
FedPDPO: Federated Personalized Direct Preference Optimization for Large Language Model Alignment
por: Zhu, Kewen, et al.
Publicado: (2026)
por: Zhu, Kewen, et al.
Publicado: (2026)
Importance Sampling for Multi-Negative Multimodal Direct Preference Optimization
por: Li, Xintong, et al.
Publicado: (2025)
por: Li, Xintong, et al.
Publicado: (2025)
Federated Fine-Tuning of Large Language Models: Kahneman-Tversky vs. Direct Preference Optimization
por: Spadea, Fernando, et al.
Publicado: (2025)
por: Spadea, Fernando, et al.
Publicado: (2025)
TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization
por: Zhu, Mingkang, et al.
Publicado: (2025)
por: Zhu, Mingkang, et al.
Publicado: (2025)
Preference Optimization with Multi-Sample Comparisons
por: Wang, Chaoqi, et al.
Publicado: (2024)
por: Wang, Chaoqi, et al.
Publicado: (2024)
VERI-DPO: Evidence-Aware Alignment for Clinical Summarization via Claim Verification and Direct Preference Optimization
por: Liu, Weixin, et al.
Publicado: (2026)
por: Liu, Weixin, et al.
Publicado: (2026)
DiaTool-DPO: Multi-Turn Direct Preference Optimization for Tool-Augmented Large Language Models
por: Jung, Sunghee, et al.
Publicado: (2025)
por: Jung, Sunghee, et al.
Publicado: (2025)
Towards Robust Alignment of Language Models: Distributionally Robustifying Direct Preference Optimization
por: Wu, Junkang, et al.
Publicado: (2024)
por: Wu, Junkang, et al.
Publicado: (2024)
A Comprehensive Survey of Direct Preference Optimization: Datasets, Theories, Variants, and Applications
por: Xiao, Wenyi, et al.
Publicado: (2024)
por: Xiao, Wenyi, et al.
Publicado: (2024)
On the Role of Preference Variance in Preference Optimization
por: Guo, Jiacheng, et al.
Publicado: (2025)
por: Guo, Jiacheng, et al.
Publicado: (2025)
Online DPO: Online Direct Preference Optimization with Fast-Slow Chasing
por: Qi, Biqing, et al.
Publicado: (2024)
por: Qi, Biqing, et al.
Publicado: (2024)
Inducing Robustness in a 2 Dimensional Direct Preference Optimization Paradigm
por: Shashidhar, Sarvesh, et al.
Publicado: (2025)
por: Shashidhar, Sarvesh, et al.
Publicado: (2025)
Differential Information Distribution: A Bayesian Perspective on Direct Preference Optimization
por: Won, Yunjae, et al.
Publicado: (2025)
por: Won, Yunjae, et al.
Publicado: (2025)
Towards Infinite-Long Prefix in Transformer
por: Liang, Yingyu, et al.
Publicado: (2024)
por: Liang, Yingyu, et al.
Publicado: (2024)
Exploring Embedding Priors in Prompt-Tuning for Improved Interpretability and Control
por: Sedov, Sergey, et al.
Publicado: (2024)
por: Sedov, Sergey, et al.
Publicado: (2024)
Adaptive Preference Optimization with Uncertainty-aware Utility Anchor
por: Wang, Xiaobo, et al.
Publicado: (2025)
por: Wang, Xiaobo, et al.
Publicado: (2025)
WILDCHAT-50M: A Deep Dive Into the Role of Synthetic Data in Post-Training
por: Feuer, Benjamin, et al.
Publicado: (2025)
por: Feuer, Benjamin, et al.
Publicado: (2025)
Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences
por: Rosset, Corby, et al.
Publicado: (2024)
por: Rosset, Corby, et al.
Publicado: (2024)
Ejemplares similares
-
PEDAL: Enhancing Greedy Decoding with Large Language Models using Diverse Exemplars
por: Prabhu, Sumanth
Publicado: (2024) -
Length Desensitization in Direct Preference Optimization
por: Liu, Wei, et al.
Publicado: (2024) -
Direct Multi-Turn Preference Optimization for Language Agents
por: Shi, Wentao, et al.
Publicado: (2024) -
PrefixQuant: Eliminating Outliers by Prefixed Tokens for Large Language Models Quantization
por: Chen, Mengzhao, et al.
Publicado: (2024) -
Understanding Reference Policies in Direct Preference Optimization
por: Liu, Yixin, et al.
Publicado: (2024)