On Extending Direct Preference Optimization to Accommodate Ties
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Jinghong, Yang, Guangyu, Lin, Weizhe, Mei, Jingbiao, Byrne, Bill |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Direct Preference Optimization for Neural Machine Translation with Minimum Bayes Risk Decoding
di: Yang, Guangyu, et al.
Pubblicazione: (2023)
di: Yang, Guangyu, et al.
Pubblicazione: (2023)
Control-DAG: Constrained Decoding for Non-Autoregressive Directed Acyclic T5 using Weighted Finite State Automata
di: Chen, Jinghong, et al.
Pubblicazione: (2024)
di: Chen, Jinghong, et al.
Pubblicazione: (2024)
Retrieval-Augmented Defense: Adaptive and Controllable Jailbreak Prevention for Large Language Models
di: Yang, Guangyu, et al.
Pubblicazione: (2025)
di: Yang, Guangyu, et al.
Pubblicazione: (2025)
Robust Adaptation of Large Multimodal Models for Retrieval Augmented Hateful Meme Detection
di: Mei, Jingbiao, et al.
Pubblicazione: (2025)
di: Mei, Jingbiao, et al.
Pubblicazione: (2025)
PreFLMR: Scaling Up Fine-Grained Late-Interaction Multi-modal Retrievers
di: Lin, Weizhe, et al.
Pubblicazione: (2024)
di: Lin, Weizhe, et al.
Pubblicazione: (2024)
BERAG: Bayesian Ensemble Retrieval-Augmented Generation for Knowledge-based Visual Question Answering
di: Chen, Jinghong, et al.
Pubblicazione: (2026)
di: Chen, Jinghong, et al.
Pubblicazione: (2026)
Improving Hateful Meme Detection through Retrieval-Guided Contrastive Learning
di: Mei, Jingbiao, et al.
Pubblicazione: (2023)
di: Mei, Jingbiao, et al.
Pubblicazione: (2023)
According to Me: Long-Term Personalized Referential Memory QA
di: Mei, Jingbiao, et al.
Pubblicazione: (2026)
di: Mei, Jingbiao, et al.
Pubblicazione: (2026)
Few-Shot VQA with Frozen LLMs: A Tale of Two Approaches
di: Sterner, Igor, et al.
Pubblicazione: (2024)
di: Sterner, Igor, et al.
Pubblicazione: (2024)
ExPO-HM: Learning to Explain-then-Detect for Hateful Meme Detection
di: Mei, Jingbiao, et al.
Pubblicazione: (2025)
di: Mei, Jingbiao, et al.
Pubblicazione: (2025)
BPO: Revisiting Preference Modeling in Direct Preference Optimization
di: Sun, Lin, et al.
Pubblicazione: (2025)
di: Sun, Lin, et al.
Pubblicazione: (2025)
A Preference-driven Paradigm for Enhanced Translation with Large Language Models
di: Zhu, Dawei, et al.
Pubblicazione: (2024)
di: Zhu, Dawei, et al.
Pubblicazione: (2024)
Iterative Reasoning Preference Optimization
di: Pang, Richard Yuanzhe, et al.
Pubblicazione: (2024)
di: Pang, Richard Yuanzhe, et al.
Pubblicazione: (2024)
Orthogonal Finetuning for Direct Preference Optimization
di: Yang, Chenxu, et al.
Pubblicazione: (2024)
di: Yang, Chenxu, et al.
Pubblicazione: (2024)
Direct Judgement Preference Optimization
di: Wang, Peifeng, et al.
Pubblicazione: (2024)
di: Wang, Peifeng, et al.
Pubblicazione: (2024)
DPO-Shift: Shifting the Distribution of Direct Preference Optimization
di: Yang, Xiliang, et al.
Pubblicazione: (2025)
di: Yang, Xiliang, et al.
Pubblicazione: (2025)
Token-level Direct Preference Optimization
di: Zeng, Yongcheng, et al.
Pubblicazione: (2024)
di: Zeng, Yongcheng, et al.
Pubblicazione: (2024)
New Desiderata for Direct Preference Optimization
di: Hu, Xiangkun, et al.
Pubblicazione: (2024)
di: Hu, Xiangkun, et al.
Pubblicazione: (2024)
Length Desensitization in Direct Preference Optimization
di: Liu, Wei, et al.
Pubblicazione: (2024)
di: Liu, Wei, et al.
Pubblicazione: (2024)
Ambiguity Awareness Optimization: Towards Semantic Disambiguation for Direct Preference Optimization
di: Li, Jian, et al.
Pubblicazione: (2025)
di: Li, Jian, et al.
Pubblicazione: (2025)
Token-weighted Direct Preference Optimization with Attention
di: Huang, Chengyu, et al.
Pubblicazione: (2026)
di: Huang, Chengyu, et al.
Pubblicazione: (2026)
Self-Consistency Preference Optimization
di: Prasad, Archiki, et al.
Pubblicazione: (2024)
di: Prasad, Archiki, et al.
Pubblicazione: (2024)
Filtered Direct Preference Optimization
di: Morimura, Tetsuro, et al.
Pubblicazione: (2024)
di: Morimura, Tetsuro, et al.
Pubblicazione: (2024)
Direct Preference Optimization with an Offset
di: Amini, Afra, et al.
Pubblicazione: (2024)
di: Amini, Afra, et al.
Pubblicazione: (2024)
Earlier Tokens Contribute More: Learning Direct Preference Optimization From Temporal Decay Perspective
di: Shao, Ruichen, et al.
Pubblicazione: (2025)
di: Shao, Ruichen, et al.
Pubblicazione: (2025)
Bridging and Modeling Correlations in Pairwise Data for Direct Preference Optimization
di: Jiang, Yuxin, et al.
Pubblicazione: (2024)
di: Jiang, Yuxin, et al.
Pubblicazione: (2024)
PHOENIX: Open-Source Language Adaption for Direct Preference Optimization
di: Uhlig, Matthias, et al.
Pubblicazione: (2024)
di: Uhlig, Matthias, et al.
Pubblicazione: (2024)
Backtranslation Augmented Direct Preference Optimization for Neural Machine Translation
di: Ghassabi, Mehrdad, et al.
Pubblicazione: (2026)
di: Ghassabi, Mehrdad, et al.
Pubblicazione: (2026)
DGPO: Beyond Pairwise Preferences with Directional Consistent Groupwise Optimization
di: Deng, Mengyi, et al.
Pubblicazione: (2026)
di: Deng, Mengyi, et al.
Pubblicazione: (2026)
Understanding Reference Policies in Direct Preference Optimization
di: Liu, Yixin, et al.
Pubblicazione: (2024)
di: Liu, Yixin, et al.
Pubblicazione: (2024)
Accelerating Direct Preference Optimization with Prefix Sharing
di: Wang, Franklin, et al.
Pubblicazione: (2024)
di: Wang, Franklin, et al.
Pubblicazione: (2024)
On the Limited Generalization Capability of the Implicit Reward Model Induced by Direct Preference Optimization
di: Lin, Yong, et al.
Pubblicazione: (2024)
di: Lin, Yong, et al.
Pubblicazione: (2024)
LSPO: Length-aware Dynamic Sampling for Policy Optimization in LLM Reasoning
di: Chen, Weizhe, et al.
Pubblicazione: (2025)
di: Chen, Weizhe, et al.
Pubblicazione: (2025)
Negative Preference Optimization: From Catastrophic Collapse to Effective Unlearning
di: Zhang, Ruiqi, et al.
Pubblicazione: (2024)
di: Zhang, Ruiqi, et al.
Pubblicazione: (2024)
Entropy Controllable Direct Preference Optimization
di: Omura, Motoki, et al.
Pubblicazione: (2024)
di: Omura, Motoki, et al.
Pubblicazione: (2024)
Self-Training with Direct Preference Optimization Improves Chain-of-Thought Reasoning
di: Wang, Tianduo, et al.
Pubblicazione: (2024)
di: Wang, Tianduo, et al.
Pubblicazione: (2024)
No Preference Left Behind: Group Distributional Preference Optimization
di: Yao, Binwei, et al.
Pubblicazione: (2024)
di: Yao, Binwei, et al.
Pubblicazione: (2024)
Unintentional Unalignment: Likelihood Displacement in Direct Preference Optimization
di: Razin, Noam, et al.
Pubblicazione: (2024)
di: Razin, Noam, et al.
Pubblicazione: (2024)
Beyond Overlap Metrics: Rewarding Reasoning and Preferences for Faithful Multi-Role Dialogue Summarization
di: Mei, Xiaoyong, et al.
Pubblicazione: (2026)
di: Mei, Xiaoyong, et al.
Pubblicazione: (2026)
GroupDPO: Memory efficient Group-wise Direct Preference Optimization
di: Leng, Jixuan, et al.
Pubblicazione: (2026)
di: Leng, Jixuan, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Direct Preference Optimization for Neural Machine Translation with Minimum Bayes Risk Decoding
di: Yang, Guangyu, et al.
Pubblicazione: (2023) -
Control-DAG: Constrained Decoding for Non-Autoregressive Directed Acyclic T5 using Weighted Finite State Automata
di: Chen, Jinghong, et al.
Pubblicazione: (2024) -
Retrieval-Augmented Defense: Adaptive and Controllable Jailbreak Prevention for Large Language Models
di: Yang, Guangyu, et al.
Pubblicazione: (2025) -
Robust Adaptation of Large Multimodal Models for Retrieval Augmented Hateful Meme Detection
di: Mei, Jingbiao, et al.
Pubblicazione: (2025) -
PreFLMR: Scaling Up Fine-Grained Late-Interaction Multi-modal Retrievers
di: Lin, Weizhe, et al.
Pubblicazione: (2024)