Salvato in:
| Autori principali: | Ferragu, Constance, Ziegler, Jonathan D., Deutschmann, Nicolas, Lindoulsi, Arthur, Bixby, Eli, Team, Cradle ML |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2510.19474 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
EvoFlows: Evolutionary Edit-Based Flow-Matching for Protein Engineering
di: Deutschmann, Nicolas, et al.
Pubblicazione: (2026)
di: Deutschmann, Nicolas, et al.
Pubblicazione: (2026)
Gradient-Gated DPO: Stabilizing Preference Optimization in Language Models
di: Mouiche, Inoussa
Pubblicazione: (2026)
di: Mouiche, Inoussa
Pubblicazione: (2026)
Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment
di: Xiao, Teng, et al.
Pubblicazione: (2024)
di: Xiao, Teng, et al.
Pubblicazione: (2024)
mDPO: Conditional Preference Optimization for Multimodal Large Language Models
di: Wang, Fei, et al.
Pubblicazione: (2024)
di: Wang, Fei, et al.
Pubblicazione: (2024)
EnerBridge-DPO: Energy-Guided Protein Inverse Folding with Markov Bridges and Direct Preference Optimization
di: Rong, Dingyi, et al.
Pubblicazione: (2025)
di: Rong, Dingyi, et al.
Pubblicazione: (2025)
$β$-DPO: Direct Preference Optimization with Dynamic $β$
di: Wu, Junkang, et al.
Pubblicazione: (2024)
di: Wu, Junkang, et al.
Pubblicazione: (2024)
DiaTool-DPO: Multi-Turn Direct Preference Optimization for Tool-Augmented Large Language Models
di: Jung, Sunghee, et al.
Pubblicazione: (2025)
di: Jung, Sunghee, et al.
Pubblicazione: (2025)
C2-DPO: Constrained Controlled Direct Preference Optimization
di: Asadi, Kavosh, et al.
Pubblicazione: (2025)
di: Asadi, Kavosh, et al.
Pubblicazione: (2025)
Margin Adaptive DPO: Leveraging Reward Model for Granular Control in Preference Optimization
di: Rho, Hyung Gyu
Pubblicazione: (2025)
di: Rho, Hyung Gyu
Pubblicazione: (2025)
CompassDPO: Dynamics-Controlled Direct Preference Optimization for Robust Safety Alignment
di: Liu, Jilong, et al.
Pubblicazione: (2026)
di: Liu, Jilong, et al.
Pubblicazione: (2026)
Preference Robustness for DPO with Applications to Public Health
di: Kim, Cheol Woo, et al.
Pubblicazione: (2025)
di: Kim, Cheol Woo, et al.
Pubblicazione: (2025)
SEE-DPO: Self Entropy Enhanced Direct Preference Optimization
di: Shekhar, Shivanshu, et al.
Pubblicazione: (2024)
di: Shekhar, Shivanshu, et al.
Pubblicazione: (2024)
AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization
di: Wu, Junkang, et al.
Pubblicazione: (2024)
di: Wu, Junkang, et al.
Pubblicazione: (2024)
ActiveDPO: Active Direct Preference Optimization for Sample-Efficient Alignment
di: Lin, Xiaoqiang, et al.
Pubblicazione: (2025)
di: Lin, Xiaoqiang, et al.
Pubblicazione: (2025)
$ξ$-DPO: Direct Preference Optimization via Ratio Reward Margin
di: Fan, Zhengyuan, et al.
Pubblicazione: (2026)
di: Fan, Zhengyuan, et al.
Pubblicazione: (2026)
MixDPO: Modeling Preference Strength for Pluralistic Alignment
di: Imai, Saki, et al.
Pubblicazione: (2026)
di: Imai, Saki, et al.
Pubblicazione: (2026)
Optimizing Language Models for Human Preferences is a Causal Inference Problem
di: Lin, Victoria, et al.
Pubblicazione: (2024)
di: Lin, Victoria, et al.
Pubblicazione: (2024)
SafeDPO: A Simple Approach to Direct Preference Optimization with Enhanced Safety
di: Kim, Geon-Hyeong, et al.
Pubblicazione: (2025)
di: Kim, Geon-Hyeong, et al.
Pubblicazione: (2025)
AdaDPO: Self-Adaptive Direct Preference Optimization with Balanced Gradient Updates
di: Chen, Shaolong, et al.
Pubblicazione: (2026)
di: Chen, Shaolong, et al.
Pubblicazione: (2026)
Sem-DPO: Mitigating Semantic Inconsistency in Preference Optimization for Prompt Engineering
di: Mohamed, Anas, et al.
Pubblicazione: (2025)
di: Mohamed, Anas, et al.
Pubblicazione: (2025)
Online DPO: Online Direct Preference Optimization with Fast-Slow Chasing
di: Qi, Biqing, et al.
Pubblicazione: (2024)
di: Qi, Biqing, et al.
Pubblicazione: (2024)
Multi-Preference Optimization: Generalizing DPO via Set-Level Contrasts
di: Gupta, Taneesh, et al.
Pubblicazione: (2024)
di: Gupta, Taneesh, et al.
Pubblicazione: (2024)
DreamDPO: Aligning Text-to-3D Generation with Human Preferences via Direct Preference Optimization
di: Zhou, Zhenglin, et al.
Pubblicazione: (2025)
di: Zhou, Zhenglin, et al.
Pubblicazione: (2025)
VistaDPO: Video Hierarchical Spatial-Temporal Direct Preference Optimization for Large Video Models
di: Huang, Haojian, et al.
Pubblicazione: (2025)
di: Huang, Haojian, et al.
Pubblicazione: (2025)
InCo-DPO: Balancing Distribution Shift and Data Quality for Enhanced Preference Optimization
di: Wang, Yunan, et al.
Pubblicazione: (2025)
di: Wang, Yunan, et al.
Pubblicazione: (2025)
$ϕ$-DPO: Fairness Direct Preference Optimization Approach to Continual Learning in Large Multimodal Models
di: Truong, Thanh-Dat, et al.
Pubblicazione: (2026)
di: Truong, Thanh-Dat, et al.
Pubblicazione: (2026)
Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs
di: Lai, Xin, et al.
Pubblicazione: (2024)
di: Lai, Xin, et al.
Pubblicazione: (2024)
Robust Multi-Objective Preference Alignment with Online DPO
di: Gupta, Raghav, et al.
Pubblicazione: (2025)
di: Gupta, Raghav, et al.
Pubblicazione: (2025)
PhysMoDPO: Physically-Plausible Humanoid Motion with Preference Optimization
di: Zhang, Yangsong, et al.
Pubblicazione: (2026)
di: Zhang, Yangsong, et al.
Pubblicazione: (2026)
RS-DPO: A Hybrid Rejection Sampling and Direct Preference Optimization Method for Alignment of Large Language Models
di: Khaki, Saeed, et al.
Pubblicazione: (2024)
di: Khaki, Saeed, et al.
Pubblicazione: (2024)
Uni-DPO: A Unified Paradigm for Dynamic Preference Optimization of LLMs
di: Peng, Shangpin, et al.
Pubblicazione: (2025)
di: Peng, Shangpin, et al.
Pubblicazione: (2025)
Curriculum-DPO++: Direct Preference Optimization via Data and Model Curricula for Text-to-Image Generation
di: Croitoru, Florinel-Alin, et al.
Pubblicazione: (2026)
di: Croitoru, Florinel-Alin, et al.
Pubblicazione: (2026)
Mix- and MoE-DPO: A Variational Inference Approach to Direct Preference Optimization
di: Bohne, Jason, et al.
Pubblicazione: (2025)
di: Bohne, Jason, et al.
Pubblicazione: (2025)
Bootstrapping Language Models with DPO Implicit Rewards
di: Chen, Changyu, et al.
Pubblicazione: (2024)
di: Chen, Changyu, et al.
Pubblicazione: (2024)
VERI-DPO: Evidence-Aware Alignment for Clinical Summarization via Claim Verification and Direct Preference Optimization
di: Liu, Weixin, et al.
Pubblicazione: (2026)
di: Liu, Weixin, et al.
Pubblicazione: (2026)
Understanding the Performance Gap in Preference Learning: A Dichotomy of RLHF and DPO
di: Shi, Ruizhe, et al.
Pubblicazione: (2025)
di: Shi, Ruizhe, et al.
Pubblicazione: (2025)
PQA: Zero-shot Protein Question Answering for Free-form Scientific Enquiry with Large Language Models
di: Carrami, Eli M, et al.
Pubblicazione: (2024)
di: Carrami, Eli M, et al.
Pubblicazione: (2024)
Smaug: Fixing Failure Modes of Preference Optimisation with DPO-Positive
di: Pal, Arka, et al.
Pubblicazione: (2024)
di: Pal, Arka, et al.
Pubblicazione: (2024)
Linear-DPO: Linear Direct Preference Optimization for Diffusion and Flow-Matching Generative Models
di: Li, Kesong, et al.
Pubblicazione: (2026)
di: Li, Kesong, et al.
Pubblicazione: (2026)
FinDPO: Financial Sentiment Analysis for Algorithmic Trading through Preference Optimization of LLMs
di: Iacovides, Giorgos, et al.
Pubblicazione: (2025)
di: Iacovides, Giorgos, et al.
Pubblicazione: (2025)
Documenti analoghi
-
EvoFlows: Evolutionary Edit-Based Flow-Matching for Protein Engineering
di: Deutschmann, Nicolas, et al.
Pubblicazione: (2026) -
Gradient-Gated DPO: Stabilizing Preference Optimization in Language Models
di: Mouiche, Inoussa
Pubblicazione: (2026) -
Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment
di: Xiao, Teng, et al.
Pubblicazione: (2024) -
mDPO: Conditional Preference Optimization for Multimodal Large Language Models
di: Wang, Fei, et al.
Pubblicazione: (2024) -
EnerBridge-DPO: Energy-Guided Protein Inverse Folding with Markov Bridges and Direct Preference Optimization
di: Rong, Dingyi, et al.
Pubblicazione: (2025)