2D-Curri-DPO: Two-Dimensional Curriculum Learning for Direct Preference Optimization
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Mengyang, Zhang, Zhong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Curry-DPO: Enhancing Alignment using Curriculum Learning & Ranked Preferences
di: Pattnaik, Pulkit, et al.
Pubblicazione: (2024)
di: Pattnaik, Pulkit, et al.
Pubblicazione: (2024)
2D-DPO: Scaling Direct Preference Optimization with 2-Dimensional Supervision
di: Li, Shilong, et al.
Pubblicazione: (2024)
di: Li, Shilong, et al.
Pubblicazione: (2024)
AnnoDPO: Protein Functional Annotation Learning with Direct Preference Optimization
di: Jiang, Zixuan, et al.
Pubblicazione: (2025)
di: Jiang, Zixuan, et al.
Pubblicazione: (2025)
C2-DPO: Constrained Controlled Direct Preference Optimization
di: Asadi, Kavosh, et al.
Pubblicazione: (2025)
di: Asadi, Kavosh, et al.
Pubblicazione: (2025)
TUR-DPO: Topology- and Uncertainty-Aware Direct Preference Optimization
di: Abdullah, Abdulhady Abas, et al.
Pubblicazione: (2026)
di: Abdullah, Abdulhady Abas, et al.
Pubblicazione: (2026)
$β$-DPO: Direct Preference Optimization with Dynamic $β$
di: Wu, Junkang, et al.
Pubblicazione: (2024)
di: Wu, Junkang, et al.
Pubblicazione: (2024)
Online DPO: Online Direct Preference Optimization with Fast-Slow Chasing
di: Qi, Biqing, et al.
Pubblicazione: (2024)
di: Qi, Biqing, et al.
Pubblicazione: (2024)
Curriculum-DPO++: Direct Preference Optimization via Data and Model Curricula for Text-to-Image Generation
di: Croitoru, Florinel-Alin, et al.
Pubblicazione: (2026)
di: Croitoru, Florinel-Alin, et al.
Pubblicazione: (2026)
ActiveDPO: Active Direct Preference Optimization for Sample-Efficient Alignment
di: Lin, Xiaoqiang, et al.
Pubblicazione: (2025)
di: Lin, Xiaoqiang, et al.
Pubblicazione: (2025)
$ξ$-DPO: Direct Preference Optimization via Ratio Reward Margin
di: Fan, Zhengyuan, et al.
Pubblicazione: (2026)
di: Fan, Zhengyuan, et al.
Pubblicazione: (2026)
AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization
di: Wu, Junkang, et al.
Pubblicazione: (2024)
di: Wu, Junkang, et al.
Pubblicazione: (2024)
SafeDPO: A Simple Approach to Direct Preference Optimization with Enhanced Safety
di: Kim, Geon-Hyeong, et al.
Pubblicazione: (2025)
di: Kim, Geon-Hyeong, et al.
Pubblicazione: (2025)
PKG-DPO: Optimizing Domain-Specific AI systems with Physics Knowledge Graphs and Direct Preference Optimization
di: Kulkarni, Nitin Nagesh, et al.
Pubblicazione: (2025)
di: Kulkarni, Nitin Nagesh, et al.
Pubblicazione: (2025)
Reg-DPO: SFT-Regularized Direct Preference Optimization with GT-Pair for Improving Video Generation
di: Du, Jie, et al.
Pubblicazione: (2025)
di: Du, Jie, et al.
Pubblicazione: (2025)
EnerBridge-DPO: Energy-Guided Protein Inverse Folding with Markov Bridges and Direct Preference Optimization
di: Rong, Dingyi, et al.
Pubblicazione: (2025)
di: Rong, Dingyi, et al.
Pubblicazione: (2025)
Mix- and MoE-DPO: A Variational Inference Approach to Direct Preference Optimization
di: Bohne, Jason, et al.
Pubblicazione: (2025)
di: Bohne, Jason, et al.
Pubblicazione: (2025)
MIA-DPO: Multi-Image Augmented Direct Preference Optimization For Large Vision-Language Models
di: Liu, Ziyu, et al.
Pubblicazione: (2024)
di: Liu, Ziyu, et al.
Pubblicazione: (2024)
OmniDPO: A Preference Optimization Framework to Address Omni-Modal Hallucination
di: Chen, Junzhe, et al.
Pubblicazione: (2025)
di: Chen, Junzhe, et al.
Pubblicazione: (2025)
DA-DPO: Cost-efficient Difficulty-aware Preference Optimization for Reducing MLLM Hallucinations
di: Qiu, Longtian, et al.
Pubblicazione: (2026)
di: Qiu, Longtian, et al.
Pubblicazione: (2026)
Improving Safety Alignment via Balanced Direct Preference Optimization
di: Zhao, Shiji, et al.
Pubblicazione: (2026)
di: Zhao, Shiji, et al.
Pubblicazione: (2026)
V-DPO: Mitigating Hallucination in Large Vision Language Models via Vision-Guided Direct Preference Optimization
di: Xie, Yuxi, et al.
Pubblicazione: (2024)
di: Xie, Yuxi, et al.
Pubblicazione: (2024)
Multi-Preference Optimization: Generalizing DPO via Set-Level Contrasts
di: Gupta, Taneesh, et al.
Pubblicazione: (2024)
di: Gupta, Taneesh, et al.
Pubblicazione: (2024)
Curriculum Direct Preference Optimization for Diffusion and Consistency Models
di: Croitoru, Florinel-Alin, et al.
Pubblicazione: (2024)
di: Croitoru, Florinel-Alin, et al.
Pubblicazione: (2024)
Margin Adaptive DPO: Leveraging Reward Model for Granular Control in Preference Optimization
di: Rho, Hyung Gyu
Pubblicazione: (2025)
di: Rho, Hyung Gyu
Pubblicazione: (2025)
DPO Kernels: A Semantically-Aware, Kernel-Enhanced, and Divergence-Rich Paradigm for Direct Preference Optimization
di: Das, Amitava, et al.
Pubblicazione: (2025)
di: Das, Amitava, et al.
Pubblicazione: (2025)
CuDIP: Enhancing Theorem Proving in LLMs via Curriculum Learning-based Direct Preference Optimization
di: Shi, Shuming, et al.
Pubblicazione: (2025)
di: Shi, Shuming, et al.
Pubblicazione: (2025)
Sem-DPO: Mitigating Semantic Inconsistency in Preference Optimization for Prompt Engineering
di: Mohamed, Anas, et al.
Pubblicazione: (2025)
di: Mohamed, Anas, et al.
Pubblicazione: (2025)
RealDPO: Real or Not Real, that is the Preference
di: Cheng, Guo, et al.
Pubblicazione: (2025)
di: Cheng, Guo, et al.
Pubblicazione: (2025)
Inducing Robustness in a 2 Dimensional Direct Preference Optimization Paradigm
di: Shashidhar, Sarvesh, et al.
Pubblicazione: (2025)
di: Shashidhar, Sarvesh, et al.
Pubblicazione: (2025)
RS-DPO: A Hybrid Rejection Sampling and Direct Preference Optimization Method for Alignment of Large Language Models
di: Khaki, Saeed, et al.
Pubblicazione: (2024)
di: Khaki, Saeed, et al.
Pubblicazione: (2024)
More is Less: The Pitfalls of Multi-Model Synthetic Preference Data in DPO Safety Alignment
di: Wang, Yifan, et al.
Pubblicazione: (2025)
di: Wang, Yifan, et al.
Pubblicazione: (2025)
Teaching with Lies: Curriculum DPO on Synthetic Negatives for Hallucination Detection
di: Pandit, Shrey, et al.
Pubblicazione: (2025)
di: Pandit, Shrey, et al.
Pubblicazione: (2025)
PhysMoDPO: Physically-Plausible Humanoid Motion with Preference Optimization
di: Zhang, Yangsong, et al.
Pubblicazione: (2026)
di: Zhang, Yangsong, et al.
Pubblicazione: (2026)
Rethinking DPO: The Role of Rejected Responses in Preference Misalignment
di: Cho, Jay Hyeon, et al.
Pubblicazione: (2025)
di: Cho, Jay Hyeon, et al.
Pubblicazione: (2025)
Uni-DPO: A Unified Paradigm for Dynamic Preference Optimization of LLMs
di: Peng, Shangpin, et al.
Pubblicazione: (2025)
di: Peng, Shangpin, et al.
Pubblicazione: (2025)
Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs
di: Lai, Xin, et al.
Pubblicazione: (2024)
di: Lai, Xin, et al.
Pubblicazione: (2024)
mDPO: Conditional Preference Optimization for Multimodal Large Language Models
di: Wang, Fei, et al.
Pubblicazione: (2024)
di: Wang, Fei, et al.
Pubblicazione: (2024)
Autoregressive Direct Preference Optimization
di: Oi, Masanari, et al.
Pubblicazione: (2026)
di: Oi, Masanari, et al.
Pubblicazione: (2026)
Direct Preference Optimization with Unobserved Preference Heterogeneity: The Necessity of Ternary Preferences
di: Chidambaram, Keertana, et al.
Pubblicazione: (2025)
di: Chidambaram, Keertana, et al.
Pubblicazione: (2025)
Token-Importance Guided Direct Preference Optimization
di: Yang, Ning, et al.
Pubblicazione: (2025)
di: Yang, Ning, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Curry-DPO: Enhancing Alignment using Curriculum Learning & Ranked Preferences
di: Pattnaik, Pulkit, et al.
Pubblicazione: (2024) -
2D-DPO: Scaling Direct Preference Optimization with 2-Dimensional Supervision
di: Li, Shilong, et al.
Pubblicazione: (2024) -
AnnoDPO: Protein Functional Annotation Learning with Direct Preference Optimization
di: Jiang, Zixuan, et al.
Pubblicazione: (2025) -
C2-DPO: Constrained Controlled Direct Preference Optimization
di: Asadi, Kavosh, et al.
Pubblicazione: (2025) -
TUR-DPO: Topology- and Uncertainty-Aware Direct Preference Optimization
di: Abdullah, Abdulhady Abas, et al.
Pubblicazione: (2026)