Guardado en:
| Autor principal: | Mouiche, Inoussa |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2605.02626 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
TIJERE: A Novel Threat Intelligence Joint Extraction Model Based on Analyst Expert Knowledge
por: Mouiche, Inoussa, et al.
Publicado: (2026)
por: Mouiche, Inoussa, et al.
Publicado: (2026)
Context-aware Entity-Relation Extraction for Threat Intelligence Knowledge Graphs
por: Mouiche, Inoussa, et al.
Publicado: (2026)
por: Mouiche, Inoussa, et al.
Publicado: (2026)
g-DPO: Scalable Preference Optimization for Protein Language Models
por: Ferragu, Constance, et al.
Publicado: (2025)
por: Ferragu, Constance, et al.
Publicado: (2025)
Benchmarking Deep Neural Networks for Modern Recommendation Systems
por: Bahi, Abderaouf, et al.
Publicado: (2025)
por: Bahi, Abderaouf, et al.
Publicado: (2025)
Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment
por: Xiao, Teng, et al.
Publicado: (2024)
por: Xiao, Teng, et al.
Publicado: (2024)
AdaDPO: Self-Adaptive Direct Preference Optimization with Balanced Gradient Updates
por: Chen, Shaolong, et al.
Publicado: (2026)
por: Chen, Shaolong, et al.
Publicado: (2026)
mDPO: Conditional Preference Optimization for Multimodal Large Language Models
por: Wang, Fei, et al.
Publicado: (2024)
por: Wang, Fei, et al.
Publicado: (2024)
$β$-DPO: Direct Preference Optimization with Dynamic $β$
por: Wu, Junkang, et al.
Publicado: (2024)
por: Wu, Junkang, et al.
Publicado: (2024)
DiaTool-DPO: Multi-Turn Direct Preference Optimization for Tool-Augmented Large Language Models
por: Jung, Sunghee, et al.
Publicado: (2025)
por: Jung, Sunghee, et al.
Publicado: (2025)
C2-DPO: Constrained Controlled Direct Preference Optimization
por: Asadi, Kavosh, et al.
Publicado: (2025)
por: Asadi, Kavosh, et al.
Publicado: (2025)
Margin Adaptive DPO: Leveraging Reward Model for Granular Control in Preference Optimization
por: Rho, Hyung Gyu
Publicado: (2025)
por: Rho, Hyung Gyu
Publicado: (2025)
CompassDPO: Dynamics-Controlled Direct Preference Optimization for Robust Safety Alignment
por: Liu, Jilong, et al.
Publicado: (2026)
por: Liu, Jilong, et al.
Publicado: (2026)
Preference Robustness for DPO with Applications to Public Health
por: Kim, Cheol Woo, et al.
Publicado: (2025)
por: Kim, Cheol Woo, et al.
Publicado: (2025)
SEE-DPO: Self Entropy Enhanced Direct Preference Optimization
por: Shekhar, Shivanshu, et al.
Publicado: (2024)
por: Shekhar, Shivanshu, et al.
Publicado: (2024)
AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization
por: Wu, Junkang, et al.
Publicado: (2024)
por: Wu, Junkang, et al.
Publicado: (2024)
$ξ$-DPO: Direct Preference Optimization via Ratio Reward Margin
por: Fan, Zhengyuan, et al.
Publicado: (2026)
por: Fan, Zhengyuan, et al.
Publicado: (2026)
ActiveDPO: Active Direct Preference Optimization for Sample-Efficient Alignment
por: Lin, Xiaoqiang, et al.
Publicado: (2025)
por: Lin, Xiaoqiang, et al.
Publicado: (2025)
MixDPO: Modeling Preference Strength for Pluralistic Alignment
por: Imai, Saki, et al.
Publicado: (2026)
por: Imai, Saki, et al.
Publicado: (2026)
SafeDPO: A Simple Approach to Direct Preference Optimization with Enhanced Safety
por: Kim, Geon-Hyeong, et al.
Publicado: (2025)
por: Kim, Geon-Hyeong, et al.
Publicado: (2025)
Online DPO: Online Direct Preference Optimization with Fast-Slow Chasing
por: Qi, Biqing, et al.
Publicado: (2024)
por: Qi, Biqing, et al.
Publicado: (2024)
Sem-DPO: Mitigating Semantic Inconsistency in Preference Optimization for Prompt Engineering
por: Mohamed, Anas, et al.
Publicado: (2025)
por: Mohamed, Anas, et al.
Publicado: (2025)
Multi-Preference Optimization: Generalizing DPO via Set-Level Contrasts
por: Gupta, Taneesh, et al.
Publicado: (2024)
por: Gupta, Taneesh, et al.
Publicado: (2024)
DreamDPO: Aligning Text-to-3D Generation with Human Preferences via Direct Preference Optimization
por: Zhou, Zhenglin, et al.
Publicado: (2025)
por: Zhou, Zhenglin, et al.
Publicado: (2025)
$ϕ$-DPO: Fairness Direct Preference Optimization Approach to Continual Learning in Large Multimodal Models
por: Truong, Thanh-Dat, et al.
Publicado: (2026)
por: Truong, Thanh-Dat, et al.
Publicado: (2026)
VistaDPO: Video Hierarchical Spatial-Temporal Direct Preference Optimization for Large Video Models
por: Huang, Haojian, et al.
Publicado: (2025)
por: Huang, Haojian, et al.
Publicado: (2025)
InCo-DPO: Balancing Distribution Shift and Data Quality for Enhanced Preference Optimization
por: Wang, Yunan, et al.
Publicado: (2025)
por: Wang, Yunan, et al.
Publicado: (2025)
Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs
por: Lai, Xin, et al.
Publicado: (2024)
por: Lai, Xin, et al.
Publicado: (2024)
Robust Multi-Objective Preference Alignment with Online DPO
por: Gupta, Raghav, et al.
Publicado: (2025)
por: Gupta, Raghav, et al.
Publicado: (2025)
PhysMoDPO: Physically-Plausible Humanoid Motion with Preference Optimization
por: Zhang, Yangsong, et al.
Publicado: (2026)
por: Zhang, Yangsong, et al.
Publicado: (2026)
RS-DPO: A Hybrid Rejection Sampling and Direct Preference Optimization Method for Alignment of Large Language Models
por: Khaki, Saeed, et al.
Publicado: (2024)
por: Khaki, Saeed, et al.
Publicado: (2024)
Curriculum-DPO++: Direct Preference Optimization via Data and Model Curricula for Text-to-Image Generation
por: Croitoru, Florinel-Alin, et al.
Publicado: (2026)
por: Croitoru, Florinel-Alin, et al.
Publicado: (2026)
Uni-DPO: A Unified Paradigm for Dynamic Preference Optimization of LLMs
por: Peng, Shangpin, et al.
Publicado: (2025)
por: Peng, Shangpin, et al.
Publicado: (2025)
Mix- and MoE-DPO: A Variational Inference Approach to Direct Preference Optimization
por: Bohne, Jason, et al.
Publicado: (2025)
por: Bohne, Jason, et al.
Publicado: (2025)
Bootstrapping Language Models with DPO Implicit Rewards
por: Chen, Changyu, et al.
Publicado: (2024)
por: Chen, Changyu, et al.
Publicado: (2024)
Gradient Imbalance in Direct Preference Optimization
por: Ma, Qinwei, et al.
Publicado: (2025)
por: Ma, Qinwei, et al.
Publicado: (2025)
VERI-DPO: Evidence-Aware Alignment for Clinical Summarization via Claim Verification and Direct Preference Optimization
por: Liu, Weixin, et al.
Publicado: (2026)
por: Liu, Weixin, et al.
Publicado: (2026)
EnerBridge-DPO: Energy-Guided Protein Inverse Folding with Markov Bridges and Direct Preference Optimization
por: Rong, Dingyi, et al.
Publicado: (2025)
por: Rong, Dingyi, et al.
Publicado: (2025)
Understanding the Performance Gap in Preference Learning: A Dichotomy of RLHF and DPO
por: Shi, Ruizhe, et al.
Publicado: (2025)
por: Shi, Ruizhe, et al.
Publicado: (2025)
Smaug: Fixing Failure Modes of Preference Optimisation with DPO-Positive
por: Pal, Arka, et al.
Publicado: (2024)
por: Pal, Arka, et al.
Publicado: (2024)
Linear-DPO: Linear Direct Preference Optimization for Diffusion and Flow-Matching Generative Models
por: Li, Kesong, et al.
Publicado: (2026)
por: Li, Kesong, et al.
Publicado: (2026)
Ejemplares similares
-
TIJERE: A Novel Threat Intelligence Joint Extraction Model Based on Analyst Expert Knowledge
por: Mouiche, Inoussa, et al.
Publicado: (2026) -
Context-aware Entity-Relation Extraction for Threat Intelligence Knowledge Graphs
por: Mouiche, Inoussa, et al.
Publicado: (2026) -
g-DPO: Scalable Preference Optimization for Protein Language Models
por: Ferragu, Constance, et al.
Publicado: (2025) -
Benchmarking Deep Neural Networks for Modern Recommendation Systems
por: Bahi, Abderaouf, et al.
Publicado: (2025) -
Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment
por: Xiao, Teng, et al.
Publicado: (2024)