CompassDPO: Dynamics-Controlled Direct Preference Optimization for Robust Safety Alignment
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Jilong, Yang, Yonghui, Shao, Pengyang, Tao, Wenjian, Zhan, Hao, Ma, Haokai, Qin, Wei, Hong, Richang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Debate over Mixed-knowledge: A Robust Multi-Agent Reasoning Framework for Incomplete Knowledge Graph Question Answering
di: Liu, Jilong, et al.
Pubblicazione: (2025)
di: Liu, Jilong, et al.
Pubblicazione: (2025)
Revisiting Robustness for LLM Safety Alignment via Selective Geometry Control
di: Yang, Yonghui, et al.
Pubblicazione: (2026)
di: Yang, Yonghui, et al.
Pubblicazione: (2026)
$β$-DPO: Direct Preference Optimization with Dynamic $β$
di: Wu, Junkang, et al.
Pubblicazione: (2024)
di: Wu, Junkang, et al.
Pubblicazione: (2024)
ActiveDPO: Active Direct Preference Optimization for Sample-Efficient Alignment
di: Lin, Xiaoqiang, et al.
Pubblicazione: (2025)
di: Lin, Xiaoqiang, et al.
Pubblicazione: (2025)
Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment
di: Xiao, Teng, et al.
Pubblicazione: (2024)
di: Xiao, Teng, et al.
Pubblicazione: (2024)
C2-DPO: Constrained Controlled Direct Preference Optimization
di: Asadi, Kavosh, et al.
Pubblicazione: (2025)
di: Asadi, Kavosh, et al.
Pubblicazione: (2025)
SafeDPO: A Simple Approach to Direct Preference Optimization with Enhanced Safety
di: Kim, Geon-Hyeong, et al.
Pubblicazione: (2025)
di: Kim, Geon-Hyeong, et al.
Pubblicazione: (2025)
Controllable Value Alignment in Large Language Models through Neuron-Level Editing
di: Yang, Yonghui, et al.
Pubblicazione: (2026)
di: Yang, Yonghui, et al.
Pubblicazione: (2026)
Robust Multi-Objective Preference Alignment with Online DPO
di: Gupta, Raghav, et al.
Pubblicazione: (2025)
di: Gupta, Raghav, et al.
Pubblicazione: (2025)
Invariance Matters: Empowering Social Recommendation via Graph Invariant Learning
di: Yang, Yonghui, et al.
Pubblicazione: (2025)
di: Yang, Yonghui, et al.
Pubblicazione: (2025)
Multimodal Large Language Models with Adaptive Preference Optimization for Sequential Recommendation
di: Wang, Yu, et al.
Pubblicazione: (2025)
di: Wang, Yu, et al.
Pubblicazione: (2025)
RS-DPO: A Hybrid Rejection Sampling and Direct Preference Optimization Method for Alignment of Large Language Models
di: Khaki, Saeed, et al.
Pubblicazione: (2024)
di: Khaki, Saeed, et al.
Pubblicazione: (2024)
More is Less: The Pitfalls of Multi-Model Synthetic Preference Data in DPO Safety Alignment
di: Wang, Yifan, et al.
Pubblicazione: (2025)
di: Wang, Yifan, et al.
Pubblicazione: (2025)
DPO-Shift: Shifting the Distribution of Direct Preference Optimization
di: Yang, Xiliang, et al.
Pubblicazione: (2025)
di: Yang, Xiliang, et al.
Pubblicazione: (2025)
Emo-DPO: Controllable Emotional Speech Synthesis through Direct Preference Optimization
di: Gao, Xiaoxue, et al.
Pubblicazione: (2024)
di: Gao, Xiaoxue, et al.
Pubblicazione: (2024)
Reg-DPO: SFT-Regularized Direct Preference Optimization with GT-Pair for Improving Video Generation
di: Du, Jie, et al.
Pubblicazione: (2025)
di: Du, Jie, et al.
Pubblicazione: (2025)
VERI-DPO: Evidence-Aware Alignment for Clinical Summarization via Claim Verification and Direct Preference Optimization
di: Liu, Weixin, et al.
Pubblicazione: (2026)
di: Liu, Weixin, et al.
Pubblicazione: (2026)
HuViDPO:Enhancing Video Generation through Direct Preference Optimization for Human-Centric Alignment
di: Jiang, Lifan, et al.
Pubblicazione: (2025)
di: Jiang, Lifan, et al.
Pubblicazione: (2025)
Improving Safety Alignment via Balanced Direct Preference Optimization
di: Zhao, Shiji, et al.
Pubblicazione: (2026)
di: Zhao, Shiji, et al.
Pubblicazione: (2026)
SEE-DPO: Self Entropy Enhanced Direct Preference Optimization
di: Shekhar, Shivanshu, et al.
Pubblicazione: (2024)
di: Shekhar, Shivanshu, et al.
Pubblicazione: (2024)
TUR-DPO: Topology- and Uncertainty-Aware Direct Preference Optimization
di: Abdullah, Abdulhady Abas, et al.
Pubblicazione: (2026)
di: Abdullah, Abdulhady Abas, et al.
Pubblicazione: (2026)
AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization
di: Wu, Junkang, et al.
Pubblicazione: (2024)
di: Wu, Junkang, et al.
Pubblicazione: (2024)
DeDPO: Debiased Direct Preference Optimization for Diffusion Models
di: Pham, Khiem, et al.
Pubblicazione: (2026)
di: Pham, Khiem, et al.
Pubblicazione: (2026)
RAD-DPO: Robust Adaptive Denoising Direct Preference Optimization for Generative Retrieval in E-commerce
di: Chen, Zhiguo, et al.
Pubblicazione: (2026)
di: Chen, Zhiguo, et al.
Pubblicazione: (2026)
Linear-DPO: Linear Direct Preference Optimization for Diffusion and Flow-Matching Generative Models
di: Li, Kesong, et al.
Pubblicazione: (2026)
di: Li, Kesong, et al.
Pubblicazione: (2026)
DreamDPO: Aligning Text-to-3D Generation with Human Preferences via Direct Preference Optimization
di: Zhou, Zhenglin, et al.
Pubblicazione: (2025)
di: Zhou, Zhenglin, et al.
Pubblicazione: (2025)
Align-for-Fusion: Harmonizing Triple Preferences via Dual-oriented Diffusion for Cross-domain Sequential Recommendation
di: Zha, Yongfu, et al.
Pubblicazione: (2025)
di: Zha, Yongfu, et al.
Pubblicazione: (2025)
MCM-DPO: Multifaceted Cross-Modal Direct Preference Optimization for Alt-text Generation
di: Fu, Jinlan, et al.
Pubblicazione: (2025)
di: Fu, Jinlan, et al.
Pubblicazione: (2025)
$ξ$-DPO: Direct Preference Optimization via Ratio Reward Margin
di: Fan, Zhengyuan, et al.
Pubblicazione: (2026)
di: Fan, Zhengyuan, et al.
Pubblicazione: (2026)
Online DPO: Online Direct Preference Optimization with Fast-Slow Chasing
di: Qi, Biqing, et al.
Pubblicazione: (2024)
di: Qi, Biqing, et al.
Pubblicazione: (2024)
GroupDPO: Memory efficient Group-wise Direct Preference Optimization
di: Leng, Jixuan, et al.
Pubblicazione: (2026)
di: Leng, Jixuan, et al.
Pubblicazione: (2026)
AnnoDPO: Protein Functional Annotation Learning with Direct Preference Optimization
di: Jiang, Zixuan, et al.
Pubblicazione: (2025)
di: Jiang, Zixuan, et al.
Pubblicazione: (2025)
AVC-DPO: Aligned Video Captioning via Direct Preference Optimization
di: Tang, Jiyang, et al.
Pubblicazione: (2025)
di: Tang, Jiyang, et al.
Pubblicazione: (2025)
VideoDPO: Omni-Preference Alignment for Video Diffusion Generation
di: Liu, Runtao, et al.
Pubblicazione: (2024)
di: Liu, Runtao, et al.
Pubblicazione: (2024)
Bridging SFT and DPO for Diffusion Model Alignment with Self-Sampling Preference Optimization
di: Zhang, Daoan, et al.
Pubblicazione: (2024)
di: Zhang, Daoan, et al.
Pubblicazione: (2024)
FashionDPO:Fine-tune Fashion Outfit Generation Model using Direct Preference Optimization
di: Yu, Mingzhe, et al.
Pubblicazione: (2025)
di: Yu, Mingzhe, et al.
Pubblicazione: (2025)
Cat-DPO: Category-Adaptive Safety Alignment
di: Yang, Tiankai, et al.
Pubblicazione: (2026)
di: Yang, Tiankai, et al.
Pubblicazione: (2026)
TPMM-DPO: Trajectory-aware Preference-guided Model Merging for Iterative Direct Preference Optimization
di: Fu, Lingling, et al.
Pubblicazione: (2026)
di: Fu, Lingling, et al.
Pubblicazione: (2026)
MixDPO: Modeling Preference Strength for Pluralistic Alignment
di: Imai, Saki, et al.
Pubblicazione: (2026)
di: Imai, Saki, et al.
Pubblicazione: (2026)
VistaDPO: Video Hierarchical Spatial-Temporal Direct Preference Optimization for Large Video Models
di: Huang, Haojian, et al.
Pubblicazione: (2025)
di: Huang, Haojian, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Debate over Mixed-knowledge: A Robust Multi-Agent Reasoning Framework for Incomplete Knowledge Graph Question Answering
di: Liu, Jilong, et al.
Pubblicazione: (2025) -
Revisiting Robustness for LLM Safety Alignment via Selective Geometry Control
di: Yang, Yonghui, et al.
Pubblicazione: (2026) -
$β$-DPO: Direct Preference Optimization with Dynamic $β$
di: Wu, Junkang, et al.
Pubblicazione: (2024) -
ActiveDPO: Active Direct Preference Optimization for Sample-Efficient Alignment
di: Lin, Xiaoqiang, et al.
Pubblicazione: (2025) -
Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment
di: Xiao, Teng, et al.
Pubblicazione: (2024)