C2-DPO: Constrained Controlled Direct Preference Optimization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Asadi, Kavosh, Han, Julien, Pipano, Idan, Xu, Xingzi, Perrault-Joncas, Dominique, Sabach, Shoham, Bouyarmane, Karim, Ghavamzadeh, Mohammad |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Displacement-Resistant Extensions of DPO with Nonconvex $f$-Divergences
par: Pipano, Idan, et autres
Publié: (2026)
par: Pipano, Idan, et autres
Publié: (2026)
Adjoint sharding for very long context training of state space models
par: Xu, Xingzi, et autres
Publié: (2025)
par: Xu, Xingzi, et autres
Publié: (2025)
InstructVTON: Optimal Auto-Masking and Natural-Language-Guided Interactive Style Control for Inpainting-Based Virtual Try-On
par: Han, Julien, et autres
Publié: (2025)
par: Han, Julien, et autres
Publié: (2025)
Learning the Target Network in Function Space
par: Asadi, Kavosh, et autres
Publié: (2024)
par: Asadi, Kavosh, et autres
Publié: (2024)
Directional-Clamp PPO
par: Karpel, Gilad, et autres
Publié: (2025)
par: Karpel, Gilad, et autres
Publié: (2025)
Direct Preference Optimization with Rating Information: Practical Algorithms and Provable Gains
par: Viano, Luca, et autres
Publié: (2026)
par: Viano, Luca, et autres
Publié: (2026)
TAIL: Task-specific Adapters for Imitation Learning with Large Pretrained Models
par: Liu, Zuxin, et autres
Publié: (2023)
par: Liu, Zuxin, et autres
Publié: (2023)
Learning to Reason Efficiently with Discounted Reinforcement Learning
par: Ayoub, Alex, et autres
Publié: (2025)
par: Ayoub, Alex, et autres
Publié: (2025)
DEFT-VTON: Efficient Virtual Try-On with Consistent Generalised H-Transform
par: Xu, Xingzi, et autres
Publié: (2025)
par: Xu, Xingzi, et autres
Publié: (2025)
DiT-VTON: Diffusion Transformer Framework for Unified Multi-Category Virtual Try-On and Virtual Try-All with Integrated Image Editing
par: Li, Qi, et autres
Publié: (2025)
par: Li, Qi, et autres
Publié: (2025)
Mind the Sim-to-Real Gap & Think Like a Scientist
par: Parikh, Harsh, et autres
Publié: (2026)
par: Parikh, Harsh, et autres
Publié: (2026)
AnnoDPO: Protein Functional Annotation Learning with Direct Preference Optimization
par: Jiang, Zixuan, et autres
Publié: (2025)
par: Jiang, Zixuan, et autres
Publié: (2025)
$β$-DPO: Direct Preference Optimization with Dynamic $β$
par: Wu, Junkang, et autres
Publié: (2024)
par: Wu, Junkang, et autres
Publié: (2024)
Comparing Few to Rank Many: Active Human Preference Learning using Randomized Frank-Wolfe
par: Thekumparampil, Kiran Koshy, et autres
Publié: (2024)
par: Thekumparampil, Kiran Koshy, et autres
Publié: (2024)
TUR-DPO: Topology- and Uncertainty-Aware Direct Preference Optimization
par: Abdullah, Abdulhady Abas, et autres
Publié: (2026)
par: Abdullah, Abdulhady Abas, et autres
Publié: (2026)
Efficient Encoder-Free Pose Conditioning and Pose Control for Virtual Try-On
par: Li, Qi, et autres
Publié: (2025)
par: Li, Qi, et autres
Publié: (2025)
AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization
par: Wu, Junkang, et autres
Publié: (2024)
par: Wu, Junkang, et autres
Publié: (2024)
$ξ$-DPO: Direct Preference Optimization via Ratio Reward Margin
par: Fan, Zhengyuan, et autres
Publié: (2026)
par: Fan, Zhengyuan, et autres
Publié: (2026)
ActiveDPO: Active Direct Preference Optimization for Sample-Efficient Alignment
par: Lin, Xiaoqiang, et autres
Publié: (2025)
par: Lin, Xiaoqiang, et autres
Publié: (2025)
Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator
par: Chen, Zhuotong, et autres
Publié: (2025)
par: Chen, Zhuotong, et autres
Publié: (2025)
Dynamic FISTA for Convex Composite Bi-Level Optimization
par: Merchav, Roey, et autres
Publié: (2024)
par: Merchav, Roey, et autres
Publié: (2024)
Online DPO: Online Direct Preference Optimization with Fast-Slow Chasing
par: Qi, Biqing, et autres
Publié: (2024)
par: Qi, Biqing, et autres
Publié: (2024)
Ready from Day 1: Population-Aware Coordination for Large-Scale Constrained Multi-Agent Systems
par: Wang, Angel, et autres
Publié: (2026)
par: Wang, Angel, et autres
Publié: (2026)
2D-DPO: Scaling Direct Preference Optimization with 2-Dimensional Supervision
par: Li, Shilong, et autres
Publié: (2024)
par: Li, Shilong, et autres
Publié: (2024)
SafeDPO: A Simple Approach to Direct Preference Optimization with Enhanced Safety
par: Kim, Geon-Hyeong, et autres
Publié: (2025)
par: Kim, Geon-Hyeong, et autres
Publié: (2025)
2D-Curri-DPO: Two-Dimensional Curriculum Learning for Direct Preference Optimization
par: Li, Mengyang, et autres
Publié: (2025)
par: Li, Mengyang, et autres
Publié: (2025)
PKG-DPO: Optimizing Domain-Specific AI systems with Physics Knowledge Graphs and Direct Preference Optimization
par: Kulkarni, Nitin Nagesh, et autres
Publié: (2025)
par: Kulkarni, Nitin Nagesh, et autres
Publié: (2025)
Margin Adaptive DPO: Leveraging Reward Model for Granular Control in Preference Optimization
par: Rho, Hyung Gyu
Publié: (2025)
par: Rho, Hyung Gyu
Publié: (2025)
Mix- and MoE-DPO: A Variational Inference Approach to Direct Preference Optimization
par: Bohne, Jason, et autres
Publié: (2025)
par: Bohne, Jason, et autres
Publié: (2025)
V-DPO: Mitigating Hallucination in Large Vision Language Models via Vision-Guided Direct Preference Optimization
par: Xie, Yuxi, et autres
Publié: (2024)
par: Xie, Yuxi, et autres
Publié: (2024)
Optimizing Urban Service Allocation with Time-Constrained Restless Bandits
par: Mao, Yi, et autres
Publié: (2025)
par: Mao, Yi, et autres
Publié: (2025)
MIA-DPO: Multi-Image Augmented Direct Preference Optimization For Large Vision-Language Models
par: Liu, Ziyu, et autres
Publié: (2024)
par: Liu, Ziyu, et autres
Publié: (2024)
Reg-DPO: SFT-Regularized Direct Preference Optimization with GT-Pair for Improving Video Generation
par: Du, Jie, et autres
Publié: (2025)
par: Du, Jie, et autres
Publié: (2025)
EnerBridge-DPO: Energy-Guided Protein Inverse Folding with Markov Bridges and Direct Preference Optimization
par: Rong, Dingyi, et autres
Publié: (2025)
par: Rong, Dingyi, et autres
Publié: (2025)
Beyond Binary Preferences: A Principled Framework for Reward Modeling with Ordinal Feedback
par: Afsharrad, Amirhossein, et autres
Publié: (2026)
par: Afsharrad, Amirhossein, et autres
Publié: (2026)
Structured Object Language Modeling (SoLM): Native Structured Objects Generation Conforming to Complex Schemas with Self-Supervised Denoising
par: Tavanaei, Amir, et autres
Publié: (2024)
par: Tavanaei, Amir, et autres
Publié: (2024)
Curriculum-DPO++: Direct Preference Optimization via Data and Model Curricula for Text-to-Image Generation
par: Croitoru, Florinel-Alin, et autres
Publié: (2026)
par: Croitoru, Florinel-Alin, et autres
Publié: (2026)
TEA-Time: Transporting Effects Across Time
par: Parikh, Harsh, et autres
Publié: (2026)
par: Parikh, Harsh, et autres
Publié: (2026)
DPO Kernels: A Semantically-Aware, Kernel-Enhanced, and Divergence-Rich Paradigm for Direct Preference Optimization
par: Das, Amitava, et autres
Publié: (2025)
par: Das, Amitava, et autres
Publié: (2025)
Diffusion Blend: Inference-Time Multi-Preference Alignment for Diffusion Models
par: Cheng, Min, et autres
Publié: (2025)
par: Cheng, Min, et autres
Publié: (2025)
Documents similaires
-
Displacement-Resistant Extensions of DPO with Nonconvex $f$-Divergences
par: Pipano, Idan, et autres
Publié: (2026) -
Adjoint sharding for very long context training of state space models
par: Xu, Xingzi, et autres
Publié: (2025) -
InstructVTON: Optimal Auto-Masking and Natural-Language-Guided Interactive Style Control for Inpainting-Based Virtual Try-On
par: Han, Julien, et autres
Publié: (2025) -
Learning the Target Network in Function Space
par: Asadi, Kavosh, et autres
Publié: (2024) -
Directional-Clamp PPO
par: Karpel, Gilad, et autres
Publié: (2025)