DA-DPO: Cost-efficient Difficulty-aware Preference Optimization for Reducing MLLM Hallucinations
Fuente:
arXiv
Guardado en:
| Autores principales: | Qiu, Longtian, Ning, Shan, Zhang, Chuyu, Sun, Jiaxuan, He, Xuming |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Mining Fine-Grained Image-Text Alignment for Zero-Shot Captioning via Text-Only Training
por: Qiu, Longtian, et al.
Publicado: (2024)
por: Qiu, Longtian, et al.
Publicado: (2024)
OmniDPO: A Preference Optimization Framework to Address Omni-Modal Hallucination
por: Chen, Junzhe, et al.
Publicado: (2025)
por: Chen, Junzhe, et al.
Publicado: (2025)
WikiCLIP: An Efficient Contrastive Baseline for Open-domain Visual Entity Recognition
por: Ning, Shan, et al.
Publicado: (2026)
por: Ning, Shan, et al.
Publicado: (2026)
NoisyGRPO: Incentivizing Multimodal CoT Reasoning via Noise Injection and Bayesian Estimation
por: Qiu, Longtian, et al.
Publicado: (2025)
por: Qiu, Longtian, et al.
Publicado: (2025)
Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum
por: Ning, Shan, et al.
Publicado: (2026)
por: Ning, Shan, et al.
Publicado: (2026)
Difficulty-Based Preference Data Selection by DPO Implicit Reward Gap
por: Qi, Xuan, et al.
Publicado: (2025)
por: Qi, Xuan, et al.
Publicado: (2025)
$β$-DPO: Direct Preference Optimization with Dynamic $β$
por: Wu, Junkang, et al.
Publicado: (2024)
por: Wu, Junkang, et al.
Publicado: (2024)
Freeze and Cluster: A Simple Baseline for Rehearsal-Free Continual Category Discovery
por: Zhang, Chuyu, et al.
Publicado: (2025)
por: Zhang, Chuyu, et al.
Publicado: (2025)
TUR-DPO: Topology- and Uncertainty-Aware Direct Preference Optimization
por: Abdullah, Abdulhady Abas, et al.
Publicado: (2026)
por: Abdullah, Abdulhady Abas, et al.
Publicado: (2026)
EnerBridge-DPO: Energy-Guided Protein Inverse Folding with Markov Bridges and Direct Preference Optimization
por: Rong, Dingyi, et al.
Publicado: (2025)
por: Rong, Dingyi, et al.
Publicado: (2025)
Decoding by Perturbation: Mitigating MLLM Hallucinations via Dynamic Textual Perturbation
por: Jia, Sihang, et al.
Publicado: (2026)
por: Jia, Sihang, et al.
Publicado: (2026)
AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization
por: Wu, Junkang, et al.
Publicado: (2024)
por: Wu, Junkang, et al.
Publicado: (2024)
2D-Curri-DPO: Two-Dimensional Curriculum Learning for Direct Preference Optimization
por: Li, Mengyang, et al.
Publicado: (2025)
por: Li, Mengyang, et al.
Publicado: (2025)
V-DPO: Mitigating Hallucination in Large Vision Language Models via Vision-Guided Direct Preference Optimization
por: Xie, Yuxi, et al.
Publicado: (2024)
por: Xie, Yuxi, et al.
Publicado: (2024)
C2-DPO: Constrained Controlled Direct Preference Optimization
por: Asadi, Kavosh, et al.
Publicado: (2025)
por: Asadi, Kavosh, et al.
Publicado: (2025)
2D-DPO: Scaling Direct Preference Optimization with 2-Dimensional Supervision
por: Li, Shilong, et al.
Publicado: (2024)
por: Li, Shilong, et al.
Publicado: (2024)
AnnoDPO: Protein Functional Annotation Learning with Direct Preference Optimization
por: Jiang, Zixuan, et al.
Publicado: (2025)
por: Jiang, Zixuan, et al.
Publicado: (2025)
$ξ$-DPO: Direct Preference Optimization via Ratio Reward Margin
por: Fan, Zhengyuan, et al.
Publicado: (2026)
por: Fan, Zhengyuan, et al.
Publicado: (2026)
ActiveDPO: Active Direct Preference Optimization for Sample-Efficient Alignment
por: Lin, Xiaoqiang, et al.
Publicado: (2025)
por: Lin, Xiaoqiang, et al.
Publicado: (2025)
Online DPO: Online Direct Preference Optimization with Fast-Slow Chasing
por: Qi, Biqing, et al.
Publicado: (2024)
por: Qi, Biqing, et al.
Publicado: (2024)
Multi-Preference Optimization: Generalizing DPO via Set-Level Contrasts
por: Gupta, Taneesh, et al.
Publicado: (2024)
por: Gupta, Taneesh, et al.
Publicado: (2024)
PKG-DPO: Optimizing Domain-Specific AI systems with Physics Knowledge Graphs and Direct Preference Optimization
por: Kulkarni, Nitin Nagesh, et al.
Publicado: (2025)
por: Kulkarni, Nitin Nagesh, et al.
Publicado: (2025)
Graph Unlearning Meets Influence-aware Negative Preference Optimization
por: Chen, Qiang, et al.
Publicado: (2025)
por: Chen, Qiang, et al.
Publicado: (2025)
SafeDPO: A Simple Approach to Direct Preference Optimization with Enhanced Safety
por: Kim, Geon-Hyeong, et al.
Publicado: (2025)
por: Kim, Geon-Hyeong, et al.
Publicado: (2025)
Margin Adaptive DPO: Leveraging Reward Model for Granular Control in Preference Optimization
por: Rho, Hyung Gyu
Publicado: (2025)
por: Rho, Hyung Gyu
Publicado: (2025)
MIA-DPO: Multi-Image Augmented Direct Preference Optimization For Large Vision-Language Models
por: Liu, Ziyu, et al.
Publicado: (2024)
por: Liu, Ziyu, et al.
Publicado: (2024)
Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization
por: Compagnoni, Alberto, et al.
Publicado: (2025)
por: Compagnoni, Alberto, et al.
Publicado: (2025)
Sem-DPO: Mitigating Semantic Inconsistency in Preference Optimization for Prompt Engineering
por: Mohamed, Anas, et al.
Publicado: (2025)
por: Mohamed, Anas, et al.
Publicado: (2025)
RealDPO: Real or Not Real, that is the Preference
por: Cheng, Guo, et al.
Publicado: (2025)
por: Cheng, Guo, et al.
Publicado: (2025)
Teaching with Lies: Curriculum DPO on Synthetic Negatives for Hallucination Detection
por: Pandit, Shrey, et al.
Publicado: (2025)
por: Pandit, Shrey, et al.
Publicado: (2025)
DPO Meets PPO: Reinforced Token Optimization for RLHF
por: Zhong, Han, et al.
Publicado: (2024)
por: Zhong, Han, et al.
Publicado: (2024)
Just Say What You Want: Only-prompting Self-rewarding Online Preference Optimization
por: Xu, Ruijie, et al.
Publicado: (2024)
por: Xu, Ruijie, et al.
Publicado: (2024)
PhysMoDPO: Physically-Plausible Humanoid Motion with Preference Optimization
por: Zhang, Yangsong, et al.
Publicado: (2026)
por: Zhang, Yangsong, et al.
Publicado: (2026)
Rethinking DPO: The Role of Rejected Responses in Preference Misalignment
por: Cho, Jay Hyeon, et al.
Publicado: (2025)
por: Cho, Jay Hyeon, et al.
Publicado: (2025)
Uni-DPO: A Unified Paradigm for Dynamic Preference Optimization of LLMs
por: Peng, Shangpin, et al.
Publicado: (2025)
por: Peng, Shangpin, et al.
Publicado: (2025)
Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs
por: Lai, Xin, et al.
Publicado: (2024)
por: Lai, Xin, et al.
Publicado: (2024)
Reg-DPO: SFT-Regularized Direct Preference Optimization with GT-Pair for Improving Video Generation
por: Du, Jie, et al.
Publicado: (2025)
por: Du, Jie, et al.
Publicado: (2025)
mDPO: Conditional Preference Optimization for Multimodal Large Language Models
por: Wang, Fei, et al.
Publicado: (2024)
por: Wang, Fei, et al.
Publicado: (2024)
More is Less: The Pitfalls of Multi-Model Synthetic Preference Data in DPO Safety Alignment
por: Wang, Yifan, et al.
Publicado: (2025)
por: Wang, Yifan, et al.
Publicado: (2025)
Mix- and MoE-DPO: A Variational Inference Approach to Direct Preference Optimization
por: Bohne, Jason, et al.
Publicado: (2025)
por: Bohne, Jason, et al.
Publicado: (2025)
Ejemplares similares
-
Mining Fine-Grained Image-Text Alignment for Zero-Shot Captioning via Text-Only Training
por: Qiu, Longtian, et al.
Publicado: (2024) -
OmniDPO: A Preference Optimization Framework to Address Omni-Modal Hallucination
por: Chen, Junzhe, et al.
Publicado: (2025) -
WikiCLIP: An Efficient Contrastive Baseline for Open-domain Visual Entity Recognition
por: Ning, Shan, et al.
Publicado: (2026) -
NoisyGRPO: Incentivizing Multimodal CoT Reasoning via Noise Injection and Bayesian Estimation
por: Qiu, Longtian, et al.
Publicado: (2025) -
Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum
por: Ning, Shan, et al.
Publicado: (2026)