MoD-DPO: Towards Mitigating Cross-modal Hallucinations in Omni LLMs using Modality Decoupled Preference Optimization
Fuente:
arXiv
Salvato in:
| Autori principali: | Chaubey, Ashutosh, Pang, Jiacheng, Soleymani, Mohammad |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
AVERE: Improving Audiovisual Emotion Reasoning with Preference Optimization
di: Chaubey, Ashutosh, et al.
Pubblicazione: (2026)
di: Chaubey, Ashutosh, et al.
Pubblicazione: (2026)
GDPO-Listener: Expressive Interactive Head Generation via Auto-Regressive Flow Matching and Group reward-Decoupled Policy Optimization
di: Jin, Zhangyu, et al.
Pubblicazione: (2026)
di: Jin, Zhangyu, et al.
Pubblicazione: (2026)
Do Audio LLMs Listen or Read? Analyzing and Mitigating Paralinguistic Failures with VoxParadox
di: Pang, Jiacheng, et al.
Pubblicazione: (2026)
di: Pang, Jiacheng, et al.
Pubblicazione: (2026)
Face-LLaVA: Facial Expression and Attribute Understanding through Instruction Tuning
di: Chaubey, Ashutosh, et al.
Pubblicazione: (2025)
di: Chaubey, Ashutosh, et al.
Pubblicazione: (2025)
p-MoD: Building Mixture-of-Depths MLLMs via Progressive Ratio Decay
di: Zhang, Jun, et al.
Pubblicazione: (2024)
di: Zhang, Jun, et al.
Pubblicazione: (2024)
Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization
di: Compagnoni, Alberto, et al.
Pubblicazione: (2025)
di: Compagnoni, Alberto, et al.
Pubblicazione: (2025)
Omni-Reward: Towards Generalist Omni-Modal Reward Modeling with Free-Form Preferences
di: Jin, Zhuoran, et al.
Pubblicazione: (2025)
di: Jin, Zhuoran, et al.
Pubblicazione: (2025)
CHiP: Cross-modal Hierarchical Direct Preference Optimization for Multimodal LLMs
di: Fu, Jinlan, et al.
Pubblicazione: (2025)
di: Fu, Jinlan, et al.
Pubblicazione: (2025)
Uni-DPO: A Unified Paradigm for Dynamic Preference Optimization of LLMs
di: Peng, Shangpin, et al.
Pubblicazione: (2025)
di: Peng, Shangpin, et al.
Pubblicazione: (2025)
Is Extending Modality The Right Path Towards Omni-Modality?
di: Zhu, Tinghui, et al.
Pubblicazione: (2025)
di: Zhu, Tinghui, et al.
Pubblicazione: (2025)
MCM-DPO: Multifaceted Cross-Modal Direct Preference Optimization for Alt-text Generation
di: Fu, Jinlan, et al.
Pubblicazione: (2025)
di: Fu, Jinlan, et al.
Pubblicazione: (2025)
Mitigating Hallucination in Multimodal Large Language Model via Hallucination-targeted Direct Preference Optimization
di: Fu, Yuhan, et al.
Pubblicazione: (2024)
di: Fu, Yuhan, et al.
Pubblicazione: (2024)
FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs
di: Chen, Qian, et al.
Pubblicazione: (2026)
di: Chen, Qian, et al.
Pubblicazione: (2026)
e5-omni: Explicit Cross-modal Alignment for Omni-modal Embeddings
di: Chen, Haonan, et al.
Pubblicazione: (2026)
di: Chen, Haonan, et al.
Pubblicazione: (2026)
Beyond Hallucinations: Enhancing LVLMs through Hallucination-Aware Direct Preference Optimization
di: Zhao, Zhiyuan, et al.
Pubblicazione: (2023)
di: Zhao, Zhiyuan, et al.
Pubblicazione: (2023)
RoboOmni: Proactive Robot Manipulation in Omni-modal Context
di: Wang, Siyin, et al.
Pubblicazione: (2025)
di: Wang, Siyin, et al.
Pubblicazione: (2025)
Mitigating Hallucinations in Large Vision-Language Models via Entity-Centric Multimodal Preference Optimization
di: Wu, Jiulong, et al.
Pubblicazione: (2025)
di: Wu, Jiulong, et al.
Pubblicazione: (2025)
InpaintDPO: Mitigating Spatial Relationship Hallucinations in Foreground-conditioned Inpainting via Diverse Preference Optimization
di: Li, Qirui, et al.
Pubblicazione: (2025)
di: Li, Qirui, et al.
Pubblicazione: (2025)
OmniGAIA: Towards Native Omni-Modal AI Agents
di: Li, Xiaoxi, et al.
Pubblicazione: (2026)
di: Li, Xiaoxi, et al.
Pubblicazione: (2026)
Modality Bias in LVLMs: Analyzing and Mitigating Object Hallucination via Attention Lens
di: Zheng, Haohan, et al.
Pubblicazione: (2025)
di: Zheng, Haohan, et al.
Pubblicazione: (2025)
Cross-Modal Attention Calibration for LVLM Hallucination Mitigation
di: Li, Jiaming, et al.
Pubblicazione: (2025)
di: Li, Jiaming, et al.
Pubblicazione: (2025)
mDPO: Conditional Preference Optimization for Multimodal Large Language Models
di: Wang, Fei, et al.
Pubblicazione: (2024)
di: Wang, Fei, et al.
Pubblicazione: (2024)
Systematic Reward Gap Optimization for Mitigating VLM Hallucinations
di: He, Lehan, et al.
Pubblicazione: (2024)
di: He, Lehan, et al.
Pubblicazione: (2024)
Ex-Omni: Enabling 3D Facial Animation Generation for Omni-modal Large Language Models
di: Zhang, Haoyu, et al.
Pubblicazione: (2026)
di: Zhang, Haoyu, et al.
Pubblicazione: (2026)
BiasDPO: Mitigating Bias in Language Models through Direct Preference Optimization
di: Allam, Ahmed
Pubblicazione: (2024)
di: Allam, Ahmed
Pubblicazione: (2024)
HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context
di: Yang, Qize, et al.
Pubblicazione: (2025)
di: Yang, Qize, et al.
Pubblicazione: (2025)
What if...?: Thinking Counterfactual Keywords Helps to Mitigate Hallucination in Large Multi-modal Models
di: Kim, Junho, et al.
Pubblicazione: (2024)
di: Kim, Junho, et al.
Pubblicazione: (2024)
X-InstructBLIP: A Framework for aligning X-Modal instruction-aware representations to LLMs and Emergent Cross-modal Reasoning
di: Panagopoulou, Artemis, et al.
Pubblicazione: (2023)
di: Panagopoulou, Artemis, et al.
Pubblicazione: (2023)
Sandboxed Coding Agents are Competitive Omni-modal Task Solvers
di: Chen, Dongping, et al.
Pubblicazione: (2026)
di: Chen, Dongping, et al.
Pubblicazione: (2026)
LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning
di: Dai, Yifan, et al.
Pubblicazione: (2026)
di: Dai, Yifan, et al.
Pubblicazione: (2026)
Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual Embeddings
di: Agrawal, Aakriti, et al.
Pubblicazione: (2025)
di: Agrawal, Aakriti, et al.
Pubblicazione: (2025)
OmniVinci: Enhancing Architecture and Data for Omni-Modal Understanding LLM
di: Ye, Hanrong, et al.
Pubblicazione: (2025)
di: Ye, Hanrong, et al.
Pubblicazione: (2025)
Daily-Omni: Towards Audio-Visual Reasoning with Temporal Alignment across Modalities
di: Zhou, Ziwei, et al.
Pubblicazione: (2025)
di: Zhou, Ziwei, et al.
Pubblicazione: (2025)
V-DPO: Mitigating Hallucination in Large Vision Language Models via Vision-Guided Direct Preference Optimization
di: Xie, Yuxi, et al.
Pubblicazione: (2024)
di: Xie, Yuxi, et al.
Pubblicazione: (2024)
Diving into Mitigating Hallucinations from a Vision Perspective for Large Vision-Language Models
di: Wang, Weihang, et al.
Pubblicazione: (2025)
di: Wang, Weihang, et al.
Pubblicazione: (2025)
Can VLMs Recall Factual Associations From Visual References?
di: Ashok, Dhananjay, et al.
Pubblicazione: (2025)
di: Ashok, Dhananjay, et al.
Pubblicazione: (2025)
Mitigating Hallucinations in Large Vision-Language Models by Self-Injecting Hallucinations
di: Lu, Yifan, et al.
Pubblicazione: (2025)
di: Lu, Yifan, et al.
Pubblicazione: (2025)
Sem-DPO: Mitigating Semantic Inconsistency in Preference Optimization for Prompt Engineering
di: Mohamed, Anas, et al.
Pubblicazione: (2025)
di: Mohamed, Anas, et al.
Pubblicazione: (2025)
SignDPO: Multi-level Direct Preference Optimisation for Skeleton-based Gloss-free Sign Language Translation
di: Pu, Muxin, et al.
Pubblicazione: (2026)
di: Pu, Muxin, et al.
Pubblicazione: (2026)
Efficient and High-Fidelity Omni Modality Retrieval
di: Huynh, Chuong, et al.
Pubblicazione: (2026)
di: Huynh, Chuong, et al.
Pubblicazione: (2026)
Documenti analoghi
-
AVERE: Improving Audiovisual Emotion Reasoning with Preference Optimization
di: Chaubey, Ashutosh, et al.
Pubblicazione: (2026) -
GDPO-Listener: Expressive Interactive Head Generation via Auto-Regressive Flow Matching and Group reward-Decoupled Policy Optimization
di: Jin, Zhangyu, et al.
Pubblicazione: (2026) -
Do Audio LLMs Listen or Read? Analyzing and Mitigating Paralinguistic Failures with VoxParadox
di: Pang, Jiacheng, et al.
Pubblicazione: (2026) -
Face-LLaVA: Facial Expression and Attribute Understanding through Instruction Tuning
di: Chaubey, Ashutosh, et al.
Pubblicazione: (2025) -
p-MoD: Building Mixture-of-Depths MLLMs via Progressive Ratio Decay
di: Zhang, Jun, et al.
Pubblicazione: (2024)