OmniDPO: A Preference Optimization Framework to Address Omni-Modal Hallucination
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Junzhe, Zhang, Tianshu, Huang, Shiyu, Niu, Yuwei, Sun, Chao, Zhang, Rongzhou, Zhou, Guanyu, Wen, Lijie, Hu, Xuming |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
V2A-DPO: Omni-Preference Optimization for Video-to-Audio Generation
par: Chan, Nolan, et autres
Publié: (2026)
par: Chan, Nolan, et autres
Publié: (2026)
OmniTrace: A Unified Framework for Generation-Time Attribution in Omni-Modal LLMs
par: Yan, Qianqi, et autres
Publié: (2026)
par: Yan, Qianqi, et autres
Publié: (2026)
OmniSep: Unified Omni-Modality Sound Separation with Query-Mixup
par: Cheng, Xize, et autres
Publié: (2024)
par: Cheng, Xize, et autres
Publié: (2024)
ICT: Image-Object Cross-Level Trusted Intervention for Mitigating Object Hallucination in Large Vision-Language Models
par: Chen, Junzhe, et autres
Publié: (2024)
par: Chen, Junzhe, et autres
Publié: (2024)
OmniGAIA: Towards Native Omni-Modal AI Agents
par: Li, Xiaoxi, et autres
Publié: (2026)
par: Li, Xiaoxi, et autres
Publié: (2026)
OmnixR: Evaluating Omni-modality Language Models on Reasoning across Modalities
par: Chen, Lichang, et autres
Publié: (2024)
par: Chen, Lichang, et autres
Publié: (2024)
AVID: A Benchmark for Omni-Modal Audio-Visual Inconsistency Understanding via Agent-Driven Construction
par: Chen, Zixuan, et autres
Publié: (2026)
par: Chen, Zixuan, et autres
Publié: (2026)
FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs
par: Chen, Qian, et autres
Publié: (2026)
par: Chen, Qian, et autres
Publié: (2026)
Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation
par: Chen, Yuheng, et autres
Publié: (2026)
par: Chen, Yuheng, et autres
Publié: (2026)
Lyra: An Efficient and Speech-Centric Framework for Omni-Cognition
par: Zhong, Zhisheng, et autres
Publié: (2024)
par: Zhong, Zhisheng, et autres
Publié: (2024)
Boosting Omni-Modal Language Models: Staged Post-Training with Visually Debiased Evaluation
par: Liu, Che, et autres
Publié: (2026)
par: Liu, Che, et autres
Publié: (2026)
LongInsightBench: A Comprehensive Benchmark for Evaluating Omni-Modal Models on Human-Centric Long-Video Understanding
par: Han, ZhaoYang, et autres
Publié: (2025)
par: Han, ZhaoYang, et autres
Publié: (2025)
ChronusOmni: Improving Time Awareness of Omni Large Language Models
par: Chen, Yijing, et autres
Publié: (2025)
par: Chen, Yijing, et autres
Publié: (2025)
Omni-Captioner: Data Pipeline, Models, and Benchmark for Omni Detailed Perception
par: Ma, Ziyang, et autres
Publié: (2025)
par: Ma, Ziyang, et autres
Publié: (2025)
FashionDPO:Fine-tune Fashion Outfit Generation Model using Direct Preference Optimization
par: Yu, Mingzhe, et autres
Publié: (2025)
par: Yu, Mingzhe, et autres
Publié: (2025)
Ola: Pushing the Frontiers of Omni-Modal Language Model
par: Liu, Zuyan, et autres
Publié: (2025)
par: Liu, Zuyan, et autres
Publié: (2025)
OralGPT-Omni: A Versatile Dental Multimodal Large Language Model
par: Hao, Jing, et autres
Publié: (2025)
par: Hao, Jing, et autres
Publié: (2025)
OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows
par: Li, Shufan, et autres
Publié: (2024)
par: Li, Shufan, et autres
Publié: (2024)
Multi-view Hypergraph-based Contrastive Learning Model for Cold-Start Micro-video Recommendation
par: Lyu, Sisuo, et autres
Publié: (2024)
par: Lyu, Sisuo, et autres
Publié: (2024)
MGM-Omni: Scaling Omni LLMs to Personalized Long-Horizon Speech
par: Wang, Chengyao, et autres
Publié: (2025)
par: Wang, Chengyao, et autres
Publié: (2025)
AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues
par: Zhou, Dingkun, et autres
Publié: (2025)
par: Zhou, Dingkun, et autres
Publié: (2025)
Explore the Limits of Omni-modal Pretraining at Scale
par: Zhang, Yiyuan, et autres
Publié: (2024)
par: Zhang, Yiyuan, et autres
Publié: (2024)
Nexus: An Omni-Perceptive And -Interactive Model for Language, Audio, And Vision
par: Liu, Che, et autres
Publié: (2025)
par: Liu, Che, et autres
Publié: (2025)
OmniEvalKit: A Modular, Lightweight Toolbox for Evaluating Large Language Model and its Omni-Extensions
par: Zhang, Yi-Kai, et autres
Publié: (2024)
par: Zhang, Yi-Kai, et autres
Publié: (2024)
LongVALE: Vision-Audio-Language-Event Benchmark Towards Time-Aware Omni-Modal Perception of Long Videos
par: Geng, Tiantian, et autres
Publié: (2024)
par: Geng, Tiantian, et autres
Publié: (2024)
Omni-Dish: Photorealistic and Faithful Image Generation and Editing for Arbitrary Chinese Dishes
par: Liu, Huijie, et autres
Publié: (2025)
par: Liu, Huijie, et autres
Publié: (2025)
LongCat-Flash-Omni Technical Report
par: Meituan LongCat Team, et autres
Publié: (2025)
par: Meituan LongCat Team, et autres
Publié: (2025)
Omni-C: Compressing Heterogeneous Modalities into a Single Dense Encoder
par: Lau, Kin Wai, et autres
Publié: (2026)
par: Lau, Kin Wai, et autres
Publié: (2026)
Rethinking Fusion: Disentangled Learning of Shared and Modality-Specific Information for Stance Detection
par: Xie, Zhiyu, et autres
Publié: (2026)
par: Xie, Zhiyu, et autres
Publié: (2026)
OmniMER: Auxiliary-Enhanced LLM Adaptation for Indonesian Multimodal Emotion Recognition
par: Yan, Xueming, et autres
Publié: (2025)
par: Yan, Xueming, et autres
Publié: (2025)
Omni2Sound: Towards Unified Video-Text-to-Audio Generation
par: Dai, Yusheng, et autres
Publié: (2026)
par: Dai, Yusheng, et autres
Publié: (2026)
OmniForcing: Unleashing Real-time Joint Audio-Visual Generation
par: Su, Yaofeng, et autres
Publié: (2026)
par: Su, Yaofeng, et autres
Publié: (2026)
OmniPlay: Benchmarking Omni-Modal Models on Omni-Modal Game Playing
par: Bie, Fuqing, et autres
Publié: (2025)
par: Bie, Fuqing, et autres
Publié: (2025)
CDIO: Cross-Domain Inference Optimization with Resource Preference Prediction for Edge-Cloud Collaboration
par: Yang, Zheming, et autres
Publié: (2025)
par: Yang, Zheming, et autres
Publié: (2025)
OmniScript: Towards Audio-Visual Script Generation for Long-Form Cinematic Video
par: Pu, Junfu, et autres
Publié: (2026)
par: Pu, Junfu, et autres
Publié: (2026)
OmniCustom: Sync Audio-Video Customization Via Joint Audio-Video Generation Model
par: Li, Maomao, et autres
Publié: (2026)
par: Li, Maomao, et autres
Publié: (2026)
OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text
par: Pian, Weiguo, et autres
Publié: (2026)
par: Pian, Weiguo, et autres
Publié: (2026)
Mitigating Hallucination in Multimodal Large Language Model via Hallucination-targeted Direct Preference Optimization
par: Fu, Yuhan, et autres
Publié: (2024)
par: Fu, Yuhan, et autres
Publié: (2024)
TMDC: A Two-Stage Modality Denoising and Complementation Framework for Multimodal Sentiment Analysis with Missing and Noisy Modalities
par: Zhuang, Yan, et autres
Publié: (2025)
par: Zhuang, Yan, et autres
Publié: (2025)
Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing
par: Tian, Zeyue, et autres
Publié: (2026)
par: Tian, Zeyue, et autres
Publié: (2026)
Documents similaires
-
V2A-DPO: Omni-Preference Optimization for Video-to-Audio Generation
par: Chan, Nolan, et autres
Publié: (2026) -
OmniTrace: A Unified Framework for Generation-Time Attribution in Omni-Modal LLMs
par: Yan, Qianqi, et autres
Publié: (2026) -
OmniSep: Unified Omni-Modality Sound Separation with Query-Mixup
par: Cheng, Xize, et autres
Publié: (2024) -
ICT: Image-Object Cross-Level Trusted Intervention for Mitigating Object Hallucination in Large Vision-Language Models
par: Chen, Junzhe, et autres
Publié: (2024) -
OmniGAIA: Towards Native Omni-Modal AI Agents
par: Li, Xiaoxi, et autres
Publié: (2026)