Do Understanding and Generation Fight? A Diagnostic Study of DPO for Unified Multimodal Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Rao, Abinav, Rachuri, Sujan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Detecting Systematic Weaknesses in Vision Models along Predefined Human-Understandable Dimensions
di: Gannamaneni, Sujan Sai, et al.
Pubblicazione: (2025)
di: Gannamaneni, Sujan Sai, et al.
Pubblicazione: (2025)
Simulating the Real World: A Unified Survey of Multimodal Generative Models
di: Hu, Yuqi, et al.
Pubblicazione: (2025)
di: Hu, Yuqi, et al.
Pubblicazione: (2025)
mDPO: Conditional Preference Optimization for Multimodal Large Language Models
di: Wang, Fei, et al.
Pubblicazione: (2024)
di: Wang, Fei, et al.
Pubblicazione: (2024)
Uni-DPO: A Unified Paradigm for Dynamic Preference Optimization of LLMs
di: Peng, Shangpin, et al.
Pubblicazione: (2025)
di: Peng, Shangpin, et al.
Pubblicazione: (2025)
Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO
di: Tong, Chengzhuo, et al.
Pubblicazione: (2025)
di: Tong, Chengzhuo, et al.
Pubblicazione: (2025)
VideoDPO: Omni-Preference Alignment for Video Diffusion Generation
di: Liu, Runtao, et al.
Pubblicazione: (2024)
di: Liu, Runtao, et al.
Pubblicazione: (2024)
Curriculum-DPO++: Direct Preference Optimization via Data and Model Curricula for Text-to-Image Generation
di: Croitoru, Florinel-Alin, et al.
Pubblicazione: (2026)
di: Croitoru, Florinel-Alin, et al.
Pubblicazione: (2026)
Dual Diffusion for Unified Image Generation and Understanding
di: Li, Zijie, et al.
Pubblicazione: (2024)
di: Li, Zijie, et al.
Pubblicazione: (2024)
Do Language Models Understand Time?
di: Ding, Xi, et al.
Pubblicazione: (2024)
di: Ding, Xi, et al.
Pubblicazione: (2024)
Correct Chains, Wrong Answers: Dissociating Reasoning from Output in LLM Logic
di: Rao, Abinav, et al.
Pubblicazione: (2026)
di: Rao, Abinav, et al.
Pubblicazione: (2026)
Reconstruction Alignment Improves Unified Multimodal Models
di: Xie, Ji, et al.
Pubblicazione: (2025)
di: Xie, Ji, et al.
Pubblicazione: (2025)
Adaptive Diagnostic Reasoning Framework for Pathology with Multimodal Large Language Models
di: Hong, Yunqi, et al.
Pubblicazione: (2025)
di: Hong, Yunqi, et al.
Pubblicazione: (2025)
JoyAI-Image: Awaking Spatial Intelligence in Unified Multimodal Understanding and Generation
di: Song, Lin, et al.
Pubblicazione: (2026)
di: Song, Lin, et al.
Pubblicazione: (2026)
Unified Continuous Generative Models
di: Sun, Peng, et al.
Pubblicazione: (2025)
di: Sun, Peng, et al.
Pubblicazione: (2025)
UniF$^2$ace: A Unified Fine-grained Face Understanding and Generation Model
di: Li, Junzhe, et al.
Pubblicazione: (2025)
di: Li, Junzhe, et al.
Pubblicazione: (2025)
Structure-aware Contrastive Learning for Diagram Understanding of Multimodal Models
di: Sasaki, Hiroshi
Pubblicazione: (2025)
di: Sasaki, Hiroshi
Pubblicazione: (2025)
See, Hear, and Understand: Benchmarking Audiovisual Human Speech Understanding in Multimodal Large Language Models
di: Nguyen, Le Thien Phuc, et al.
Pubblicazione: (2025)
di: Nguyen, Le Thien Phuc, et al.
Pubblicazione: (2025)
UniGame: Turning a Unified Multimodal Model Into Its Own Adversary
di: Su, Zhaolong, et al.
Pubblicazione: (2025)
di: Su, Zhaolong, et al.
Pubblicazione: (2025)
Understanding the Role of Hallucination in Reinforcement Post-Training of Multimodal Reasoning Models
di: Zhang, Gengwei, et al.
Pubblicazione: (2026)
di: Zhang, Gengwei, et al.
Pubblicazione: (2026)
A Unifying Information-theoretic Perspective on Evaluating Generative Models
di: Fox, Alexis, et al.
Pubblicazione: (2024)
di: Fox, Alexis, et al.
Pubblicazione: (2024)
Better Understanding Differences in Attribution Methods via Systematic Evaluations
di: Rao, Sukrut, et al.
Pubblicazione: (2023)
di: Rao, Sukrut, et al.
Pubblicazione: (2023)
Insight-V++: Towards Advanced Long-Chain Visual Reasoning with Multimodal Large Language Models
di: Dong, Yuhao, et al.
Pubblicazione: (2026)
di: Dong, Yuhao, et al.
Pubblicazione: (2026)
Circuit Tracing in Vision-Language Models: Understanding the Internal Mechanisms of Multimodal Thinking
di: Yang, Jingcheng, et al.
Pubblicazione: (2026)
di: Yang, Jingcheng, et al.
Pubblicazione: (2026)
Unified Multimodal Discrete Diffusion
di: Swerdlow, Alexander, et al.
Pubblicazione: (2025)
di: Swerdlow, Alexander, et al.
Pubblicazione: (2025)
RS-DPO: A Hybrid Rejection Sampling and Direct Preference Optimization Method for Alignment of Large Language Models
di: Khaki, Saeed, et al.
Pubblicazione: (2024)
di: Khaki, Saeed, et al.
Pubblicazione: (2024)
PhysMoDPO: Physically-Plausible Humanoid Motion with Preference Optimization
di: Zhang, Yangsong, et al.
Pubblicazione: (2026)
di: Zhang, Yangsong, et al.
Pubblicazione: (2026)
UniT: Unified Multimodal Chain-of-Thought Test-time Scaling
di: Chen, Leon Liangyu, et al.
Pubblicazione: (2026)
di: Chen, Leon Liangyu, et al.
Pubblicazione: (2026)
Advancing Conversational Diagnostic AI with Multimodal Reasoning
di: Saab, Khaled, et al.
Pubblicazione: (2025)
di: Saab, Khaled, et al.
Pubblicazione: (2025)
Studying How to Efficiently and Effectively Guide Models with Explanations
di: Rao, Sukrut, et al.
Pubblicazione: (2023)
di: Rao, Sukrut, et al.
Pubblicazione: (2023)
Understanding Multimodal Deep Neural Networks: A Concept Selection View
di: Shang, Chenming, et al.
Pubblicazione: (2024)
di: Shang, Chenming, et al.
Pubblicazione: (2024)
ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement
di: Rao, Zhefan, et al.
Pubblicazione: (2024)
di: Rao, Zhefan, et al.
Pubblicazione: (2024)
SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding
di: Chen, Zhen, et al.
Pubblicazione: (2025)
di: Chen, Zhen, et al.
Pubblicazione: (2025)
AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling
di: Zhan, Jun, et al.
Pubblicazione: (2024)
di: Zhan, Jun, et al.
Pubblicazione: (2024)
Orion: A Unified Visual Agent for Multimodal Perception, Advanced Visual Reasoning and Execution
di: Reddy, N Dinesh, et al.
Pubblicazione: (2025)
di: Reddy, N Dinesh, et al.
Pubblicazione: (2025)
TIGeR: Unifying Text-to-Image Generation and Retrieval with Large Multimodal Models
di: Qu, Leigang, et al.
Pubblicazione: (2024)
di: Qu, Leigang, et al.
Pubblicazione: (2024)
A Unified and General Framework for Continual Learning
di: Wang, Zhenyi, et al.
Pubblicazione: (2024)
di: Wang, Zhenyi, et al.
Pubblicazione: (2024)
Filtered Posterior Mean Collections: A Unified Framework for Analytical Models of Diffusion Generalization
di: Niedoba, Matthew, et al.
Pubblicazione: (2026)
di: Niedoba, Matthew, et al.
Pubblicazione: (2026)
Latent Zoning Network: A Unified Principle for Generative Modeling, Representation Learning, and Classification
di: Lin, Zinan, et al.
Pubblicazione: (2025)
di: Lin, Zinan, et al.
Pubblicazione: (2025)
UniFusion: Vision-Language Model as Unified Encoder in Image Generation
di: Li, Kevin, et al.
Pubblicazione: (2025)
di: Li, Kevin, et al.
Pubblicazione: (2025)
Towards Equitable ASD Diagnostics: A Comparative Study of Machine and Deep Learning Models Using Behavioral and Facial Data
di: Aledhari, Mohammed, et al.
Pubblicazione: (2024)
di: Aledhari, Mohammed, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Detecting Systematic Weaknesses in Vision Models along Predefined Human-Understandable Dimensions
di: Gannamaneni, Sujan Sai, et al.
Pubblicazione: (2025) -
Simulating the Real World: A Unified Survey of Multimodal Generative Models
di: Hu, Yuqi, et al.
Pubblicazione: (2025) -
mDPO: Conditional Preference Optimization for Multimodal Large Language Models
di: Wang, Fei, et al.
Pubblicazione: (2024) -
Uni-DPO: A Unified Paradigm for Dynamic Preference Optimization of LLMs
di: Peng, Shangpin, et al.
Pubblicazione: (2025) -
Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO
di: Tong, Chengzhuo, et al.
Pubblicazione: (2025)