Understanding vs. Generation: Navigating Optimization Dilemma in Multimodal Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Ye, Sen, Xu, Mengde, Gu, Shuyang, He, Di, Wang, Liwei, Hu, Han |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Distribution Matching Variational AutoEncoder
di: Ye, Sen, et al.
Pubblicazione: (2025)
di: Ye, Sen, et al.
Pubblicazione: (2025)
Tokenize Image as a Set
di: Geng, Zigang, et al.
Pubblicazione: (2025)
di: Geng, Zigang, et al.
Pubblicazione: (2025)
LarvSeg: Exploring Image Classification Data For Large Vocabulary Semantic Segmentation via Category-wise Attentive Classifier
di: Yu, Haojun, et al.
Pubblicazione: (2025)
di: Yu, Haojun, et al.
Pubblicazione: (2025)
GenArena: How Can We Achieve Human-Aligned Evaluation for Visual Generation Tasks?
di: Li, Ruihang, et al.
Pubblicazione: (2026)
di: Li, Ruihang, et al.
Pubblicazione: (2026)
TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation
di: Qu, Liao, et al.
Pubblicazione: (2024)
di: Qu, Liao, et al.
Pubblicazione: (2024)
Equivariant Image Modeling
di: Dong, Ruixiao, et al.
Pubblicazione: (2025)
di: Dong, Ruixiao, et al.
Pubblicazione: (2025)
NextFlow: Unified Sequential Modeling Activates Multimodal Understanding and Generation
di: Zhang, Huichao, et al.
Pubblicazione: (2026)
di: Zhang, Huichao, et al.
Pubblicazione: (2026)
Can Multimodal Large Language Models Truly Understand Small Objects?
di: Han, Fujun, et al.
Pubblicazione: (2026)
di: Han, Fujun, et al.
Pubblicazione: (2026)
Towards Learning a Generalist Model for Embodied Navigation
di: Zheng, Duo, et al.
Pubblicazione: (2023)
di: Zheng, Duo, et al.
Pubblicazione: (2023)
UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding
di: Xu, Chenkai, et al.
Pubblicazione: (2025)
di: Xu, Chenkai, et al.
Pubblicazione: (2025)
Steering Visual Generation in Unified Multimodal Models with Understanding Supervision
di: Liu, Zeyu, et al.
Pubblicazione: (2026)
di: Liu, Zeyu, et al.
Pubblicazione: (2026)
Evaluating Compositional Scene Understanding in Multimodal Generative Models
di: Fu, Shuhao, et al.
Pubblicazione: (2025)
di: Fu, Shuhao, et al.
Pubblicazione: (2025)
Understanding and Harnessing Sparsity in Unified Multimodal Models
di: He, Shwai, et al.
Pubblicazione: (2025)
di: He, Shwai, et al.
Pubblicazione: (2025)
UniEval: Unified Holistic Evaluation for Unified Multimodal Understanding and Generation
di: Li, Yi, et al.
Pubblicazione: (2025)
di: Li, Yi, et al.
Pubblicazione: (2025)
ARMOR: Empowering Multimodal Understanding Model with Interleaved Multimodal Generation Capability
di: Sun, Jianwen, et al.
Pubblicazione: (2025)
di: Sun, Jianwen, et al.
Pubblicazione: (2025)
Diagnosing and Improving Diffusion Models by Estimating the Optimal Loss Value
di: Xu, Yixian, et al.
Pubblicazione: (2025)
di: Xu, Yixian, et al.
Pubblicazione: (2025)
Photon: Speedup Volume Understanding with Efficient Multimodal Large Language Models
di: Fang, Chengyu, et al.
Pubblicazione: (2026)
di: Fang, Chengyu, et al.
Pubblicazione: (2026)
SemHiTok: A Unified Image Tokenizer via Semantic-Guided Hierarchical Codebook for Multimodal Understanding and Generation
di: Chen, Zisheng, et al.
Pubblicazione: (2025)
di: Chen, Zisheng, et al.
Pubblicazione: (2025)
USV: Towards Understanding the User-generated Short-form Videos
di: Cheng, Haoyue, et al.
Pubblicazione: (2026)
di: Cheng, Haoyue, et al.
Pubblicazione: (2026)
Apollo: An Exploration of Video Understanding in Large Multimodal Models
di: Zohar, Orr, et al.
Pubblicazione: (2024)
di: Zohar, Orr, et al.
Pubblicazione: (2024)
LMGenDrive: Bridging Multimodal Understanding and Generative World Modeling for End-to-End Driving
di: Shao, Hao, et al.
Pubblicazione: (2026)
di: Shao, Hao, et al.
Pubblicazione: (2026)
Improved Noise Schedule for Diffusion Training
di: Hang, Tiankai, et al.
Pubblicazione: (2024)
di: Hang, Tiankai, et al.
Pubblicazione: (2024)
Luminark: Training-free, Probabilistically-Certified Watermarking for General Vision Generative Models
di: Xu, Jiayi, et al.
Pubblicazione: (2026)
di: Xu, Jiayi, et al.
Pubblicazione: (2026)
Learning to Retrieve Navigable Candidates for Efficient Vision-and-Language Navigation
di: Gu, Shutian, et al.
Pubblicazione: (2026)
di: Gu, Shutian, et al.
Pubblicazione: (2026)
Schrödinger's Navigator: Imagining an Ensemble of Futures for Zero-Shot Object Navigation
di: He, Yu, et al.
Pubblicazione: (2025)
di: He, Yu, et al.
Pubblicazione: (2025)
EmoTrans: A Benchmark for Understanding, Reasoning, and Predicting Emotion Transitions in Multimodal LLMs
di: Hu, He, et al.
Pubblicazione: (2026)
di: Hu, He, et al.
Pubblicazione: (2026)
VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding
di: Zhang, Zhihong, et al.
Pubblicazione: (2025)
di: Zhang, Zhihong, et al.
Pubblicazione: (2025)
HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation
di: Xiao, Yicheng, et al.
Pubblicazione: (2025)
di: Xiao, Yicheng, et al.
Pubblicazione: (2025)
Unleashing the Intrinsic Visual Representation Capability of Multimodal Large Language Models
di: Li, Hengzhuang, et al.
Pubblicazione: (2025)
di: Li, Hengzhuang, et al.
Pubblicazione: (2025)
Direct Preference Optimization of Video Large Multimodal Models from Language Model Reward
di: Zhang, Ruohong, et al.
Pubblicazione: (2024)
di: Zhang, Ruohong, et al.
Pubblicazione: (2024)
Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation
di: Xu, Zhiyang, et al.
Pubblicazione: (2025)
di: Xu, Zhiyang, et al.
Pubblicazione: (2025)
MOSABench: Multi-Object Sentiment Analysis Benchmark for Evaluating Multimodal Large Language Models Understanding of Complex Image
di: Song, Shezheng, et al.
Pubblicazione: (2024)
di: Song, Shezheng, et al.
Pubblicazione: (2024)
COEF-VQ: Cost-Efficient Video Quality Understanding through a Cascaded Multimodal LLM Framework
di: Dong, Xin, et al.
Pubblicazione: (2024)
di: Dong, Xin, et al.
Pubblicazione: (2024)
General Scene Adaptation for Vision-and-Language Navigation
di: Hong, Haodong, et al.
Pubblicazione: (2025)
di: Hong, Haodong, et al.
Pubblicazione: (2025)
UniSVG: A Unified Dataset for Vector Graphic Understanding and Generation with Multimodal Large Language Models
di: Li, Jinke, et al.
Pubblicazione: (2025)
di: Li, Jinke, et al.
Pubblicazione: (2025)
Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction
di: Tian, Keyu, et al.
Pubblicazione: (2024)
di: Tian, Keyu, et al.
Pubblicazione: (2024)
Semantic Localization Guiding Segment Anything Model For Reference Remote Sensing Image Segmentation
di: Li, Shuyang, et al.
Pubblicazione: (2025)
di: Li, Shuyang, et al.
Pubblicazione: (2025)
Octopus: Agentic Multimodal Reasoning with Six-Capability Orchestration
di: Guo, Yifu, et al.
Pubblicazione: (2025)
di: Guo, Yifu, et al.
Pubblicazione: (2025)
GoViG: Goal-Conditioned Visual Navigation Instruction Generation via Multimodal Reasoning
di: Wu, Fengyi, et al.
Pubblicazione: (2025)
di: Wu, Fengyi, et al.
Pubblicazione: (2025)
Response-G1: Explicit Scene Graph Modeling for Proactive Streaming Video Understanding
di: Ma, Ke, et al.
Pubblicazione: (2026)
di: Ma, Ke, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Distribution Matching Variational AutoEncoder
di: Ye, Sen, et al.
Pubblicazione: (2025) -
Tokenize Image as a Set
di: Geng, Zigang, et al.
Pubblicazione: (2025) -
LarvSeg: Exploring Image Classification Data For Large Vocabulary Semantic Segmentation via Category-wise Attentive Classifier
di: Yu, Haojun, et al.
Pubblicazione: (2025) -
GenArena: How Can We Achieve Human-Aligned Evaluation for Visual Generation Tasks?
di: Li, Ruihang, et al.
Pubblicazione: (2026) -
TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation
di: Qu, Liao, et al.
Pubblicazione: (2024)