Unified Multimodal Understanding and Generation Models: Advances, Challenges, and Opportunities
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhao, Shanshan, Zhang, Xinjie, Guo, Jintao, Hu, Jiakui, Duan, Lunhao, Fu, Minghao, Chng, Yong Xien, Wang, Guo-Hua, Chen, Qing-Guo, Xu, Zhao, Luo, Weihua, Zhang, Kaifu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Scaling Beyond Context: A Survey of Multimodal Retrieval-Augmented Generation for Document Understanding
par: Gao, Sensen, et autres
Publié: (2025)
par: Gao, Sensen, et autres
Publié: (2025)
UNIC-Adapter: Unified Image-instruction Adapter with Multi-modal Transformer for Image Generation
par: Duan, Lunhao, et autres
Publié: (2024)
par: Duan, Lunhao, et autres
Publié: (2024)
Diffusion-SDPO: Safeguarded Direct Preference Optimization for Diffusion Models
par: Fu, Minghao, et autres
Publié: (2025)
par: Fu, Minghao, et autres
Publié: (2025)
CHATS: Combining Human-Aligned Optimization and Test-Time Sampling for Text-to-Image Generation
par: Fu, Minghao, et autres
Publié: (2025)
par: Fu, Minghao, et autres
Publié: (2025)
TeEFusion: Blending Text Embeddings to Distill Classifier-Free Guidance
par: Fu, Minghao, et autres
Publié: (2025)
par: Fu, Minghao, et autres
Publié: (2025)
Ovis-U1 Technical Report
par: Wang, Guo-Hua, et autres
Publié: (2025)
par: Wang, Guo-Hua, et autres
Publié: (2025)
Omni-View: Unlocking How Generation Facilitates Understanding in Unified 3D Model based on Multiview images
par: Hu, JiaKui, et autres
Publié: (2025)
par: Hu, JiaKui, et autres
Publié: (2025)
SPACE: Noise Contrastive Estimation Stabilizes Self-Play Fine-Tuning for Large Language Models
par: Wang, Yibo, et autres
Publié: (2025)
par: Wang, Yibo, et autres
Publié: (2025)
Ovis: Structural Embedding Alignment for Multimodal Large Language Model
par: Lu, Shiyin, et autres
Publié: (2024)
par: Lu, Shiyin, et autres
Publié: (2024)
Evaluating Image Caption via Cycle-consistent Text-to-Image Generation
par: Cui, Tianyu, et autres
Publié: (2025)
par: Cui, Tianyu, et autres
Publié: (2025)
Advancing Tool-Augmented Large Language Models: Integrating Insights from Errors in Inference Trees
par: Chen, Sijia, et autres
Publié: (2024)
par: Chen, Sijia, et autres
Publié: (2024)
Triplets Better Than Pairs: Towards Stable and Effective Self-Play Fine-Tuning for LLMs
par: Wang, Yibo, et autres
Publié: (2026)
par: Wang, Yibo, et autres
Publié: (2026)
Deep But Reliable: Advancing Multi-turn Reasoning for Thinking with Images
par: Yang, Wenhao, et autres
Publié: (2025)
par: Yang, Wenhao, et autres
Publié: (2025)
High-quality Pseudo-labeling for Point Cloud Segmentation with Scene-level Annotation
par: Duan, Lunhao, et autres
Publié: (2025)
par: Duan, Lunhao, et autres
Publié: (2025)
Local-consistent Transformation Learning for Rotation-invariant Point Cloud Analysis
par: Chen, Yiyang, et autres
Publié: (2024)
par: Chen, Yiyang, et autres
Publié: (2024)
Harnessing Text-to-Image Diffusion Models for Point Cloud Self-Supervised Learning
par: Chen, Yiyang, et autres
Publié: (2025)
par: Chen, Yiyang, et autres
Publié: (2025)
MDP3: A Training-free Approach for List-wise Frame Selection in Video-LLMs
par: Sun, Hui, et autres
Publié: (2025)
par: Sun, Hui, et autres
Publié: (2025)
Wings: Learning Multimodal LLMs without Text-only Forgetting
par: Zhang, Yi-Kai, et autres
Publié: (2024)
par: Zhang, Yi-Kai, et autres
Publié: (2024)
MMCR: Advancing Visual Language Model in Multimodal Multi-Turn Contextual Reasoning
par: Yan, Dawei, et autres
Publié: (2025)
par: Yan, Dawei, et autres
Publié: (2025)
Multimodal Tabular Reasoning with Privileged Structured Information
par: Jiang, Jun-Peng, et autres
Publié: (2025)
par: Jiang, Jun-Peng, et autres
Publié: (2025)
Building Autonomous GUI Navigation via Agentic-Q Estimation and Step-Wise Policy Optimization
par: Wang, Yibo, et autres
Publié: (2026)
par: Wang, Yibo, et autres
Publié: (2026)
Challenging Multilingual LLMs: A New Taxonomy and Benchmark for Unraveling Hallucination in Translation
par: Wu, Xinwei, et autres
Publié: (2025)
par: Wu, Xinwei, et autres
Publié: (2025)
Walk the Talk: Bridging the Reasoning-Action Gap for Thinking with Images via Multimodal Agentic Policy Optimization
par: Yang, Wenhao, et autres
Publié: (2026)
par: Yang, Wenhao, et autres
Publié: (2026)
New Trends for Modern Machine Translation with Large Reasoning Models
par: Liu, Sinuo, et autres
Publié: (2025)
par: Liu, Sinuo, et autres
Publié: (2025)
(Perhaps) Beyond Human Translation: Harnessing Multi-Agent Collaboration for Translating Ultra-Long Literary Texts
par: Wu, Minghao, et autres
Publié: (2024)
par: Wu, Minghao, et autres
Publié: (2024)
Challenges and Opportunities for Proton Batteries: From Electrodes, Electrolytes to Full‐Cell Applications
par: Sicheng Wu, et autres
Publié: (2024)
par: Sicheng Wu, et autres
Publié: (2024)
Building Decision Making Models Through Language Model Regime
par: Zhang, Yu, et autres
Publié: (2024)
par: Zhang, Yu, et autres
Publié: (2024)
A State-Transition Framework for Efficient LLM Reasoning
par: Zhang, Liang, et autres
Publié: (2026)
par: Zhang, Liang, et autres
Publié: (2026)
Opportunity and Challenge of Advanced Porous Sorbents for PFAS Removal
par: Zhuozhi Lai, et autres
Publié: (2024)
par: Zhuozhi Lai, et autres
Publié: (2024)
MECap-R1: Emotion-aware Policy with Reinforcement Learning for Multimodal Emotion Captioning
par: Sun, Haoqin, et autres
Publié: (2025)
par: Sun, Haoqin, et autres
Publié: (2025)
Mask Grounding for Referring Image Segmentation
par: Chng, Yong Xien, et autres
Publié: (2023)
par: Chng, Yong Xien, et autres
Publié: (2023)
Active Visual Perception: Opportunities and Challenges
par: Li, Yian, et autres
Publié: (2025)
par: Li, Yian, et autres
Publié: (2025)
The Rise of Multivalent Metal–Sulfur Batteries: Advances, Challenges, and Opportunities
par: Jing Zhao, et autres
Publié: (2024)
par: Jing Zhao, et autres
Publié: (2024)
Circularly polarized metasurface antenna based on characteristic mode analysis for microwave energy harvesting
par: Weihua Hui, et autres
Publié: (2024)
par: Weihua Hui, et autres
Publié: (2024)
The Bitter Lesson Learned from 2,000+ Multilingual Benchmarks
par: Wu, Minghao, et autres
Publié: (2025)
par: Wu, Minghao, et autres
Publié: (2025)
LongSpeech: A Scalable Benchmark for Transcription, Translation and Understanding in Long Speech
par: Yang, Fei, et autres
Publié: (2026)
par: Yang, Fei, et autres
Publié: (2026)
Indoloquinoline Alkaloids as Antimalarials: Advances, Challenges, and Opportunities
par: Prakash T. Parvatkar, et autres
Publié: (2024)
par: Prakash T. Parvatkar, et autres
Publié: (2024)
Active RIS Enabled NLoS LEO Satellite Communications: A Three-timescale Optimization Framework
par: Liu, Ziwei, et autres
Publié: (2025)
par: Liu, Ziwei, et autres
Publié: (2025)
CLEAR: Unlocking Generative Potential for Degraded Image Understanding in Unified Multimodal Models
par: Hao, Xiangzhao, et autres
Publié: (2026)
par: Hao, Xiangzhao, et autres
Publié: (2026)
A Scenario-Oriented Survey of Federated Recommender Systems: Techniques, Challenges, and Future Directions
par: Mi, Yunqi, et autres
Publié: (2025)
par: Mi, Yunqi, et autres
Publié: (2025)
Documents similaires
-
Scaling Beyond Context: A Survey of Multimodal Retrieval-Augmented Generation for Document Understanding
par: Gao, Sensen, et autres
Publié: (2025) -
UNIC-Adapter: Unified Image-instruction Adapter with Multi-modal Transformer for Image Generation
par: Duan, Lunhao, et autres
Publié: (2024) -
Diffusion-SDPO: Safeguarded Direct Preference Optimization for Diffusion Models
par: Fu, Minghao, et autres
Publié: (2025) -
CHATS: Combining Human-Aligned Optimization and Test-Time Sampling for Text-to-Image Generation
par: Fu, Minghao, et autres
Publié: (2025) -
TeEFusion: Blending Text Embeddings to Distill Classifier-Free Guidance
par: Fu, Minghao, et autres
Publié: (2025)