Planning with Unified Multimodal Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Sun, Yihao, Zhang, Zhilong, Yu, Yang, Bacon, Pierre-Luc |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CLEAR: Unlocking Generative Potential for Degraded Image Understanding in Unified Multimodal Models
di: Hao, Xiangzhao, et al.
Pubblicazione: (2026)
di: Hao, Xiangzhao, et al.
Pubblicazione: (2026)
Omni-Weather: A Unified Multimodal Model for Weather Radar Understanding and Generation
di: Zhou, Zhiwang, et al.
Pubblicazione: (2025)
di: Zhou, Zhiwang, et al.
Pubblicazione: (2025)
MME-Unify: A Comprehensive Benchmark for Unified Multimodal Understanding and Generation Models
di: Xie, Wulin, et al.
Pubblicazione: (2025)
di: Xie, Wulin, et al.
Pubblicazione: (2025)
InternVL-U: Democratizing Unified Multimodal Models for Understanding, Reasoning, Generation and Editing
di: Tian, Changyao, et al.
Pubblicazione: (2026)
di: Tian, Changyao, et al.
Pubblicazione: (2026)
WeGen: A Unified Model for Interactive Multimodal Generation as We Chat
di: Huang, Zhipeng, et al.
Pubblicazione: (2025)
di: Huang, Zhipeng, et al.
Pubblicazione: (2025)
Representation Forcing for Bottleneck-Free Unified Multimodal Models
di: Wang, Yuqing, et al.
Pubblicazione: (2026)
di: Wang, Yuqing, et al.
Pubblicazione: (2026)
MMA: Multimodal Memory Agent
di: Lu, Yihao, et al.
Pubblicazione: (2026)
di: Lu, Yihao, et al.
Pubblicazione: (2026)
Unified Map Prior Encoder for Mapping and Planning
di: Zhang, Zongzheng, et al.
Pubblicazione: (2026)
di: Zhang, Zongzheng, et al.
Pubblicazione: (2026)
Towards Unified Multimodal Editing with Enhanced Knowledge Collaboration
di: Pan, Kaihang, et al.
Pubblicazione: (2024)
di: Pan, Kaihang, et al.
Pubblicazione: (2024)
Mamoda2.5: Enhancing Unified Multimodal Model with DiT-MoE
di: Shi, Yangming, et al.
Pubblicazione: (2026)
di: Shi, Yangming, et al.
Pubblicazione: (2026)
TUNA: Taming Unified Visual Representations for Native Unified Multimodal Models
di: Liu, Zhiheng, et al.
Pubblicazione: (2025)
di: Liu, Zhiheng, et al.
Pubblicazione: (2025)
Learning to Generate via Understanding: Understanding-Driven Intrinsic Rewarding for Unified Multimodal Models
di: Pan, Jiadong, et al.
Pubblicazione: (2026)
di: Pan, Jiadong, et al.
Pubblicazione: (2026)
Exploring Scalable Unified Modeling for General Low-Level Vision
di: Chen, Xiangyu, et al.
Pubblicazione: (2025)
di: Chen, Xiangyu, et al.
Pubblicazione: (2025)
Fully Unified Motion Planning for End-to-End Autonomous Driving
di: Liu, Lin, et al.
Pubblicazione: (2025)
di: Liu, Lin, et al.
Pubblicazione: (2025)
Show-o2: Improved Native Unified Multimodal Models
di: Xie, Jinheng, et al.
Pubblicazione: (2025)
di: Xie, Jinheng, et al.
Pubblicazione: (2025)
Query-Kontext: An Unified Multimodal Model for Image Generation and Editing
di: Song, Yuxin, et al.
Pubblicazione: (2025)
di: Song, Yuxin, et al.
Pubblicazione: (2025)
UniCom: Unified Multimodal Modeling via Compressed Continuous Semantic Representations
di: Zhao, Yaqi, et al.
Pubblicazione: (2026)
di: Zhao, Yaqi, et al.
Pubblicazione: (2026)
Unified Multimodal Models as Auto-Encoders
di: Yan, Zhiyuan, et al.
Pubblicazione: (2025)
di: Yan, Zhiyuan, et al.
Pubblicazione: (2025)
CPath-Omni: A Unified Multimodal Foundation Model for Patch and Whole Slide Image Analysis in Computational Pathology
di: Sun, Yuxuan, et al.
Pubblicazione: (2024)
di: Sun, Yuxuan, et al.
Pubblicazione: (2024)
Customized Visual Storytelling with Unified Multimodal LLMs
di: Li, Wei-Hua, et al.
Pubblicazione: (2026)
di: Li, Wei-Hua, et al.
Pubblicazione: (2026)
UniModel: A Visual-Only Framework for Unified Multimodal Understanding and Generation
di: Zhang, Chi, et al.
Pubblicazione: (2025)
di: Zhang, Chi, et al.
Pubblicazione: (2025)
Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation
di: Zhang, Xiaofeng, et al.
Pubblicazione: (2024)
di: Zhang, Xiaofeng, et al.
Pubblicazione: (2024)
Lumina-OmniLV: A Unified Multimodal Framework for General Low-Level Vision
di: Pu, Yuandong, et al.
Pubblicazione: (2025)
di: Pu, Yuandong, et al.
Pubblicazione: (2025)
Multimodal Data Storage and Retrieval for Embodied AI: A Survey
di: Lu, Yihao, et al.
Pubblicazione: (2025)
di: Lu, Yihao, et al.
Pubblicazione: (2025)
UniAPO: Unified Multimodal Automated Prompt Optimization
di: Zhu, Qipeng, et al.
Pubblicazione: (2025)
di: Zhu, Qipeng, et al.
Pubblicazione: (2025)
Unified Multimodal Understanding and Generation Models: Advances, Challenges, and Opportunities
di: Zhao, Shanshan, et al.
Pubblicazione: (2025)
di: Zhao, Shanshan, et al.
Pubblicazione: (2025)
Unified Reward Model for Multimodal Understanding and Generation
di: Wang, Yibin, et al.
Pubblicazione: (2025)
di: Wang, Yibin, et al.
Pubblicazione: (2025)
InternSVG: Towards Unified SVG Tasks with Multimodal Large Language Models
di: Wang, Haomin, et al.
Pubblicazione: (2025)
di: Wang, Haomin, et al.
Pubblicazione: (2025)
AIA: Rethinking Architecture Decoupling Strategy In Unified Multimodal Model
di: Zheng, Dian, et al.
Pubblicazione: (2025)
di: Zheng, Dian, et al.
Pubblicazione: (2025)
Towards Generalized Multi-Image Editing for Unified Multimodal Models
di: Xu, Pengcheng, et al.
Pubblicazione: (2026)
di: Xu, Pengcheng, et al.
Pubblicazione: (2026)
UniChange: Unifying Change Detection with Multimodal Large Language Model
di: Zhang, Xu, et al.
Pubblicazione: (2025)
di: Zhang, Xu, et al.
Pubblicazione: (2025)
MM-UAVBench: How Well Do Multimodal Large Language Models See, Think, and Plan in Low-Altitude UAV Scenarios?
di: Dai, Shiqi, et al.
Pubblicazione: (2025)
di: Dai, Shiqi, et al.
Pubblicazione: (2025)
How and What to Imagine? Visual Thinking in Unified Multimodal Models for Cross-View Spatial Reasoning
di: Yang, Qian, et al.
Pubblicazione: (2026)
di: Yang, Qian, et al.
Pubblicazione: (2026)
Semantic Generative Tuning for Unified Multimodal Models
di: Yu, Songsong, et al.
Pubblicazione: (2026)
di: Yu, Songsong, et al.
Pubblicazione: (2026)
UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning
di: Mao, Weijia, et al.
Pubblicazione: (2025)
di: Mao, Weijia, et al.
Pubblicazione: (2025)
MICON-Bench: Benchmarking and Enhancing Multi-Image Context Image Generation in Unified Multimodal Models
di: Wu, Mingrui, et al.
Pubblicazione: (2026)
di: Wu, Mingrui, et al.
Pubblicazione: (2026)
Emerging Properties in Unified Multimodal Pretraining
di: Deng, Chaorui, et al.
Pubblicazione: (2025)
di: Deng, Chaorui, et al.
Pubblicazione: (2025)
Steering Visual Generation in Unified Multimodal Models with Understanding Supervision
di: Liu, Zeyu, et al.
Pubblicazione: (2026)
di: Liu, Zeyu, et al.
Pubblicazione: (2026)
DrivingGPT: Unifying Driving World Modeling and Planning with Multi-modal Autoregressive Transformers
di: Chen, Yuntao, et al.
Pubblicazione: (2024)
di: Chen, Yuntao, et al.
Pubblicazione: (2024)
Text-Guided Multimodal Unified Industrial Anomaly Detection
di: Li, Zewen, et al.
Pubblicazione: (2026)
di: Li, Zewen, et al.
Pubblicazione: (2026)
Documenti analoghi
-
CLEAR: Unlocking Generative Potential for Degraded Image Understanding in Unified Multimodal Models
di: Hao, Xiangzhao, et al.
Pubblicazione: (2026) -
Omni-Weather: A Unified Multimodal Model for Weather Radar Understanding and Generation
di: Zhou, Zhiwang, et al.
Pubblicazione: (2025) -
MME-Unify: A Comprehensive Benchmark for Unified Multimodal Understanding and Generation Models
di: Xie, Wulin, et al.
Pubblicazione: (2025) -
InternVL-U: Democratizing Unified Multimodal Models for Understanding, Reasoning, Generation and Editing
di: Tian, Changyao, et al.
Pubblicazione: (2026) -
WeGen: A Unified Model for Interactive Multimodal Generation as We Chat
di: Huang, Zhipeng, et al.
Pubblicazione: (2025)