Lemon: A Unified and Scalable 3D Multimodal Model for Universal Spatial Understanding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liang, Yongyuan, Wang, Xiyao, Ju, Yuanchen, Yang, Jianwei, Huang, Furong |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Steering Visual Generation in Unified Multimodal Models with Understanding Supervision
par: Liu, Zeyu, et autres
Publié: (2026)
par: Liu, Zeyu, et autres
Publié: (2026)
MORSE-500: A Programmatically Controllable Video Benchmark to Stress-Test Multimodal Reasoning
par: Cai, Zikui, et autres
Publié: (2025)
par: Cai, Zikui, et autres
Publié: (2025)
MomaGraph: State-Aware Unified Scene Graphs with Vision-Language Model for Embodied Task Planning
par: Ju, Yuanchen, et autres
Publié: (2025)
par: Ju, Yuanchen, et autres
Publié: (2025)
Understanding and Harnessing Sparsity in Unified Multimodal Models
par: He, Shwai, et autres
Publié: (2025)
par: He, Shwai, et autres
Publié: (2025)
NextFlow: Unified Sequential Modeling Activates Multimodal Understanding and Generation
par: Zhang, Huichao, et autres
Publié: (2026)
par: Zhang, Huichao, et autres
Publié: (2026)
UniEval: Unified Holistic Evaluation for Unified Multimodal Understanding and Generation
par: Li, Yi, et autres
Publié: (2025)
par: Li, Yi, et autres
Publié: (2025)
ImAgent: A Unified Multimodal Agent Framework for Test-Time Scalable Image Generation
par: Wang, Kaishen, et autres
Publié: (2025)
par: Wang, Kaishen, et autres
Publié: (2025)
Towards Scalable Spatial Intelligence via 2D-to-3D Data Lifting
par: Miao, Xingyu, et autres
Publié: (2025)
par: Miao, Xingyu, et autres
Publié: (2025)
UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding
par: Xu, Chenkai, et autres
Publié: (2025)
par: Xu, Chenkai, et autres
Publié: (2025)
UniG2U-Bench: Do Unified Models Advance Multimodal Understanding?
par: Wen, Zimo, et autres
Publié: (2026)
par: Wen, Zimo, et autres
Publié: (2026)
M2-Encoder: Advancing Bilingual Image-Text Understanding by Large-scale Efficient Pretraining
par: Guo, Qingpei, et autres
Publié: (2024)
par: Guo, Qingpei, et autres
Publié: (2024)
UniSVG: A Unified Dataset for Vector Graphic Understanding and Generation with Multimodal Large Language Models
par: Li, Jinke, et autres
Publié: (2025)
par: Li, Jinke, et autres
Publié: (2025)
MetaEarth3D: Unlocking World-scale 3D Generation with Spatially Scalable Generative Modeling
par: Cao, Jinqi, et autres
Publié: (2026)
par: Cao, Jinqi, et autres
Publié: (2026)
Spatial 3D-LLM: Exploring Spatial Awareness in 3D Vision-Language Models
par: Wang, Xiaoyan, et autres
Publié: (2025)
par: Wang, Xiaoyan, et autres
Publié: (2025)
SemHiTok: A Unified Image Tokenizer via Semantic-Guided Hierarchical Codebook for Multimodal Understanding and Generation
par: Chen, Zisheng, et autres
Publié: (2025)
par: Chen, Zisheng, et autres
Publié: (2025)
TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation
par: Qu, Liao, et autres
Publié: (2024)
par: Qu, Liao, et autres
Publié: (2024)
SmartSpatial: Enhancing the 3D Spatial Arrangement Capabilities of Stable Diffusion Models and Introducing a Novel 3D Spatial Evaluation Framework
par: Huang, Mao Xun, et autres
Publié: (2025)
par: Huang, Mao Xun, et autres
Publié: (2025)
HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation
par: Xiao, Yicheng, et autres
Publié: (2025)
par: Xiao, Yicheng, et autres
Publié: (2025)
Unifying 2D and 3D Vision-Language Understanding
par: Jain, Ayush, et autres
Publié: (2025)
par: Jain, Ayush, et autres
Publié: (2025)
Uni-RS: A Spatially Faithful Unified Understanding and Generation Model for Remote Sensing
par: Zhang, Weiyu, et autres
Publié: (2026)
par: Zhang, Weiyu, et autres
Publié: (2026)
Spatial457: A Diagnostic Benchmark for 6D Spatial Reasoning of Large Multimodal Models
par: Wang, Xingrui, et autres
Publié: (2025)
par: Wang, Xingrui, et autres
Publié: (2025)
Towards Understanding Graphical Perception in Large Multimodal Models
par: Zhang, Kai, et autres
Publié: (2025)
par: Zhang, Kai, et autres
Publié: (2025)
UniToken: Harmonizing Multimodal Understanding and Generation through Unified Visual Encoding
par: Jiao, Yang, et autres
Publié: (2025)
par: Jiao, Yang, et autres
Publié: (2025)
Unified Multimodal Understanding via Byte-Pair Visual Encoding
par: Zhang, Wanpeng, et autres
Publié: (2025)
par: Zhang, Wanpeng, et autres
Publié: (2025)
SyCoCa: Symmetrizing Contrastive Captioners with Attentive Masking for Multimodal Alignment
par: Ma, Ziping, et autres
Publié: (2024)
par: Ma, Ziping, et autres
Publié: (2024)
Crab$^{+}$: A Scalable and Unified Audio-Visual Scene Understanding Model with Explicit Cooperation
par: Cai, Dongnuan, et autres
Publié: (2026)
par: Cai, Dongnuan, et autres
Publié: (2026)
Free Lunch for Unified Multimodal Models: Enhancing Generation via Reflective Rectification with Inherent Understanding
par: Jiang, Yibo, et autres
Publié: (2026)
par: Jiang, Yibo, et autres
Publié: (2026)
HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding
par: Shi, Yanzhao, et autres
Publié: (2025)
par: Shi, Yanzhao, et autres
Publié: (2025)
DiMSUM: Diffusion Mamba -- A Scalable and Unified Spatial-Frequency Method for Image Generation
par: Phung, Hao, et autres
Publié: (2024)
par: Phung, Hao, et autres
Publié: (2024)
JoyAI-Image: Awaking Spatial Intelligence in Unified Multimodal Understanding and Generation
par: Song, Lin, et autres
Publié: (2026)
par: Song, Lin, et autres
Publié: (2026)
Discrete Diffusion Models with MLLMs for Unified Medical Multimodal Generation
par: Mao, Jiawei, et autres
Publié: (2025)
par: Mao, Jiawei, et autres
Publié: (2025)
Scone: Bridging Composition and Distinction in Subject-Driven Image Generation via Unified Understanding-Generation Modeling
par: Wang, Yuran, et autres
Publié: (2025)
par: Wang, Yuran, et autres
Publié: (2025)
UniWeTok: An Unified Binary Tokenizer with Codebook Size $\mathit{2^{128}}$ for Unified Multimodal Large Language Model
par: Zhuang, Shaobin, et autres
Publié: (2026)
par: Zhuang, Shaobin, et autres
Publié: (2026)
Multi-modal Relation Distillation for Unified 3D Representation Learning
par: Wang, Huiqun, et autres
Publié: (2024)
par: Wang, Huiqun, et autres
Publié: (2024)
Mementos: A Comprehensive Benchmark for Multimodal Large Language Model Reasoning over Image Sequences
par: Wang, Xiyao, et autres
Publié: (2024)
par: Wang, Xiyao, et autres
Publié: (2024)
MultihopSpatial: Multi-hop Compositional Spatial Reasoning Benchmark for Vision-Language Model
par: Lee, Youngwan, et autres
Publié: (2026)
par: Lee, Youngwan, et autres
Publié: (2026)
Lance: Unified Multimodal Modeling by Multi-Task Synergy
par: Fu, Fengyi, et autres
Publié: (2026)
par: Fu, Fengyi, et autres
Publié: (2026)
IAD-Unify: A Region-Grounded Unified Model for Industrial Anomaly Segmentation, Understanding, and Generation
par: Zheng, Haoyu, et autres
Publié: (2026)
par: Zheng, Haoyu, et autres
Publié: (2026)
Hunyuan3D-Omni: A Unified Framework for Controllable Generation of 3D Assets
par: Hunyuan3D, Team, et autres
Publié: (2025)
par: Hunyuan3D, Team, et autres
Publié: (2025)
Lingshu: A Generalist Foundation Model for Unified Multimodal Medical Understanding and Reasoning
par: LASA Team, et autres
Publié: (2025)
par: LASA Team, et autres
Publié: (2025)
Documents similaires
-
Steering Visual Generation in Unified Multimodal Models with Understanding Supervision
par: Liu, Zeyu, et autres
Publié: (2026) -
MORSE-500: A Programmatically Controllable Video Benchmark to Stress-Test Multimodal Reasoning
par: Cai, Zikui, et autres
Publié: (2025) -
MomaGraph: State-Aware Unified Scene Graphs with Vision-Language Model for Embodied Task Planning
par: Ju, Yuanchen, et autres
Publié: (2025) -
Understanding and Harnessing Sparsity in Unified Multimodal Models
par: He, Shwai, et autres
Publié: (2025) -
NextFlow: Unified Sequential Modeling Activates Multimodal Understanding and Generation
par: Zhang, Huichao, et autres
Publié: (2026)