Multi-SpatialMLLM: Multi-Frame Spatial Understanding with Multi-Modal Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Xu, Runsen, Wang, Weiyao, Tang, Hao, Chen, Xingyu, Wang, Xiaodong, Chu, Fu-Jen, Feiszli, Matt, Liang, Kevin J. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ICON: Incremental CONfidence for Joint Pose and Radiance Field Optimization
di: Wang, Weiyao, et al.
Pubblicazione: (2024)
di: Wang, Weiyao, et al.
Pubblicazione: (2024)
OmniPose6D: Towards Short-Term Object Pose Tracking in Dynamic Scenes from Monocular RGB
di: Lin, Yunzhi, et al.
Pubblicazione: (2024)
di: Lin, Yunzhi, et al.
Pubblicazione: (2024)
ADen: Adaptive Density Representations for Sparse-view Camera Pose Estimation
di: Tang, Hao, et al.
Pubblicazione: (2024)
di: Tang, Hao, et al.
Pubblicazione: (2024)
HOIGPT: Learning Long Sequence Hand-Object Interaction with Language Models
di: Huang, Mingzhen, et al.
Pubblicazione: (2025)
di: Huang, Mingzhen, et al.
Pubblicazione: (2025)
Enhancing MLLM Spatial Understanding via Active 3D Scene Exploration for Multi-Perspective Reasoning
di: Chen, Jiahua, et al.
Pubblicazione: (2026)
di: Chen, Jiahua, et al.
Pubblicazione: (2026)
SAM4MLLM: Enhance Multi-Modal Large Language Model for Referring Expression Segmentation
di: Chen, Yi-Chia, et al.
Pubblicazione: (2024)
di: Chen, Yi-Chia, et al.
Pubblicazione: (2024)
3x2: 3D Object Part Segmentation by 2D Semantic Correspondences
di: Thai, Anh, et al.
Pubblicazione: (2024)
di: Thai, Anh, et al.
Pubblicazione: (2024)
DynImg: Key Frames with Visual Prompts are Good Representation for Multi-Modal Video Understanding
di: Bao, Xiaoyi, et al.
Pubblicazione: (2025)
di: Bao, Xiaoyi, et al.
Pubblicazione: (2025)
MMSI-Bench: A Benchmark for Multi-Image Spatial Intelligence
di: Yang, Sihan, et al.
Pubblicazione: (2025)
di: Yang, Sihan, et al.
Pubblicazione: (2025)
UnifiedMLLM: Enabling Unified Representation for Multi-modal Multi-tasks With Large Language Model
di: Li, Zhaowei, et al.
Pubblicazione: (2024)
di: Li, Zhaowei, et al.
Pubblicazione: (2024)
EarthGPT-X: A Spatial MLLM for Multi-level Multi-Source Remote Sensing Imagery Understanding with Visual Prompting
di: Zhang, Wei, et al.
Pubblicazione: (2025)
di: Zhang, Wei, et al.
Pubblicazione: (2025)
Interactive Test-Time Adaptation with Reliable Spatial-Temporal Voxels for Multi-Modal Segmentation
di: Cao, Haozhi, et al.
Pubblicazione: (2024)
di: Cao, Haozhi, et al.
Pubblicazione: (2024)
PUMA: Empowering Unified MLLM with Multi-granular Visual Generation
di: Fang, Rongyao, et al.
Pubblicazione: (2024)
di: Fang, Rongyao, et al.
Pubblicazione: (2024)
PointLLM: Empowering Large Language Models to Understand Point Clouds
di: Xu, Runsen, et al.
Pubblicazione: (2023)
di: Xu, Runsen, et al.
Pubblicazione: (2023)
UrbanLLaVA: A Multi-modal Large Language Model for Urban Intelligence with Spatial Reasoning and Understanding
di: Feng, Jie, et al.
Pubblicazione: (2025)
di: Feng, Jie, et al.
Pubblicazione: (2025)
Multi-Modal Framing Analysis of News
di: Arora, Arnav, et al.
Pubblicazione: (2025)
di: Arora, Arnav, et al.
Pubblicazione: (2025)
CG-MLLM: Captioning and Generating 3D content via Multi-modal Large Language Models
di: Huang, Junming, et al.
Pubblicazione: (2026)
di: Huang, Junming, et al.
Pubblicazione: (2026)
Spatial-Frequency Enhanced Mamba for Multi-Modal Image Fusion
di: Sun, Hui, et al.
Pubblicazione: (2025)
di: Sun, Hui, et al.
Pubblicazione: (2025)
Towards Grounded Visual Spatial Reasoning in Multi-Modal Vision Language Models
di: Rajabi, Navid, et al.
Pubblicazione: (2023)
di: Rajabi, Navid, et al.
Pubblicazione: (2023)
dMLLM-TTS: Self-Verified and Efficient Test-Time Scaling for Diffusion Multi-Modal Large Language Models
di: Xin, Yi, et al.
Pubblicazione: (2025)
di: Xin, Yi, et al.
Pubblicazione: (2025)
TPO: Aligning Large Language Models with Multi-branch & Multi-step Preference Trees
di: Liao, Weibin, et al.
Pubblicazione: (2024)
di: Liao, Weibin, et al.
Pubblicazione: (2024)
M3: 3D-Spatial MultiModal Memory
di: Zou, Xueyan, et al.
Pubblicazione: (2025)
di: Zou, Xueyan, et al.
Pubblicazione: (2025)
Evaluating Large Language Models on Spatial Tasks: A Multi-Task Benchmarking Study
di: Xu, Liuchang, et al.
Pubblicazione: (2024)
di: Xu, Liuchang, et al.
Pubblicazione: (2024)
Interactive Spatial-Frequency Fusion Mamba for Multi-Modal Image Fusion
di: Zhu, Yixin, et al.
Pubblicazione: (2026)
di: Zhu, Yixin, et al.
Pubblicazione: (2026)
ViewSpatial-Bench: Evaluating Multi-perspective Spatial Localization in Vision-Language Models
di: Li, Dingming, et al.
Pubblicazione: (2025)
di: Li, Dingming, et al.
Pubblicazione: (2025)
LVAgent: Long Video Understanding by Multi-Round Dynamical Collaboration of MLLM Agents
di: Chen, Boyu, et al.
Pubblicazione: (2025)
di: Chen, Boyu, et al.
Pubblicazione: (2025)
Oryx MLLM: On-Demand Spatial-Temporal Understanding at Arbitrary Resolution
di: Liu, Zuyan, et al.
Pubblicazione: (2024)
di: Liu, Zuyan, et al.
Pubblicazione: (2024)
ViewFusion: Structured Spatial Thinking Chains for Multi-View Reasoning
di: Tao, Xingjian, et al.
Pubblicazione: (2026)
di: Tao, Xingjian, et al.
Pubblicazione: (2026)
Medical MLLM is Vulnerable: Cross-Modality Jailbreak and Mismatched Attacks on Medical Multimodal Large Language Models
di: Huang, Xijie, et al.
Pubblicazione: (2024)
di: Huang, Xijie, et al.
Pubblicazione: (2024)
Lumina-DiMOO: An Omni Diffusion Large Language Model for Multi-Modal Generation and Understanding
di: Xin, Yi, et al.
Pubblicazione: (2025)
di: Xin, Yi, et al.
Pubblicazione: (2025)
MLLM-4D: Towards Visual-based Spatial-Temporal Intelligence
di: Yin, Xingyilang, et al.
Pubblicazione: (2026)
di: Yin, Xingyilang, et al.
Pubblicazione: (2026)
ML-Mamba: Efficient Multi-Modal Large Language Model Utilizing Mamba-2
di: Huang, Wenjun, et al.
Pubblicazione: (2024)
di: Huang, Wenjun, et al.
Pubblicazione: (2024)
Forging Spatial Intelligence: A Roadmap of Multi-Modal Data Pre-Training for Autonomous Systems
di: Wang, Song, et al.
Pubblicazione: (2025)
di: Wang, Song, et al.
Pubblicazione: (2025)
MMRel: Benchmarking Relation Understanding in Multi-Modal Large Language Models
di: Nie, Jiahao, et al.
Pubblicazione: (2024)
di: Nie, Jiahao, et al.
Pubblicazione: (2024)
Dual-Pathway Geometry-Aware MLLM for Spatial Intelligence
di: Zheng, Yufei, et al.
Pubblicazione: (2026)
di: Zheng, Yufei, et al.
Pubblicazione: (2026)
MM-LLMs: Recent Advances in MultiModal Large Language Models
di: Zhang, Duzhen, et al.
Pubblicazione: (2024)
di: Zhang, Duzhen, et al.
Pubblicazione: (2024)
Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning
di: Liu, Fuxiao, et al.
Pubblicazione: (2023)
di: Liu, Fuxiao, et al.
Pubblicazione: (2023)
MMRL: Multi-Modal Representation Learning for Vision-Language Models
di: Guo, Yuncheng, et al.
Pubblicazione: (2025)
di: Guo, Yuncheng, et al.
Pubblicazione: (2025)
Proximity QA: Unleashing the Power of Multi-Modal Large Language Models for Spatial Proximity Analysis
di: Li, Jianing, et al.
Pubblicazione: (2024)
di: Li, Jianing, et al.
Pubblicazione: (2024)
MMScan: A Multi-Modal 3D Scene Dataset with Hierarchical Grounded Language Annotations
di: Lyu, Ruiyuan, et al.
Pubblicazione: (2024)
di: Lyu, Ruiyuan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
ICON: Incremental CONfidence for Joint Pose and Radiance Field Optimization
di: Wang, Weiyao, et al.
Pubblicazione: (2024) -
OmniPose6D: Towards Short-Term Object Pose Tracking in Dynamic Scenes from Monocular RGB
di: Lin, Yunzhi, et al.
Pubblicazione: (2024) -
ADen: Adaptive Density Representations for Sparse-view Camera Pose Estimation
di: Tang, Hao, et al.
Pubblicazione: (2024) -
HOIGPT: Learning Long Sequence Hand-Object Interaction with Language Models
di: Huang, Mingzhen, et al.
Pubblicazione: (2025) -
Enhancing MLLM Spatial Understanding via Active 3D Scene Exploration for Multi-Perspective Reasoning
di: Chen, Jiahua, et al.
Pubblicazione: (2026)