MM-Spatial: Exploring 3D Spatial Understanding in Multimodal LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Daxberger, Erik, Wenzel, Nina, Griffiths, David, Gang, Haiming, Lazarow, Justin, Kohavi, Gefen, Kang, Kai, Eichner, Marcin, Yang, Yinfei, Dehghan, Afshin, Grasch, Peter |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Cubify Anything: Scaling Indoor 3D Object Detection
par: Lazarow, Justin, et autres
Publié: (2024)
par: Lazarow, Justin, et autres
Publié: (2024)
Rooms from Motion: Un-posed Indoor 3D Object Detection as Localization and Mapping
par: Lazarow, Justin, et autres
Publié: (2025)
par: Lazarow, Justin, et autres
Publié: (2025)
Understanding Alignment in Multimodal LLMs: A Comprehensive Study
par: Amirloo, Elmira, et autres
Publié: (2024)
par: Amirloo, Elmira, et autres
Publié: (2024)
MM-Ego: Towards Building Egocentric Multimodal LLMs for Video QA
par: Ye, Hanrong, et autres
Publié: (2024)
par: Ye, Hanrong, et autres
Publié: (2024)
MM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-tuning
par: Zhang, Haotian, et autres
Publié: (2024)
par: Zhang, Haotian, et autres
Publié: (2024)
MIA-Bench: Towards Better Instruction Following Evaluation of Multimodal LLMs
par: Qian, Yusu, et autres
Publié: (2024)
par: Qian, Yusu, et autres
Publié: (2024)
UniGen-1.5: Enhancing Image Generation and Editing through Reward Unification in Reinforcement Learning
par: Tian, Rui, et autres
Publié: (2025)
par: Tian, Rui, et autres
Publié: (2025)
SO-Bench: A Structural Output Evaluation of Multimodal LLMs
par: Feng, Di, et autres
Publié: (2025)
par: Feng, Di, et autres
Publié: (2025)
Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor
par: Agarwal, Vatsal, et autres
Publié: (2025)
par: Agarwal, Vatsal, et autres
Publié: (2025)
UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation
par: Tian, Rui, et autres
Publié: (2025)
par: Tian, Rui, et autres
Publié: (2025)
DeepMMSearch-R1: Empowering Multimodal LLMs in Multimodal Web Search
par: Narayan, Kartik, et autres
Publié: (2025)
par: Narayan, Kartik, et autres
Publié: (2025)
SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models
par: Xu, Mingze, et autres
Publié: (2024)
par: Xu, Mingze, et autres
Publié: (2024)
SlowFast-LLaVA-1.5: A Family of Token-Efficient Video Large Language Models for Long-Form Video Understanding
par: Xu, Mingze, et autres
Publié: (2025)
par: Xu, Mingze, et autres
Publié: (2025)
Ferret-UI: Grounded Mobile UI Understanding with Multimodal LLMs
par: You, Keen, et autres
Publié: (2024)
par: You, Keen, et autres
Publié: (2024)
MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training
par: McKinzie, Brandon, et autres
Publié: (2024)
par: McKinzie, Brandon, et autres
Publié: (2024)
How Easy is It to Fool Your Multimodal LLMs? An Empirical Analysis on Deceptive Prompts
par: Qian, Yusu, et autres
Publié: (2024)
par: Qian, Yusu, et autres
Publié: (2024)
MM-Embed: Universal Multimodal Retrieval with Multimodal LLMs
par: Lin, Sheng-Chieh, et autres
Publié: (2024)
par: Lin, Sheng-Chieh, et autres
Publié: (2024)
Holistic Evaluation of Multimodal LLMs on Spatial Intelligence
par: Cai, Zhongang, et autres
Publié: (2025)
par: Cai, Zhongang, et autres
Publié: (2025)
MM-SpuBench: Towards Better Understanding of Spurious Biases in Multimodal LLMs
par: Ye, Wenqian, et autres
Publié: (2024)
par: Ye, Wenqian, et autres
Publié: (2024)
Spatial Audio Motion Understanding and Reasoning
par: Sridhar, Arvind Krishna, et autres
Publié: (2025)
par: Sridhar, Arvind Krishna, et autres
Publié: (2025)
SpatialThinker: Reinforcing 3D Reasoning in Multimodal LLMs via Spatial Rewards
par: Batra, Hunar, et autres
Publié: (2025)
par: Batra, Hunar, et autres
Publié: (2025)
AToken: A Unified Tokenizer for Vision
par: Lu, Jiasen, et autres
Publié: (2025)
par: Lu, Jiasen, et autres
Publié: (2025)
SpatialGeo:Boosting Spatial Reasoning in Multimodal LLMs via Geometry-Semantics Fusion
par: Guo, Jiajie, et autres
Publié: (2025)
par: Guo, Jiajie, et autres
Publié: (2025)
Spatial-ORMLLM: Improve Spatial Relation Understanding in the Operating Room with Multimodal Large Language Model
par: He, Peiqi, et autres
Publié: (2025)
par: He, Peiqi, et autres
Publié: (2025)
EarthSpatialBench: Benchmarking Spatial Reasoning Capabilities of Multimodal LLMs on Earth Imagery
par: Xu, Zelin, et autres
Publié: (2026)
par: Xu, Zelin, et autres
Publié: (2026)
ElasticMM: Efficient Multimodal LLMs Serving with Elastic Multimodal Parallelism
par: Liu, Zedong, et autres
Publié: (2025)
par: Liu, Zedong, et autres
Publié: (2025)
Towards Understanding Multimodal Fine-Tuning: Spatial Features
par: Naghashyar, Lachin, et autres
Publié: (2026)
par: Naghashyar, Lachin, et autres
Publié: (2026)
Spatial Preference Rewarding for MLLMs Spatial Understanding
par: Qiu, Han, et autres
Publié: (2025)
par: Qiu, Han, et autres
Publié: (2025)
Can Multimodal Large Language Models Understand Spatial Relations?
par: Liu, Jingping, et autres
Publié: (2025)
par: Liu, Jingping, et autres
Publié: (2025)
VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs
par: Cheng, Zesen, et autres
Publié: (2024)
par: Cheng, Zesen, et autres
Publié: (2024)
GSR-BENCH: A Benchmark for Grounded Spatial Reasoning Evaluation via Multimodal LLMs
par: Rajabi, Navid, et autres
Publié: (2024)
par: Rajabi, Navid, et autres
Publié: (2024)
Spatial As Deep: Spatial CNN for Traffic Scene Understanding
par: Pan, Xingang, et autres
Publié: (2017)
par: Pan, Xingang, et autres
Publié: (2017)
JoyAI-Image: Awaking Spatial Intelligence in Unified Multimodal Understanding and Generation
par: Song, Lin, et autres
Publié: (2026)
par: Song, Lin, et autres
Publié: (2026)
Mechanistic Diagnostics of Spatial Lexical Bias in Multimodal Large Language Model Spatial Reasoning
par: Ma, Chuang, et autres
Publié: (2026)
par: Ma, Chuang, et autres
Publié: (2026)
SpatialTouch: Exploring Spatial Data Visualizations in Cross-reality
par: Zhao, Lixiang, et autres
Publié: (2024)
par: Zhao, Lixiang, et autres
Publié: (2024)
InfiMM-HD: A Leap Forward in High-Resolution Multimodal Understanding
par: Liu, Haogeng, et autres
Publié: (2024)
par: Liu, Haogeng, et autres
Publié: (2024)
SpatialBot: Precise Spatial Understanding with Vision Language Models
par: Cai, Wenxiao, et autres
Publié: (2024)
par: Cai, Wenxiao, et autres
Publié: (2024)
MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning
par: Meng, Fanqing, et autres
Publié: (2025)
par: Meng, Fanqing, et autres
Publié: (2025)
STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs
par: Li, Zongzhao, et autres
Publié: (2025)
par: Li, Zongzhao, et autres
Publié: (2025)
From Where Things Are to What They Are For: Benchmarking Spatial-Functional Intelligence in Multimodal LLMs
par: Zhang, Le, et autres
Publié: (2026)
par: Zhang, Le, et autres
Publié: (2026)
Documents similaires
-
Cubify Anything: Scaling Indoor 3D Object Detection
par: Lazarow, Justin, et autres
Publié: (2024) -
Rooms from Motion: Un-posed Indoor 3D Object Detection as Localization and Mapping
par: Lazarow, Justin, et autres
Publié: (2025) -
Understanding Alignment in Multimodal LLMs: A Comprehensive Study
par: Amirloo, Elmira, et autres
Publié: (2024) -
MM-Ego: Towards Building Egocentric Multimodal LLMs for Video QA
par: Ye, Hanrong, et autres
Publié: (2024) -
MM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-tuning
par: Zhang, Haotian, et autres
Publié: (2024)