Spatial-ORMLLM: Improve Spatial Relation Understanding in the Operating Room with Multimodal Large Language Model
Fuente:
arXiv
Salvato in:
| Autori principali: | He, Peiqi, Zhang, Zhenhao, Zhang, Yixiang, Zhao, Xiongjun, Peng, Shaoliang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Can Multimodal Large Language Models Understand Spatial Relations?
di: Liu, Jingping, et al.
Pubblicazione: (2025)
di: Liu, Jingping, et al.
Pubblicazione: (2025)
SpatialBot: Precise Spatial Understanding with Vision Language Models
di: Cai, Wenxiao, et al.
Pubblicazione: (2024)
di: Cai, Wenxiao, et al.
Pubblicazione: (2024)
SDEval: Safety Dynamic Evaluation for Multimodal Large Language Models
di: Wang, Hanqing, et al.
Pubblicazione: (2025)
di: Wang, Hanqing, et al.
Pubblicazione: (2025)
Spatial Preference Rewarding for MLLMs Spatial Understanding
di: Qiu, Han, et al.
Pubblicazione: (2025)
di: Qiu, Han, et al.
Pubblicazione: (2025)
SURDS: Benchmarking Spatial Understanding and Reasoning in Driving Scenarios with Vision Language Models
di: Guo, Xianda, et al.
Pubblicazione: (2024)
di: Guo, Xianda, et al.
Pubblicazione: (2024)
LLaVA-ST: A Multimodal Large Language Model for Fine-Grained Spatial-Temporal Understanding
di: Li, Hongyu, et al.
Pubblicazione: (2025)
di: Li, Hongyu, et al.
Pubblicazione: (2025)
Are Multimodal Large Language Models Ready for Omnidirectional Spatial Reasoning?
di: Dongfang, Zihao, et al.
Pubblicazione: (2025)
di: Dongfang, Zihao, et al.
Pubblicazione: (2025)
VideoLoom: A Video Large Language Model for Joint Spatial-Temporal Understanding
di: Shi, Jiapeng, et al.
Pubblicazione: (2026)
di: Shi, Jiapeng, et al.
Pubblicazione: (2026)
HiSpatial: Taming Hierarchical 3D Spatial Understanding in Vision-Language Models
di: Liang, Huizhi, et al.
Pubblicazione: (2026)
di: Liang, Huizhi, et al.
Pubblicazione: (2026)
Mechanistic Diagnostics of Spatial Lexical Bias in Multimodal Large Language Model Spatial Reasoning
di: Ma, Chuang, et al.
Pubblicazione: (2026)
di: Ma, Chuang, et al.
Pubblicazione: (2026)
Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation
di: Ning, Zhenhua, et al.
Pubblicazione: (2025)
di: Ning, Zhenhua, et al.
Pubblicazione: (2025)
SPARTUN3D: Situated Spatial Understanding of 3D World in Large Language Models
di: Zhang, Yue, et al.
Pubblicazione: (2024)
di: Zhang, Yue, et al.
Pubblicazione: (2024)
Multi-SpatialMLLM: Multi-Frame Spatial Understanding with Multi-Modal Large Language Models
di: Xu, Runsen, et al.
Pubblicazione: (2025)
di: Xu, Runsen, et al.
Pubblicazione: (2025)
MPDrive: Improving Spatial Understanding with Marker-Based Prompt Learning for Autonomous Driving
di: Zhang, Zhiyuan, et al.
Pubblicazione: (2025)
di: Zhang, Zhiyuan, et al.
Pubblicazione: (2025)
Temporal Gains, Spatial Costs: Revisiting Video Fine-Tuning in Multimodal Large Language Models
di: Zhang, Linghao, et al.
Pubblicazione: (2026)
di: Zhang, Linghao, et al.
Pubblicazione: (2026)
Multimodal Spatial Reasoning in the Large Model Era: A Survey and Benchmarks
di: Zheng, Xu, et al.
Pubblicazione: (2025)
di: Zheng, Xu, et al.
Pubblicazione: (2025)
Temporal-Spatial Object Relations Modeling for Vision-and-Language Navigation
di: Huang, Bowen, et al.
Pubblicazione: (2024)
di: Huang, Bowen, et al.
Pubblicazione: (2024)
OpenHOI: Open-World Hand-Object Interaction Synthesis with Multimodal Large Language Model
di: Zhang, Zhenhao, et al.
Pubblicazione: (2025)
di: Zhang, Zhenhao, et al.
Pubblicazione: (2025)
MM-OR: A Large Multimodal Operating Room Dataset for Semantic Understanding of High-Intensity Surgical Environments
di: Özsoy, Ege, et al.
Pubblicazione: (2025)
di: Özsoy, Ege, et al.
Pubblicazione: (2025)
InternSpatial: A Comprehensive Dataset for Spatial Reasoning in Vision-Language Models
di: Deng, Nianchen, et al.
Pubblicazione: (2025)
di: Deng, Nianchen, et al.
Pubblicazione: (2025)
Seeing Together: Multi-Robot Cooperative Egocentric Spatial Reasoning with Multimodal Large Language Models
di: Peng, Kunyu, et al.
Pubblicazione: (2026)
di: Peng, Kunyu, et al.
Pubblicazione: (2026)
Actial: Activate Spatial Reasoning Ability of Multimodal Large Language Models
di: Zhan, Xiaoyu, et al.
Pubblicazione: (2025)
di: Zhan, Xiaoyu, et al.
Pubblicazione: (2025)
MMRel: Benchmarking Relation Understanding in Multi-Modal Large Language Models
di: Nie, Jiahao, et al.
Pubblicazione: (2024)
di: Nie, Jiahao, et al.
Pubblicazione: (2024)
Spatial Reasoning in Foundation Models: Benchmarking Object-Centric Spatial Understanding
di: Mirjalili, Vahid, et al.
Pubblicazione: (2025)
di: Mirjalili, Vahid, et al.
Pubblicazione: (2025)
NAUTILUS: A Large Multimodal Model for Underwater Scene Understanding
di: Xu, Wei, et al.
Pubblicazione: (2025)
di: Xu, Wei, et al.
Pubblicazione: (2025)
Open3D-VQA: A Benchmark for Comprehensive Spatial Reasoning with Multimodal Large Language Model in Open Space
di: Zhang, Weichen, et al.
Pubblicazione: (2025)
di: Zhang, Weichen, et al.
Pubblicazione: (2025)
Spatial Chain-of-Thought: Bridging Understanding and Generation Models for Spatial Reasoning Generation
di: Chen, Wei, et al.
Pubblicazione: (2026)
di: Chen, Wei, et al.
Pubblicazione: (2026)
Spatial457: A Diagnostic Benchmark for 6D Spatial Reasoning of Large Multimodal Models
di: Wang, Xingrui, et al.
Pubblicazione: (2025)
di: Wang, Xingrui, et al.
Pubblicazione: (2025)
EventGPT: Event Stream Understanding with Multimodal Large Language Models
di: Liu, Shaoyu, et al.
Pubblicazione: (2024)
di: Liu, Shaoyu, et al.
Pubblicazione: (2024)
GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models
di: Zhang, Jiaxin, et al.
Pubblicazione: (2026)
di: Zhang, Jiaxin, et al.
Pubblicazione: (2026)
PARSE: Part-Aware Relational Spatial Modeling
di: Bai, Yinuo, et al.
Pubblicazione: (2026)
di: Bai, Yinuo, et al.
Pubblicazione: (2026)
OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models
di: Jia, Mengdi, et al.
Pubblicazione: (2025)
di: Jia, Mengdi, et al.
Pubblicazione: (2025)
TraceVision: Trajectory-Aware Vision-Language Model for Human-Like Spatial Understanding
di: Yang, Fan, et al.
Pubblicazione: (2026)
di: Yang, Fan, et al.
Pubblicazione: (2026)
RelationVLM: Making Large Vision-Language Models Understand Visual Relations
di: Huang, Zhipeng, et al.
Pubblicazione: (2024)
di: Huang, Zhipeng, et al.
Pubblicazione: (2024)
ST$^3$: Accelerating Multimodal Large Language Model by Spatial-Temporal Visual Token Trimming
di: Zhuang, Jiedong, et al.
Pubblicazione: (2024)
di: Zhuang, Jiedong, et al.
Pubblicazione: (2024)
TennisTV: Do Multimodal Large Language Models Understand Tennis Rallies?
di: Bao, Zhongyuan, et al.
Pubblicazione: (2025)
di: Bao, Zhongyuan, et al.
Pubblicazione: (2025)
Can Large Vision-Language Models Understand Multimodal Sarcasm?
di: Wang, Xinyu, et al.
Pubblicazione: (2025)
di: Wang, Xinyu, et al.
Pubblicazione: (2025)
Attention-guided Fine-tuning of Multimodal Large Language Models Improves Chain-of-Thought Reasoning
di: Sinha, Sanchit, et al.
Pubblicazione: (2026)
di: Sinha, Sanchit, et al.
Pubblicazione: (2026)
Improving Large Vision-Language Models' Understanding for Flow Field Data
di: Zhang, Xiaomei, et al.
Pubblicazione: (2025)
di: Zhang, Xiaomei, et al.
Pubblicazione: (2025)
SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models
di: Ma, Wufei, et al.
Pubblicazione: (2025)
di: Ma, Wufei, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Can Multimodal Large Language Models Understand Spatial Relations?
di: Liu, Jingping, et al.
Pubblicazione: (2025) -
SpatialBot: Precise Spatial Understanding with Vision Language Models
di: Cai, Wenxiao, et al.
Pubblicazione: (2024) -
SDEval: Safety Dynamic Evaluation for Multimodal Large Language Models
di: Wang, Hanqing, et al.
Pubblicazione: (2025) -
Spatial Preference Rewarding for MLLMs Spatial Understanding
di: Qiu, Han, et al.
Pubblicazione: (2025) -
SURDS: Benchmarking Spatial Understanding and Reasoning in Driving Scenarios with Vision Language Models
di: Guo, Xianda, et al.
Pubblicazione: (2024)