Unleashing Spatial Reasoning in Multimodal Large Language Models via Textual Representation Guided Reasoning
Fuente:
arXiv
Guardado en:
| Autores principales: | Hua, Jiacheng, Yin, Yishu, Wu, Yuhang, Wang, Tai, Huang, Yifei, Liu, Miao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Actial: Activate Spatial Reasoning Ability of Multimodal Large Language Models
por: Zhan, Xiaoyu, et al.
Publicado: (2025)
por: Zhan, Xiaoyu, et al.
Publicado: (2025)
Unleashing Perception-Time Scaling to Multimodal Reasoning Models
por: Li, Yifan, et al.
Publicado: (2025)
por: Li, Yifan, et al.
Publicado: (2025)
Think Visually, Reason Textually: Vision-Language Synergy in ARC
por: Zhang, Beichen, et al.
Publicado: (2025)
por: Zhang, Beichen, et al.
Publicado: (2025)
Mechanistic Diagnostics of Spatial Lexical Bias in Multimodal Large Language Model Spatial Reasoning
por: Ma, Chuang, et al.
Publicado: (2026)
por: Ma, Chuang, et al.
Publicado: (2026)
TangramPuzzle: Evaluating Multimodal Large Language Models with Compositional Spatial Reasoning
por: Liu, Daixian, et al.
Publicado: (2026)
por: Liu, Daixian, et al.
Publicado: (2026)
Plug-and-Play Grounding of Reasoning in Multimodal Large Language Models
por: Chen, Jiaxing, et al.
Publicado: (2024)
por: Chen, Jiaxing, et al.
Publicado: (2024)
Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models
por: Sun, Haoyuan, et al.
Publicado: (2025)
por: Sun, Haoyuan, et al.
Publicado: (2025)
Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation
por: Zhang, Xiaofeng, et al.
Publicado: (2024)
por: Zhang, Xiaofeng, et al.
Publicado: (2024)
NavGPT-2: Unleashing Navigational Reasoning Capability for Large Vision-Language Models
por: Zhou, Gengze, et al.
Publicado: (2024)
por: Zhou, Gengze, et al.
Publicado: (2024)
Reasoning Paths with Reference Objects Elicit Quantitative Spatial Reasoning in Large Vision-Language Models
por: Liao, Yuan-Hong, et al.
Publicado: (2024)
por: Liao, Yuan-Hong, et al.
Publicado: (2024)
Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization
por: Wang, Weiyun, et al.
Publicado: (2024)
por: Wang, Weiyun, et al.
Publicado: (2024)
R1-ShareVL: Incentivizing Reasoning Capability of Multimodal Large Language Models via Share-GRPO
por: Yao, Huanjin, et al.
Publicado: (2025)
por: Yao, Huanjin, et al.
Publicado: (2025)
Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models
por: Li, Yunxin, et al.
Publicado: (2025)
por: Li, Yunxin, et al.
Publicado: (2025)
SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models
por: Taguchi, Shun, et al.
Publicado: (2025)
por: Taguchi, Shun, et al.
Publicado: (2025)
VoCoT: Unleashing Visually Grounded Multi-Step Reasoning in Large Multi-Modal Models
por: Li, Zejun, et al.
Publicado: (2024)
por: Li, Zejun, et al.
Publicado: (2024)
From Perception to Reasoning: Deep Thinking Empowers Multimodal Large Language Models
por: Zhu, Wenxin, et al.
Publicado: (2025)
por: Zhu, Wenxin, et al.
Publicado: (2025)
Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models
por: Xu, Jiacong, et al.
Publicado: (2025)
por: Xu, Jiacong, et al.
Publicado: (2025)
Speak While Watching: Unleashing TRUE Real-Time Video Understanding Capability of Multimodal Large Language Models
por: Lin, Junyan, et al.
Publicado: (2026)
por: Lin, Junyan, et al.
Publicado: (2026)
AOR: Anatomical Ontology-Guided Reasoning for Medical Large Multimodal Model in Chest X-Ray Interpretation
por: Li, Qingqiu, et al.
Publicado: (2025)
por: Li, Qingqiu, et al.
Publicado: (2025)
Gemini in Reasoning: Unveiling Commonsense in Multimodal Large Language Models
por: Wang, Yuqing, et al.
Publicado: (2023)
por: Wang, Yuqing, et al.
Publicado: (2023)
Sparkle: Mastering Basic Spatial Capabilities in Vision Language Models Elicits Generalization to Spatial Reasoning
por: Tang, Yihong, et al.
Publicado: (2024)
por: Tang, Yihong, et al.
Publicado: (2024)
Mind the Gap: Benchmarking Spatial Reasoning in Vision-Language Models
por: Stogiannidis, Ilias, et al.
Publicado: (2025)
por: Stogiannidis, Ilias, et al.
Publicado: (2025)
Addressing Overthinking in Large Vision-Language Models via Gated Perception-Reasoning Optimization
por: Diao, Xingjian, et al.
Publicado: (2026)
por: Diao, Xingjian, et al.
Publicado: (2026)
STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models
por: Liang, Yiming, et al.
Publicado: (2026)
por: Liang, Yiming, et al.
Publicado: (2026)
Mementos: A Comprehensive Benchmark for Multimodal Large Language Model Reasoning over Image Sequences
por: Wang, Xiyao, et al.
Publicado: (2024)
por: Wang, Xiyao, et al.
Publicado: (2024)
Multilingual OCR-Aware Fine-Tuning and Prompt-Guided Chain-of-Thought Reasoning for Multimodal Large Language Models
por: Xu, Qinwu, et al.
Publicado: (2026)
por: Xu, Qinwu, et al.
Publicado: (2026)
Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models
por: Xu, Shilin, et al.
Publicado: (2025)
por: Xu, Shilin, et al.
Publicado: (2025)
SpatialLadder: Progressive Training for Spatial Reasoning in Vision-Language Models
por: Li, Hongxing, et al.
Publicado: (2025)
por: Li, Hongxing, et al.
Publicado: (2025)
GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing
por: Fang, Rongyao, et al.
Publicado: (2025)
por: Fang, Rongyao, et al.
Publicado: (2025)
IdealGPT: Iteratively Decomposing Vision and Language Reasoning via Large Language Models
por: You, Haoxuan, et al.
Publicado: (2023)
por: You, Haoxuan, et al.
Publicado: (2023)
ThinkFake: Reasoning in Multimodal Large Language Models for AI-Generated Image Detection
por: Huang, Tai-Ming, et al.
Publicado: (2025)
por: Huang, Tai-Ming, et al.
Publicado: (2025)
AlignMMBench: Evaluating Chinese Multimodal Alignment in Large Vision-Language Models
por: Wu, Yuhang, et al.
Publicado: (2024)
por: Wu, Yuhang, et al.
Publicado: (2024)
Multimodal Chain-of-Thought Reasoning in Language Models
por: Zhang, Zhuosheng, et al.
Publicado: (2023)
por: Zhang, Zhuosheng, et al.
Publicado: (2023)
Image-of-Thought Prompting for Visual Reasoning Refinement in Multimodal Large Language Models
por: Zhou, Qiji, et al.
Publicado: (2024)
por: Zhou, Qiji, et al.
Publicado: (2024)
Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual Embeddings
por: Agrawal, Aakriti, et al.
Publicado: (2025)
por: Agrawal, Aakriti, et al.
Publicado: (2025)
CX-Mind: A Pioneering Multimodal Large Language Model for Interleaved Reasoning in Chest X-ray via Curriculum-Guided Reinforcement Learning
por: Li, Wenjie, et al.
Publicado: (2025)
por: Li, Wenjie, et al.
Publicado: (2025)
M4U: Evaluating Multilingual Understanding and Reasoning for Large Multimodal Models
por: Wang, Hongyu, et al.
Publicado: (2024)
por: Wang, Hongyu, et al.
Publicado: (2024)
Vision-DeepResearch Benchmark: Rethinking Visual and Textual Search for Multimodal Large Language Models
por: Zeng, Yu, et al.
Publicado: (2026)
por: Zeng, Yu, et al.
Publicado: (2026)
ChartMuseum: Testing Visual Reasoning Capabilities of Large Vision-Language Models
por: Tang, Liyan, et al.
Publicado: (2025)
por: Tang, Liyan, et al.
Publicado: (2025)
Mavors: Multi-granularity Video Representation for Multimodal Large Language Model
por: Shi, Yang, et al.
Publicado: (2025)
por: Shi, Yang, et al.
Publicado: (2025)
Ejemplares similares
-
Actial: Activate Spatial Reasoning Ability of Multimodal Large Language Models
por: Zhan, Xiaoyu, et al.
Publicado: (2025) -
Unleashing Perception-Time Scaling to Multimodal Reasoning Models
por: Li, Yifan, et al.
Publicado: (2025) -
Think Visually, Reason Textually: Vision-Language Synergy in ARC
por: Zhang, Beichen, et al.
Publicado: (2025) -
Mechanistic Diagnostics of Spatial Lexical Bias in Multimodal Large Language Model Spatial Reasoning
por: Ma, Chuang, et al.
Publicado: (2026) -
TangramPuzzle: Evaluating Multimodal Large Language Models with Compositional Spatial Reasoning
por: Liu, Daixian, et al.
Publicado: (2026)