Imagine in Space: Exploring the Frontier of Spatial Intelligence and Reasoning Efficiency in Vision Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lian, Xiaoxing, Yang, Aidong, Zhu, Jun, Wang, Peng, Zhang, Yue |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Concept-RuleNet: Grounded Multi-Agent Neurosymbolic Reasoning in Vision Language Models
par: Sinha, Sanchit, et autres
Publié: (2025)
par: Sinha, Sanchit, et autres
Publié: (2025)
Exploring Spatial Representation to Enhance LLM Reasoning in Aerial Vision-Language Navigation
par: Gao, Yunpeng, et autres
Publié: (2024)
par: Gao, Yunpeng, et autres
Publié: (2024)
Rethinking Visual Attribution for Chest X-ray Reasoning in Large Vision Language Models
par: Xiong, Guangzhi, et autres
Publié: (2026)
par: Xiong, Guangzhi, et autres
Publié: (2026)
SpatialLadder: Progressive Training for Spatial Reasoning in Vision-Language Models
par: Li, Hongxing, et autres
Publié: (2025)
par: Li, Hongxing, et autres
Publié: (2025)
SpaceMind: Camera-Guided Modality Fusion for Spatial Reasoning in Vision-Language Models
par: Zhao, Ruosen, et autres
Publié: (2025)
par: Zhao, Ruosen, et autres
Publié: (2025)
Paraphrase and Solve: Exploring and Exploiting the Impact of Surface Form on Mathematical Reasoning in Large Language Models
par: Zhou, Yue, et autres
Publié: (2024)
par: Zhou, Yue, et autres
Publié: (2024)
Reasoning Beyond Chain-of-Thought: A Latent Computational Mode in Large Language Models
par: He, Zhenghao, et autres
Publié: (2026)
par: He, Zhenghao, et autres
Publié: (2026)
Spatial 3D-LLM: Exploring Spatial Awareness in 3D Vision-Language Models
par: Wang, Xiaoyan, et autres
Publié: (2025)
par: Wang, Xiaoyan, et autres
Publié: (2025)
When and How Much to Imagine: Adaptive Test-Time Scaling with World Models for Visual Spatial Reasoning
par: Yu, Shoubin, et autres
Publié: (2026)
par: Yu, Shoubin, et autres
Publié: (2026)
Pelican-Unify 1.0: A Unified Embodied Intelligence Model for Understanding, Reasoning, Imagination and Action
par: Zhang, Yi, et autres
Publié: (2026)
par: Zhang, Yi, et autres
Publié: (2026)
A Medical Multimodal Diagnostic Framework Integrating Vision-Language Models and Logic Tree Reasoning
par: Zang, Zelin, et autres
Publié: (2025)
par: Zang, Zelin, et autres
Publié: (2025)
CityCube: Benchmarking Cross-view Spatial Reasoning on Vision-Language Models in Urban Environments
par: Xu, Haotian, et autres
Publié: (2026)
par: Xu, Haotian, et autres
Publié: (2026)
Visual Distraction Undermines Moral Reasoning in Vision-Language Models
par: Yang, Xinyi, et autres
Publié: (2026)
par: Yang, Xinyi, et autres
Publié: (2026)
OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models
par: Jia, Mengdi, et autres
Publié: (2025)
par: Jia, Mengdi, et autres
Publié: (2025)
Limits of Spatial Imagery Reasoning in Frontier LLM Models
par: Hayashi, Sergio Y., et autres
Publié: (2026)
par: Hayashi, Sergio Y., et autres
Publié: (2026)
Bridging Efficiency and Transparency: Explainable CoT Compression in Multimodal Large Reasoning Models
par: Wang, Yizhi, et autres
Publié: (2026)
par: Wang, Yizhi, et autres
Publié: (2026)
Euclid's Gift: Enhancing Spatial Perception and Reasoning in Vision-Language Models via Geometric Surrogate Tasks
par: Lian, Shijie, et autres
Publié: (2025)
par: Lian, Shijie, et autres
Publié: (2025)
Seeing Through Experts Eyes A Foundational Vision Language Model Trained on Radiologists Gaze and Reasoning
par: Lee, Kinhei, et autres
Publié: (2026)
par: Lee, Kinhei, et autres
Publié: (2026)
Large Language Models' Reasoning Stalls: An Investigation into the Capabilities of Frontier Models
par: McGinness, Lachlan, et autres
Publié: (2025)
par: McGinness, Lachlan, et autres
Publié: (2025)
Reasoning under Vision: Understanding Visual-Spatial Cognition in Vision-Language Models for CAPTCHA
par: Song, Python, et autres
Publié: (2025)
par: Song, Python, et autres
Publié: (2025)
Exploring and Exploiting the Inherent Efficiency within Large Reasoning Models for Self-Guided Efficiency Enhancement
par: Zhao, Weixiang, et autres
Publié: (2025)
par: Zhao, Weixiang, et autres
Publié: (2025)
A Survey on the Applications of Frontier AI, Foundation Models, and Large Language Models to Intelligent Transportation Systems
par: Shoaib, Mohamed R., et autres
Publié: (2024)
par: Shoaib, Mohamed R., et autres
Publié: (2024)
UrbanVideo-Bench: Benchmarking Vision-Language Models on Embodied Intelligence with Video Data in Urban Spaces
par: Zhao, Baining, et autres
Publié: (2025)
par: Zhao, Baining, et autres
Publié: (2025)
A Comprehensive Survey on the Risks and Limitations of Concept-based Models
par: Sinha, Sanchit, et autres
Publié: (2025)
par: Sinha, Sanchit, et autres
Publié: (2025)
TangramSR: Can Vision-Language Models Reason in Continuous Geometric Space?
par: Zong, Yikun, et autres
Publié: (2026)
par: Zong, Yikun, et autres
Publié: (2026)
ArchSIBench: Benchmarking the Architectural Spatial Intelligence of Vision-Language Models
par: Shen, Qirui, et autres
Publié: (2026)
par: Shen, Qirui, et autres
Publié: (2026)
Exploring Reasoning Reward Model for Agents
par: Fan, Kaixuan, et autres
Publié: (2026)
par: Fan, Kaixuan, et autres
Publié: (2026)
NuScenes-SpatialQA: A Spatial Understanding and Reasoning Benchmark for Vision-Language Models in Autonomous Driving
par: Tian, Kexin, et autres
Publié: (2025)
par: Tian, Kexin, et autres
Publié: (2025)
Truly Assessing Fluid Intelligence of Large Language Models through Dynamic Reasoning Evaluation
par: Yang, Yue, et autres
Publié: (2025)
par: Yang, Yue, et autres
Publié: (2025)
RoboRefer: Towards Spatial Referring with Reasoning in Vision-Language Models for Robotics
par: Zhou, Enshen, et autres
Publié: (2025)
par: Zhou, Enshen, et autres
Publié: (2025)
Self-Imagine: Effective Unimodal Reasoning with Multimodal Models using Self-Imagination
par: Akter, Syeda Nahida, et autres
Publié: (2024)
par: Akter, Syeda Nahida, et autres
Publié: (2024)
ACPO: Adaptive Curriculum Policy Optimization for Aligning Vision-Language Models in Complex Reasoning
par: Wang, Yunhao, et autres
Publié: (2025)
par: Wang, Yunhao, et autres
Publié: (2025)
Exploring the Compositional Deficiency of Large Language Models in Mathematical Reasoning
par: Zhao, Jun, et autres
Publié: (2024)
par: Zhao, Jun, et autres
Publié: (2024)
AniSora: Exploring the Frontiers of Animation Video Generation in the Sora Era
par: Jiang, Yudong, et autres
Publié: (2024)
par: Jiang, Yudong, et autres
Publié: (2024)
Exploring the Adversarial Vulnerabilities of Vision-Language-Action Models in Robotics
par: Wang, Taowen, et autres
Publié: (2024)
par: Wang, Taowen, et autres
Publié: (2024)
Learning to Disprove: Formal Counterexample Generation with Large Language Models
par: Li, Zenan, et autres
Publié: (2026)
par: Li, Zenan, et autres
Publié: (2026)
Shaping Schema via Language Representation as the Next Frontier for LLM Intelligence Expanding
par: Yang, Zhiqin, et autres
Publié: (2026)
par: Yang, Zhiqin, et autres
Publié: (2026)
SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model
par: Qu, Delin, et autres
Publié: (2025)
par: Qu, Delin, et autres
Publié: (2025)
A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning
par: Yang, Xiaoda, et autres
Publié: (2026)
par: Yang, Xiaoda, et autres
Publié: (2026)
Large Multimodal Models for Embodied Intelligent Driving: The Next Frontier in Self-Driving?
par: Zhang, Long, et autres
Publié: (2026)
par: Zhang, Long, et autres
Publié: (2026)
Documents similaires
-
Concept-RuleNet: Grounded Multi-Agent Neurosymbolic Reasoning in Vision Language Models
par: Sinha, Sanchit, et autres
Publié: (2025) -
Exploring Spatial Representation to Enhance LLM Reasoning in Aerial Vision-Language Navigation
par: Gao, Yunpeng, et autres
Publié: (2024) -
Rethinking Visual Attribution for Chest X-ray Reasoning in Large Vision Language Models
par: Xiong, Guangzhi, et autres
Publié: (2026) -
SpatialLadder: Progressive Training for Spatial Reasoning in Vision-Language Models
par: Li, Hongxing, et autres
Publié: (2025) -
SpaceMind: Camera-Guided Modality Fusion for Spatial Reasoning in Vision-Language Models
par: Zhao, Ruosen, et autres
Publié: (2025)