Imagine in Space: Exploring the Frontier of Spatial Intelligence and Reasoning Efficiency in Vision Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Lian, Xiaoxing, Yang, Aidong, Zhu, Jun, Wang, Peng, Zhang, Yue |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Concept-RuleNet: Grounded Multi-Agent Neurosymbolic Reasoning in Vision Language Models
por: Sinha, Sanchit, et al.
Publicado: (2025)
por: Sinha, Sanchit, et al.
Publicado: (2025)
Exploring Spatial Representation to Enhance LLM Reasoning in Aerial Vision-Language Navigation
por: Gao, Yunpeng, et al.
Publicado: (2024)
por: Gao, Yunpeng, et al.
Publicado: (2024)
Rethinking Visual Attribution for Chest X-ray Reasoning in Large Vision Language Models
por: Xiong, Guangzhi, et al.
Publicado: (2026)
por: Xiong, Guangzhi, et al.
Publicado: (2026)
SpatialLadder: Progressive Training for Spatial Reasoning in Vision-Language Models
por: Li, Hongxing, et al.
Publicado: (2025)
por: Li, Hongxing, et al.
Publicado: (2025)
SpaceMind: Camera-Guided Modality Fusion for Spatial Reasoning in Vision-Language Models
por: Zhao, Ruosen, et al.
Publicado: (2025)
por: Zhao, Ruosen, et al.
Publicado: (2025)
Paraphrase and Solve: Exploring and Exploiting the Impact of Surface Form on Mathematical Reasoning in Large Language Models
por: Zhou, Yue, et al.
Publicado: (2024)
por: Zhou, Yue, et al.
Publicado: (2024)
Reasoning Beyond Chain-of-Thought: A Latent Computational Mode in Large Language Models
por: He, Zhenghao, et al.
Publicado: (2026)
por: He, Zhenghao, et al.
Publicado: (2026)
Spatial 3D-LLM: Exploring Spatial Awareness in 3D Vision-Language Models
por: Wang, Xiaoyan, et al.
Publicado: (2025)
por: Wang, Xiaoyan, et al.
Publicado: (2025)
When and How Much to Imagine: Adaptive Test-Time Scaling with World Models for Visual Spatial Reasoning
por: Yu, Shoubin, et al.
Publicado: (2026)
por: Yu, Shoubin, et al.
Publicado: (2026)
Pelican-Unify 1.0: A Unified Embodied Intelligence Model for Understanding, Reasoning, Imagination and Action
por: Zhang, Yi, et al.
Publicado: (2026)
por: Zhang, Yi, et al.
Publicado: (2026)
A Medical Multimodal Diagnostic Framework Integrating Vision-Language Models and Logic Tree Reasoning
por: Zang, Zelin, et al.
Publicado: (2025)
por: Zang, Zelin, et al.
Publicado: (2025)
CityCube: Benchmarking Cross-view Spatial Reasoning on Vision-Language Models in Urban Environments
por: Xu, Haotian, et al.
Publicado: (2026)
por: Xu, Haotian, et al.
Publicado: (2026)
Visual Distraction Undermines Moral Reasoning in Vision-Language Models
por: Yang, Xinyi, et al.
Publicado: (2026)
por: Yang, Xinyi, et al.
Publicado: (2026)
OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models
por: Jia, Mengdi, et al.
Publicado: (2025)
por: Jia, Mengdi, et al.
Publicado: (2025)
Limits of Spatial Imagery Reasoning in Frontier LLM Models
por: Hayashi, Sergio Y., et al.
Publicado: (2026)
por: Hayashi, Sergio Y., et al.
Publicado: (2026)
Bridging Efficiency and Transparency: Explainable CoT Compression in Multimodal Large Reasoning Models
por: Wang, Yizhi, et al.
Publicado: (2026)
por: Wang, Yizhi, et al.
Publicado: (2026)
Euclid's Gift: Enhancing Spatial Perception and Reasoning in Vision-Language Models via Geometric Surrogate Tasks
por: Lian, Shijie, et al.
Publicado: (2025)
por: Lian, Shijie, et al.
Publicado: (2025)
Seeing Through Experts Eyes A Foundational Vision Language Model Trained on Radiologists Gaze and Reasoning
por: Lee, Kinhei, et al.
Publicado: (2026)
por: Lee, Kinhei, et al.
Publicado: (2026)
Large Language Models' Reasoning Stalls: An Investigation into the Capabilities of Frontier Models
por: McGinness, Lachlan, et al.
Publicado: (2025)
por: McGinness, Lachlan, et al.
Publicado: (2025)
Reasoning under Vision: Understanding Visual-Spatial Cognition in Vision-Language Models for CAPTCHA
por: Song, Python, et al.
Publicado: (2025)
por: Song, Python, et al.
Publicado: (2025)
Exploring and Exploiting the Inherent Efficiency within Large Reasoning Models for Self-Guided Efficiency Enhancement
por: Zhao, Weixiang, et al.
Publicado: (2025)
por: Zhao, Weixiang, et al.
Publicado: (2025)
A Survey on the Applications of Frontier AI, Foundation Models, and Large Language Models to Intelligent Transportation Systems
por: Shoaib, Mohamed R., et al.
Publicado: (2024)
por: Shoaib, Mohamed R., et al.
Publicado: (2024)
UrbanVideo-Bench: Benchmarking Vision-Language Models on Embodied Intelligence with Video Data in Urban Spaces
por: Zhao, Baining, et al.
Publicado: (2025)
por: Zhao, Baining, et al.
Publicado: (2025)
A Comprehensive Survey on the Risks and Limitations of Concept-based Models
por: Sinha, Sanchit, et al.
Publicado: (2025)
por: Sinha, Sanchit, et al.
Publicado: (2025)
TangramSR: Can Vision-Language Models Reason in Continuous Geometric Space?
por: Zong, Yikun, et al.
Publicado: (2026)
por: Zong, Yikun, et al.
Publicado: (2026)
ArchSIBench: Benchmarking the Architectural Spatial Intelligence of Vision-Language Models
por: Shen, Qirui, et al.
Publicado: (2026)
por: Shen, Qirui, et al.
Publicado: (2026)
Exploring Reasoning Reward Model for Agents
por: Fan, Kaixuan, et al.
Publicado: (2026)
por: Fan, Kaixuan, et al.
Publicado: (2026)
NuScenes-SpatialQA: A Spatial Understanding and Reasoning Benchmark for Vision-Language Models in Autonomous Driving
por: Tian, Kexin, et al.
Publicado: (2025)
por: Tian, Kexin, et al.
Publicado: (2025)
Truly Assessing Fluid Intelligence of Large Language Models through Dynamic Reasoning Evaluation
por: Yang, Yue, et al.
Publicado: (2025)
por: Yang, Yue, et al.
Publicado: (2025)
RoboRefer: Towards Spatial Referring with Reasoning in Vision-Language Models for Robotics
por: Zhou, Enshen, et al.
Publicado: (2025)
por: Zhou, Enshen, et al.
Publicado: (2025)
Self-Imagine: Effective Unimodal Reasoning with Multimodal Models using Self-Imagination
por: Akter, Syeda Nahida, et al.
Publicado: (2024)
por: Akter, Syeda Nahida, et al.
Publicado: (2024)
ACPO: Adaptive Curriculum Policy Optimization for Aligning Vision-Language Models in Complex Reasoning
por: Wang, Yunhao, et al.
Publicado: (2025)
por: Wang, Yunhao, et al.
Publicado: (2025)
Exploring the Compositional Deficiency of Large Language Models in Mathematical Reasoning
por: Zhao, Jun, et al.
Publicado: (2024)
por: Zhao, Jun, et al.
Publicado: (2024)
AniSora: Exploring the Frontiers of Animation Video Generation in the Sora Era
por: Jiang, Yudong, et al.
Publicado: (2024)
por: Jiang, Yudong, et al.
Publicado: (2024)
Exploring the Adversarial Vulnerabilities of Vision-Language-Action Models in Robotics
por: Wang, Taowen, et al.
Publicado: (2024)
por: Wang, Taowen, et al.
Publicado: (2024)
Learning to Disprove: Formal Counterexample Generation with Large Language Models
por: Li, Zenan, et al.
Publicado: (2026)
por: Li, Zenan, et al.
Publicado: (2026)
Shaping Schema via Language Representation as the Next Frontier for LLM Intelligence Expanding
por: Yang, Zhiqin, et al.
Publicado: (2026)
por: Yang, Zhiqin, et al.
Publicado: (2026)
SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model
por: Qu, Delin, et al.
Publicado: (2025)
por: Qu, Delin, et al.
Publicado: (2025)
A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning
por: Yang, Xiaoda, et al.
Publicado: (2026)
por: Yang, Xiaoda, et al.
Publicado: (2026)
Large Multimodal Models for Embodied Intelligent Driving: The Next Frontier in Self-Driving?
por: Zhang, Long, et al.
Publicado: (2026)
por: Zhang, Long, et al.
Publicado: (2026)
Ejemplares similares
-
Concept-RuleNet: Grounded Multi-Agent Neurosymbolic Reasoning in Vision Language Models
por: Sinha, Sanchit, et al.
Publicado: (2025) -
Exploring Spatial Representation to Enhance LLM Reasoning in Aerial Vision-Language Navigation
por: Gao, Yunpeng, et al.
Publicado: (2024) -
Rethinking Visual Attribution for Chest X-ray Reasoning in Large Vision Language Models
por: Xiong, Guangzhi, et al.
Publicado: (2026) -
SpatialLadder: Progressive Training for Spatial Reasoning in Vision-Language Models
por: Li, Hongxing, et al.
Publicado: (2025) -
SpaceMind: Camera-Guided Modality Fusion for Spatial Reasoning in Vision-Language Models
por: Zhao, Ruosen, et al.
Publicado: (2025)