Vision-Language Memory for Spatial Reasoning
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Zuntao, Du, Yi, Fu, Taimeng, Su, Shaoshu, Ho, Cherie, Wang, Chen |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
VL-Nav: A Neuro-Symbolic Approach for Reasoning-based Vision-Language Navigation
por: Du, Yi, et al.
Publicado: (2025)
por: Du, Yi, et al.
Publicado: (2025)
iSLAM: Imperative SLAM
por: Fu, Taimeng, et al.
Publicado: (2023)
por: Fu, Taimeng, et al.
Publicado: (2023)
Vision to Geometry: 3D Spatial Memory for Sequential Embodied MLLM Reasoning and Exploration
por: Cai, Zhongyi, et al.
Publicado: (2025)
por: Cai, Zhongyi, et al.
Publicado: (2025)
SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models
por: Cheng, An-Chieh, et al.
Publicado: (2024)
por: Cheng, An-Chieh, et al.
Publicado: (2024)
MSNav: Zero-Shot Vision-and-Language Navigation with Dynamic Memory and LLM Spatial Reasoning
por: Liu, Chenghao, et al.
Publicado: (2025)
por: Liu, Chenghao, et al.
Publicado: (2025)
SuperPC: A Single Diffusion Model for Point Cloud Completion, Upsampling, Denoising, and Colorization
por: Du, Yi, et al.
Publicado: (2025)
por: Du, Yi, et al.
Publicado: (2025)
InternSpatial: A Comprehensive Dataset for Spatial Reasoning in Vision-Language Models
por: Deng, Nianchen, et al.
Publicado: (2025)
por: Deng, Nianchen, et al.
Publicado: (2025)
GSMem: 3D Gaussian Splatting as Persistent Spatial Memory for Zero-Shot Embodied Exploration and Reasoning
por: Lu, Yiren, et al.
Publicado: (2026)
por: Lu, Yiren, et al.
Publicado: (2026)
Spatial-DISE: A Unified Benchmark for Evaluating Spatial Reasoning in Vision-Language Models
por: Huang, Xinmiao, et al.
Publicado: (2025)
por: Huang, Xinmiao, et al.
Publicado: (2025)
Nonlinear Motion-Guided and Spatio-Temporal Aware Network for Unsupervised Event-Based Optical Flow
por: Liu, Zuntao, et al.
Publicado: (2025)
por: Liu, Zuntao, et al.
Publicado: (2025)
Towards Faithful Reasoning in Remote Sensing: A Perceptually-Grounded GeoSpatial Chain-of-Thought for Vision-Language Models
por: Liu, Jiaqi, et al.
Publicado: (2025)
por: Liu, Jiaqi, et al.
Publicado: (2025)
Seeing Across Views: Benchmarking Spatial Reasoning of Vision-Language Models in Robotic Scenes
por: Feng, Zhiyuan, et al.
Publicado: (2025)
por: Feng, Zhiyuan, et al.
Publicado: (2025)
RoboTracer: Mastering Spatial Trace with Reasoning in Vision-Language Models for Robotics
por: Zhou, Enshen, et al.
Publicado: (2025)
por: Zhou, Enshen, et al.
Publicado: (2025)
MASS: Motion-Aware Spatial-Temporal Grounding for Physics Reasoning and Comprehension in Vision-Language Models
por: Wu, Xiyang, et al.
Publicado: (2025)
por: Wu, Xiyang, et al.
Publicado: (2025)
Hierarchical Spatial Proximity Reasoning for Vision-and-Language Navigation
por: Xu, Ming, et al.
Publicado: (2024)
por: Xu, Ming, et al.
Publicado: (2024)
DepthVLA: Enhancing Vision-Language-Action Models with Depth-Aware Spatial Reasoning
por: Yuan, Tianyuan, et al.
Publicado: (2025)
por: Yuan, Tianyuan, et al.
Publicado: (2025)
SURDS: Benchmarking Spatial Understanding and Reasoning in Driving Scenarios with Vision Language Models
por: Guo, Xianda, et al.
Publicado: (2024)
por: Guo, Xianda, et al.
Publicado: (2024)
OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models
por: Jia, Mengdi, et al.
Publicado: (2025)
por: Jia, Mengdi, et al.
Publicado: (2025)
Learning to Reason in 4D: Dynamic Spatial Understanding for Vision Language Models
por: Zhou, Shengchao, et al.
Publicado: (2025)
por: Zhou, Shengchao, et al.
Publicado: (2025)
Spike-EVPR: Deep Spiking Residual Networks with SNN-Tailored Representations for Event-Based Visual Place Recognition
por: Liu, Zuntao, et al.
Publicado: (2024)
por: Liu, Zuntao, et al.
Publicado: (2024)
Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models
por: Zhang, Jiahuan, et al.
Publicado: (2025)
por: Zhang, Jiahuan, et al.
Publicado: (2025)
SSR: Enhancing Depth Perception in Vision-Language Models via Rationale-Guided Spatial Reasoning
por: Liu, Yang, et al.
Publicado: (2025)
por: Liu, Yang, et al.
Publicado: (2025)
Self-Evolving Spatial Reasoning in Vision Language Models via Geometric Logic Consistency
por: Liu, Junming, et al.
Publicado: (2026)
por: Liu, Junming, et al.
Publicado: (2026)
Sparkle: Mastering Basic Spatial Capabilities in Vision Language Models Elicits Generalization to Spatial Reasoning
por: Tang, Yihong, et al.
Publicado: (2024)
por: Tang, Yihong, et al.
Publicado: (2024)
Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
por: Yang, Ganlin, et al.
Publicado: (2025)
por: Yang, Ganlin, et al.
Publicado: (2025)
Q-GeoMem: Question-Guided Geometric Memory for Video Spatial Reasoning
por: Gao, Xianqiang, et al.
Publicado: (2026)
por: Gao, Xianqiang, et al.
Publicado: (2026)
Abstract 3D Perception for Spatial Intelligence in Vision-Language Models
por: Liu, Yifan, et al.
Publicado: (2025)
por: Liu, Yifan, et al.
Publicado: (2025)
ESceme: Vision-and-Language Navigation with Episodic Scene Memory
por: Zheng, Qi, et al.
Publicado: (2023)
por: Zheng, Qi, et al.
Publicado: (2023)
Mind the Gap: Benchmarking Spatial Reasoning in Vision-Language Models
por: Stogiannidis, Ilias, et al.
Publicado: (2025)
por: Stogiannidis, Ilias, et al.
Publicado: (2025)
Spatial Reasoning with Vision-Language Models in Ego-Centric Multi-View Scenes
por: Gholami, Mohsen, et al.
Publicado: (2025)
por: Gholami, Mohsen, et al.
Publicado: (2025)
PRISM: Progressive Reasoning through Iterative Slot Memory for Vision
por: Wang, Ziyu, et al.
Publicado: (2026)
por: Wang, Ziyu, et al.
Publicado: (2026)
SpatialLadder: Progressive Training for Spatial Reasoning in Vision-Language Models
por: Li, Hongxing, et al.
Publicado: (2025)
por: Li, Hongxing, et al.
Publicado: (2025)
Thinking with Blueprints: Assisting Vision-Language Models in Spatial Reasoning via Structured Object Representation
por: Ma, Weijian, et al.
Publicado: (2026)
por: Ma, Weijian, et al.
Publicado: (2026)
Can MLLMs Reason Beyond Language? VisReason: A Comprehensive Benchmark for Vision-Centric Reasoning
por: Guo, Longteng, et al.
Publicado: (2026)
por: Guo, Longteng, et al.
Publicado: (2026)
Feature Projection Learning for Better Vision-Language Reasoning
por: Zhang, Yi, et al.
Publicado: (2026)
por: Zhang, Yi, et al.
Publicado: (2026)
Grounded 3D-Aware Spatial Vision-Language Modeling
por: Cheng, An-Chieh, et al.
Publicado: (2026)
por: Cheng, An-Chieh, et al.
Publicado: (2026)
The Dual Mechanisms of Spatial Reasoning in Vision-Language Models
por: Cui, Kelly, et al.
Publicado: (2026)
por: Cui, Kelly, et al.
Publicado: (2026)
Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT
por: Asfour, Alaa, et al.
Publicado: (2026)
por: Asfour, Alaa, et al.
Publicado: (2026)
Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing
por: Wu, Junfei, et al.
Publicado: (2025)
por: Wu, Junfei, et al.
Publicado: (2025)
The Spatial Blindspot of Vision-Language Models
por: Alam, Nahid, et al.
Publicado: (2026)
por: Alam, Nahid, et al.
Publicado: (2026)
Ejemplares similares
-
VL-Nav: A Neuro-Symbolic Approach for Reasoning-based Vision-Language Navigation
por: Du, Yi, et al.
Publicado: (2025) -
iSLAM: Imperative SLAM
por: Fu, Taimeng, et al.
Publicado: (2023) -
Vision to Geometry: 3D Spatial Memory for Sequential Embodied MLLM Reasoning and Exploration
por: Cai, Zhongyi, et al.
Publicado: (2025) -
SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models
por: Cheng, An-Chieh, et al.
Publicado: (2024) -
MSNav: Zero-Shot Vision-and-Language Navigation with Dynamic Memory and LLM Spatial Reasoning
por: Liu, Chenghao, et al.
Publicado: (2025)