Salvato in:
| Autori principali: | Cai, Zhongyi, Du, Yi, Wang, Chen, Kong, Yu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2512.02458 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
GSMem: 3D Gaussian Splatting as Persistent Spatial Memory for Zero-Shot Embodied Exploration and Reasoning
di: Lu, Yiren, et al.
Pubblicazione: (2026)
di: Lu, Yiren, et al.
Pubblicazione: (2026)
3D-Mem: 3D Scene Memory for Embodied Exploration and Reasoning
di: Yang, Yuncong, et al.
Pubblicazione: (2024)
di: Yang, Yuncong, et al.
Pubblicazione: (2024)
Vision-Language Memory for Spatial Reasoning
di: Liu, Zuntao, et al.
Pubblicazione: (2025)
di: Liu, Zuntao, et al.
Pubblicazione: (2025)
Enhancing MLLM Spatial Understanding via Active 3D Scene Exploration for Multi-Perspective Reasoning
di: Chen, Jiahua, et al.
Pubblicazione: (2026)
di: Chen, Jiahua, et al.
Pubblicazione: (2026)
GaussExplorer: 3D Gaussian Splatting for Embodied Exploration and Reasoning
di: Yu-Ji, Kim, et al.
Pubblicazione: (2026)
di: Yu-Ji, Kim, et al.
Pubblicazione: (2026)
Dual-Pathway Geometry-Aware MLLM for Spatial Intelligence
di: Zheng, Yufei, et al.
Pubblicazione: (2026)
di: Zheng, Yufei, et al.
Pubblicazione: (2026)
Boosting MLLM Spatial Reasoning with Geometrically Referenced 3D Scene Representations
di: Yuan, Jiangye, et al.
Pubblicazione: (2026)
di: Yuan, Jiangye, et al.
Pubblicazione: (2026)
IndustryEQA: Pushing the Frontiers of Embodied Question Answering in Industrial Scenarios
di: Li, Yifan, et al.
Pubblicazione: (2025)
di: Li, Yifan, et al.
Pubblicazione: (2025)
ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge
di: Zhou, Zhongyi, et al.
Pubblicazione: (2025)
di: Zhou, Zhongyi, et al.
Pubblicazione: (2025)
GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models
di: Zhang, Jiaxin, et al.
Pubblicazione: (2026)
di: Zhang, Jiaxin, et al.
Pubblicazione: (2026)
Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
di: Yang, Ganlin, et al.
Pubblicazione: (2025)
di: Yang, Ganlin, et al.
Pubblicazione: (2025)
IndustryNav: Exploring Spatial Reasoning of Embodied Agents in Dynamic Industrial Navigation
di: Li, Yifan, et al.
Pubblicazione: (2025)
di: Li, Yifan, et al.
Pubblicazione: (2025)
Judge Anything: MLLM as a Judge Across Any Modality
di: Pu, Shu, et al.
Pubblicazione: (2025)
di: Pu, Shu, et al.
Pubblicazione: (2025)
S$^2$-MLLM: Boosting Spatial Reasoning Capability of MLLMs for 3D Visual Grounding with Structural Guidance
di: Xu, Beining, et al.
Pubblicazione: (2025)
di: Xu, Beining, et al.
Pubblicazione: (2025)
EAGLE: Episodic Appearance- and Geometry-aware Memory for Unified 2D-3D Visual Query Localization in Egocentric Vision
di: Cao, Yifei, et al.
Pubblicazione: (2025)
di: Cao, Yifei, et al.
Pubblicazione: (2025)
MLLM-For3D: Adapting Multimodal Large Language Model for 3D Reasoning Segmentation
di: Huang, Jiaxin, et al.
Pubblicazione: (2025)
di: Huang, Jiaxin, et al.
Pubblicazione: (2025)
VisionTrim: Unified Vision Token Compression for Training-Free MLLM Acceleration
di: Yu, Hanxun, et al.
Pubblicazione: (2026)
di: Yu, Hanxun, et al.
Pubblicazione: (2026)
SpatialStack: Layered Geometry-Language Fusion for 3D VLM Spatial Reasoning
di: Zhang, Jian, et al.
Pubblicazione: (2026)
di: Zhang, Jian, et al.
Pubblicazione: (2026)
GeoAlign: Geometric Feature Realignment for MLLM Spatial Reasoning
di: Liu, Zhaochen, et al.
Pubblicazione: (2026)
di: Liu, Zhaochen, et al.
Pubblicazione: (2026)
Embodied3DBench: Benchmarking Low-Level Embodied Spatial Intelligence of Vision Language Models
di: Zhang, Jiyao, et al.
Pubblicazione: (2026)
di: Zhang, Jiyao, et al.
Pubblicazione: (2026)
N3D-VLM: Native 3D Grounding Enables Accurate Spatial Reasoning in Vision-Language Models
di: Wang, Yuxin, et al.
Pubblicazione: (2025)
di: Wang, Yuxin, et al.
Pubblicazione: (2025)
VLingNav: Embodied Navigation with Adaptive Reasoning and Visual-Assisted Linguistic Memory
di: Wang, Shaoan, et al.
Pubblicazione: (2026)
di: Wang, Shaoan, et al.
Pubblicazione: (2026)
REALM: An MLLM-Agent Framework for Open World 3D Reasoning Segmentation and Editing on Gaussian Splatting
di: Shi, Changyue, et al.
Pubblicazione: (2025)
di: Shi, Changyue, et al.
Pubblicazione: (2025)
SpatialReasoner: Towards Explicit and Generalizable 3D Spatial Reasoning
di: Ma, Wufei, et al.
Pubblicazione: (2025)
di: Ma, Wufei, et al.
Pubblicazione: (2025)
Let Language Constrain Geometry: Vision-Language Models as Semantic and Spatial Critics for 3D Generation
di: Bai, Weimin, et al.
Pubblicazione: (2025)
di: Bai, Weimin, et al.
Pubblicazione: (2025)
Thinking with Geometry: Active Geometry Integration for Spatial Reasoning
di: Li, Haoyuan, et al.
Pubblicazione: (2026)
di: Li, Haoyuan, et al.
Pubblicazione: (2026)
Virgo: A Preliminary Exploration on Reproducing o1-like MLLM
di: Du, Yifan, et al.
Pubblicazione: (2025)
di: Du, Yifan, et al.
Pubblicazione: (2025)
3D-MoRe: Unified Modal-Contextual Reasoning for Embodied Question Answering
di: Xu, Rongtao, et al.
Pubblicazione: (2025)
di: Xu, Rongtao, et al.
Pubblicazione: (2025)
3D Reconstruction with Spatial Memory
di: Wang, Hengyi, et al.
Pubblicazione: (2024)
di: Wang, Hengyi, et al.
Pubblicazione: (2024)
G$^2$VLM: Geometry Grounded Vision Language Model with Unified 3D Reconstruction and Spatial Reasoning
di: Hu, Wenbo, et al.
Pubblicazione: (2025)
di: Hu, Wenbo, et al.
Pubblicazione: (2025)
Embodied-R: Collaborative Framework for Activating Embodied Spatial Reasoning in Foundation Models via Reinforcement Learning
di: Zhao, Baining, et al.
Pubblicazione: (2025)
di: Zhao, Baining, et al.
Pubblicazione: (2025)
InternSpatial: A Comprehensive Dataset for Spatial Reasoning in Vision-Language Models
di: Deng, Nianchen, et al.
Pubblicazione: (2025)
di: Deng, Nianchen, et al.
Pubblicazione: (2025)
Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation
di: Zhu, Ziyu, et al.
Pubblicazione: (2025)
di: Zhu, Ziyu, et al.
Pubblicazione: (2025)
Reasmory: 3D Reconstruction as Explicit Memory for VLMs Spatial Reasoning
di: He, Jixuan, et al.
Pubblicazione: (2026)
di: He, Jixuan, et al.
Pubblicazione: (2026)
MLLM-4D: Towards Visual-based Spatial-Temporal Intelligence
di: Yin, Xingyilang, et al.
Pubblicazione: (2026)
di: Yin, Xingyilang, et al.
Pubblicazione: (2026)
Aerial Vision-Language Navigation with a Unified Framework for Spatial, Temporal and Embodied Reasoning
di: Xu, Huilin, et al.
Pubblicazione: (2025)
di: Xu, Huilin, et al.
Pubblicazione: (2025)
Syn-GRPO: Self-Evolving Data Synthesis for MLLM Perception Reasoning
di: Huang, Qihan, et al.
Pubblicazione: (2025)
di: Huang, Qihan, et al.
Pubblicazione: (2025)
CAD-MLLM: Unifying Multimodality-Conditioned CAD Generation With MLLM
di: Xu, Jingwei, et al.
Pubblicazione: (2024)
di: Xu, Jingwei, et al.
Pubblicazione: (2024)
ESPIRE: A Diagnostic Benchmark for Embodied Spatial Reasoning of Vision-Language Models
di: Zhao, Yanpeng, et al.
Pubblicazione: (2026)
di: Zhao, Yanpeng, et al.
Pubblicazione: (2026)
Beyond 3D VQAs: Injecting 3D Spatial Priors into Vision-Language Models for Enhanced Geometric Reasoning
di: Yeh, Chun-Hsiao, et al.
Pubblicazione: (2026)
di: Yeh, Chun-Hsiao, et al.
Pubblicazione: (2026)
Documenti analoghi
-
GSMem: 3D Gaussian Splatting as Persistent Spatial Memory for Zero-Shot Embodied Exploration and Reasoning
di: Lu, Yiren, et al.
Pubblicazione: (2026) -
3D-Mem: 3D Scene Memory for Embodied Exploration and Reasoning
di: Yang, Yuncong, et al.
Pubblicazione: (2024) -
Vision-Language Memory for Spatial Reasoning
di: Liu, Zuntao, et al.
Pubblicazione: (2025) -
Enhancing MLLM Spatial Understanding via Active 3D Scene Exploration for Multi-Perspective Reasoning
di: Chen, Jiahua, et al.
Pubblicazione: (2026) -
GaussExplorer: 3D Gaussian Splatting for Embodied Exploration and Reasoning
di: Yu-Ji, Kim, et al.
Pubblicazione: (2026)