Thinking with Geometry: Active Geometry Integration for Spatial Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Haoyuan, Cao, Qihang, Tang, Tao, Xiang, Kun, Guo, Zihan, Han, Jianhua, Bian, JiaWang, Xu, Hang, Liang, Xiaodan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Seeing through Imagination: Learning Scene Geometry via Implicit Spatial World Modeling
di: Cao, Meng, et al.
Pubblicazione: (2025)
di: Cao, Meng, et al.
Pubblicazione: (2025)
SpatialDreamer: Incentivizing Spatial Reasoning via Active Mental Imagery
di: Cao, Meng, et al.
Pubblicazione: (2025)
di: Cao, Meng, et al.
Pubblicazione: (2025)
Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs
di: Li, Haoyuan, et al.
Pubblicazione: (2025)
di: Li, Haoyuan, et al.
Pubblicazione: (2025)
AtomThink: Multimodal Slow Thinking with Atomic Step Reasoning
di: Xiang, Kun, et al.
Pubblicazione: (2024)
di: Xiang, Kun, et al.
Pubblicazione: (2024)
GS-CLIP: Gaussian Splatting for Contrastive Language-Image-3D Pretraining from Real-World Data
di: Li, Haoyuan, et al.
Pubblicazione: (2024)
di: Li, Haoyuan, et al.
Pubblicazione: (2024)
Make Geometry Matter for Spatial Reasoning
di: Zhang, Shihua, et al.
Pubblicazione: (2026)
di: Zhang, Shihua, et al.
Pubblicazione: (2026)
Video Spatial Reasoning with Object-Centric 3D Rollout
di: Tang, Haoran, et al.
Pubblicazione: (2025)
di: Tang, Haoran, et al.
Pubblicazione: (2025)
CorNav: Autonomous Agent with Self-Corrected Planning for Zero-Shot Vision-and-Language Navigation
di: Liang, Xiwen, et al.
Pubblicazione: (2023)
di: Liang, Xiwen, et al.
Pubblicazione: (2023)
AlignMiF: Geometry-Aligned Multimodal Implicit Field for LiDAR-Camera Joint Synthesis
di: Tang, Tao, et al.
Pubblicazione: (2024)
di: Tang, Tao, et al.
Pubblicazione: (2024)
SpatialGeo:Boosting Spatial Reasoning in Multimodal LLMs via Geometry-Semantics Fusion
di: Guo, Jiajie, et al.
Pubblicazione: (2025)
di: Guo, Jiajie, et al.
Pubblicazione: (2025)
UniGS: Unified Language-Image-3D Pretraining with Gaussian Splatting
di: Li, Haoyuan, et al.
Pubblicazione: (2025)
di: Li, Haoyuan, et al.
Pubblicazione: (2025)
ActiveNeRF: Learning Accurate 3D Geometry by Active Pattern Projection
di: Tao, Jianyu, et al.
Pubblicazione: (2024)
di: Tao, Jianyu, et al.
Pubblicazione: (2024)
Implicit Geometry Representations for Vision-and-Language Navigation from Web Videos
di: Han, Mingfei, et al.
Pubblicazione: (2026)
di: Han, Mingfei, et al.
Pubblicazione: (2026)
Think3D: Thinking with Space for Spatial Reasoning
di: Zhang, Zaibin, et al.
Pubblicazione: (2026)
di: Zhang, Zaibin, et al.
Pubblicazione: (2026)
HumanRefiner: Benchmarking Abnormal Human Generation and Refining with Coarse-to-fine Pose-Reversible Guidance
di: Fang, Guian, et al.
Pubblicazione: (2024)
di: Fang, Guian, et al.
Pubblicazione: (2024)
EasyControl: Transfer ControlNet to Video Diffusion for Controllable Generation and Interpolation
di: Wang, Cong, et al.
Pubblicazione: (2024)
di: Wang, Cong, et al.
Pubblicazione: (2024)
Draw2Think: Harnessing Geometry Reasoning through Constraint Engine Interaction
di: Hu, Juncheng, et al.
Pubblicazione: (2026)
di: Hu, Juncheng, et al.
Pubblicazione: (2026)
SpatialStack: Layered Geometry-Language Fusion for 3D VLM Spatial Reasoning
di: Zhang, Jian, et al.
Pubblicazione: (2026)
di: Zhang, Jian, et al.
Pubblicazione: (2026)
ViewFusion: Structured Spatial Thinking Chains for Multi-View Reasoning
di: Tao, Xingjian, et al.
Pubblicazione: (2026)
di: Tao, Xingjian, et al.
Pubblicazione: (2026)
MagicSeg: Open-World Segmentation Pretraining via Counterfactural Diffusion-Based Auto-Generation
di: Cai, Kaixin, et al.
Pubblicazione: (2026)
di: Cai, Kaixin, et al.
Pubblicazione: (2026)
Dual-Pathway Geometry-Aware MLLM for Spatial Intelligence
di: Zheng, Yufei, et al.
Pubblicazione: (2026)
di: Zheng, Yufei, et al.
Pubblicazione: (2026)
Bridging Semantics and Geometry: A Decoupled LVLM-SAM Framework for Reasoning Segmentation in Optical Remote Sensing
di: Zhang, Xu, et al.
Pubblicazione: (2025)
di: Zhang, Xu, et al.
Pubblicazione: (2025)
VidMan: Exploiting Implicit Dynamics from Video Diffusion Model for Effective Robot Manipulation
di: Wen, Youpeng, et al.
Pubblicazione: (2024)
di: Wen, Youpeng, et al.
Pubblicazione: (2024)
Enhancing Spatial Reasoning through Visual and Textual Thinking
di: Liang, Xun, et al.
Pubblicazione: (2025)
di: Liang, Xun, et al.
Pubblicazione: (2025)
RoomTour3D: Geometry-Aware Video-Instruction Tuning for Embodied Navigation
di: Han, Mingfei, et al.
Pubblicazione: (2024)
di: Han, Mingfei, et al.
Pubblicazione: (2024)
RADAR: Revealing Asymmetric Development of Abilities in MLLM Pre-training
di: Nie, Yunshuang, et al.
Pubblicazione: (2026)
di: Nie, Yunshuang, et al.
Pubblicazione: (2026)
NavCoT: Boosting LLM-Based Vision-and-Language Navigation via Learning Disentangled Reasoning
di: Lin, Bingqian, et al.
Pubblicazione: (2024)
di: Lin, Bingqian, et al.
Pubblicazione: (2024)
Thinking with Drafts: Speculative Temporal Reasoning for Efficient Long Video Understanding
di: Hu, Pengfei, et al.
Pubblicazione: (2025)
di: Hu, Pengfei, et al.
Pubblicazione: (2025)
Learning Proposes, Geometry Disposes: A Modular Framework for Efficient Spatial Reasoning
di: Zhu, Haichao, et al.
Pubblicazione: (2026)
di: Zhu, Haichao, et al.
Pubblicazione: (2026)
Geometry without Position? When Positional Embeddings Help and Hurt Spatial Reasoning
di: Shi, Jian, et al.
Pubblicazione: (2026)
di: Shi, Jian, et al.
Pubblicazione: (2026)
DetCLIPv3: Towards Versatile Generative Open-vocabulary Object Detection
di: Yao, Lewei, et al.
Pubblicazione: (2024)
di: Yao, Lewei, et al.
Pubblicazione: (2024)
SSDiff: Spatial-spectral Integrated Diffusion Model for Remote Sensing Pansharpening
di: Zhong, Yu, et al.
Pubblicazione: (2024)
di: Zhong, Yu, et al.
Pubblicazione: (2024)
ObjSplat: Geometry-Aware Gaussian Surfels for Active Object Reconstruction
di: Li, Yuetao, et al.
Pubblicazione: (2026)
di: Li, Yuetao, et al.
Pubblicazione: (2026)
Vision to Geometry: 3D Spatial Memory for Sequential Embodied MLLM Reasoning and Exploration
di: Cai, Zhongyi, et al.
Pubblicazione: (2025)
di: Cai, Zhongyi, et al.
Pubblicazione: (2025)
Normal Transformer: Extracting Surface Geometry from LiDAR Points Enhanced by Visual Semantics
di: Lin, Ancheng, et al.
Pubblicazione: (2022)
di: Lin, Ancheng, et al.
Pubblicazione: (2022)
Evaluate Geometry of Radiance Fields with Low-frequency Color Prior
di: Fang, Qihang, et al.
Pubblicazione: (2023)
di: Fang, Qihang, et al.
Pubblicazione: (2023)
VTimeCoT: Thinking by Drawing for Video Temporal Grounding and Reasoning
di: Zhang, Jinglei, et al.
Pubblicazione: (2025)
di: Zhang, Jinglei, et al.
Pubblicazione: (2025)
Thinking with Blueprints: Assisting Vision-Language Models in Spatial Reasoning via Structured Object Representation
di: Ma, Weijian, et al.
Pubblicazione: (2026)
di: Ma, Weijian, et al.
Pubblicazione: (2026)
Taming Camera-Controlled Video Generation with Verifiable Geometry Reward
di: Wang, Zhaoqing, et al.
Pubblicazione: (2025)
di: Wang, Zhaoqing, et al.
Pubblicazione: (2025)
AtomicVLA: Unlocking the Potential of Atomic Skill Learning in Robots
di: Zhang, Likui, et al.
Pubblicazione: (2026)
di: Zhang, Likui, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Seeing through Imagination: Learning Scene Geometry via Implicit Spatial World Modeling
di: Cao, Meng, et al.
Pubblicazione: (2025) -
SpatialDreamer: Incentivizing Spatial Reasoning via Active Mental Imagery
di: Cao, Meng, et al.
Pubblicazione: (2025) -
Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs
di: Li, Haoyuan, et al.
Pubblicazione: (2025) -
AtomThink: Multimodal Slow Thinking with Atomic Step Reasoning
di: Xiang, Kun, et al.
Pubblicazione: (2024) -
GS-CLIP: Gaussian Splatting for Contrastive Language-Image-3D Pretraining from Real-World Data
di: Li, Haoyuan, et al.
Pubblicazione: (2024)