Make Geometry Matter for Spatial Reasoning
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Shihua, Shen, Qiuhong, Wang, Shizun, Pan, Tianbo, Wang, Xinchao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
GFlow: Recovering 4D World from Monocular Video
por: Wang, Shizun, et al.
Publicado: (2024)
por: Wang, Shizun, et al.
Publicado: (2024)
C4D: 4D Made from 3D through Dual Correspondences
por: Wang, Shizun, et al.
Publicado: (2025)
por: Wang, Shizun, et al.
Publicado: (2025)
MindBridge: A Cross-Subject Brain Decoding Framework
por: Wang, Shizun, et al.
Publicado: (2024)
por: Wang, Shizun, et al.
Publicado: (2024)
FlashSplat: 2D to 3D Gaussian Splatting Segmentation Solved Optimally
por: Shen, Qiuhong, et al.
Publicado: (2024)
por: Shen, Qiuhong, et al.
Publicado: (2024)
Test3R: Learning to Reconstruct 3D at Test Time
por: Yuan, Yuheng, et al.
Publicado: (2025)
por: Yuan, Yuheng, et al.
Publicado: (2025)
Gamba: Marry Gaussian Splatting with Mamba for single view 3D reconstruction
por: Shen, Qiuhong, et al.
Publicado: (2024)
por: Shen, Qiuhong, et al.
Publicado: (2024)
Seeing World Dynamics in a Nutshell
por: Shen, Qiuhong, et al.
Publicado: (2025)
por: Shen, Qiuhong, et al.
Publicado: (2025)
Vista3D: Unravel the 3D Darkside of a Single Image
por: Shen, Qiuhong, et al.
Publicado: (2024)
por: Shen, Qiuhong, et al.
Publicado: (2024)
PE3R: Perception-Efficient 3D Reconstruction
por: Hu, Jie, et al.
Publicado: (2025)
por: Hu, Jie, et al.
Publicado: (2025)
EAvatar: Expression-Aware Head Avatar Reconstruction with Generative Geometry Priors
por: Zhang, Shikun, et al.
Publicado: (2025)
por: Zhang, Shikun, et al.
Publicado: (2025)
WorldWarp: Propagating 3D Geometry with Asynchronous Video Diffusion
por: Kong, Hanyang, et al.
Publicado: (2025)
por: Kong, Hanyang, et al.
Publicado: (2025)
MetaSpatial: Reinforcing 3D Spatial Reasoning in VLMs for the Metaverse
por: Pan, Zhenyu, et al.
Publicado: (2025)
por: Pan, Zhenyu, et al.
Publicado: (2025)
ConciseHint: Boosting Efficient Reasoning via Continuous Concise Hints during Generation
por: Tang, Siao, et al.
Publicado: (2025)
por: Tang, Siao, et al.
Publicado: (2025)
GeoVLMath: Enhancing Geometry Reasoning in Vision-Language Models via Cross-Modal Reward for Auxiliary Line Creation
por: Guo, Shasha, et al.
Publicado: (2025)
por: Guo, Shasha, et al.
Publicado: (2025)
In-Video Instructions: Visual Signals as Generative Control
por: Fang, Gongfan, et al.
Publicado: (2025)
por: Fang, Gongfan, et al.
Publicado: (2025)
Remix-DiT: Mixing Diffusion Transformers for Multi-Expert Denoising
por: Fang, Gongfan, et al.
Publicado: (2024)
por: Fang, Gongfan, et al.
Publicado: (2024)
Vid-SME: Membership Inference Attacks against Large Video Understanding Models
por: Li, Qi, et al.
Publicado: (2025)
por: Li, Qi, et al.
Publicado: (2025)
Attention Prompting on Image for Large Vision-Language Models
por: Yu, Runpeng, et al.
Publicado: (2024)
por: Yu, Runpeng, et al.
Publicado: (2024)
ReasonMap: Towards Fine-Grained Visual Reasoning from Transit Maps
por: Feng, Sicheng, et al.
Publicado: (2025)
por: Feng, Sicheng, et al.
Publicado: (2025)
RieMind: Geometry-Grounded Spatial Agent for Scene Understanding
por: Ropero, Fernando, et al.
Publicado: (2026)
por: Ropero, Fernando, et al.
Publicado: (2026)
SpatialLadder: Progressive Training for Spatial Reasoning in Vision-Language Models
por: Li, Hongxing, et al.
Publicado: (2025)
por: Li, Hongxing, et al.
Publicado: (2025)
MambaOut: Do We Really Need Mamba for Vision?
por: Yu, Weihao, et al.
Publicado: (2024)
por: Yu, Weihao, et al.
Publicado: (2024)
Neural Metamorphosis
por: Yang, Xingyi, et al.
Publicado: (2024)
por: Yang, Xingyi, et al.
Publicado: (2024)
InceptionNeXt: When Inception Meets ConvNeXt
por: Yu, Weihao, et al.
Publicado: (2023)
por: Yu, Weihao, et al.
Publicado: (2023)
G$^2$VLM: Geometry Grounded Vision Language Model with Unified 3D Reconstruction and Spatial Reasoning
por: Hu, Wenbo, et al.
Publicado: (2025)
por: Hu, Wenbo, et al.
Publicado: (2025)
Masking Matters: Unlocking the Spatial Reasoning Capabilities of LLMs for 3D Scene-Language Understanding
por: Jeon, Yerim, et al.
Publicado: (2025)
por: Jeon, Yerim, et al.
Publicado: (2025)
Video-Infinity: Distributed Long Video Generation
por: Tan, Zhenxiong, et al.
Publicado: (2024)
por: Tan, Zhenxiong, et al.
Publicado: (2024)
Few-shot Implicit Function Generation via Equivariance
por: Huang, Suizhi, et al.
Publicado: (2025)
por: Huang, Suizhi, et al.
Publicado: (2025)
1000+ FPS 4D Gaussian Splatting for Dynamic Scene Rendering
por: Yuan, Yuheng, et al.
Publicado: (2025)
por: Yuan, Yuheng, et al.
Publicado: (2025)
Spatial457: A Diagnostic Benchmark for 6D Spatial Reasoning of Large Multimodal Models
por: Wang, Xingrui, et al.
Publicado: (2025)
por: Wang, Xingrui, et al.
Publicado: (2025)
SpotEdit: Selective Region Editing in Diffusion Transformers
por: Qin, Zhibin, et al.
Publicado: (2025)
por: Qin, Zhibin, et al.
Publicado: (2025)
Vision Bridge Transformer at Scale
por: Tan, Zhenxiong, et al.
Publicado: (2025)
por: Tan, Zhenxiong, et al.
Publicado: (2025)
CoV: Chain-of-View Prompting for Spatial Reasoning
por: Zhao, Haoyu, et al.
Publicado: (2026)
por: Zhao, Haoyu, et al.
Publicado: (2026)
Enhancing Spatial Reasoning through Visual and Textual Thinking
por: Liang, Xun, et al.
Publicado: (2025)
por: Liang, Xun, et al.
Publicado: (2025)
Reasoning Path and Latent State Analysis for Multi-view Visual Spatial Reasoning: A Cognitive Science Perspective
por: Xue, Qiyao, et al.
Publicado: (2025)
por: Xue, Qiyao, et al.
Publicado: (2025)
CamReasoner: Reinforcing Camera Movement Understanding via Structured Spatial Reasoning
por: Wu, Hang, et al.
Publicado: (2026)
por: Wu, Hang, et al.
Publicado: (2026)
Decoupled Seg Tokens Make Stronger Reasoning Video Segmenter and Grounder
por: Jisheng, Dang, et al.
Publicado: (2025)
por: Jisheng, Dang, et al.
Publicado: (2025)
MIRAGE: A Multi-modal Benchmark for Spatial Perception, Reasoning, and Intelligence
por: Liu, Chonghan, et al.
Publicado: (2025)
por: Liu, Chonghan, et al.
Publicado: (2025)
SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes
por: Liu, Tianhui, et al.
Publicado: (2026)
por: Liu, Tianhui, et al.
Publicado: (2026)
ST-GDance++: A Scalable Spatial-Temporal Diffusion for Long-Duration Group Choreography
por: Xu, Jing, et al.
Publicado: (2026)
por: Xu, Jing, et al.
Publicado: (2026)
Ejemplares similares
-
GFlow: Recovering 4D World from Monocular Video
por: Wang, Shizun, et al.
Publicado: (2024) -
C4D: 4D Made from 3D through Dual Correspondences
por: Wang, Shizun, et al.
Publicado: (2025) -
MindBridge: A Cross-Subject Brain Decoding Framework
por: Wang, Shizun, et al.
Publicado: (2024) -
FlashSplat: 2D to 3D Gaussian Splatting Segmentation Solved Optimally
por: Shen, Qiuhong, et al.
Publicado: (2024) -
Test3R: Learning to Reconstruct 3D at Test Time
por: Yuan, Yuheng, et al.
Publicado: (2025)