SSR3D-LLM: Structured Spatial Reasoning via Latent Steps for Fine-Grained Grounding in Unified 3D-LLMs
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Jiawei, Liu, Ziyi, Shi, Weijie, Chen, Long, Xu, Jiajie, Zhou, Xiaofang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Fine-Grained Spatial and Verbal Losses for 3D Visual Grounding
por: Dey, Sombit, et al.
Publicado: (2024)
por: Dey, Sombit, et al.
Publicado: (2024)
Enhancing Fine-Grained Spatial Grounding in 3D CT Report Generation via Discriminative Guidance
por: Wang, Chenyu, et al.
Publicado: (2026)
por: Wang, Chenyu, et al.
Publicado: (2026)
UniFunc3D: Unified Active Spatial-Temporal Grounding for 3D Functionality Segmentation
por: Lin, Jiaying, et al.
Publicado: (2026)
por: Lin, Jiaying, et al.
Publicado: (2026)
SSR: Pushing the Limit of Spatial Intelligence with Structured Scene Reasoning
por: Zhang, Yi, et al.
Publicado: (2026)
por: Zhang, Yi, et al.
Publicado: (2026)
Reasoning3D -- Grounding and Reasoning in 3D: Fine-Grained Zero-Shot Open-Vocabulary 3D Reasoning Part Segmentation via Large Vision-Language Models
por: Chen, Tianrun, et al.
Publicado: (2024)
por: Chen, Tianrun, et al.
Publicado: (2024)
G$^2$VLM: Geometry Grounded Vision Language Model with Unified 3D Reconstruction and Spatial Reasoning
por: Hu, Wenbo, et al.
Publicado: (2025)
por: Hu, Wenbo, et al.
Publicado: (2025)
FGU3R: Fine-Grained Fusion via Unified 3D Representation for Multimodal 3D Object Detection
por: Zhang, Guoxin, et al.
Publicado: (2025)
por: Zhang, Guoxin, et al.
Publicado: (2025)
S$^2$-MLLM: Boosting Spatial Reasoning Capability of MLLMs for 3D Visual Grounding with Structural Guidance
por: Xu, Beining, et al.
Publicado: (2025)
por: Xu, Beining, et al.
Publicado: (2025)
SSR-2D: Semantic 3D Scene Reconstruction from 2D Images
por: Huang, Junwen, et al.
Publicado: (2023)
por: Huang, Junwen, et al.
Publicado: (2023)
N3D-VLM: Native 3D Grounding Enables Accurate Spatial Reasoning in Vision-Language Models
por: Wang, Yuxin, et al.
Publicado: (2025)
por: Wang, Yuxin, et al.
Publicado: (2025)
CEI-3D: Collaborative Explicit-Implicit 3D Reconstruction for Realistic and Fine-Grained Object Editing
por: Shi, Yue, et al.
Publicado: (2026)
por: Shi, Yue, et al.
Publicado: (2026)
SpatialGeo:Boosting Spatial Reasoning in Multimodal LLMs via Geometry-Semantics Fusion
por: Guo, Jiajie, et al.
Publicado: (2025)
por: Guo, Jiajie, et al.
Publicado: (2025)
SpatialThinker: Reinforcing 3D Reasoning in Multimodal LLMs via Spatial Rewards
por: Batra, Hunar, et al.
Publicado: (2025)
por: Batra, Hunar, et al.
Publicado: (2025)
A Neural Representation Framework with LLM-Driven Spatial Reasoning for Open-Vocabulary 3D Visual Grounding
por: Liu, Zhenyang, et al.
Publicado: (2025)
por: Liu, Zhenyang, et al.
Publicado: (2025)
Structured 3D Latents for Scalable and Versatile 3D Generation
por: Xiang, Jianfeng, et al.
Publicado: (2024)
por: Xiang, Jianfeng, et al.
Publicado: (2024)
Grounded 3D-LLM with Referent Tokens
por: Chen, Yilun, et al.
Publicado: (2024)
por: Chen, Yilun, et al.
Publicado: (2024)
FinePOSE: Fine-Grained Prompt-Driven 3D Human Pose Estimation via Diffusion Models
por: Xu, Jinglin, et al.
Publicado: (2024)
por: Xu, Jinglin, et al.
Publicado: (2024)
UniPre3D: Unified Pre-training of 3D Point Cloud Models with Cross-Modal Gaussian Splatting
por: Wang, Ziyi, et al.
Publicado: (2025)
por: Wang, Ziyi, et al.
Publicado: (2025)
SSR: A Training-Free Approach for Streaming 3D Reconstruction
por: Deng, Hui, et al.
Publicado: (2026)
por: Deng, Hui, et al.
Publicado: (2026)
UniPart: Part-Level 3D Generation with Unified 3D Geom-Seg Latents
por: He, Xufan, et al.
Publicado: (2025)
por: He, Xufan, et al.
Publicado: (2025)
Prompt-Guided Spatial Understanding with RGB-D Transformers for Fine-Grained Object Relation Reasoning
por: Muturi, Tanner, et al.
Publicado: (2025)
por: Muturi, Tanner, et al.
Publicado: (2025)
Fine-Grained 3D Facial Reconstruction for Micro-Expressions
por: Sun, Che, et al.
Publicado: (2026)
por: Sun, Che, et al.
Publicado: (2026)
XMask3D: Cross-modal Mask Reasoning for Open Vocabulary 3D Semantic Segmentation
por: Wang, Ziyi, et al.
Publicado: (2024)
por: Wang, Ziyi, et al.
Publicado: (2024)
SSR: Enhancing Depth Perception in Vision-Language Models via Rationale-Guided Spatial Reasoning
por: Liu, Yang, et al.
Publicado: (2025)
por: Liu, Yang, et al.
Publicado: (2025)
A Coarse-to-Fine Approach to Multi-Modality 3D Occupancy Grounding
por: Shi, Zhan, et al.
Publicado: (2025)
por: Shi, Zhan, et al.
Publicado: (2025)
Map2Thought: Explicit 3D Spatial Reasoning via Metric Cognitive Maps
por: Gao, Xiangjun, et al.
Publicado: (2026)
por: Gao, Xiangjun, et al.
Publicado: (2026)
Spatial 3D-LLM: Exploring Spatial Awareness in 3D Vision-Language Models
por: Wang, Xiaoyan, et al.
Publicado: (2025)
por: Wang, Xiaoyan, et al.
Publicado: (2025)
AeroRAG: Structured Multimodal Retrieval-Augmented LLM for Fine-Grained Aerial Visual Reasoning
por: Xue, Junxiao, et al.
Publicado: (2026)
por: Xue, Junxiao, et al.
Publicado: (2026)
Unified Representation Space for 3D Visual Grounding
por: Zheng, Yinuo, et al.
Publicado: (2025)
por: Zheng, Yinuo, et al.
Publicado: (2025)
UniSplat: Unified Spatio-Temporal Fusion via 3D Latent Scaffolds for Dynamic Driving Scene Reconstruction
por: Shi, Chen, et al.
Publicado: (2025)
por: Shi, Chen, et al.
Publicado: (2025)
A Unified Framework for 3D Scene Understanding
por: Xu, Wei, et al.
Publicado: (2024)
por: Xu, Wei, et al.
Publicado: (2024)
SpatialReasoner: Towards Explicit and Generalizable 3D Spatial Reasoning
por: Ma, Wufei, et al.
Publicado: (2025)
por: Ma, Wufei, et al.
Publicado: (2025)
SPAZER: Spatial-Semantic Progressive Reasoning Agent for Zero-shot 3D Visual Grounding
por: Jin, Zhao, et al.
Publicado: (2025)
por: Jin, Zhao, et al.
Publicado: (2025)
Dual Attribute-Spatial Relation Alignment for 3D Visual Grounding
por: Xu, Yue, et al.
Publicado: (2024)
por: Xu, Yue, et al.
Publicado: (2024)
How to Enable LLM with 3D Capacity? A Survey of Spatial Reasoning in LLM
por: Zha, Jirong, et al.
Publicado: (2025)
por: Zha, Jirong, et al.
Publicado: (2025)
PointLLM-R: Enhancing 3D Point Cloud Reasoning via Chain-of-Thought
por: Chen, Chaoqi, et al.
Publicado: (2026)
por: Chen, Chaoqi, et al.
Publicado: (2026)
Direct3D: Scalable Image-to-3D Generation via 3D Latent Diffusion Transformer
por: Wu, Shuang, et al.
Publicado: (2024)
por: Wu, Shuang, et al.
Publicado: (2024)
Reasoning Matters for 3D Visual Grounding
por: Huang, Hsiang-Wei, et al.
Publicado: (2026)
por: Huang, Hsiang-Wei, et al.
Publicado: (2026)
ArtiLatent: Realistic Articulated 3D Object Generation via Structured Latents
por: Chen, Honghua, et al.
Publicado: (2025)
por: Chen, Honghua, et al.
Publicado: (2025)
MAG-3D: Multi-Agent Grounded Reasoning for 3D Understanding
por: Zheng, Henry, et al.
Publicado: (2026)
por: Zheng, Henry, et al.
Publicado: (2026)
Ejemplares similares
-
Fine-Grained Spatial and Verbal Losses for 3D Visual Grounding
por: Dey, Sombit, et al.
Publicado: (2024) -
Enhancing Fine-Grained Spatial Grounding in 3D CT Report Generation via Discriminative Guidance
por: Wang, Chenyu, et al.
Publicado: (2026) -
UniFunc3D: Unified Active Spatial-Temporal Grounding for 3D Functionality Segmentation
por: Lin, Jiaying, et al.
Publicado: (2026) -
SSR: Pushing the Limit of Spatial Intelligence with Structured Scene Reasoning
por: Zhang, Yi, et al.
Publicado: (2026) -
Reasoning3D -- Grounding and Reasoning in 3D: Fine-Grained Zero-Shot Open-Vocabulary 3D Reasoning Part Segmentation via Large Vision-Language Models
por: Chen, Tianrun, et al.
Publicado: (2024)