Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Zechuan, Yu, Hongshan, Ding, Yihao, Li, Yan, He, Yong, Akhtar, Naveed |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
GO-N3RDet: Geometry Optimized NeRF-enhanced 3D Object Detector
by: Li, Zechuan, et al.
Published: (2025)
by: Li, Zechuan, et al.
Published: (2025)
3D Question Answering for City Scene Understanding
by: Sun, Penglei, et al.
Published: (2024)
by: Sun, Penglei, et al.
Published: (2024)
Symmetry-Aware 9D Pose Estimation with Sim(3)-Consistent Feature and Spherical Inception Convolution
by: Cheng, Panfei, et al.
Published: (2026)
by: Cheng, Panfei, et al.
Published: (2026)
3D-MoRe: Unified Modal-Contextual Reasoning for Embodied Question Answering
by: Xu, Rongtao, et al.
Published: (2025)
by: Xu, Rongtao, et al.
Published: (2025)
Deep Learning Based 3D Segmentation: A Survey
by: He, Yong, et al.
Published: (2021)
by: He, Yong, et al.
Published: (2021)
DSPNet: Dual-vision Scene Perception for Robust 3D Question Answering
by: Luo, Jingzhou, et al.
Published: (2025)
by: Luo, Jingzhou, et al.
Published: (2025)
Skip Mamba Diffusion for Monocular 3D Semantic Scene Completion
by: Liang, Li, et al.
Published: (2025)
by: Liang, Li, et al.
Published: (2025)
CymbaDiff: Structured Spatial Diffusion for Sketch-based 3D Semantic Urban Scene Generation
by: Liang, Li, et al.
Published: (2025)
by: Liang, Li, et al.
Published: (2025)
GraphEQA: Using 3D Semantic Scene Graphs for Real-time Embodied Question Answering
by: Saxena, Saumya, et al.
Published: (2024)
by: Saxena, Saumya, et al.
Published: (2024)
Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation
by: Zhu, Ziyu, et al.
Published: (2025)
by: Zhu, Ziyu, et al.
Published: (2025)
Multistream Network for LiDAR and Camera-based 3D Object Detection in Outdoor Scenes
by: Ibrahim, Muhammad, et al.
Published: (2025)
by: Ibrahim, Muhammad, et al.
Published: (2025)
SceneExpander: Expanding 3D Scenes with Free-Form Inserted Views
by: He, Zijian, et al.
Published: (2026)
by: He, Zijian, et al.
Published: (2026)
Open-Vocabulary Octree-Graph for 3D Scene Understanding
by: Wang, Zhigang, et al.
Published: (2024)
by: Wang, Zhigang, et al.
Published: (2024)
Open-Vocabulary SAM3D: Towards Training-free Open-Vocabulary 3D Scene Understanding
by: Tai, Hanchen, et al.
Published: (2024)
by: Tai, Hanchen, et al.
Published: (2024)
SAGE: Scalable Agentic 3D Scene Generation for Embodied AI
by: Xia, Hongchi, et al.
Published: (2026)
by: Xia, Hongchi, et al.
Published: (2026)
IndustryEQA: Pushing the Frontiers of Embodied Question Answering in Industrial Scenarios
by: Li, Yifan, et al.
Published: (2025)
by: Li, Yifan, et al.
Published: (2025)
Efficient Diffusion Models for Vision: A Survey
by: Ulhaq, Anwaar, et al.
Published: (2022)
by: Ulhaq, Anwaar, et al.
Published: (2022)
Soft Masked Transformer for Point Cloud Processing with Skip Attention-Based Upsampling
by: He, Yong, et al.
Published: (2024)
by: He, Yong, et al.
Published: (2024)
PointDiffuse: A Dual-Conditional Diffusion Model for Enhanced Point Cloud Semantic Segmentation
by: He, Yong, et al.
Published: (2025)
by: He, Yong, et al.
Published: (2025)
Space3D-Bench: Spatial 3D Question Answering Benchmark
by: Szymanska, Emilia, et al.
Published: (2024)
by: Szymanska, Emilia, et al.
Published: (2024)
D3Seg: Dependency-Aware Diffusion for Brain Tumor Segmentation with Missing Modalities
by: Ali, Danish, et al.
Published: (2026)
by: Ali, Danish, et al.
Published: (2026)
SynJAC: Synthetic-data-driven Joint-granular Adaptation and Calibration for Domain Specific Scanned Document Key Information Extraction
by: Ding, Yihao, et al.
Published: (2024)
by: Ding, Yihao, et al.
Published: (2024)
TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking
by: Hu, Jiyuan, et al.
Published: (2026)
by: Hu, Jiyuan, et al.
Published: (2026)
EmbodiedSplat: Online Feed-Forward Semantic 3DGS for Open-Vocabulary 3D Scene Understanding
by: Lee, Seungjun, et al.
Published: (2026)
by: Lee, Seungjun, et al.
Published: (2026)
Neural 3D Strokes: Creating Stylized 3D Scenes with Vectorized 3D Strokes
by: Duan, Hao-Bin, et al.
Published: (2023)
by: Duan, Hao-Bin, et al.
Published: (2023)
Compositional 4D Dynamic Scenes Understanding with Physics Priors for Video Question Answering
by: Wang, Xingrui, et al.
Published: (2024)
by: Wang, Xingrui, et al.
Published: (2024)
3D-Mem: 3D Scene Memory for Embodied Exploration and Reasoning
by: Yang, Yuncong, et al.
Published: (2024)
by: Yang, Yuncong, et al.
Published: (2024)
OST: Refining Text Knowledge with Optimal Spatio-Temporal Descriptor for General Video Recognition
by: Chen, Tongjia, et al.
Published: (2023)
by: Chen, Tongjia, et al.
Published: (2023)
3D Question Answering via only 2D Vision-Language Models
by: Wang, Fengyun, et al.
Published: (2025)
by: Wang, Fengyun, et al.
Published: (2025)
SynDoc: A Hybrid Discriminative-Generative Framework for Enhancing Synthetic Domain-Adaptive Document Key Information Extraction
by: Ding, Yihao, et al.
Published: (2025)
by: Ding, Yihao, et al.
Published: (2025)
Dense Multimodal Alignment for Open-Vocabulary 3D Scene Understanding
by: Li, Ruihuang, et al.
Published: (2024)
by: Li, Ruihuang, et al.
Published: (2024)
Inst3D-LMM: Instance-Aware 3D Scene Understanding with Multi-modal Instruction Tuning
by: Yu, Hanxun, et al.
Published: (2025)
by: Yu, Hanxun, et al.
Published: (2025)
SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes
by: Huang, Jiaxin, et al.
Published: (2025)
by: Huang, Jiaxin, et al.
Published: (2025)
Swin3D++: Effective Multi-Source Pretraining for 3D Indoor Scene Understanding
by: Yang, Yu-Qi, et al.
Published: (2024)
by: Yang, Yu-Qi, et al.
Published: (2024)
Natural Language Understanding and Inference with MLLM in Visual Question Answering: A Survey
by: Kuang, Jiayi, et al.
Published: (2024)
by: Kuang, Jiayi, et al.
Published: (2024)
LangSurf: Language-Embedded Surface Gaussians for 3D Scene Understanding
by: Li, Hao, et al.
Published: (2024)
by: Li, Hao, et al.
Published: (2024)
ShapeLLM: Universal 3D Object Understanding for Embodied Interaction
by: Qi, Zekun, et al.
Published: (2024)
by: Qi, Zekun, et al.
Published: (2024)
3D Scene Generation: A Survey
by: Wen, Beichen, et al.
Published: (2025)
by: Wen, Beichen, et al.
Published: (2025)
A Comprehensive Survey of 3D Dense Captioning: Localizing and Describing Objects in 3D Scenes
by: Yu, Ting, et al.
Published: (2024)
by: Yu, Ting, et al.
Published: (2024)
Simultaneous Multiple Object Detection and Pose Estimation using 3D Model Infusion with Monocular Vision
by: Li, Congliang, et al.
Published: (2022)
by: Li, Congliang, et al.
Published: (2022)
Similar Items
-
GO-N3RDet: Geometry Optimized NeRF-enhanced 3D Object Detector
by: Li, Zechuan, et al.
Published: (2025) -
3D Question Answering for City Scene Understanding
by: Sun, Penglei, et al.
Published: (2024) -
Symmetry-Aware 9D Pose Estimation with Sim(3)-Consistent Feature and Spherical Inception Convolution
by: Cheng, Panfei, et al.
Published: (2026) -
3D-MoRe: Unified Modal-Contextual Reasoning for Embodied Question Answering
by: Xu, Rongtao, et al.
Published: (2025) -
Deep Learning Based 3D Segmentation: A Survey
by: He, Yong, et al.
Published: (2021)