SURPRISE3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Huang, Jiaxin, Li, Ziwen, Zhang, Hanlve, Chen, Runnan, He, Xiao, Guo, Yandong, Wang, Wenping, Liu, Tongliang, Gong, Mingming |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MLLM-For3D: Adapting Multimodal Large Language Model for 3D Reasoning Segmentation
par: Huang, Jiaxin, et autres
Publié: (2025)
par: Huang, Jiaxin, et autres
Publié: (2025)
PanoSLAM: Panoptic 3D Scene Reconstruction via Gaussian SLAM
par: Chen, Runnan, et autres
Publié: (2024)
par: Chen, Runnan, et autres
Publié: (2024)
PosA-VLA: Enhancing Action Generation via Pose-Conditioned Anchor Attention
par: Li, Ziwen, et autres
Publié: (2025)
par: Li, Ziwen, et autres
Publié: (2025)
UrbanGS: Semantic-Guided Gaussian Splatting for Urban Scene Reconstruction
par: Li, Ziwen, et autres
Publié: (2024)
par: Li, Ziwen, et autres
Publié: (2024)
Hierarchical Collaborative Fusion for 3D Instance-aware Referring Expression Segmentation
par: Zhou, Keshen, et autres
Publié: (2026)
par: Zhou, Keshen, et autres
Publié: (2026)
Intellectual Property Protection for 3D Gaussian Splatting Assets: A Survey
par: Zhao, Longjie, et autres
Publié: (2026)
par: Zhao, Longjie, et autres
Publié: (2026)
Intern-GS: Vision Model Guided Sparse-View 3D Gaussian Splatting
par: Sun, Xiangyu, et autres
Publié: (2025)
par: Sun, Xiangyu, et autres
Publié: (2025)
Articulate3D: Holistic Understanding of 3D Scenes as Universal Scene Description
par: Halacheva, Anna-Maria, et autres
Publié: (2024)
par: Halacheva, Anna-Maria, et autres
Publié: (2024)
RDSplat: Robust Watermarking for 3D Gaussian Splatting Against 2D and 3D Diffusion Editing
par: Zhao, Longjie, et autres
Publié: (2025)
par: Zhao, Longjie, et autres
Publié: (2025)
Language-Assisted 3D Scene Understanding
par: Wu, Yanmin, et autres
Publié: (2023)
par: Wu, Yanmin, et autres
Publié: (2023)
3D-Mem: 3D Scene Memory for Embodied Exploration and Reasoning
par: Yang, Yuncong, et autres
Publié: (2024)
par: Yang, Yuncong, et autres
Publié: (2024)
Is Your LiDAR Placement Optimized for 3D Scene Understanding?
par: Li, Ye, et autres
Publié: (2024)
par: Li, Ye, et autres
Publié: (2024)
Multi-modal Situated Reasoning in 3D Scenes
par: Linghu, Xiongkun, et autres
Publié: (2024)
par: Linghu, Xiongkun, et autres
Publié: (2024)
LightHarmony3D: Harmonizing Illumination and Shadows for Object Insertion in 3D Gaussian Splatting
par: Huang, Tianyu, et autres
Publié: (2026)
par: Huang, Tianyu, et autres
Publié: (2026)
MesaTask: Towards Task-Driven Tabletop Scene Generation via 3D Spatial Reasoning
par: Hao, Jinkun, et autres
Publié: (2025)
par: Hao, Jinkun, et autres
Publié: (2025)
PLAF: Pixel-wise Language-Aligned Feature Extraction for Efficient 3D Scene Understanding
par: Wen, Junjie, et autres
Publié: (2026)
par: Wen, Junjie, et autres
Publié: (2026)
SHOW3D: Capturing Scenes of 3D Hands and Objects in the Wild
par: Rim, Patrick, et autres
Publié: (2026)
par: Rim, Patrick, et autres
Publié: (2026)
Generation Models Know Space: Unleashing Implicit 3D Priors for Scene Understanding
par: Wu, Xianjin, et autres
Publié: (2026)
par: Wu, Xianjin, et autres
Publié: (2026)
REACT3D: Recovering Articulations for Interactive Physical 3D Scenes
par: Huang, Zhao, et autres
Publié: (2025)
par: Huang, Zhao, et autres
Publié: (2025)
GLEAM: Learning Generalizable Exploration Policy for Active Mapping in Complex 3D Indoor Scenes
par: Chen, Xiao, et autres
Publié: (2025)
par: Chen, Xiao, et autres
Publié: (2025)
OmniLiDAR: A Unified Diffusion Framework for Multi-Domain 3D LiDAR Generation
par: Liu, Youquan, et autres
Publié: (2026)
par: Liu, Youquan, et autres
Publié: (2026)
Calib3D: Calibrating Model Preferences for Reliable 3D Scene Understanding
par: Kong, Lingdong, et autres
Publié: (2024)
par: Kong, Lingdong, et autres
Publié: (2024)
Text-Scene: A Scene-to-Language Parsing Framework for 3D Scene Understanding
par: Li, Haoyuan, et autres
Publié: (2025)
par: Li, Haoyuan, et autres
Publié: (2025)
DGSG-Mind: Dynamic 3D Gaussian Scene Graphs for Long-Term Scene Understanding and Grounding
par: Ge, Luzhou, et autres
Publié: (2026)
par: Ge, Luzhou, et autres
Publié: (2026)
QueSTMaps: Queryable Semantic Topological Maps for 3D Scene Understanding
par: Mehan, Yash, et autres
Publié: (2024)
par: Mehan, Yash, et autres
Publié: (2024)
Lexicon3D: Probing Visual Foundation Models for Complex 3D Scene Understanding
par: Man, Yunze, et autres
Publié: (2024)
par: Man, Yunze, et autres
Publié: (2024)
arg-VU: Affordance Reasoning with Physics-Aware 3D Geometry for Visual Understanding in Robotic Surgery
par: Xiao, Nan, et autres
Publié: (2026)
par: Xiao, Nan, et autres
Publié: (2026)
MoD-SLAM: Monocular Dense Mapping for Unbounded 3D Scene Reconstruction
par: Zhou, Heng, et autres
Publié: (2024)
par: Zhou, Heng, et autres
Publié: (2024)
SGFormer: Satellite-Ground Fusion for 3D Semantic Scene Completion
par: Guo, Xiyue, et autres
Publié: (2025)
par: Guo, Xiyue, et autres
Publié: (2025)
OVGaussian: Generalizable 3D Gaussian Segmentation with Open Vocabularies
par: Chen, Runnan, et autres
Publié: (2024)
par: Chen, Runnan, et autres
Publié: (2024)
3DVLA: Enhancing Vision-Language-Action Models via 3D Spatial and Instance Understanding
par: Xia, Zhongyu, et autres
Publié: (2026)
par: Xia, Zhongyu, et autres
Publié: (2026)
Intelligent Spatial Perception by Building Hierarchical 3D Scene Graphs for Indoor Scenarios with the Help of LLMs
par: Cheng, Yao, et autres
Publié: (2025)
par: Cheng, Yao, et autres
Publié: (2025)
AdLift: Lifting Adversarial Perturbations to Safeguard 3D Gaussian Splatting Assets Against Instruction-Driven Editing
par: Hong, Ziming, et autres
Publié: (2025)
par: Hong, Ziming, et autres
Publié: (2025)
MMScan: A Multi-Modal 3D Scene Dataset with Hierarchical Grounded Language Annotations
par: Lyu, Ruiyuan, et autres
Publié: (2024)
par: Lyu, Ruiyuan, et autres
Publié: (2024)
Multi-Modal Data-Efficient 3D Scene Understanding for Autonomous Driving
par: Kong, Lingdong, et autres
Publié: (2024)
par: Kong, Lingdong, et autres
Publié: (2024)
UniScene: Multi-Camera Unified Pre-training via 3D Scene Reconstruction for Autonomous Driving
par: Min, Chen, et autres
Publié: (2023)
par: Min, Chen, et autres
Publié: (2023)
DME-Driver: Integrating Human Decision Logic and 3D Scene Perception in Autonomous Driving
par: Han, Wencheng, et autres
Publié: (2024)
par: Han, Wencheng, et autres
Publié: (2024)
Photorealistic Phantom Roads in Real Scenes: Disentangling 3D Hallucinations from Physical Geometry
par: Nguyen, Hoang, et autres
Publié: (2025)
par: Nguyen, Hoang, et autres
Publié: (2025)
ZING-3D: Zero-shot Incremental 3D Scene Graphs via Vision-Language Models
par: Saxena, Pranav, et autres
Publié: (2025)
par: Saxena, Pranav, et autres
Publié: (2025)
OpenLex3D: A Tiered Evaluation Benchmark for Open-Vocabulary 3D Scene Representations
par: Kassab, Christina, et autres
Publié: (2025)
par: Kassab, Christina, et autres
Publié: (2025)
Documents similaires
-
MLLM-For3D: Adapting Multimodal Large Language Model for 3D Reasoning Segmentation
par: Huang, Jiaxin, et autres
Publié: (2025) -
PanoSLAM: Panoptic 3D Scene Reconstruction via Gaussian SLAM
par: Chen, Runnan, et autres
Publié: (2024) -
PosA-VLA: Enhancing Action Generation via Pose-Conditioned Anchor Attention
par: Li, Ziwen, et autres
Publié: (2025) -
UrbanGS: Semantic-Guided Gaussian Splatting for Urban Scene Reconstruction
par: Li, Ziwen, et autres
Publié: (2024) -
Hierarchical Collaborative Fusion for 3D Instance-aware Referring Expression Segmentation
par: Zhou, Keshen, et autres
Publié: (2026)