Space3D-Bench: Spatial 3D Question Answering Benchmark
Fuente:
arXiv
Salvato in:
| Autori principali: | Szymanska, Emilia, Dusmanu, Mihai, Buurlage, Jan-Willem, Rad, Mahdi, Pollefeys, Marc |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Loc3R-VLM: Language-based Localization and 3D Reasoning with Vision-Language Models
di: Qu, Kevin, et al.
Pubblicazione: (2026)
di: Qu, Kevin, et al.
Pubblicazione: (2026)
MaRINeR: Enhancing Novel Views by Matching Rendered Images with Nearby References
di: Bösiger, Lukas, et al.
Pubblicazione: (2024)
di: Bösiger, Lukas, et al.
Pubblicazione: (2024)
CoPE-VideoLM: Leveraging Codec Primitives For Efficient Video Language Modeling
di: Sarkar, Sayan Deb, et al.
Pubblicazione: (2026)
di: Sarkar, Sayan Deb, et al.
Pubblicazione: (2026)
Multi Activity Sequence Alignment via Implicit Clustering
di: Kwon, Taein, et al.
Pubblicazione: (2025)
di: Kwon, Taein, et al.
Pubblicazione: (2025)
SpaceControl: Introducing Test-Time Spatial Control to 3D Generative Modeling
di: Fedele, Elisabetta, et al.
Pubblicazione: (2025)
di: Fedele, Elisabetta, et al.
Pubblicazione: (2025)
MR.NAVI: Mixed-Reality Navigation Assistant for the Visually Impaired
di: Pfitzer, Nicolas, et al.
Pubblicazione: (2025)
di: Pfitzer, Nicolas, et al.
Pubblicazione: (2025)
EgoGen: An Egocentric Synthetic Data Generator
di: Li, Gen, et al.
Pubblicazione: (2024)
di: Li, Gen, et al.
Pubblicazione: (2024)
3D Question Answering for City Scene Understanding
di: Sun, Penglei, et al.
Pubblicazione: (2024)
di: Sun, Penglei, et al.
Pubblicazione: (2024)
REACT3D: Recovering Articulations for Interactive Physical 3D Scenes
di: Huang, Zhao, et al.
Pubblicazione: (2025)
di: Huang, Zhao, et al.
Pubblicazione: (2025)
OpenDAS: Open-Vocabulary Domain Adaptation for 2D and 3D Segmentation
di: Yilmaz, Gonca, et al.
Pubblicazione: (2024)
di: Yilmaz, Gonca, et al.
Pubblicazione: (2024)
Open-Vocabulary Functional 3D Scene Graphs for Real-World Indoor Spaces
di: Zhang, Chenyangguang, et al.
Pubblicazione: (2025)
di: Zhang, Chenyangguang, et al.
Pubblicazione: (2025)
Volumetric Semantically Consistent 3D Panoptic Mapping
di: Miao, Yang, et al.
Pubblicazione: (2023)
di: Miao, Yang, et al.
Pubblicazione: (2023)
WildGaussians: 3D Gaussian Splatting in the Wild
di: Kulhanek, Jonas, et al.
Pubblicazione: (2024)
di: Kulhanek, Jonas, et al.
Pubblicazione: (2024)
Spatial4D-Bench: A Versatile 4D Spatial Intelligence Benchmark
di: Wang, Pan, et al.
Pubblicazione: (2025)
di: Wang, Pan, et al.
Pubblicazione: (2025)
CG-Bench: Clue-grounded Question Answering Benchmark for Long Video Understanding
di: Chen, Guo, et al.
Pubblicazione: (2024)
di: Chen, Guo, et al.
Pubblicazione: (2024)
Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering
di: Li, Zechuan, et al.
Pubblicazione: (2025)
di: Li, Zechuan, et al.
Pubblicazione: (2025)
SuperDec: 3D Scene Decomposition with Superquadric Primitives
di: Fedele, Elisabetta, et al.
Pubblicazione: (2025)
di: Fedele, Elisabetta, et al.
Pubblicazione: (2025)
Object-X: Learning to Reconstruct Multi-Modal 3D Object Representations
di: Di Lorenzo, Gaia, et al.
Pubblicazione: (2025)
di: Di Lorenzo, Gaia, et al.
Pubblicazione: (2025)
3D Question Answering via only 2D Vision-Language Models
di: Wang, Fengyun, et al.
Pubblicazione: (2025)
di: Wang, Fengyun, et al.
Pubblicazione: (2025)
Hierarchical and Holistic Open-Vocabulary Functional 3D Scene Graphs for Indoor Spaces
di: Hu, Xinggang, et al.
Pubblicazione: (2026)
di: Hu, Xinggang, et al.
Pubblicazione: (2026)
CrossOver: 3D Scene Cross-Modal Alignment
di: Sarkar, Sayan Deb, et al.
Pubblicazione: (2025)
di: Sarkar, Sayan Deb, et al.
Pubblicazione: (2025)
3D Neural Edge Reconstruction
di: Li, Lei, et al.
Pubblicazione: (2024)
di: Li, Lei, et al.
Pubblicazione: (2024)
TORA: Topological Representation Alignment for 3D Shape Assembly
di: Lee, Nahyuk, et al.
Pubblicazione: (2026)
di: Lee, Nahyuk, et al.
Pubblicazione: (2026)
Dynamic 3D Gaussian Fields for Urban Areas
di: Fischer, Tobias, et al.
Pubblicazione: (2024)
di: Fischer, Tobias, et al.
Pubblicazione: (2024)
ChineseVideoBench: Benchmarking Multi-modal Large Models for Chinese Video Question Answering
di: Nie, Yuxiang, et al.
Pubblicazione: (2025)
di: Nie, Yuxiang, et al.
Pubblicazione: (2025)
YoNoSplat: You Only Need One Model for Feedforward 3D Gaussian Splatting
di: Ye, Botao, et al.
Pubblicazione: (2025)
di: Ye, Botao, et al.
Pubblicazione: (2025)
DSPNet: Dual-vision Scene Perception for Robust 3D Question Answering
di: Luo, Jingzhou, et al.
Pubblicazione: (2025)
di: Luo, Jingzhou, et al.
Pubblicazione: (2025)
3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection
di: Yang, Yung-Hsu, et al.
Pubblicazione: (2025)
di: Yang, Yung-Hsu, et al.
Pubblicazione: (2025)
AdaptToken: Entropy-based Adaptive Token Selection for MLLM Long Video Understanding
di: Qi, Haozhe, et al.
Pubblicazione: (2026)
di: Qi, Haozhe, et al.
Pubblicazione: (2026)
Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering
di: Chen, Yixiong, et al.
Pubblicazione: (2025)
di: Chen, Yixiong, et al.
Pubblicazione: (2025)
Sat2Scene: 3D Urban Scene Generation from Satellite Images with Diffusion
di: Li, Zuoyue, et al.
Pubblicazione: (2024)
di: Li, Zuoyue, et al.
Pubblicazione: (2024)
Synthesizing Consistent Novel Views via 3D Epipolar Attention without Re-Training
di: Ye, Botao, et al.
Pubblicazione: (2025)
di: Ye, Botao, et al.
Pubblicazione: (2025)
3DGen-Bench: Comprehensive Benchmark Suite for 3D Generative Models
di: Zhang, Yuhan, et al.
Pubblicazione: (2025)
di: Zhang, Yuhan, et al.
Pubblicazione: (2025)
VidBot: Learning Generalizable 3D Actions from In-the-Wild 2D Human Videos for Zero-Shot Robotic Manipulation
di: Chen, Hanzhi, et al.
Pubblicazione: (2025)
di: Chen, Hanzhi, et al.
Pubblicazione: (2025)
LvBench: A Benchmark for Long-form Video Understanding with Versatile Multi-modal Question Answering
di: Zhang, Hongjie, et al.
Pubblicazione: (2023)
di: Zhang, Hongjie, et al.
Pubblicazione: (2023)
CaST-Bench: Benchmarking Causal Chain-Grounded Spatio-Temporal Reasoning for Video Question Answering
di: Zhang, Mingfang, et al.
Pubblicazione: (2026)
di: Zhang, Mingfang, et al.
Pubblicazione: (2026)
E3D-Bench: A Benchmark for End-to-End 3D Geometric Foundation Models
di: Cong, Wenyan, et al.
Pubblicazione: (2025)
di: Cong, Wenyan, et al.
Pubblicazione: (2025)
Evaluating Zero-Shot GPT-4V Performance on 3D Visual Question Answering Benchmarks
di: Singh, Simranjit, et al.
Pubblicazione: (2024)
di: Singh, Simranjit, et al.
Pubblicazione: (2024)
SeGPruner: Semantic-Geometric Visual Token Pruner for 3D Question Answering
di: Li, Wenli, et al.
Pubblicazione: (2026)
di: Li, Wenli, et al.
Pubblicazione: (2026)
3D-MoRe: Unified Modal-Contextual Reasoning for Embodied Question Answering
di: Xu, Rongtao, et al.
Pubblicazione: (2025)
di: Xu, Rongtao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Loc3R-VLM: Language-based Localization and 3D Reasoning with Vision-Language Models
di: Qu, Kevin, et al.
Pubblicazione: (2026) -
MaRINeR: Enhancing Novel Views by Matching Rendered Images with Nearby References
di: Bösiger, Lukas, et al.
Pubblicazione: (2024) -
CoPE-VideoLM: Leveraging Codec Primitives For Efficient Video Language Modeling
di: Sarkar, Sayan Deb, et al.
Pubblicazione: (2026) -
Multi Activity Sequence Alignment via Implicit Clustering
di: Kwon, Taein, et al.
Pubblicazione: (2025) -
SpaceControl: Introducing Test-Time Spatial Control to 3D Generative Modeling
di: Fedele, Elisabetta, et al.
Pubblicazione: (2025)