Salvato in:
| Autori principali: | Fu, Rao, Liu, Jingyu, Chen, Xilun, Nie, Yixin, Xiong, Wenhan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2403.11401 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SceneLLM: Implicit Language Reasoning in LLM for Dynamic Scene Graph Generation
di: Zhang, Hang, et al.
Pubblicazione: (2024)
di: Zhang, Hang, et al.
Pubblicazione: (2024)
SceneVerse: Scaling 3D Vision-Language Learning for Grounded Scene Understanding
di: Jia, Baoxiong, et al.
Pubblicazione: (2024)
di: Jia, Baoxiong, et al.
Pubblicazione: (2024)
Text-Scene: A Scene-to-Language Parsing Framework for 3D Scene Understanding
di: Li, Haoyuan, et al.
Pubblicazione: (2025)
di: Li, Haoyuan, et al.
Pubblicazione: (2025)
Lifting Unlabeled Internet-level Data for 3D Scene Understanding
di: Chen, Yixin, et al.
Pubblicazione: (2026)
di: Chen, Yixin, et al.
Pubblicazione: (2026)
Masking Matters: Unlocking the Spatial Reasoning Capabilities of LLMs for 3D Scene-Language Understanding
di: Jeon, Yerim, et al.
Pubblicazione: (2025)
di: Jeon, Yerim, et al.
Pubblicazione: (2025)
HexPlane Representation for 3D Semantic Scene Understanding
di: Chen, Zeren, et al.
Pubblicazione: (2025)
di: Chen, Zeren, et al.
Pubblicazione: (2025)
Argus: Leveraging Multiview Images for Improved 3-D Scene Understanding With Large Language Models
di: Xu, Yifan, et al.
Pubblicazione: (2025)
di: Xu, Yifan, et al.
Pubblicazione: (2025)
Lexicon3D: Probing Visual Foundation Models for Complex 3D Scene Understanding
di: Man, Yunze, et al.
Pubblicazione: (2024)
di: Man, Yunze, et al.
Pubblicazione: (2024)
RE-VLM: Event-Augmented Vision-Language Model for Scene Understanding
di: Liu, Hanqing, et al.
Pubblicazione: (2026)
di: Liu, Hanqing, et al.
Pubblicazione: (2026)
SceneCOT: Eliciting Grounded Chain-of-Thought Reasoning in 3D Scenes
di: Linghu, Xiongkun, et al.
Pubblicazione: (2025)
di: Linghu, Xiongkun, et al.
Pubblicazione: (2025)
Multi-Agent Visual-Language Reasoning for Comprehensive Highway Scene Understanding
di: Yang, Yunxiang, et al.
Pubblicazione: (2025)
di: Yang, Yunxiang, et al.
Pubblicazione: (2025)
Insight-V++: Towards Advanced Long-Chain Visual Reasoning with Multimodal Large Language Models
di: Dong, Yuhao, et al.
Pubblicazione: (2026)
di: Dong, Yuhao, et al.
Pubblicazione: (2026)
Masked Scene Modeling: Narrowing the Gap Between Supervised and Self-Supervised Learning in 3D Scene Understanding
di: Hermosilla, Pedro, et al.
Pubblicazione: (2025)
di: Hermosilla, Pedro, et al.
Pubblicazione: (2025)
NuScenes-SpatialQA: A Spatial Understanding and Reasoning Benchmark for Vision-Language Models in Autonomous Driving
di: Tian, Kexin, et al.
Pubblicazione: (2025)
di: Tian, Kexin, et al.
Pubblicazione: (2025)
DRScaffold: Boosting Dense-Scene Reasoning in Lightweight Vision Language Models
di: Shi, Xinrui, et al.
Pubblicazione: (2026)
di: Shi, Xinrui, et al.
Pubblicazione: (2026)
FMGS: Foundation Model Embedded 3D Gaussian Splatting for Holistic 3D Scene Understanding
di: Zuo, Xingxing, et al.
Pubblicazione: (2024)
di: Zuo, Xingxing, et al.
Pubblicazione: (2024)
Evaluating Compositional Scene Understanding in Multimodal Generative Models
di: Fu, Shuhao, et al.
Pubblicazione: (2025)
di: Fu, Shuhao, et al.
Pubblicazione: (2025)
Reasoning under Vision: Understanding Visual-Spatial Cognition in Vision-Language Models for CAPTCHA
di: Song, Python, et al.
Pubblicazione: (2025)
di: Song, Python, et al.
Pubblicazione: (2025)
Instruct 4D-to-4D: Editing 4D Scenes as Pseudo-3D Scenes Using 2D Diffusion
di: Mou, Linzhan, et al.
Pubblicazione: (2024)
di: Mou, Linzhan, et al.
Pubblicazione: (2024)
TC-LLaVA: Rethinking the Transfer from Image to Video Understanding with Temporal Considerations
di: Gao, Mingze, et al.
Pubblicazione: (2024)
di: Gao, Mingze, et al.
Pubblicazione: (2024)
Reasoning Matters for 3D Visual Grounding
di: Huang, Hsiang-Wei, et al.
Pubblicazione: (2026)
di: Huang, Hsiang-Wei, et al.
Pubblicazione: (2026)
Towards Understanding Visual Grounding in Visual Language Models
di: Pantazopoulos, Georgios, et al.
Pubblicazione: (2025)
di: Pantazopoulos, Georgios, et al.
Pubblicazione: (2025)
Fewer Tokens and Fewer Videos: Extending Video Understanding Abilities in Large Vision-Language Models
di: Chen, Shimin, et al.
Pubblicazione: (2024)
di: Chen, Shimin, et al.
Pubblicazione: (2024)
PaintScene4D: Consistent 4D Scene Generation from Text Prompts
di: Gupta, Vinayak, et al.
Pubblicazione: (2024)
di: Gupta, Vinayak, et al.
Pubblicazione: (2024)
Language Models Can See Better: Visual Contrastive Decoding For LLM Multimodal Reasoning
di: Pang, Yuqi, et al.
Pubblicazione: (2025)
di: Pang, Yuqi, et al.
Pubblicazione: (2025)
RegionPLC: Regional Point-Language Contrastive Learning for Open-World 3D Scene Understanding
di: Yang, Jihan, et al.
Pubblicazione: (2023)
di: Yang, Jihan, et al.
Pubblicazione: (2023)
Robust-R1: Degradation-Aware Reasoning for Robust Visual Understanding
di: Tang, Jiaqi, et al.
Pubblicazione: (2025)
di: Tang, Jiaqi, et al.
Pubblicazione: (2025)
GauU-Scene: A Scene Reconstruction Benchmark on Large Scale 3D Reconstruction Dataset Using Gaussian Splatting
di: Xiong, Butian, et al.
Pubblicazione: (2024)
di: Xiong, Butian, et al.
Pubblicazione: (2024)
LatentPilot: Scene-Aware Vision-and-Language Navigation by Dreaming Ahead with Latent Visual Reasoning
di: Hao, Haihong, et al.
Pubblicazione: (2026)
di: Hao, Haihong, et al.
Pubblicazione: (2026)
A Large-Scale Multimodal Dataset and Benchmarks for Human Activity Scene Understanding and Reasoning
di: Jiang, Siyang, et al.
Pubblicazione: (2025)
di: Jiang, Siyang, et al.
Pubblicazione: (2025)
Crab$^{+}$: A Scalable and Unified Audio-Visual Scene Understanding Model with Explicit Cooperation
di: Cai, Dongnuan, et al.
Pubblicazione: (2026)
di: Cai, Dongnuan, et al.
Pubblicazione: (2026)
ChatBEV: A Visual Language Model that Understands BEV Maps
di: Xu, Qingyao, et al.
Pubblicazione: (2025)
di: Xu, Qingyao, et al.
Pubblicazione: (2025)
3D-RFT: Reinforcement Fine-Tuning for Video-based 3D Scene Understanding
di: Linghu, Xiongkun, et al.
Pubblicazione: (2026)
di: Linghu, Xiongkun, et al.
Pubblicazione: (2026)
How to Enable LLM with 3D Capacity? A Survey of Spatial Reasoning in LLM
di: Zha, Jirong, et al.
Pubblicazione: (2025)
di: Zha, Jirong, et al.
Pubblicazione: (2025)
ArtiScene: Language-Driven Artistic 3D Scene Generation Through Image Intermediary
di: Gu, Zeqi, et al.
Pubblicazione: (2025)
di: Gu, Zeqi, et al.
Pubblicazione: (2025)
Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models
di: Tan, Huajie, et al.
Pubblicazione: (2025)
di: Tan, Huajie, et al.
Pubblicazione: (2025)
Multi-modal Situated Reasoning in 3D Scenes
di: Linghu, Xiongkun, et al.
Pubblicazione: (2024)
di: Linghu, Xiongkun, et al.
Pubblicazione: (2024)
DenseScan: Advancing 3D Scene Understanding with 2D Dense Annotation
di: Wang, Zirui, et al.
Pubblicazione: (2025)
di: Wang, Zirui, et al.
Pubblicazione: (2025)
Flame3D: Zero-shot Compositional Reasoning of 3D Scenes with Agentic Language Models
di: Bharadwaj, Sagar, et al.
Pubblicazione: (2026)
di: Bharadwaj, Sagar, et al.
Pubblicazione: (2026)
OpenGS-SLAM: Open-Set Dense Semantic SLAM with 3D Gaussian Splatting for Object-Level Scene Understanding
di: Yang, Dianyi, et al.
Pubblicazione: (2025)
di: Yang, Dianyi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
SceneLLM: Implicit Language Reasoning in LLM for Dynamic Scene Graph Generation
di: Zhang, Hang, et al.
Pubblicazione: (2024) -
SceneVerse: Scaling 3D Vision-Language Learning for Grounded Scene Understanding
di: Jia, Baoxiong, et al.
Pubblicazione: (2024) -
Text-Scene: A Scene-to-Language Parsing Framework for 3D Scene Understanding
di: Li, Haoyuan, et al.
Pubblicazione: (2025) -
Lifting Unlabeled Internet-level Data for 3D Scene Understanding
di: Chen, Yixin, et al.
Pubblicazione: (2026) -
Masking Matters: Unlocking the Spatial Reasoning Capabilities of LLMs for 3D Scene-Language Understanding
di: Jeon, Yerim, et al.
Pubblicazione: (2025)