GPT4Scene: Understand 3D Scenes from Videos with Vision-Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Qi, Zhangyang, Zhang, Zhixiong, Fang, Ye, Wang, Jiaqi, Zhao, Hengshuang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning
di: Qi, Zhangyang, et al.
Pubblicazione: (2025)
di: Qi, Zhangyang, et al.
Pubblicazione: (2025)
GPT4Point: A Unified Framework for Point-Language Understanding and Generation
di: Qi, Zhangyang, et al.
Pubblicazione: (2023)
di: Qi, Zhangyang, et al.
Pubblicazione: (2023)
SceneGPT: A Language Model for 3D Scene Understanding
di: Chandhok, Shivam
Pubblicazione: (2024)
di: Chandhok, Shivam
Pubblicazione: (2024)
HERMES++: Toward a Unified Driving World Model for 3D Scene Understanding and Generation
di: Zhou, Xin, et al.
Pubblicazione: (2026)
di: Zhou, Xin, et al.
Pubblicazione: (2026)
HIS-GPT: Towards 3D Human-In-Scene Multimodal Understanding
di: Zhao, Jiahe, et al.
Pubblicazione: (2025)
di: Zhao, Jiahe, et al.
Pubblicazione: (2025)
HERMES: A Unified Self-Driving World Model for Simultaneous 3D Scene Understanding and Generation
di: Zhou, Xin, et al.
Pubblicazione: (2025)
di: Zhou, Xin, et al.
Pubblicazione: (2025)
DC-Scene: Data-Centric Learning for 3D Scene Understanding
di: Huang, Ting, et al.
Pubblicazione: (2025)
di: Huang, Ting, et al.
Pubblicazione: (2025)
3D Smoke Scene Reconstruction Guided by Vision Priors from Multimodal Large Language Models
di: Zheng, Xinye, et al.
Pubblicazione: (2026)
di: Zheng, Xinye, et al.
Pubblicazione: (2026)
SceneSplat: Gaussian Splatting-based Scene Understanding with Vision-Language Pretraining
di: Li, Yue, et al.
Pubblicazione: (2025)
di: Li, Yue, et al.
Pubblicazione: (2025)
Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations
di: Yuan, Zhihao, et al.
Pubblicazione: (2025)
di: Yuan, Zhihao, et al.
Pubblicazione: (2025)
Scene-VLM: Multimodal Video Scene Segmentation via Vision-Language Models
di: Berman, Nimrod, et al.
Pubblicazione: (2025)
di: Berman, Nimrod, et al.
Pubblicazione: (2025)
Unified Scene Representation and Reconstruction for 3D Large Language Models
di: Chu, Tao, et al.
Pubblicazione: (2024)
di: Chu, Tao, et al.
Pubblicazione: (2024)
Language-Assisted 3D Scene Understanding
di: Wu, Yanmin, et al.
Pubblicazione: (2023)
di: Wu, Yanmin, et al.
Pubblicazione: (2023)
DoraemonGPT: Toward Understanding Dynamic Scenes with Large Language Models (Exemplified as A Video Agent)
di: Yang, Zongxin, et al.
Pubblicazione: (2024)
di: Yang, Zongxin, et al.
Pubblicazione: (2024)
SceneGraphVLM: Dynamic Scene Graph Generation from Video with Vision-Language Models
di: Makarov, Vladislav, et al.
Pubblicazione: (2026)
di: Makarov, Vladislav, et al.
Pubblicazione: (2026)
VideoScene: Distilling Video Diffusion Model to Generate 3D Scenes in One Step
di: Wang, Hanyang, et al.
Pubblicazione: (2025)
di: Wang, Hanyang, et al.
Pubblicazione: (2025)
Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers
di: Huang, Haifeng, et al.
Pubblicazione: (2023)
di: Huang, Haifeng, et al.
Pubblicazione: (2023)
Tailor3D: Customized 3D Assets Editing and Generation with Dual-Side Images
di: Qi, Zhangyang, et al.
Pubblicazione: (2024)
di: Qi, Zhangyang, et al.
Pubblicazione: (2024)
IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering
di: Liu, Parker, et al.
Pubblicazione: (2025)
di: Liu, Parker, et al.
Pubblicazione: (2025)
HMR3D: Hierarchical Multimodal Representation for 3D Scene Understanding with Large Vision-Language Model
di: Li, Chen, et al.
Pubblicazione: (2025)
di: Li, Chen, et al.
Pubblicazione: (2025)
Seeing the Scene Matters: Revealing Forgetting in Video Understanding Models with a Scene-Aware Long-Video Benchmark
di: Chen, Seng Nam, et al.
Pubblicazione: (2026)
di: Chen, Seng Nam, et al.
Pubblicazione: (2026)
Comp4D: LLM-Guided Compositional 4D Scene Generation
di: Xu, Dejia, et al.
Pubblicazione: (2024)
di: Xu, Dejia, et al.
Pubblicazione: (2024)
DivScene: Towards Open-Vocabulary Object Navigation with Large Vision Language Models in Diverse Scenes
di: Wang, Zhaowei, et al.
Pubblicazione: (2024)
di: Wang, Zhaowei, et al.
Pubblicazione: (2024)
Spatio-Temporal Data Enhanced Vision-Language Model for Traffic Scene Understanding
di: Ma, Jingtian, et al.
Pubblicazione: (2025)
di: Ma, Jingtian, et al.
Pubblicazione: (2025)
ESceme: Vision-and-Language Navigation with Episodic Scene Memory
di: Zheng, Qi, et al.
Pubblicazione: (2023)
di: Zheng, Qi, et al.
Pubblicazione: (2023)
Do Thought Streams Matter? Evaluating Reasoning in Gemini Vision-Language Models for Video Scene Understanding
di: Sharma, Shivam, et al.
Pubblicazione: (2026)
di: Sharma, Shivam, et al.
Pubblicazione: (2026)
SceneVerse: Scaling 3D Vision-Language Learning for Grounded Scene Understanding
di: Jia, Baoxiong, et al.
Pubblicazione: (2024)
di: Jia, Baoxiong, et al.
Pubblicazione: (2024)
Do Vision--Language Models Understand 3D Scenes or Just Catalogue Objects?
di: Maheshwari, Animesh, et al.
Pubblicazione: (2026)
di: Maheshwari, Animesh, et al.
Pubblicazione: (2026)
RLM: A Vision-Language Model Approach for Radar Scene Understanding
di: Mishra, Pushkal, et al.
Pubblicazione: (2025)
di: Mishra, Pushkal, et al.
Pubblicazione: (2025)
Embodied Scene Understanding for Vision Language Models via MetaVQA
di: Wang, Weizhen, et al.
Pubblicazione: (2025)
di: Wang, Weizhen, et al.
Pubblicazione: (2025)
Uncovering and Shaping the Latent Representation of 3D Scene Topology in Vision-Language Models
di: Wang, Haoming, et al.
Pubblicazione: (2026)
di: Wang, Haoming, et al.
Pubblicazione: (2026)
LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion
di: Liu, Fangfu, et al.
Pubblicazione: (2025)
di: Liu, Fangfu, et al.
Pubblicazione: (2025)
EgoGaussian: Dynamic Scene Understanding from Egocentric Video with 3D Gaussian Splatting
di: Zhang, Daiwei, et al.
Pubblicazione: (2024)
di: Zhang, Daiwei, et al.
Pubblicazione: (2024)
Scenes as Tokens: Multi-Scale Normal Distributions Transform Tokenizer for General 3D Vision-Language Understanding
di: Tang, Yutao, et al.
Pubblicazione: (2025)
di: Tang, Yutao, et al.
Pubblicazione: (2025)
Video-3D LLM: Learning Position-Aware Video Representation for 3D Scene Understanding
di: Zheng, Duo, et al.
Pubblicazione: (2024)
di: Zheng, Duo, et al.
Pubblicazione: (2024)
Open-Vocabulary Octree-Graph for 3D Scene Understanding
di: Wang, Zhigang, et al.
Pubblicazione: (2024)
di: Wang, Zhigang, et al.
Pubblicazione: (2024)
SceneTeller: Language-to-3D Scene Generation
di: Öcal, Başak Melis, et al.
Pubblicazione: (2024)
di: Öcal, Başak Melis, et al.
Pubblicazione: (2024)
Text-Scene: A Scene-to-Language Parsing Framework for 3D Scene Understanding
di: Li, Haoyuan, et al.
Pubblicazione: (2025)
di: Li, Haoyuan, et al.
Pubblicazione: (2025)
Articulate3D: Holistic Understanding of 3D Scenes as Universal Scene Description
di: Halacheva, Anna-Maria, et al.
Pubblicazione: (2024)
di: Halacheva, Anna-Maria, et al.
Pubblicazione: (2024)
POMA-3D: The Point Map Way to 3D Scene Understanding
di: Mao, Ye, et al.
Pubblicazione: (2025)
di: Mao, Ye, et al.
Pubblicazione: (2025)
Documenti analoghi
-
VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning
di: Qi, Zhangyang, et al.
Pubblicazione: (2025) -
GPT4Point: A Unified Framework for Point-Language Understanding and Generation
di: Qi, Zhangyang, et al.
Pubblicazione: (2023) -
SceneGPT: A Language Model for 3D Scene Understanding
di: Chandhok, Shivam
Pubblicazione: (2024) -
HERMES++: Toward a Unified Driving World Model for 3D Scene Understanding and Generation
di: Zhou, Xin, et al.
Pubblicazione: (2026) -
HIS-GPT: Towards 3D Human-In-Scene Multimodal Understanding
di: Zhao, Jiahe, et al.
Pubblicazione: (2025)