Fast SceneScript: Fast and Accurate Language-Based 3D Scene Understanding via Multi-Token Prediction
Fuente:
arXiv
Saved in:
| Main Authors: | Yin, Ruihong, Shi, Xuepeng, Bailo, Oleksandr, Manfredi, Marco, Gevers, Theo |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
SceneScript: Reconstructing Scenes With An Autoregressive Structured Language Model
by: Avetisyan, Armen, et al.
Published: (2024)
by: Avetisyan, Armen, et al.
Published: (2024)
Geometry-guided Feature Learning and Fusion for Indoor Scene Reconstruction
by: Yin, Ruihong, et al.
Published: (2024)
by: Yin, Ruihong, et al.
Published: (2024)
Ray-Distance Volume Rendering for Neural Scene Reconstruction
by: Yin, Ruihong, et al.
Published: (2024)
by: Yin, Ruihong, et al.
Published: (2024)
SceneTeller: Language-to-3D Scene Generation
by: Öcal, Başak Melis, et al.
Published: (2024)
by: Öcal, Başak Melis, et al.
Published: (2024)
Edge-Centric Relational Reasoning for 3D Scene Graph Prediction
by: Ma, Yanni, et al.
Published: (2025)
by: Ma, Yanni, et al.
Published: (2025)
FewViewGS: Gaussian Splatting with Few View Matching and Multi-stage Training
by: Yin, Ruihong, et al.
Published: (2024)
by: Yin, Ruihong, et al.
Published: (2024)
SceneSplat: Gaussian Splatting-based Scene Understanding with Vision-Language Pretraining
by: Li, Yue, et al.
Published: (2025)
by: Li, Yue, et al.
Published: (2025)
FastScene: Text-Driven Fast 3D Indoor Scene Generation via Panoramic Gaussian Splatting
by: Ma, Yikun, et al.
Published: (2024)
by: Ma, Yikun, et al.
Published: (2024)
Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding
by: Huang, Wencan, et al.
Published: (2025)
by: Huang, Wencan, et al.
Published: (2025)
Gaussian Mapping for Evolving Scenes
by: Yugay, Vladimir, et al.
Published: (2025)
by: Yugay, Vladimir, et al.
Published: (2025)
SAM-Guided Masked Token Prediction for 3D Scene Understanding
by: Chen, Zhimin, et al.
Published: (2024)
by: Chen, Zhimin, et al.
Published: (2024)
Scenes as Tokens: Multi-Scale Normal Distributions Transform Tokenizer for General 3D Vision-Language Understanding
by: Tang, Yutao, et al.
Published: (2025)
by: Tang, Yutao, et al.
Published: (2025)
Chorus: Multi-Teacher Pretraining for Holistic 3D Gaussian Scene Encoding
by: Li, Yue, et al.
Published: (2025)
by: Li, Yue, et al.
Published: (2025)
LumiNet: Latent Intrinsics Meets Diffusion Models for Indoor Scene Relighting
by: Xing, Xiaoyan, et al.
Published: (2024)
by: Xing, Xiaoyan, et al.
Published: (2024)
Grab-3D: Detecting AI-Generated Videos from 3D Geometric Temporal Consistency
by: Chen, Wenhan, et al.
Published: (2025)
by: Chen, Wenhan, et al.
Published: (2025)
Feeling the Space: Egomotion-Aware Video Representation for Efficient and Accurate 3D Scene Understanding
by: Shi, Shuyao, et al.
Published: (2026)
by: Shi, Shuyao, et al.
Published: (2026)
SceneGPT: A Language Model for 3D Scene Understanding
by: Chandhok, Shivam
Published: (2024)
by: Chandhok, Shivam
Published: (2024)
Fast and Accurate Multi-Agent Trajectory Prediction For Crowded Unknown Scenes
by: Tao, Xiuye, et al.
Published: (2024)
by: Tao, Xiuye, et al.
Published: (2024)
Fast Kernel Scene Flow
by: Li, Xueqian, et al.
Published: (2024)
by: Li, Xueqian, et al.
Published: (2024)
Text-Scene: A Scene-to-Language Parsing Framework for 3D Scene Understanding
by: Li, Haoyuan, et al.
Published: (2025)
by: Li, Haoyuan, et al.
Published: (2025)
FVO: Fast Visual Odometry with Transformers
by: Yugay, Vlardimir, et al.
Published: (2025)
by: Yugay, Vlardimir, et al.
Published: (2025)
MoST: Multi-modality Scene Tokenization for Motion Prediction
by: Mu, Norman, et al.
Published: (2024)
by: Mu, Norman, et al.
Published: (2024)
LightSplat: Fast and Memory-Efficient Open-Vocabulary 3D Scene Understanding in Five Seconds
by: Bang, Jaehun, et al.
Published: (2026)
by: Bang, Jaehun, et al.
Published: (2026)
Language-Assisted 3D Scene Understanding
by: Wu, Yanmin, et al.
Published: (2023)
by: Wu, Yanmin, et al.
Published: (2023)
Fast Low-light Enhancement and Deblurring for 3D Dark Scenes
by: Zhang, Feng, et al.
Published: (2026)
by: Zhang, Feng, et al.
Published: (2026)
Fast and Efficient: Mask Neural Fields for 3D Scene Segmentation
by: Gao, Zihan, et al.
Published: (2024)
by: Gao, Zihan, et al.
Published: (2024)
3D Gaussian Ray Tracing: Fast Tracing of Particle Scenes
by: Moenne-Loccoz, Nicolas, et al.
Published: (2024)
by: Moenne-Loccoz, Nicolas, et al.
Published: (2024)
DriveTok: 3D Driving Scene Tokenization for Unified Multi-View Reconstruction and Understanding
by: Zhuo, Dong, et al.
Published: (2026)
by: Zhuo, Dong, et al.
Published: (2026)
Modeling Weather Uncertainty for Multi-weather Co-Presence Estimation
by: Bi, Qi, et al.
Published: (2024)
by: Bi, Qi, et al.
Published: (2024)
Pts3D-LLM: Studying the Impact of Token Structure for 3D Scene Understanding With Large Language Models
by: Thomas, Hugues, et al.
Published: (2025)
by: Thomas, Hugues, et al.
Published: (2025)
Hybrid 3D-4D Gaussian Splatting for Fast Dynamic Scene Representation
by: Oh, Seungjun, et al.
Published: (2025)
by: Oh, Seungjun, et al.
Published: (2025)
GPT4Scene: Understand 3D Scenes from Videos with Vision-Language Models
by: Qi, Zhangyang, et al.
Published: (2025)
by: Qi, Zhangyang, et al.
Published: (2025)
A Unified Framework for 3D Scene Understanding
by: Xu, Wei, et al.
Published: (2024)
by: Xu, Wei, et al.
Published: (2024)
DC-Scene: Data-Centric Learning for 3D Scene Understanding
by: Huang, Ting, et al.
Published: (2025)
by: Huang, Ting, et al.
Published: (2025)
Articulate3D: Holistic Understanding of 3D Scenes as Universal Scene Description
by: Halacheva, Anna-Maria, et al.
Published: (2024)
by: Halacheva, Anna-Maria, et al.
Published: (2024)
WaterSplatting: Fast Underwater 3D Scene Reconstruction Using Gaussian Splatting
by: Li, Huapeng, et al.
Published: (2024)
by: Li, Huapeng, et al.
Published: (2024)
SceneTok: A Compressed, Diffusable Token Space for 3D Scenes
by: Asim, Mohammad, et al.
Published: (2026)
by: Asim, Mohammad, et al.
Published: (2026)
Floxels: Fast Unsupervised Voxel Based Scene Flow Estimation
by: Hoffmann, David T., et al.
Published: (2025)
by: Hoffmann, David T., et al.
Published: (2025)
R3DS: Reality-linked 3D Scenes for Panoramic Scene Understanding
by: Wu, Qirui, et al.
Published: (2024)
by: Wu, Qirui, et al.
Published: (2024)
Reg3D: Reconstructive Geometry Instruction Tuning for 3D Scene Understanding
by: Zheng, Hongpei, et al.
Published: (2025)
by: Zheng, Hongpei, et al.
Published: (2025)
Similar Items
-
SceneScript: Reconstructing Scenes With An Autoregressive Structured Language Model
by: Avetisyan, Armen, et al.
Published: (2024) -
Geometry-guided Feature Learning and Fusion for Indoor Scene Reconstruction
by: Yin, Ruihong, et al.
Published: (2024) -
Ray-Distance Volume Rendering for Neural Scene Reconstruction
by: Yin, Ruihong, et al.
Published: (2024) -
SceneTeller: Language-to-3D Scene Generation
by: Öcal, Başak Melis, et al.
Published: (2024) -
Edge-Centric Relational Reasoning for 3D Scene Graph Prediction
by: Ma, Yanni, et al.
Published: (2025)