OnlineSI: Taming Large Language Model for Online 3D Understanding and Grounding
Fuente:
arXiv
Saved in:
| Main Authors: | Liu, Zixian, Chen, Zhaoxi, Pan, Liang, Liu, Ziwei |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
PhysX-3D: Physical-Grounded 3D Asset Generation
by: Cao, Ziang, et al.
Published: (2025)
by: Cao, Ziang, et al.
Published: (2025)
Collaborative Multi-Modal Coding for High-Quality 3D Generation
by: Cao, Ziang, et al.
Published: (2025)
by: Cao, Ziang, et al.
Published: (2025)
PhysX-Anything: Simulation-Ready Physical 3D Assets from Single Image
by: Cao, Ziang, et al.
Published: (2025)
by: Cao, Ziang, et al.
Published: (2025)
CityDreamer: Compositional Generative Model of Unbounded 3D Cities
by: Xie, Haozhe, et al.
Published: (2023)
by: Xie, Haozhe, et al.
Published: (2023)
LGM: Large Multi-View Gaussian Model for High-Resolution 3D Content Creation
by: Tang, Jiaxiang, et al.
Published: (2024)
by: Tang, Jiaxiang, et al.
Published: (2024)
Compositional Generative Model of Unbounded 4D Cities
by: Xie, Haozhe, et al.
Published: (2025)
by: Xie, Haozhe, et al.
Published: (2025)
Generative Gaussian Splatting for Unbounded 3D City Generation
by: Xie, Haozhe, et al.
Published: (2024)
by: Xie, Haozhe, et al.
Published: (2024)
FashionEngine: Interactive 3D Human Generation and Editing via Multimodal Controls
by: Hu, Tao, et al.
Published: (2024)
by: Hu, Tao, et al.
Published: (2024)
3DTopia: Large Text-to-3D Generation Model with Hybrid Diffusion Priors
by: Hong, Fangzhou, et al.
Published: (2024)
by: Hong, Fangzhou, et al.
Published: (2024)
3D Scene Generation: A Survey
by: Wen, Beichen, et al.
Published: (2025)
by: Wen, Beichen, et al.
Published: (2025)
HiSpatial: Taming Hierarchical 3D Spatial Understanding in Vision-Language Models
by: Liang, Huizhi, et al.
Published: (2026)
by: Liang, Huizhi, et al.
Published: (2026)
4DNeX: Feed-Forward 4D Generative Modeling Made Easy
by: Chen, Zhaoxi, et al.
Published: (2025)
by: Chen, Zhaoxi, et al.
Published: (2025)
PhysX-Omni: Unified Simulation-Ready Physical 3D Generation for Rigid, Deformable, and Articulated Objects
by: Cao, Ziang, et al.
Published: (2026)
by: Cao, Ziang, et al.
Published: (2026)
Kinema4D: Kinematic 4D World Modeling for Spatiotemporal Embodied Simulation
by: Xu, Mutian, et al.
Published: (2026)
by: Xu, Mutian, et al.
Published: (2026)
DiffTF++: 3D-aware Diffusion Transformer for Large-Vocabulary 3D Generation
by: Cao, Ziang, et al.
Published: (2024)
by: Cao, Ziang, et al.
Published: (2024)
OnlineX: Unified Online 3D Reconstruction and Understanding with Active-to-Stable State Evolution
by: Xia, Chong, et al.
Published: (2026)
by: Xia, Chong, et al.
Published: (2026)
3EED: Ground Everything Everywhere in 3D
by: Li, Rong, et al.
Published: (2025)
by: Li, Rong, et al.
Published: (2025)
HSImul3R: Physics-in-the-Loop Reconstruction of Simulation-Ready Human-Scene Interactions
by: Cao, Yukang, et al.
Published: (2026)
by: Cao, Yukang, et al.
Published: (2026)
Calib3D: Calibrating Model Preferences for Reliable 3D Scene Understanding
by: Kong, Lingdong, et al.
Published: (2024)
by: Kong, Lingdong, et al.
Published: (2024)
GS-VTON: Controllable 3D Virtual Try-on with Gaussian Splatting
by: Cao, Yukang, et al.
Published: (2024)
by: Cao, Yukang, et al.
Published: (2024)
FreeTraj: Tuning-Free Trajectory Control in Video Diffusion Models
by: Qiu, Haonan, et al.
Published: (2024)
by: Qiu, Haonan, et al.
Published: (2024)
Memory-based Adapters for Online 3D Scene Perception
by: Xu, Xiuwei, et al.
Published: (2024)
by: Xu, Xiuwei, et al.
Published: (2024)
DynamicVLA: A Vision-Language-Action Model for Dynamic Object Manipulation
by: Xie, Haozhe, et al.
Published: (2026)
by: Xie, Haozhe, et al.
Published: (2026)
Online Video Understanding: OVBench and VideoChat-Online
by: Huang, Zhenpeng, et al.
Published: (2024)
by: Huang, Zhenpeng, et al.
Published: (2024)
SI-MIL: Taming Deep MIL for Self-Interpretability in Gigapixel Histopathology
by: Kapse, Saarthak, et al.
Published: (2023)
by: Kapse, Saarthak, et al.
Published: (2023)
Dual-Expert Consistency Model for Efficient and High-Quality Video Generation
by: Lv, Zhengyao, et al.
Published: (2025)
by: Lv, Zhengyao, et al.
Published: (2025)
EmbodiedSAM: Online Segment Any 3D Thing in Real Time
by: Xu, Xiuwei, et al.
Published: (2024)
by: Xu, Xiuwei, et al.
Published: (2024)
VideoLLM-online: Online Video Large Language Model for Streaming Video
by: Chen, Joya, et al.
Published: (2024)
by: Chen, Joya, et al.
Published: (2024)
OnlinePG: Online Open-Vocabulary Panoptic Mapping with 3D Gaussian Splatting
by: Zhai, Hongjia, et al.
Published: (2026)
by: Zhai, Hongjia, et al.
Published: (2026)
Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding
by: Huang, Wencan, et al.
Published: (2025)
by: Huang, Wencan, et al.
Published: (2025)
Attribute-Grounded Selective Reasoning for Artwork Emotion Understanding with Multimodal Large Language Models
by: Zhang, Cheng, et al.
Published: (2026)
by: Zhang, Cheng, et al.
Published: (2026)
MoniTor: Exploiting Large Language Models with Instruction for Online Video Anomaly Detection
by: Yang, Shengtian, et al.
Published: (2025)
by: Yang, Shengtian, et al.
Published: (2025)
ID-Crafter: VLM-Grounded Online RL for Compositional Multi-Subject Video Generation
by: Pan, Panwang, et al.
Published: (2025)
by: Pan, Panwang, et al.
Published: (2025)
Zero-1-to-G: Taming Pretrained 2D Diffusion Model for Direct 3D Generation
by: Meng, Xuyi, et al.
Published: (2025)
by: Meng, Xuyi, et al.
Published: (2025)
A Survey on Video Temporal Grounding with Multimodal Large Language Model
by: Wu, Jianlong, et al.
Published: (2025)
by: Wu, Jianlong, et al.
Published: (2025)
Tango: Taming Visual Signals for Efficient Video Large Language Models
by: Yin, Shukang, et al.
Published: (2026)
by: Yin, Shukang, et al.
Published: (2026)
Situat3DChange: Situated 3D Change Understanding Dataset for Multimodal Large Language Model
by: Liu, Ruiping, et al.
Published: (2025)
by: Liu, Ruiping, et al.
Published: (2025)
OnlineHMR: Video-based Online World-Grounded Human Mesh Recovery
by: Zhao, Yiwen, et al.
Published: (2026)
by: Zhao, Yiwen, et al.
Published: (2026)
ESAM++: Efficient Online 3D Perception on the Edge
by: Liu, Qin, et al.
Published: (2026)
by: Liu, Qin, et al.
Published: (2026)
3DTopia-XL: Scaling High-quality 3D Asset Generation via Primitive Diffusion
by: Chen, Zhaoxi, et al.
Published: (2024)
by: Chen, Zhaoxi, et al.
Published: (2024)
Similar Items
-
PhysX-3D: Physical-Grounded 3D Asset Generation
by: Cao, Ziang, et al.
Published: (2025) -
Collaborative Multi-Modal Coding for High-Quality 3D Generation
by: Cao, Ziang, et al.
Published: (2025) -
PhysX-Anything: Simulation-Ready Physical 3D Assets from Single Image
by: Cao, Ziang, et al.
Published: (2025) -
CityDreamer: Compositional Generative Model of Unbounded 3D Cities
by: Xie, Haozhe, et al.
Published: (2023) -
LGM: Large Multi-View Gaussian Model for High-Resolution 3D Content Creation
by: Tang, Jiaxiang, et al.
Published: (2024)