StarGen: A Spatiotemporal Autoregression Framework with Video Diffusion Model for Scalable and Controllable Scene Generation
Fuente:
arXiv
Saved in:
| Main Authors: | Zhai, Shangjin, Ye, Zhichao, Liu, Jialin, Xie, Weijian, Hu, Jiaqi, Peng, Zhen, Xue, Hua, Chen, Danpeng, Wang, Xiaomeng, Yang, Lei, Wang, Nan, Liu, Haomin, Zhang, Guofeng |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
XR-VIO: High-precision Visual Inertial Odometry with Fast Initialization for XR Applications
by: Zhai, Shangjin, et al.
Published: (2025)
by: Zhai, Shangjin, et al.
Published: (2025)
PGSR: Planar-based Gaussian Splatting for Efficient and High-Fidelity Surface Reconstruction
by: Chen, Danpeng, et al.
Published: (2024)
by: Chen, Danpeng, et al.
Published: (2024)
Depth Completion with Multiple Balanced Bases and Confidence for Dense Monocular SLAM
by: Xie, Weijian, et al.
Published: (2023)
by: Xie, Weijian, et al.
Published: (2023)
INSPATIO-WORLD: A Real-Time 4D World Simulator via Spatiotemporal Autoregressive Modeling
by: InSpatio Team, et al.
Published: (2026)
by: InSpatio Team, et al.
Published: (2026)
PostCam: Camera-Controllable Novel-View Video Generation with Query-Shared Cross-Attention
by: Chen, Yipeng, et al.
Published: (2025)
by: Chen, Yipeng, et al.
Published: (2025)
XRDSLAM: A Flexible and Modular Framework for Deep Learning based SLAM
by: Wang, Xiaomeng, et al.
Published: (2024)
by: Wang, Xiaomeng, et al.
Published: (2024)
SparseCam4D: Spatio-Temporally Consistent 4D Reconstruction from Sparse Cameras
by: Pan, Weihong, et al.
Published: (2026)
by: Pan, Weihong, et al.
Published: (2026)
EndoGen: Conditional Autoregressive Endoscopic Video Generation
by: Liu, Xinyu, et al.
Published: (2025)
by: Liu, Xinyu, et al.
Published: (2025)
VideoMAP: Toward Scalable Mamba-based Video Autoregressive Pretraining
by: Liu, Yunze, et al.
Published: (2025)
by: Liu, Yunze, et al.
Published: (2025)
GigaGS: Scaling up Planar-Based 3D Gaussians for Large Scene Surface Reconstruction
by: Chen, Junyi, et al.
Published: (2024)
by: Chen, Junyi, et al.
Published: (2024)
InSpatio-WorldFM: An Open-Source Real-Time Generative Frame Model
by: InSpatio Team, et al.
Published: (2026)
by: InSpatio Team, et al.
Published: (2026)
Progressive Autoregressive Video Diffusion Models
by: Xie, Desai, et al.
Published: (2024)
by: Xie, Desai, et al.
Published: (2024)
LaGen: Towards Autoregressive LiDAR Scene Generation
by: Zhou, Sizhuo, et al.
Published: (2025)
by: Zhou, Sizhuo, et al.
Published: (2025)
VideoScene: Distilling Video Diffusion Model to Generate 3D Scenes in One Step
by: Wang, Hanyang, et al.
Published: (2025)
by: Wang, Hanyang, et al.
Published: (2025)
VideoAR: Autoregressive Video Generation via Next-Frame & Scale Prediction
by: Ji, Longbin, et al.
Published: (2026)
by: Ji, Longbin, et al.
Published: (2026)
Swap Attention in Spatiotemporal Diffusions for Text-to-Video Generation
by: Wang, Wenjing, et al.
Published: (2023)
by: Wang, Wenjing, et al.
Published: (2023)
DriveGen3D: Boosting Feed-Forward Driving Scene Generation with Efficient Video Diffusion
by: Wang, Weijie, et al.
Published: (2025)
by: Wang, Weijie, et al.
Published: (2025)
Scalable Autoregressive Monocular Depth Estimation
by: Wang, Jinhong, et al.
Published: (2024)
by: Wang, Jinhong, et al.
Published: (2024)
DifFlow3D: Toward Robust Uncertainty-Aware Scene Flow Estimation with Diffusion Model
by: Liu, Jiuming, et al.
Published: (2023)
by: Liu, Jiuming, et al.
Published: (2023)
MoSa: Motion Generation with Scalable Autoregressive Modeling
by: Liu, Mengyuan, et al.
Published: (2025)
by: Liu, Mengyuan, et al.
Published: (2025)
Marrying Autoregressive Transformer and Diffusion with Multi-Reference Autoregression
by: Zhen, Dingcheng, et al.
Published: (2025)
by: Zhen, Dingcheng, et al.
Published: (2025)
CoSurfGS:Collaborative 3D Surface Gaussian Splatting with Distributed Learning for Large Scene Reconstruction
by: Gao, Yuanyuan, et al.
Published: (2024)
by: Gao, Yuanyuan, et al.
Published: (2024)
Efficient Autoregressive Video Diffusion with Dummy Head
by: Guo, Hang, et al.
Published: (2026)
by: Guo, Hang, et al.
Published: (2026)
EGG-Fusion: Efficient 3D Reconstruction with Geometry-aware Gaussian Surfel on the Fly
by: Pan, Xiaokun, et al.
Published: (2025)
by: Pan, Xiaokun, et al.
Published: (2025)
CoGenCast: A Coupled Autoregressive-Flow Generative Framework for Time Series Forecasting
by: Liu, Yaguo, et al.
Published: (2026)
by: Liu, Yaguo, et al.
Published: (2026)
GenRec: Unifying Video Generation and Recognition with Diffusion Models
by: Weng, Zejia, et al.
Published: (2024)
by: Weng, Zejia, et al.
Published: (2024)
Q-ARVD: Quantizing Autoregressive Video Diffusion Models
by: Tang, Siao, et al.
Published: (2026)
by: Tang, Siao, et al.
Published: (2026)
DART: Denoising Autoregressive Transformer for Scalable Text-to-Image Generation
by: Gu, Jiatao, et al.
Published: (2024)
by: Gu, Jiatao, et al.
Published: (2024)
FastSTAR: Spatiotemporal Token Pruning for Efficient Autoregressive Video Synthesis
by: Yune, Sungwoong, et al.
Published: (2026)
by: Yune, Sungwoong, et al.
Published: (2026)
VDEGaussian: Video Diffusion Enhanced 4D Gaussian Splatting for Dynamic Urban Scenes Modeling
by: Xiao, Yuru, et al.
Published: (2025)
by: Xiao, Yuru, et al.
Published: (2025)
MarDini: Masked Autoregressive Diffusion for Video Generation at Scale
by: Liu, Haozhe, et al.
Published: (2024)
by: Liu, Haozhe, et al.
Published: (2024)
DynamicScaler: Seamless and Scalable Video Generation for Panoramic Scenes
by: Liu, Jinxiu, et al.
Published: (2024)
by: Liu, Jinxiu, et al.
Published: (2024)
Rolling Forcing: Autoregressive Long Video Diffusion in Real Time
by: Liu, Kunhao, et al.
Published: (2025)
by: Liu, Kunhao, et al.
Published: (2025)
LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion
by: Liu, Fangfu, et al.
Published: (2025)
by: Liu, Fangfu, et al.
Published: (2025)
Dynamic Gaussian Scene Reconstruction from Unsynchronized Videos
by: Xu, Zhixin, et al.
Published: (2025)
by: Xu, Zhixin, et al.
Published: (2025)
Talker-T2AV: Joint Talking Audio-Video Generation with Autoregressive Diffusion Modeling
by: Ye, Zhen, et al.
Published: (2026)
by: Ye, Zhen, et al.
Published: (2026)
Language-Driven Object-Oriented Two-Stage Method for Scene Graph Anticipation
by: Zhu, Xiaomeng, et al.
Published: (2025)
by: Zhu, Xiaomeng, et al.
Published: (2025)
IPAD: Iterative, Parallel, and Diffusion-based Network for Scene Text Recognition
by: Yang, Xiaomeng, et al.
Published: (2023)
by: Yang, Xiaomeng, et al.
Published: (2023)
GenCompositor: Generative Video Compositing with Diffusion Transformer
by: Yang, Shuzhou, et al.
Published: (2025)
by: Yang, Shuzhou, et al.
Published: (2025)
DreamForge: Motion-Aware Autoregressive Video Generation for Multi-View Driving Scenes
by: Mei, Jianbiao, et al.
Published: (2024)
by: Mei, Jianbiao, et al.
Published: (2024)
Similar Items
-
XR-VIO: High-precision Visual Inertial Odometry with Fast Initialization for XR Applications
by: Zhai, Shangjin, et al.
Published: (2025) -
PGSR: Planar-based Gaussian Splatting for Efficient and High-Fidelity Surface Reconstruction
by: Chen, Danpeng, et al.
Published: (2024) -
Depth Completion with Multiple Balanced Bases and Confidence for Dense Monocular SLAM
by: Xie, Weijian, et al.
Published: (2023) -
INSPATIO-WORLD: A Real-Time 4D World Simulator via Spatiotemporal Autoregressive Modeling
by: InSpatio Team, et al.
Published: (2026) -
PostCam: Camera-Controllable Novel-View Video Generation with Query-Shared Cross-Attention
by: Chen, Yipeng, et al.
Published: (2025)