Scene Splatter: Momentum 3D Scene Generation from Single Image with Video Diffusion Model
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Shengjun, Li, Jinzhao, Fei, Xin, Liu, Hao, Duan, Yueqi |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
DimensionX: Create Any 3D and 4D Scenes from a Single Image with Controllable Video Diffusion
by: Sun, Wenqiang, et al.
Published: (2024)
by: Sun, Wenqiang, et al.
Published: (2024)
Physics3D: Learning Physical Properties of 3D Gaussians via Video Diffusion
by: Liu, Fangfu, et al.
Published: (2024)
by: Liu, Fangfu, et al.
Published: (2024)
VideoScene: Distilling Video Diffusion Model to Generate 3D Scenes in One Step
by: Wang, Hanyang, et al.
Published: (2025)
by: Wang, Hanyang, et al.
Published: (2025)
ReconX: Reconstruct Any Scene from Sparse Views with Video Diffusion Model
by: Liu, Fangfu, et al.
Published: (2024)
by: Liu, Fangfu, et al.
Published: (2024)
ScenePainter: Semantically Consistent Perpetual 3D Scene Generation with Concept Relation Alignment
by: Xia, Chong, et al.
Published: (2025)
by: Xia, Chong, et al.
Published: (2025)
SceneGen: Single-Image 3D Scene Generation in One Feedforward Pass
by: Meng, Yanxu, et al.
Published: (2025)
by: Meng, Yanxu, et al.
Published: (2025)
GEN3D: Generating Domain-Free 3D Scenes from a Single Image
by: Zhang, Yuxin, et al.
Published: (2025)
by: Zhang, Yuxin, et al.
Published: (2025)
NavCrafter: Exploring 3D Scenes from a Single Image
by: Duan, Hongbo, et al.
Published: (2026)
by: Duan, Hongbo, et al.
Published: (2026)
GeoAuxNet: Towards Universal 3D Representation Learning for Multi-sensor Point Clouds
by: Zhang, Shengjun, et al.
Published: (2024)
by: Zhang, Shengjun, et al.
Published: (2024)
Constructing a 3D Scene from a Single Image
by: Zheng, Kaizhi, et al.
Published: (2025)
by: Zheng, Kaizhi, et al.
Published: (2025)
SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding
by: Zeng, Nianbo, et al.
Published: (2025)
by: Zeng, Nianbo, et al.
Published: (2025)
E-GRPO: High Entropy Steps Drive Effective Reinforcement Learning for Flow Models
by: Zhang, Shengjun, et al.
Published: (2026)
by: Zhang, Shengjun, et al.
Published: (2026)
ArtiScene: Language-Driven Artistic 3D Scene Generation Through Image Intermediary
by: Gu, Zeqi, et al.
Published: (2025)
by: Gu, Zeqi, et al.
Published: (2025)
3D-SceneDreamer: Text-Driven 3D-Consistent Scene Generation
by: Zhang, Frank, et al.
Published: (2024)
by: Zhang, Frank, et al.
Published: (2024)
Sat3DGen: Comprehensive Street-Level 3D Scene Generation from Single Satellite Image
by: Qian, Ming, et al.
Published: (2026)
by: Qian, Ming, et al.
Published: (2026)
LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion
by: Liu, Fangfu, et al.
Published: (2025)
by: Liu, Fangfu, et al.
Published: (2025)
BetterScene: 3D Scene Synthesis with Representation-Aligned Generative Model
by: Han, Yuci, et al.
Published: (2026)
by: Han, Yuci, et al.
Published: (2026)
Geometry Forcing: Marrying Video Diffusion and 3D Representation for Consistent World Modeling
by: Wu, Haoyu, et al.
Published: (2025)
by: Wu, Haoyu, et al.
Published: (2025)
NOVA3D: Normal Aligned Video Diffusion Model for Single Image to 3D Generation
by: Yang, Yuxiao, et al.
Published: (2025)
by: Yang, Yuxiao, et al.
Published: (2025)
HetScene: Heterogeneity-Aware Diffusion for Dense Indoor Scene Generation
by: Chen, Zini, et al.
Published: (2026)
by: Chen, Zini, et al.
Published: (2026)
WonderPlay: Dynamic 3D Scene Generation from a Single Image and Actions
by: Li, Zizhang, et al.
Published: (2025)
by: Li, Zizhang, et al.
Published: (2025)
MVRoom: Controllable 3D Indoor Scene Generation with Multi-View Diffusion Models
by: Fang, Shaoheng, et al.
Published: (2025)
by: Fang, Shaoheng, et al.
Published: (2025)
MetaFind: Scene-Aware 3D Asset Retrieval for Coherent Metaverse Scene Generation
by: Pan, Zhenyu, et al.
Published: (2025)
by: Pan, Zhenyu, et al.
Published: (2025)
SceneMaker: Open-set 3D Scene Generation with Decoupled De-occlusion and Pose Estimation Model
by: Shi, Yukai, et al.
Published: (2025)
by: Shi, Yukai, et al.
Published: (2025)
Video-T1: Test-Time Scaling for Video Generation
by: Liu, Fangfu, et al.
Published: (2025)
by: Liu, Fangfu, et al.
Published: (2025)
Enhancing Long Video Question Answering with Scene-Localized Frame Grouping
by: Yang, Xuyi, et al.
Published: (2025)
by: Yang, Xuyi, et al.
Published: (2025)
Look Beyond: Two-Stage Scene View Generation via Panorama and Video Diffusion
by: Kang, Xueyang, et al.
Published: (2025)
by: Kang, Xueyang, et al.
Published: (2025)
SSEditor: Controllable Mask-to-Scene Generation with Diffusion Model
by: Zheng, Haowen, et al.
Published: (2024)
by: Zheng, Haowen, et al.
Published: (2024)
Enhancing Monocular 3D Scene Completion with Diffusion Model
by: Song, Changlin, et al.
Published: (2025)
by: Song, Changlin, et al.
Published: (2025)
BeyondScene: Higher-Resolution Human-Centric Scene Generation With Pretrained Diffusion
by: Kim, Gwanghyun, et al.
Published: (2024)
by: Kim, Gwanghyun, et al.
Published: (2024)
Text-Scene: A Scene-to-Language Parsing Framework for 3D Scene Understanding
by: Li, Haoyuan, et al.
Published: (2025)
by: Li, Haoyuan, et al.
Published: (2025)
DualTSR: Unified Dual-Diffusion Transformer for Scene Text Image Super-Resolution
by: Niu, Axi, et al.
Published: (2026)
by: Niu, Axi, et al.
Published: (2026)
DreamScene360: Unconstrained Text-to-3D Scene Generation with Panoramic Gaussian Splatting
by: Zhou, Shijie, et al.
Published: (2024)
by: Zhou, Shijie, et al.
Published: (2024)
SceneLLM: Implicit Language Reasoning in LLM for Dynamic Scene Graph Generation
by: Zhang, Hang, et al.
Published: (2024)
by: Zhang, Hang, et al.
Published: (2024)
InsertAnywhere: Bridging 4D Scene Geometry and Diffusion Models for Realistic Video Object Insertion
by: Jin, Hoiyeong, et al.
Published: (2025)
by: Jin, Hoiyeong, et al.
Published: (2025)
Open-Vocabulary Functional 3D Human-Scene Interaction Generation
by: Liu, Jie, et al.
Published: (2026)
by: Liu, Jie, et al.
Published: (2026)
LT3SD: Latent Trees for 3D Scene Diffusion
by: Meng, Quan, et al.
Published: (2024)
by: Meng, Quan, et al.
Published: (2024)
Argus: Leveraging Multiview Images for Improved 3-D Scene Understanding With Large Language Models
by: Xu, Yifan, et al.
Published: (2025)
by: Xu, Yifan, et al.
Published: (2025)
SceneTok: A Compressed, Diffusable Token Space for 3D Scenes
by: Asim, Mohammad, et al.
Published: (2026)
by: Asim, Mohammad, et al.
Published: (2026)
InteractMove: Text-Controlled Human-Object Interaction Generation in 3D Scenes with Movable Objects
by: Cai, Xinhao, et al.
Published: (2025)
by: Cai, Xinhao, et al.
Published: (2025)
Similar Items
-
DimensionX: Create Any 3D and 4D Scenes from a Single Image with Controllable Video Diffusion
by: Sun, Wenqiang, et al.
Published: (2024) -
Physics3D: Learning Physical Properties of 3D Gaussians via Video Diffusion
by: Liu, Fangfu, et al.
Published: (2024) -
VideoScene: Distilling Video Diffusion Model to Generate 3D Scenes in One Step
by: Wang, Hanyang, et al.
Published: (2025) -
ReconX: Reconstruct Any Scene from Sparse Views with Video Diffusion Model
by: Liu, Fangfu, et al.
Published: (2024) -
ScenePainter: Semantically Consistent Perpetual 3D Scene Generation with Concept Relation Alignment
by: Xia, Chong, et al.
Published: (2025)