3D4D: An Interactive, Editable, 4D World Model via 3D Video Generation
Fuente:
arXiv
Saved in:
| Main Authors: | He, Yunhong, Yuan, Zhengqing, Tu, Zhengzhong, Ye, Yanfang, Sun, Lichao |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
ArtGPT-4: Towards Artistic-understanding Large Vision-Language Models with Enhanced Adapter
by: Yuan, Zhengqing, et al.
Published: (2023)
by: Yuan, Zhengqing, et al.
Published: (2023)
Generating Editable Head Avatars with 3D Gaussian GANs
by: Li, Guohao, et al.
Published: (2024)
by: Li, Guohao, et al.
Published: (2024)
TinyGPT-V: Efficient Multimodal Large Language Model via Small Backbones
by: Yuan, Zhengqing, et al.
Published: (2023)
by: Yuan, Zhengqing, et al.
Published: (2023)
ViT-1.58b: Mobile Vision Transformers in the 1-bit Era
by: Yuan, Zhengqing, et al.
Published: (2024)
by: Yuan, Zhengqing, et al.
Published: (2024)
4Diffusion: Multi-view Video Diffusion Model for 4D Generation
by: Zhang, Haiyu, et al.
Published: (2024)
by: Zhang, Haiyu, et al.
Published: (2024)
MorphoSim: An Interactive, Controllable, and Editable Language-guided 4D World Simulator
by: He, Xuehai, et al.
Published: (2025)
by: He, Xuehai, et al.
Published: (2025)
AttriHuman-3D: Editable 3D Human Avatar Generation with Attribute Decomposition and Indexing
by: Yang, Fan, et al.
Published: (2023)
by: Yang, Fan, et al.
Published: (2023)
4DWorldBench: A Comprehensive Evaluation Framework for 3D/4D World Generation Models
by: Lu, Yiting, et al.
Published: (2025)
by: Lu, Yiting, et al.
Published: (2025)
4D-MoDe: Towards Editable and Scalable Volumetric Streaming via Motion-Decoupled 4D Gaussian Compression
by: Zhong, Houqiang, et al.
Published: (2025)
by: Zhong, Houqiang, et al.
Published: (2025)
Embody4D: A Generalist 4D World Model for Embodied AI
by: Tu, Peiyan, et al.
Published: (2026)
by: Tu, Peiyan, et al.
Published: (2026)
Mora: Enabling Generalist Video Generation via A Multi-Agent Framework
by: Yuan, Zhengqing, et al.
Published: (2024)
by: Yuan, Zhengqing, et al.
Published: (2024)
GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion
by: Zhu, Hanxin, et al.
Published: (2026)
by: Zhu, Hanxin, et al.
Published: (2026)
OpenECAD: An Efficient Visual Language Model for Editable 3D-CAD Design
by: Yuan, Zhe, et al.
Published: (2024)
by: Yuan, Zhe, et al.
Published: (2024)
DeepVerse: 4D Autoregressive Video Generation as a World Model
by: Chen, Junyi, et al.
Published: (2025)
by: Chen, Junyi, et al.
Published: (2025)
3D Space as a Scratchpad for Editable Text-to-Image Generation
by: Saha, Oindrila, et al.
Published: (2026)
by: Saha, Oindrila, et al.
Published: (2026)
MLLM-For3D: Adapting Multimodal Large Language Model for 3D Reasoning Segmentation
by: Huang, Jiaxin, et al.
Published: (2025)
by: Huang, Jiaxin, et al.
Published: (2025)
3D and 4D World Modeling: A Survey
by: Kong, Lingdong, et al.
Published: (2025)
by: Kong, Lingdong, et al.
Published: (2025)
AR4D: Autoregressive 4D Generation from Monocular Videos
by: Zhu, Hanxin, et al.
Published: (2025)
by: Zhu, Hanxin, et al.
Published: (2025)
4K4DGen: Panoramic 4D Generation at 4K Resolution
by: Li, Renjie, et al.
Published: (2024)
by: Li, Renjie, et al.
Published: (2024)
ST-Gen4D: Embedding 4D Spatiotemporal Cognition into World Model for 4D Generation
by: Wang, Haonan, et al.
Published: (2026)
by: Wang, Haonan, et al.
Published: (2026)
SAM 3D for 3D Object Reconstruction from Remote Sensing Images
by: Yao, Junsheng, et al.
Published: (2025)
by: Yao, Junsheng, et al.
Published: (2025)
LivingWorld: Interactive 4D World Generation with Environmental Dynamics
by: Mun, Hyeongju, et al.
Published: (2026)
by: Mun, Hyeongju, et al.
Published: (2026)
Zero4D: Training-Free 4D Video Generation From Single Video Using Off-the-Shelf Video Diffusion
by: Park, Jangho, et al.
Published: (2025)
by: Park, Jangho, et al.
Published: (2025)
CARI4D: Category Agnostic 4D Reconstruction of Human-Object Interaction
by: Xie, Xianghui, et al.
Published: (2025)
by: Xie, Xianghui, et al.
Published: (2025)
MVISTA-4D: View-Consistent 4D World Model with Test-Time Action Inference for Robotic Manipulation
by: Wang, Jiaxu, et al.
Published: (2026)
by: Wang, Jiaxu, et al.
Published: (2026)
Diffusion4D: Fast Spatial-temporal Consistent 4D Generation via Video Diffusion Models
by: Liang, Hanwen, et al.
Published: (2024)
by: Liang, Hanwen, et al.
Published: (2024)
SkeletonGaussian: Editable 4D Generation through Gaussian Skeletonization
by: Wu, Lifan, et al.
Published: (2026)
by: Wu, Lifan, et al.
Published: (2026)
World-R1: Reinforcing 3D Constraints for Text-to-Video Generation
by: Wang, Weijie, et al.
Published: (2026)
by: Wang, Weijie, et al.
Published: (2026)
Restage4D: Reanimating Deformable 3D Reconstruction from a Single Video
by: He, Jixuan, et al.
Published: (2025)
by: He, Jixuan, et al.
Published: (2025)
Pixel-to-4D: Camera-Controlled Image-to-Video Generation with Dynamic 3D Gaussians
by: de Almeida, Melonie, et al.
Published: (2026)
by: de Almeida, Melonie, et al.
Published: (2026)
FG-Portrait: 3D Flow Guided Editable Portrait Animation
by: Xu, Yating, et al.
Published: (2026)
by: Xu, Yating, et al.
Published: (2026)
V3D: Video Diffusion Models are Effective 3D Generators
by: Chen, Zilong, et al.
Published: (2024)
by: Chen, Zilong, et al.
Published: (2024)
EA3D: Online Open-World 3D Object Extraction from Streaming Videos
by: Zhou, Xiaoyu, et al.
Published: (2025)
by: Zhou, Xiaoyu, et al.
Published: (2025)
Bora: Biomedical Generalist Video Generation Model
by: Sun, Weixiang, et al.
Published: (2024)
by: Sun, Weixiang, et al.
Published: (2024)
Taming Video Models for 3D and 4D Generation via Zero-Shot Camera Control
by: Song, Chenxi, et al.
Published: (2025)
by: Song, Chenxi, et al.
Published: (2025)
3D Face Modeling via Weakly-supervised Disentanglement Network joint Identity-consistency Prior
by: Li, Guohao, et al.
Published: (2024)
by: Li, Guohao, et al.
Published: (2024)
PrITTI: Primitive-based Generation of Controllable and Editable 3D Semantic Urban Scenes
by: Tze, Christina Ourania, et al.
Published: (2025)
by: Tze, Christina Ourania, et al.
Published: (2025)
PuzzleFusion++: Auto-agglomerative 3D Fracture Assembly by Denoise and Verify
by: Wang, Zhengqing, et al.
Published: (2024)
by: Wang, Zhengqing, et al.
Published: (2024)
Interactive4D: Interactive 4D LiDAR Segmentation
by: Fradlin, Ilya, et al.
Published: (2024)
by: Fradlin, Ilya, et al.
Published: (2024)
Multi-Exposure Image Fusion via Distilled 3D LUT Grid with Editable Mode
by: Su, Xin, et al.
Published: (2024)
by: Su, Xin, et al.
Published: (2024)
Similar Items
-
ArtGPT-4: Towards Artistic-understanding Large Vision-Language Models with Enhanced Adapter
by: Yuan, Zhengqing, et al.
Published: (2023) -
Generating Editable Head Avatars with 3D Gaussian GANs
by: Li, Guohao, et al.
Published: (2024) -
TinyGPT-V: Efficient Multimodal Large Language Model via Small Backbones
by: Yuan, Zhengqing, et al.
Published: (2023) -
ViT-1.58b: Mobile Vision Transformers in the 1-bit Era
by: Yuan, Zhengqing, et al.
Published: (2024) -
4Diffusion: Multi-view Video Diffusion Model for 4D Generation
by: Zhang, Haiyu, et al.
Published: (2024)