Geometry Forcing: Marrying Video Diffusion and 3D Representation for Consistent World Modeling
Fuente:
arXiv
Salvato in:
| Autori principali: | Wu, Haoyu, Wu, Diankun, He, Tianyu, Guo, Junliang, Ye, Yang, Duan, Yueqi, Bian, Jiang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MineWorld: a Real-Time and Open-Source Interactive World Model on Minecraft
di: Guo, Junliang, et al.
Pubblicazione: (2025)
di: Guo, Junliang, et al.
Pubblicazione: (2025)
Fast Autoregressive Video Generation with Diagonal Decoding
di: Ye, Yang, et al.
Pubblicazione: (2025)
di: Ye, Yang, et al.
Pubblicazione: (2025)
Compositional 3D-aware Video Generation with LLM Director
di: Zhu, Hanxin, et al.
Pubblicazione: (2024)
di: Zhu, Hanxin, et al.
Pubblicazione: (2024)
AR4D: Autoregressive 4D Generation from Monocular Videos
di: Zhu, Hanxin, et al.
Pubblicazione: (2025)
di: Zhu, Hanxin, et al.
Pubblicazione: (2025)
DreamCinema: Cinematic Transfer with Free Camera and 3D Character
di: Chen, Weiliang, et al.
Pubblicazione: (2024)
di: Chen, Weiliang, et al.
Pubblicazione: (2024)
Video In-context Learning: Autoregressive Transformers are Zero-Shot Video Imitators
di: Zhang, Wentao, et al.
Pubblicazione: (2024)
di: Zhang, Wentao, et al.
Pubblicazione: (2024)
EPIC Fields: Marrying 3D Geometry and Video Understanding
di: Tschernezki, Vadim, et al.
Pubblicazione: (2023)
di: Tschernezki, Vadim, et al.
Pubblicazione: (2023)
Voyager: Long-Range and World-Consistent Video Diffusion for Explorable 3D Scene Generation
di: Huang, Tianyu, et al.
Pubblicazione: (2025)
di: Huang, Tianyu, et al.
Pubblicazione: (2025)
Diffusion Models in 3D Vision: A Survey
di: Wang, Zhen, et al.
Pubblicazione: (2024)
di: Wang, Zhen, et al.
Pubblicazione: (2024)
Reinforcement Learning with Inverse Rewards for World Model Post-training
di: Ye, Yang, et al.
Pubblicazione: (2025)
di: Ye, Yang, et al.
Pubblicazione: (2025)
Playing with Transformer at 30+ FPS via Next-Frame Diffusion
di: Cheng, Xinle, et al.
Pubblicazione: (2025)
di: Cheng, Xinle, et al.
Pubblicazione: (2025)
Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence
di: Wu, Diankun, et al.
Pubblicazione: (2025)
di: Wu, Diankun, et al.
Pubblicazione: (2025)
GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion
di: Zhu, Hanxin, et al.
Pubblicazione: (2026)
di: Zhu, Hanxin, et al.
Pubblicazione: (2026)
VideoScene: Distilling Video Diffusion Model to Generate 3D Scenes in One Step
di: Wang, Hanyang, et al.
Pubblicazione: (2025)
di: Wang, Hanyang, et al.
Pubblicazione: (2025)
FantasyWorld: Geometry-Consistent World Modeling via Unified Video and 3D Prediction
di: Dai, Yixiang, et al.
Pubblicazione: (2025)
di: Dai, Yixiang, et al.
Pubblicazione: (2025)
Blaze3DM: Marry Triplane Representation with Diffusion for 3D Medical Inverse Problem Solving
di: He, Jia, et al.
Pubblicazione: (2024)
di: He, Jia, et al.
Pubblicazione: (2024)
VidTwin: Video VAE with Decoupled Structure and Dynamics
di: Wang, Yuchi, et al.
Pubblicazione: (2024)
di: Wang, Yuchi, et al.
Pubblicazione: (2024)
UniEdit: A Unified Tuning-Free Framework for Video Motion and Appearance Editing
di: Bai, Jianhong, et al.
Pubblicazione: (2024)
di: Bai, Jianhong, et al.
Pubblicazione: (2024)
VidTok: A Versatile and Open-Source Video Tokenizer
di: Tang, Anni, et al.
Pubblicazione: (2024)
di: Tang, Anni, et al.
Pubblicazione: (2024)
View-Consistent Diffusion Representations for 3D-Consistent Video Generation
di: Danier, Duolikun, et al.
Pubblicazione: (2025)
di: Danier, Duolikun, et al.
Pubblicazione: (2025)
LIVE: Long-horizon Interactive Video World Modeling
di: Huang, Junchao, et al.
Pubblicazione: (2026)
di: Huang, Junchao, et al.
Pubblicazione: (2026)
ReconX: Reconstruct Any Scene from Sparse Views with Video Diffusion Model
di: Liu, Fangfu, et al.
Pubblicazione: (2024)
di: Liu, Fangfu, et al.
Pubblicazione: (2024)
GeoAuxNet: Towards Universal 3D Representation Learning for Multi-sensor Point Clouds
di: Zhang, Shengjun, et al.
Pubblicazione: (2024)
di: Zhang, Shengjun, et al.
Pubblicazione: (2024)
WorldWarp: Propagating 3D Geometry with Asynchronous Video Diffusion
di: Kong, Hanyang, et al.
Pubblicazione: (2025)
di: Kong, Hanyang, et al.
Pubblicazione: (2025)
Show-1: Marrying Pixel and Latent Diffusion Models for Text-to-Video Generation
di: Zhang, David Junhao, et al.
Pubblicazione: (2023)
di: Zhang, David Junhao, et al.
Pubblicazione: (2023)
UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation
di: Sun, Yang-Tian, et al.
Pubblicazione: (2025)
di: Sun, Yang-Tian, et al.
Pubblicazione: (2025)
WorldReel: 4D Video Generation with Consistent Geometry and Motion Modeling
di: Fang, Shaoheng, et al.
Pubblicazione: (2025)
di: Fang, Shaoheng, et al.
Pubblicazione: (2025)
DCDM: Divide-and-Conquer Diffusion Models for Consistency-Preserving Video Generation
di: Zhao, Haoyu, et al.
Pubblicazione: (2026)
di: Zhao, Haoyu, et al.
Pubblicazione: (2026)
PanoWorld: Geometry-Consistent Panoramic Video World Modeling
di: Jiang, Le, et al.
Pubblicazione: (2026)
di: Jiang, Le, et al.
Pubblicazione: (2026)
Physics3D: Learning Physical Properties of 3D Gaussians via Video Diffusion
di: Liu, Fangfu, et al.
Pubblicazione: (2024)
di: Liu, Fangfu, et al.
Pubblicazione: (2024)
LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion
di: Liu, Fangfu, et al.
Pubblicazione: (2025)
di: Liu, Fangfu, et al.
Pubblicazione: (2025)
Consistent-1-to-3: Consistent Image to 3D View Synthesis via Geometry-aware Diffusion Models
di: Ye, Jianglong, et al.
Pubblicazione: (2023)
di: Ye, Jianglong, et al.
Pubblicazione: (2023)
Make-Your-3D: Fast and Consistent Subject-Driven 3D Content Generation
di: Liu, Fangfu, et al.
Pubblicazione: (2024)
di: Liu, Fangfu, et al.
Pubblicazione: (2024)
Scene Splatter: Momentum 3D Scene Generation from Single Image with Video Diffusion Model
di: Zhang, Shengjun, et al.
Pubblicazione: (2025)
di: Zhang, Shengjun, et al.
Pubblicazione: (2025)
Mamba-YOLO-World: Marrying YOLO-World with Mamba for Open-Vocabulary Detection
di: Wang, Haoxuan, et al.
Pubblicazione: (2024)
di: Wang, Haoxuan, et al.
Pubblicazione: (2024)
TK-Mamba: Marrying KAN With Mamba for Text-Driven 3D Medical Image Segmentation
di: Yang, Haoyu, et al.
Pubblicazione: (2025)
di: Yang, Haoyu, et al.
Pubblicazione: (2025)
End-to-End Rate-Distortion Optimized 3D Gaussian Representation
di: Wang, Henan, et al.
Pubblicazione: (2024)
di: Wang, Henan, et al.
Pubblicazione: (2024)
Marrying Autoregressive Transformer and Diffusion with Multi-Reference Autoregression
di: Zhen, Dingcheng, et al.
Pubblicazione: (2025)
di: Zhen, Dingcheng, et al.
Pubblicazione: (2025)
Geometry-Aware Rotary Position Embedding for Consistent Video World Model
di: Xiang, Chendong, et al.
Pubblicazione: (2026)
di: Xiang, Chendong, et al.
Pubblicazione: (2026)
ScenePainter: Semantically Consistent Perpetual 3D Scene Generation with Concept Relation Alignment
di: Xia, Chong, et al.
Pubblicazione: (2025)
di: Xia, Chong, et al.
Pubblicazione: (2025)
Documenti analoghi
-
MineWorld: a Real-Time and Open-Source Interactive World Model on Minecraft
di: Guo, Junliang, et al.
Pubblicazione: (2025) -
Fast Autoregressive Video Generation with Diagonal Decoding
di: Ye, Yang, et al.
Pubblicazione: (2025) -
Compositional 3D-aware Video Generation with LLM Director
di: Zhu, Hanxin, et al.
Pubblicazione: (2024) -
AR4D: Autoregressive 4D Generation from Monocular Videos
di: Zhu, Hanxin, et al.
Pubblicazione: (2025) -
DreamCinema: Cinematic Transfer with Free Camera and 3D Character
di: Chen, Weiliang, et al.
Pubblicazione: (2024)