GFlow: Recovering 4D World from Monocular Video
Fuente:
arXiv
Saved in:
| Main Authors: | Wang, Shizun, Yang, Xingyi, Shen, Qiuhong, Jiang, Zhenxiang, Wang, Xinchao |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
C4D: 4D Made from 3D through Dual Correspondences
by: Wang, Shizun, et al.
Published: (2025)
by: Wang, Shizun, et al.
Published: (2025)
FlashSplat: 2D to 3D Gaussian Splatting Segmentation Solved Optimally
by: Shen, Qiuhong, et al.
Published: (2024)
by: Shen, Qiuhong, et al.
Published: (2024)
Make Geometry Matter for Spatial Reasoning
by: Zhang, Shihua, et al.
Published: (2026)
by: Zhang, Shihua, et al.
Published: (2026)
Test3R: Learning to Reconstruct 3D at Test Time
by: Yuan, Yuheng, et al.
Published: (2025)
by: Yuan, Yuheng, et al.
Published: (2025)
WorldWarp: Propagating 3D Geometry with Asynchronous Video Diffusion
by: Kong, Hanyang, et al.
Published: (2025)
by: Kong, Hanyang, et al.
Published: (2025)
Vista3D: Unravel the 3D Darkside of a Single Image
by: Shen, Qiuhong, et al.
Published: (2024)
by: Shen, Qiuhong, et al.
Published: (2024)
Video-Infinity: Distributed Long Video Generation
by: Tan, Zhenxiong, et al.
Published: (2024)
by: Tan, Zhenxiong, et al.
Published: (2024)
MindBridge: A Cross-Subject Brain Decoding Framework
by: Wang, Shizun, et al.
Published: (2024)
by: Wang, Shizun, et al.
Published: (2024)
1000+ FPS 4D Gaussian Splatting for Dynamic Scene Rendering
by: Yuan, Yuheng, et al.
Published: (2025)
by: Yuan, Yuheng, et al.
Published: (2025)
Neural Metamorphosis
by: Yang, Xingyi, et al.
Published: (2024)
by: Yang, Xingyi, et al.
Published: (2024)
Kolmogorov-Arnold Transformer
by: Yang, Xingyi, et al.
Published: (2024)
by: Yang, Xingyi, et al.
Published: (2024)
Few-shot Implicit Function Generation via Equivariance
by: Huang, Suizhi, et al.
Published: (2025)
by: Huang, Suizhi, et al.
Published: (2025)
Seeing World Dynamics in a Nutshell
by: Shen, Qiuhong, et al.
Published: (2025)
by: Shen, Qiuhong, et al.
Published: (2025)
Vision Bridge Transformer at Scale
by: Tan, Zhenxiong, et al.
Published: (2025)
by: Tan, Zhenxiong, et al.
Published: (2025)
Gamba: Marry Gaussian Splatting with Mamba for single view 3D reconstruction
by: Shen, Qiuhong, et al.
Published: (2024)
by: Shen, Qiuhong, et al.
Published: (2024)
PE3R: Perception-Efficient 3D Reconstruction
by: Hu, Jie, et al.
Published: (2025)
by: Hu, Jie, et al.
Published: (2025)
OminiControl2: Efficient Conditioning for Diffusion Transformers
by: Tan, Zhenxiong, et al.
Published: (2025)
by: Tan, Zhenxiong, et al.
Published: (2025)
Compositional Video Generation as Flow Equalization
by: Yang, Xingyi, et al.
Published: (2024)
by: Yang, Xingyi, et al.
Published: (2024)
Efficient Gaussian Splatting for Monocular Dynamic Scene Rendering via Sparse Time-Variant Attribute Modeling
by: Kong, Hanyang, et al.
Published: (2025)
by: Kong, Hanyang, et al.
Published: (2025)
Hash3D: Training-free Acceleration for 3D Generation
by: Yang, Xingyi, et al.
Published: (2024)
by: Yang, Xingyi, et al.
Published: (2024)
DragGaussian: Enabling Drag-style Manipulation on 3D Gaussian Representation
by: Shen, Sitian, et al.
Published: (2024)
by: Shen, Sitian, et al.
Published: (2024)
In-Video Instructions: Visual Signals as Generative Control
by: Fang, Gongfan, et al.
Published: (2025)
by: Fang, Gongfan, et al.
Published: (2025)
OminiControl: Minimal and Universal Control for Diffusion Transformer
by: Tan, Zhenxiong, et al.
Published: (2024)
by: Tan, Zhenxiong, et al.
Published: (2024)
Flash Sculptor: Modular 3D Worlds from Objects
by: Hu, Yujia, et al.
Published: (2025)
by: Hu, Yujia, et al.
Published: (2025)
Vid-SME: Membership Inference Attacks against Large Video Understanding Models
by: Li, Qi, et al.
Published: (2025)
by: Li, Qi, et al.
Published: (2025)
Language Model as Visual Explainer
by: Yang, Xingyi, et al.
Published: (2024)
by: Yang, Xingyi, et al.
Published: (2024)
4D3R: Motion-Aware Neural Reconstruction and Rendering of Dynamic Scenes from Monocular Videos
by: Guo, Mengqi, et al.
Published: (2025)
by: Guo, Mengqi, et al.
Published: (2025)
WorldReel: 4D Video Generation with Consistent Geometry and Motion Modeling
by: Fang, Shaoheng, et al.
Published: (2025)
by: Fang, Shaoheng, et al.
Published: (2025)
FreeOrbit4D: Training-Free Arbitrary Camera Redirection for Monocular Videos via Foreground-Complete 4D Reconstruction
by: Cao, Wei, et al.
Published: (2026)
by: Cao, Wei, et al.
Published: (2026)
Discovering Latent Graphs with GFlowNets for Diverse Conditional Image Generation
by: Trang, Bailey, et al.
Published: (2025)
by: Trang, Bailey, et al.
Published: (2025)
On Moving Object Segmentation from Monocular Video with Transformers
by: Homeyer, Christian, et al.
Published: (2024)
by: Homeyer, Christian, et al.
Published: (2024)
RaGS: Unleashing 3D Gaussian Splatting from 4D Radar and Monocular Cues for 3D Object Detection
by: Bai, Xiaokai, et al.
Published: (2025)
by: Bai, Xiaokai, et al.
Published: (2025)
Tamaththul3D: High-Fidelity 3D Saudi Sign Language Avatars from Monocular Video
by: Alghamdi, Eyad, et al.
Published: (2026)
by: Alghamdi, Eyad, et al.
Published: (2026)
Remix-DiT: Mixing Diffusion Transformers for Multi-Expert Denoising
by: Fang, Gongfan, et al.
Published: (2024)
by: Fang, Gongfan, et al.
Published: (2024)
Attention Prompting on Image for Large Vision-Language Models
by: Yu, Runpeng, et al.
Published: (2024)
by: Yu, Runpeng, et al.
Published: (2024)
Endo3R: Unified Online Reconstruction from Dynamic Monocular Endoscopic Video
by: Guo, Jiaxin, et al.
Published: (2025)
by: Guo, Jiaxin, et al.
Published: (2025)
Learning from Videos for 3D World: Enhancing MLLMs with 3D Vision Geometry Priors
by: Zheng, Duo, et al.
Published: (2025)
by: Zheng, Duo, et al.
Published: (2025)
BioPose: Biomechanically-accurate 3D Pose Estimation from Monocular Videos
by: Koleini, Farnoosh, et al.
Published: (2025)
by: Koleini, Farnoosh, et al.
Published: (2025)
Geometry Forcing: Marrying Video Diffusion and 3D Representation for Consistent World Modeling
by: Wu, Haoyu, et al.
Published: (2025)
by: Wu, Haoyu, et al.
Published: (2025)
GeoSAM-3D: Geodesic Prompt Propagation for Open-Vocabulary 3D Scene Segmentation from Monocular Video
by: Sharma, Arun
Published: (2026)
by: Sharma, Arun
Published: (2026)
Similar Items
-
C4D: 4D Made from 3D through Dual Correspondences
by: Wang, Shizun, et al.
Published: (2025) -
FlashSplat: 2D to 3D Gaussian Splatting Segmentation Solved Optimally
by: Shen, Qiuhong, et al.
Published: (2024) -
Make Geometry Matter for Spatial Reasoning
by: Zhang, Shihua, et al.
Published: (2026) -
Test3R: Learning to Reconstruct 3D at Test Time
by: Yuan, Yuheng, et al.
Published: (2025) -
WorldWarp: Propagating 3D Geometry with Asynchronous Video Diffusion
by: Kong, Hanyang, et al.
Published: (2025)