Reconstruct, Inpaint, Test-Time Finetune: Dynamic Novel-view Synthesis from Monocular Videos
Fuente:
arXiv
Saved in:
| Main Authors: | Chen, Kaihua, Khurana, Tarasha, Ramanan, Deva |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Using Diffusion Priors for Video Amodal Segmentation
by: Chen, Kaihua, et al.
Published: (2024)
by: Chen, Kaihua, et al.
Published: (2024)
Predicting Long-horizon Futures by Conditioning on Geometry and Time
by: Khurana, Tarasha, et al.
Published: (2024)
by: Khurana, Tarasha, et al.
Published: (2024)
MonoFusion: Sparse-View 4D Reconstruction via Monocular Fusion
by: Wang, Zihan, et al.
Published: (2025)
by: Wang, Zihan, et al.
Published: (2025)
TAO-Amodal: A Benchmark for Tracking Any Object Amodally
by: Hsieh, Cheng-Yen, et al.
Published: (2023)
by: Hsieh, Cheng-Yen, et al.
Published: (2023)
DressRecon: Freeform 4D Human Reconstruction from Monocular Video
by: Tan, Jeff, et al.
Published: (2024)
by: Tan, Jeff, et al.
Published: (2024)
DynOMo: Online Point Tracking by Dynamic Online Monocular Gaussian Reconstruction
by: Seidenschwarz, Jenny, et al.
Published: (2024)
by: Seidenschwarz, Jenny, et al.
Published: (2024)
Novel View Synthesis as Video Completion
by: Wu, Qi, et al.
Published: (2026)
by: Wu, Qi, et al.
Published: (2026)
AerialMegaDepth: Learning Aerial-Ground Reconstruction and View Synthesis
by: Vuong, Khiem, et al.
Published: (2025)
by: Vuong, Khiem, et al.
Published: (2025)
Shelf-Supervised Cross-Modal Pre-Training for 3D Object Detection
by: Khurana, Mehar, et al.
Published: (2024)
by: Khurana, Mehar, et al.
Published: (2024)
Vivid4D: Improving 4D Reconstruction from Monocular Video by Video Inpainting
by: Huang, Jiaxin, et al.
Published: (2025)
by: Huang, Jiaxin, et al.
Published: (2025)
CRISP: Contact-Guided Real2Sim from Monocular Video with Planar Scene Primitives
by: Wang, Zihan, et al.
Published: (2025)
by: Wang, Zihan, et al.
Published: (2025)
Dynamic Gaussian Marbles for Novel View Synthesis of Casual Monocular Videos
by: Stearns, Colton, et al.
Published: (2024)
by: Stearns, Colton, et al.
Published: (2024)
RHINO: Reconstructing Human Interactions with Novel Objects from Monocular Videos
by: Xue, Lixin, et al.
Published: (2026)
by: Xue, Lixin, et al.
Published: (2026)
RF-DETR: Neural Architecture Search for Real-Time Detection Transformers
by: Robinson, Isaac, et al.
Published: (2025)
by: Robinson, Isaac, et al.
Published: (2025)
MonoNPHM: Dynamic Head Reconstruction from Monocular Videos
by: Giebenhain, Simon, et al.
Published: (2023)
by: Giebenhain, Simon, et al.
Published: (2023)
Decoupling Dynamic Monocular Videos for Dynamic View Synthesis
by: You, Meng, et al.
Published: (2023)
by: You, Meng, et al.
Published: (2023)
RefAV: Towards Planning-Centric Scenario Mining
by: Davidson, Cainan, et al.
Published: (2025)
by: Davidson, Cainan, et al.
Published: (2025)
Diffusion Priors for Dynamic View Synthesis from Monocular Videos
by: Wang, Chaoyang, et al.
Published: (2024)
by: Wang, Chaoyang, et al.
Published: (2024)
Revisiting Few-Shot Object Detection with Vision-Language Models
by: Madan, Anish, et al.
Published: (2023)
by: Madan, Anish, et al.
Published: (2023)
SMORE: Simultaneous Map and Object REconstruction
by: Chodosh, Nathaniel, et al.
Published: (2024)
by: Chodosh, Nathaniel, et al.
Published: (2024)
M2SVid: End-to-End Inpainting and Refinement for Monocular-to-Stereo Video Conversion
by: Shvetsova, Nina, et al.
Published: (2025)
by: Shvetsova, Nina, et al.
Published: (2025)
Mumpy: Multilateral Temporal-view Pyramid Transformer for Video Inpainting Detection
by: Zhang, Ying, et al.
Published: (2024)
by: Zhang, Ying, et al.
Published: (2024)
RaySt3R: Predicting Novel Depth Maps for Zero-Shot Object Completion
by: Duisterhof, Bardienus P., et al.
Published: (2025)
by: Duisterhof, Bardienus P., et al.
Published: (2025)
A Study of Finetuning Video Transformers for Multi-view Geometry Tasks
by: Wu, Huimin, et al.
Published: (2025)
by: Wu, Huimin, et al.
Published: (2025)
Broadening View Synthesis of Dynamic Scenes from Constrained Monocular Videos
by: Jiang, Le, et al.
Published: (2025)
by: Jiang, Le, et al.
Published: (2025)
SLAM3R: Real-Time Dense Scene Reconstruction from Monocular RGB Videos
by: Liu, Yuzheng, et al.
Published: (2024)
by: Liu, Yuzheng, et al.
Published: (2024)
Feed-Forward Bullet-Time Reconstruction of Dynamic Scenes from Monocular Videos
by: Liang, Hanxue, et al.
Published: (2024)
by: Liang, Hanxue, et al.
Published: (2024)
Mechanistic Finetuning of Vision-Language-Action Models via Few-Shot Demonstrations
by: Mitra, Chancharik, et al.
Published: (2025)
by: Mitra, Chancharik, et al.
Published: (2025)
MTV-Inpaint: Multi-Task Long Video Inpainting
by: Yang, Shiyuan, et al.
Published: (2025)
by: Yang, Shiyuan, et al.
Published: (2025)
DreamCom: Finetuning Text-guided Inpainting Model for Image Composition
by: Lu, Lingxiao, et al.
Published: (2023)
by: Lu, Lingxiao, et al.
Published: (2023)
MorpheuS: Neural Dynamic 360° Surface Reconstruction from Monocular RGB-D Video
by: Wang, Hengyi, et al.
Published: (2023)
by: Wang, Hengyi, et al.
Published: (2023)
ProDyG: Progressive Dynamic Scene Reconstruction via Gaussian Splatting from Monocular Videos
by: Chen, Shi, et al.
Published: (2025)
by: Chen, Shi, et al.
Published: (2025)
GAF: Gaussian Avatar Reconstruction from Monocular Videos via Multi-view Diffusion
by: Tang, Jiapeng, et al.
Published: (2024)
by: Tang, Jiapeng, et al.
Published: (2024)
Accenture-NVS1: A Novel View Synthesis Dataset
by: Sugg, Thomas, et al.
Published: (2025)
by: Sugg, Thomas, et al.
Published: (2025)
MultiPly: Reconstruction of Multiple People from Monocular Video in the Wild
by: Jiang, Zeren, et al.
Published: (2024)
by: Jiang, Zeren, et al.
Published: (2024)
Gaussian Sequences with Multi-Scale Dynamics for 4D Reconstruction from Monocular Casual Videos
by: Li, Can, et al.
Published: (2026)
by: Li, Can, et al.
Published: (2026)
EPRecon: An Efficient Framework for Real-Time Panoptic 3D Reconstruction from Monocular Video
by: Zhou, Zhen, et al.
Published: (2024)
by: Zhou, Zhen, et al.
Published: (2024)
Multi-view Reconstruction via SfM-guided Monocular Depth Estimation
by: Guo, Haoyu, et al.
Published: (2025)
by: Guo, Haoyu, et al.
Published: (2025)
PAI-Bench: A Comprehensive Benchmark For Physical AI
by: Zhou, Fengzhe, et al.
Published: (2025)
by: Zhou, Fengzhe, et al.
Published: (2025)
I Can't Believe It's Not Scene Flow!
by: Khatri, Ishan, et al.
Published: (2024)
by: Khatri, Ishan, et al.
Published: (2024)
Similar Items
-
Using Diffusion Priors for Video Amodal Segmentation
by: Chen, Kaihua, et al.
Published: (2024) -
Predicting Long-horizon Futures by Conditioning on Geometry and Time
by: Khurana, Tarasha, et al.
Published: (2024) -
MonoFusion: Sparse-View 4D Reconstruction via Monocular Fusion
by: Wang, Zihan, et al.
Published: (2025) -
TAO-Amodal: A Benchmark for Tracking Any Object Amodally
by: Hsieh, Cheng-Yen, et al.
Published: (2023) -
DressRecon: Freeform 4D Human Reconstruction from Monocular Video
by: Tan, Jeff, et al.
Published: (2024)