MonoFusion: Sparse-View 4D Reconstruction via Monocular Fusion
Fuente:
arXiv
Saved in:
| Main Authors: | Wang, Zihan, Tan, Jeff, Khurana, Tarasha, Peri, Neehar, Ramanan, Deva |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Reconstruct, Inpaint, Test-Time Finetune: Dynamic Novel-view Synthesis from Monocular Videos
by: Chen, Kaihua, et al.
Published: (2025)
by: Chen, Kaihua, et al.
Published: (2025)
Predicting Long-horizon Futures by Conditioning on Geometry and Time
by: Khurana, Tarasha, et al.
Published: (2024)
by: Khurana, Tarasha, et al.
Published: (2024)
Using Diffusion Priors for Video Amodal Segmentation
by: Chen, Kaihua, et al.
Published: (2024)
by: Chen, Kaihua, et al.
Published: (2024)
Shelf-Supervised Cross-Modal Pre-Training for 3D Object Detection
by: Khurana, Mehar, et al.
Published: (2024)
by: Khurana, Mehar, et al.
Published: (2024)
Long-Tailed 3D Detection via Multi-Modal Fusion
by: Ma, Yechi, et al.
Published: (2023)
by: Ma, Yechi, et al.
Published: (2023)
RefAV: Towards Planning-Centric Scenario Mining
by: Davidson, Cainan, et al.
Published: (2025)
by: Davidson, Cainan, et al.
Published: (2025)
DressRecon: Freeform 4D Human Reconstruction from Monocular Video
by: Tan, Jeff, et al.
Published: (2024)
by: Tan, Jeff, et al.
Published: (2024)
Revisiting Few-Shot Object Detection with Vision-Language Models
by: Madan, Anish, et al.
Published: (2023)
by: Madan, Anish, et al.
Published: (2023)
RF-DETR: Neural Architecture Search for Real-Time Detection Transformers
by: Robinson, Isaac, et al.
Published: (2025)
by: Robinson, Isaac, et al.
Published: (2025)
I Can't Believe It's Not Scene Flow!
by: Khatri, Ishan, et al.
Published: (2024)
by: Khatri, Ishan, et al.
Published: (2024)
TAO-Amodal: A Benchmark for Tracking Any Object Amodally
by: Hsieh, Cheng-Yen, et al.
Published: (2023)
by: Hsieh, Cheng-Yen, et al.
Published: (2023)
DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection
by: Gare, Gautam Rajendrakumar, et al.
Published: (2026)
by: Gare, Gautam Rajendrakumar, et al.
Published: (2026)
Better Call SAL: Towards Learning to Segment Anything in Lidar
by: Ošep, Aljoša, et al.
Published: (2024)
by: Ošep, Aljoša, et al.
Published: (2024)
CRISP: Contact-Guided Real2Sim from Monocular Video with Planar Scene Primitives
by: Wang, Zihan, et al.
Published: (2025)
by: Wang, Zihan, et al.
Published: (2025)
UniFlow: Zero-Shot LiDAR Scene Flow for Autonomous Vehicles
by: Li, Siyi, et al.
Published: (2025)
by: Li, Siyi, et al.
Published: (2025)
EfficientMonoHair: Fast Strand-Level Reconstruction from Monocular Video via Multi-View Direction Fusion
by: Li, Da, et al.
Published: (2026)
by: Li, Da, et al.
Published: (2026)
Roboflow100-VL: A Multi-Domain Object Detection Benchmark for Vision-Language Models
by: Robicheaux, Peter, et al.
Published: (2025)
by: Robicheaux, Peter, et al.
Published: (2025)
Pseudo-View Enhancement via Confidence Fusion for Unposed Sparse-View Reconstruction
by: Zhao, Beizhen, et al.
Published: (2026)
by: Zhao, Beizhen, et al.
Published: (2026)
DynOMo: Online Point Tracking by Dynamic Online Monocular Gaussian Reconstruction
by: Seidenschwarz, Jenny, et al.
Published: (2024)
by: Seidenschwarz, Jenny, et al.
Published: (2024)
ZeroFlow: Scalable Scene Flow via Distillation
by: Vedder, Kyle, et al.
Published: (2023)
by: Vedder, Kyle, et al.
Published: (2023)
AerialMegaDepth: Learning Aerial-Ground Reconstruction and View Synthesis
by: Vuong, Khiem, et al.
Published: (2025)
by: Vuong, Khiem, et al.
Published: (2025)
Neural Eulerian Scene Flow Fields
by: Vedder, Kyle, et al.
Published: (2024)
by: Vedder, Kyle, et al.
Published: (2024)
DiffusionSfM: Predicting Structure and Motion via Ray Origin and Endpoint Diffusion
by: Zhao, Qitao, et al.
Published: (2025)
by: Zhao, Qitao, et al.
Published: (2025)
MonoSAOD: Monocular 3D Object Detection with Sparsely Annotated Label
by: Jung, Junyoung, et al.
Published: (2026)
by: Jung, Junyoung, et al.
Published: (2026)
Novel View Synthesis as Video Completion
by: Wu, Qi, et al.
Published: (2026)
by: Wu, Qi, et al.
Published: (2026)
MonoMVSNet: Monocular Priors Guided Multi-View Stereo Network
by: Jiang, Jianfei, et al.
Published: (2025)
by: Jiang, Jianfei, et al.
Published: (2025)
AdaptiveFusion: Adaptive Multi-Modal Multi-View Fusion for 3D Human Body Reconstruction
by: Chen, Anjun, et al.
Published: (2024)
by: Chen, Anjun, et al.
Published: (2024)
Mono3R: Exploiting Monocular Cues for Geometric 3D Reconstruction
by: Li, Wenyu, et al.
Published: (2025)
by: Li, Wenyu, et al.
Published: (2025)
MonoArt: Progressive Structural Reasoning for Monocular Articulated 3D Reconstruction
by: Li, Haitian, et al.
Published: (2026)
by: Li, Haitian, et al.
Published: (2026)
MonoCD: Monocular 3D Object Detection with Complementary Depths
by: Yan, Longfei, et al.
Published: (2024)
by: Yan, Longfei, et al.
Published: (2024)
BoxFusion: Reconstruction-Free Open-Vocabulary 3D Object Detection via Real-Time Multi-View Box Fusion
by: Lan, Yuqing, et al.
Published: (2025)
by: Lan, Yuqing, et al.
Published: (2025)
MonoNPHM: Dynamic Head Reconstruction from Monocular Videos
by: Giebenhain, Simon, et al.
Published: (2023)
by: Giebenhain, Simon, et al.
Published: (2023)
GeoRect4D: Geometry-Compatible Generative Rectification for Dynamic Sparse-View 3D Reconstruction
by: Wu, Zhenlong, et al.
Published: (2026)
by: Wu, Zhenlong, et al.
Published: (2026)
MonoSelfRecon: Purely Self-Supervised Explicit Generalizable 3D Reconstruction of Indoor Scenes from Monocular RGB Views
by: Li, Runfa, et al.
Published: (2024)
by: Li, Runfa, et al.
Published: (2024)
MonoPlane: Exploiting Monocular Geometric Cues for Generalizable 3D Plane Reconstruction
by: Zhao, Wang, et al.
Published: (2024)
by: Zhao, Wang, et al.
Published: (2024)
MonoMSK: Monocular 3D Musculoskeletal Dynamics Estimation
by: Koleini, Farnoosh, et al.
Published: (2025)
by: Koleini, Farnoosh, et al.
Published: (2025)
SparseFusion: Efficient Sparse Multi-Modal Fusion Framework for Long-Range 3D Perception
by: Li, Yiheng, et al.
Published: (2024)
by: Li, Yiheng, et al.
Published: (2024)
UpFusion: Novel View Diffusion from Unposed Sparse View Observations
by: Kani, Bharath Raj Nagoor, et al.
Published: (2023)
by: Kani, Bharath Raj Nagoor, et al.
Published: (2023)
MonoInstance: Enhancing Monocular Priors via Multi-view Instance Alignment for Neural Rendering and Reconstruction
by: Zhang, Wenyuan, et al.
Published: (2025)
by: Zhang, Wenyuan, et al.
Published: (2025)
Depth-supervised NeRF: Fewer Views and Faster Training for Free
by: Deng, Kangle, et al.
Published: (2021)
by: Deng, Kangle, et al.
Published: (2021)
Similar Items
-
Reconstruct, Inpaint, Test-Time Finetune: Dynamic Novel-view Synthesis from Monocular Videos
by: Chen, Kaihua, et al.
Published: (2025) -
Predicting Long-horizon Futures by Conditioning on Geometry and Time
by: Khurana, Tarasha, et al.
Published: (2024) -
Using Diffusion Priors for Video Amodal Segmentation
by: Chen, Kaihua, et al.
Published: (2024) -
Shelf-Supervised Cross-Modal Pre-Training for 3D Object Detection
by: Khurana, Mehar, et al.
Published: (2024) -
Long-Tailed 3D Detection via Multi-Modal Fusion
by: Ma, Yechi, et al.
Published: (2023)