G-CUT3R: Guided 3D Reconstruction with Camera and Depth Prior Integration

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Khafizov, Ramil, Komarichev, Artem, Rakhimov, Ruslan, Wonka, Peter, Burnaev, Evgeny
Format: Preprint
Published: 2025
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!
_version_ 1866908564793065472
author Khafizov, Ramil
Komarichev, Artem
Rakhimov, Ruslan
Wonka, Peter
Burnaev, Evgeny
author_facet Khafizov, Ramil
Komarichev, Artem
Rakhimov, Ruslan
Wonka, Peter
Burnaev, Evgeny
contents We introduce G-CUT3R, a novel feed-forward approach for guided 3D scene reconstruction that enhances the CUT3R model by integrating prior information. Unlike existing feed-forward methods that rely solely on input images, our method leverages auxiliary data, such as depth, camera calibrations, or camera positions, commonly available in real-world scenarios. We propose a lightweight modification to CUT3R, incorporating a dedicated encoder for each modality to extract features, which are fused with RGB image tokens via zero convolution. This flexible design enables seamless integration of any combination of prior information during inference. Evaluated across multiple benchmarks, including 3D reconstruction and other multi-view tasks, our approach demonstrates significant performance improvements, showing its ability to effectively utilize available priors while maintaining compatibility with varying input modalities.
format Preprint
id arxiv_https___arxiv_org_abs_2508_11379
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle G-CUT3R: Guided 3D Reconstruction with Camera and Depth Prior Integration
Khafizov, Ramil
Komarichev, Artem
Rakhimov, Ruslan
Wonka, Peter
Burnaev, Evgeny
Computer Vision and Pattern Recognition
Artificial Intelligence
We introduce G-CUT3R, a novel feed-forward approach for guided 3D scene reconstruction that enhances the CUT3R model by integrating prior information. Unlike existing feed-forward methods that rely solely on input images, our method leverages auxiliary data, such as depth, camera calibrations, or camera positions, commonly available in real-world scenarios. We propose a lightweight modification to CUT3R, incorporating a dedicated encoder for each modality to extract features, which are fused with RGB image tokens via zero convolution. This flexible design enables seamless integration of any combination of prior information during inference. Evaluated across multiple benchmarks, including 3D reconstruction and other multi-view tasks, our approach demonstrates significant performance improvements, showing its ability to effectively utilize available priors while maintaining compatibility with varying input modalities.
title G-CUT3R: Guided 3D Reconstruction with Camera and Depth Prior Integration
topic Computer Vision and Pattern Recognition
Artificial Intelligence
url https://arxiv.org/abs/2508.11379