MV-CoLight: Efficient Object Compositing with Consistent Lighting and Shadow Generation

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Ren, Kerui, Bai, Jiayang, Xu, Linning, Jiang, Lihan, Pang, Jiangmiao, Yu, Mulin, Dai, Bo
Format: Preprint
Published: 2025
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!
_version_ 1866915307847680000
author Ren, Kerui
Bai, Jiayang
Xu, Linning
Jiang, Lihan
Pang, Jiangmiao
Yu, Mulin
Dai, Bo
author_facet Ren, Kerui
Bai, Jiayang
Xu, Linning
Jiang, Lihan
Pang, Jiangmiao
Yu, Mulin
Dai, Bo
contents Object compositing offers significant promise for augmented reality (AR) and embodied intelligence applications. Existing approaches predominantly focus on single-image scenarios or intrinsic decomposition techniques, facing challenges with multi-view consistency, complex scenes, and diverse lighting conditions. Recent inverse rendering advancements, such as 3D Gaussian and diffusion-based methods, have enhanced consistency but are limited by scalability, heavy data requirements, or prolonged reconstruction time per scene. To broaden its applicability, we introduce MV-CoLight, a two-stage framework for illumination-consistent object compositing in both 2D images and 3D scenes. Our novel feed-forward architecture models lighting and shadows directly, avoiding the iterative biases of diffusion-based methods. We employ a Hilbert curve-based mapping to align 2D image inputs with 3D Gaussian scene representations seamlessly. To facilitate training and evaluation, we further introduce a large-scale 3D compositing dataset. Experiments demonstrate state-of-the-art harmonized results across standard benchmarks and our dataset, as well as casually captured real-world scenes demonstrate the framework's robustness and wide generalization.
format Preprint
id arxiv_https___arxiv_org_abs_2505_21483
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle MV-CoLight: Efficient Object Compositing with Consistent Lighting and Shadow Generation
Ren, Kerui
Bai, Jiayang
Xu, Linning
Jiang, Lihan
Pang, Jiangmiao
Yu, Mulin
Dai, Bo
Computer Vision and Pattern Recognition
Object compositing offers significant promise for augmented reality (AR) and embodied intelligence applications. Existing approaches predominantly focus on single-image scenarios or intrinsic decomposition techniques, facing challenges with multi-view consistency, complex scenes, and diverse lighting conditions. Recent inverse rendering advancements, such as 3D Gaussian and diffusion-based methods, have enhanced consistency but are limited by scalability, heavy data requirements, or prolonged reconstruction time per scene. To broaden its applicability, we introduce MV-CoLight, a two-stage framework for illumination-consistent object compositing in both 2D images and 3D scenes. Our novel feed-forward architecture models lighting and shadows directly, avoiding the iterative biases of diffusion-based methods. We employ a Hilbert curve-based mapping to align 2D image inputs with 3D Gaussian scene representations seamlessly. To facilitate training and evaluation, we further introduce a large-scale 3D compositing dataset. Experiments demonstrate state-of-the-art harmonized results across standard benchmarks and our dataset, as well as casually captured real-world scenes demonstrate the framework's robustness and wide generalization.
title MV-CoLight: Efficient Object Compositing with Consistent Lighting and Shadow Generation
topic Computer Vision and Pattern Recognition
url https://arxiv.org/abs/2505.21483