CrossOver: 3D Scene Cross-Modal Alignment

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Sarkar, Sayan Deb, Miksik, Ondrej, Pollefeys, Marc, Barath, Daniel, Armeni, Iro
Format: Preprint
Published: 2025
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!
_version_ 1866910904046583808
author Sarkar, Sayan Deb
Miksik, Ondrej
Pollefeys, Marc
Barath, Daniel
Armeni, Iro
author_facet Sarkar, Sayan Deb
Miksik, Ondrej
Pollefeys, Marc
Barath, Daniel
Armeni, Iro
contents Multi-modal 3D object understanding has gained significant attention, yet current approaches often assume complete data availability and rigid alignment across all modalities. We present CrossOver, a novel framework for cross-modal 3D scene understanding via flexible, scene-level modality alignment. Unlike traditional methods that require aligned modality data for every object instance, CrossOver learns a unified, modality-agnostic embedding space for scenes by aligning modalities -- RGB images, point clouds, CAD models, floorplans, and text descriptions -- with relaxed constraints and without explicit object semantics. Leveraging dimensionality-specific encoders, a multi-stage training pipeline, and emergent cross-modal behaviors, CrossOver supports robust scene retrieval and object localization, even with missing modalities. Evaluations on ScanNet and 3RScan datasets show its superior performance across diverse metrics, highlighting the adaptability for real-world applications in 3D scene understanding.
format Preprint
id arxiv_https___arxiv_org_abs_2502_15011
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle CrossOver: 3D Scene Cross-Modal Alignment
Sarkar, Sayan Deb
Miksik, Ondrej
Pollefeys, Marc
Barath, Daniel
Armeni, Iro
Computer Vision and Pattern Recognition
Multi-modal 3D object understanding has gained significant attention, yet current approaches often assume complete data availability and rigid alignment across all modalities. We present CrossOver, a novel framework for cross-modal 3D scene understanding via flexible, scene-level modality alignment. Unlike traditional methods that require aligned modality data for every object instance, CrossOver learns a unified, modality-agnostic embedding space for scenes by aligning modalities -- RGB images, point clouds, CAD models, floorplans, and text descriptions -- with relaxed constraints and without explicit object semantics. Leveraging dimensionality-specific encoders, a multi-stage training pipeline, and emergent cross-modal behaviors, CrossOver supports robust scene retrieval and object localization, even with missing modalities. Evaluations on ScanNet and 3RScan datasets show its superior performance across diverse metrics, highlighting the adaptability for real-world applications in 3D scene understanding.
title CrossOver: 3D Scene Cross-Modal Alignment
topic Computer Vision and Pattern Recognition
url https://arxiv.org/abs/2502.15011