LargeAD: Large-Scale Cross-Sensor Data Pretraining for Autonomous Driving

Fuente: arXiv
Enregistré dans:
Détails bibliographiques
Auteurs principaux: Kong, Lingdong, Xu, Xiang, Liu, Youquan, Cen, Jun, Chen, Runnan, Zhang, Wenwei, Pan, Liang, Chen, Kai, Liu, Ziwei
Format: Preprint
Publié: 2025
Sujets:
Accès en ligne:
Tags: Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
_version_ 1866912744584773632
author Kong, Lingdong
Xu, Xiang
Liu, Youquan
Cen, Jun
Chen, Runnan
Zhang, Wenwei
Pan, Liang
Chen, Kai
Liu, Ziwei
author_facet Kong, Lingdong
Xu, Xiang
Liu, Youquan
Cen, Jun
Chen, Runnan
Zhang, Wenwei
Pan, Liang
Chen, Kai
Liu, Ziwei
contents Recent advancements in vision foundation models (VFMs) have revolutionized visual perception in 2D, yet their potential for 3D scene understanding, particularly in autonomous driving applications, remains underexplored. In this paper, we introduce LargeAD, a versatile and scalable framework designed for large-scale 3D pretraining across diverse real-world driving datasets. Our framework leverages VFMs to extract semantically rich superpixels from 2D images, which are aligned with LiDAR point clouds to generate high-quality contrastive samples. This alignment facilitates cross-modal representation learning, enhancing the semantic consistency between 2D and 3D data. We introduce several key innovations: (i) VFM-driven superpixel generation for detailed semantic representation, (ii) a VFM-assisted contrastive learning strategy to align multimodal features, (iii) superpoint temporal consistency to maintain stable representations across time, and (iv) multi-source data pretraining to generalize across various LiDAR configurations. Our approach achieves substantial gains over state-of-the-art methods in linear probing and fine-tuning for LiDAR-based segmentation and object detection. Extensive experiments on 11 large-scale multi-sensor datasets highlight our superior performance, demonstrating adaptability, efficiency, and robustness in real-world autonomous driving scenarios.
format Preprint
id arxiv_https___arxiv_org_abs_2501_04005
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle LargeAD: Large-Scale Cross-Sensor Data Pretraining for Autonomous Driving
Kong, Lingdong
Xu, Xiang
Liu, Youquan
Cen, Jun
Chen, Runnan
Zhang, Wenwei
Pan, Liang
Chen, Kai
Liu, Ziwei
Computer Vision and Pattern Recognition
Machine Learning
Robotics
Recent advancements in vision foundation models (VFMs) have revolutionized visual perception in 2D, yet their potential for 3D scene understanding, particularly in autonomous driving applications, remains underexplored. In this paper, we introduce LargeAD, a versatile and scalable framework designed for large-scale 3D pretraining across diverse real-world driving datasets. Our framework leverages VFMs to extract semantically rich superpixels from 2D images, which are aligned with LiDAR point clouds to generate high-quality contrastive samples. This alignment facilitates cross-modal representation learning, enhancing the semantic consistency between 2D and 3D data. We introduce several key innovations: (i) VFM-driven superpixel generation for detailed semantic representation, (ii) a VFM-assisted contrastive learning strategy to align multimodal features, (iii) superpoint temporal consistency to maintain stable representations across time, and (iv) multi-source data pretraining to generalize across various LiDAR configurations. Our approach achieves substantial gains over state-of-the-art methods in linear probing and fine-tuning for LiDAR-based segmentation and object detection. Extensive experiments on 11 large-scale multi-sensor datasets highlight our superior performance, demonstrating adaptability, efficiency, and robustness in real-world autonomous driving scenarios.
title LargeAD: Large-Scale Cross-Sensor Data Pretraining for Autonomous Driving
topic Computer Vision and Pattern Recognition
Machine Learning
Robotics
url https://arxiv.org/abs/2501.04005