CaR1: A Multi-Modal Baseline for BEV Vehicle Segmentation via Camera-Radar Fusion

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Montiel-Marín, Santiago, Llamazares, Angel, Antunes-García, Miguel, Sánchez-García, Fabio, Bergasa, Luis M.
Format: Preprint
Published: 2025
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!
_version_ 1866914033272094720
author Montiel-Marín, Santiago
Llamazares, Angel
Antunes-García, Miguel
Sánchez-García, Fabio
Bergasa, Luis M.
author_facet Montiel-Marín, Santiago
Llamazares, Angel
Antunes-García, Miguel
Sánchez-García, Fabio
Bergasa, Luis M.
contents Camera-radar fusion offers a robust and cost-effective alternative to LiDAR-based autonomous driving systems by combining complementary sensing capabilities: cameras provide rich semantic cues but unreliable depth, while radar delivers sparse yet reliable position and motion information. We introduce CaR1, a novel camera-radar fusion architecture for BEV vehicle segmentation. Built upon BEVFusion, our approach incorporates a grid-wise radar encoding that discretizes point clouds into structured BEV features and an adaptive fusion mechanism that dynamically balances sensor contributions. Experiments on nuScenes demonstrate competitive segmentation performance (57.6 IoU), on par with state-of-the-art methods. Code is publicly available \href{https://www.github.com/santimontiel/car1}{online}.
format Preprint
id arxiv_https___arxiv_org_abs_2509_10139
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle CaR1: A Multi-Modal Baseline for BEV Vehicle Segmentation via Camera-Radar Fusion
Montiel-Marín, Santiago
Llamazares, Angel
Antunes-García, Miguel
Sánchez-García, Fabio
Bergasa, Luis M.
Robotics
Camera-radar fusion offers a robust and cost-effective alternative to LiDAR-based autonomous driving systems by combining complementary sensing capabilities: cameras provide rich semantic cues but unreliable depth, while radar delivers sparse yet reliable position and motion information. We introduce CaR1, a novel camera-radar fusion architecture for BEV vehicle segmentation. Built upon BEVFusion, our approach incorporates a grid-wise radar encoding that discretizes point clouds into structured BEV features and an adaptive fusion mechanism that dynamically balances sensor contributions. Experiments on nuScenes demonstrate competitive segmentation performance (57.6 IoU), on par with state-of-the-art methods. Code is publicly available \href{https://www.github.com/santimontiel/car1}{online}.
title CaR1: A Multi-Modal Baseline for BEV Vehicle Segmentation via Camera-Radar Fusion
topic Robotics
url https://arxiv.org/abs/2509.10139