OmniGen: Unified Multimodal Sensor Generation for Autonomous Driving

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Tang, Tao, Ma, Enhui, zhou, xia, Wang, Letian, Yan, Tianyi, Zhang, Xueyang, Zhan, Kun, Jia, Peng, Lang, XianPeng, Bian, Jia-Wang, Yu, Kaicheng, Liang, Xiaodan
Format: Preprint
Published: 2025
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!
_version_ 1866911322420019200
author Tang, Tao
Ma, Enhui
zhou, xia
Wang, Letian
Yan, Tianyi
Zhang, Xueyang
Zhan, Kun
Jia, Peng
Lang, XianPeng
Bian, Jia-Wang
Yu, Kaicheng
Liang, Xiaodan
author_facet Tang, Tao
Ma, Enhui
zhou, xia
Wang, Letian
Yan, Tianyi
Zhang, Xueyang
Zhan, Kun
Jia, Peng
Lang, XianPeng
Bian, Jia-Wang
Yu, Kaicheng
Liang, Xiaodan
contents Autonomous driving has seen remarkable advancements, largely driven by extensive real-world data collection. However, acquiring diverse and corner-case data remains costly and inefficient. Generative models have emerged as a promising solution by synthesizing realistic sensor data. However, existing approaches primarily focus on single-modality generation, leading to inefficiencies and misalignment in multimodal sensor data. To address these challenges, we propose OminiGen, which generates aligned multimodal sensor data in a unified framework. Our approach leverages a shared Bird\u2019s Eye View (BEV) space to unify multimodal features and designs a novel generalizable multimodal reconstruction method, UAE, to jointly decode LiDAR and multi-view camera data. UAE achieves multimodal sensor decoding through volume rendering, enabling accurate and flexible reconstruction. Furthermore, we incorporate a Diffusion Transformer (DiT) with a ControlNet branch to enable controllable multimodal sensor generation. Our comprehensive experiments demonstrate that OminiGen achieves desired performances in unified multimodal sensor data generation with multimodal consistency and flexible sensor adjustments.
format Preprint
id arxiv_https___arxiv_org_abs_2512_14225
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle OmniGen: Unified Multimodal Sensor Generation for Autonomous Driving
Tang, Tao
Ma, Enhui
zhou, xia
Wang, Letian
Yan, Tianyi
Zhang, Xueyang
Zhan, Kun
Jia, Peng
Lang, XianPeng
Bian, Jia-Wang
Yu, Kaicheng
Liang, Xiaodan
Computer Vision and Pattern Recognition
Autonomous driving has seen remarkable advancements, largely driven by extensive real-world data collection. However, acquiring diverse and corner-case data remains costly and inefficient. Generative models have emerged as a promising solution by synthesizing realistic sensor data. However, existing approaches primarily focus on single-modality generation, leading to inefficiencies and misalignment in multimodal sensor data. To address these challenges, we propose OminiGen, which generates aligned multimodal sensor data in a unified framework. Our approach leverages a shared Bird\u2019s Eye View (BEV) space to unify multimodal features and designs a novel generalizable multimodal reconstruction method, UAE, to jointly decode LiDAR and multi-view camera data. UAE achieves multimodal sensor decoding through volume rendering, enabling accurate and flexible reconstruction. Furthermore, we incorporate a Diffusion Transformer (DiT) with a ControlNet branch to enable controllable multimodal sensor generation. Our comprehensive experiments demonstrate that OminiGen achieves desired performances in unified multimodal sensor data generation with multimodal consistency and flexible sensor adjustments.
title OmniGen: Unified Multimodal Sensor Generation for Autonomous Driving
topic Computer Vision and Pattern Recognition
url https://arxiv.org/abs/2512.14225