One Model to Translate Them All: Universal Any-to-Any Translation for Heterogeneous Collaborative Perception

Fuente: arXiv
Guardado en:
Detalles Bibliográficos
Autores principales: Li, Yang, Li, Weize, Yuan, Quan, Shao, Congzhang, Luo, Guiyang, Ba, Yunqi, Zhu, Xuanhan, Ding, Xinyuan, Fu, Xiaoyuan, Li, Jinglin
Formato: Preprint
Publicado: 2026
Materias:
Acceso en línea:
Etiquetas: Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
_version_ 1866911693798375424
author Li, Yang
Li, Weize
Yuan, Quan
Shao, Congzhang
Luo, Guiyang
Ba, Yunqi
Zhu, Xuanhan
Ding, Xinyuan
Fu, Xiaoyuan
Li, Jinglin
author_facet Li, Yang
Li, Weize
Yuan, Quan
Shao, Congzhang
Luo, Guiyang
Ba, Yunqi
Zhu, Xuanhan
Ding, Xinyuan
Fu, Xiaoyuan
Li, Jinglin
contents By sharing intermediate features, collaborative perception extends each agent's sensing beyond standalone limits, but real-world feature modality heterogeneity remains a key barrier to effective fusion. Most existing methods, including direct adaption and protocol-based transformation, typically rely on training adapters for newly emerging feature modalities and often require additional retraining or fine-tuning. Such repeated training is costly and is often infeasible across manufacturers due to model and data privacy constraints, limiting real-world scalability. To address this issue, we propose UniTrans, a universal any-to-any feature modality translation model that instantiates translators on the fly for arbitrary modalities. UniTrans pretrains a bank of translator expert parameters and learns their combination coefficients as a function of source-to-target modality mapping. The mapping is measured in a modality-intrinsic latent space, where an intrinsic encoder extracts modality-specific yet scene-invariant codes from single-frame intermediate features, enabling UniTrans to instantiate translators in a zero-shot manner. Experiments on OPV2V-H and DAIR-V2X demonstrate that UniTrans consistently outperforms state-of-the-art methods in both simulated and real-world settings, enabling efficient any-to-any translation through a universal model. The code is available at https://github.com/CheeryLeeyy/UniTrans.
format Preprint
id arxiv_https___arxiv_org_abs_2605_17907
institution arXiv
publishDate 2026
record_format arxiv
spellingShingle One Model to Translate Them All: Universal Any-to-Any Translation for Heterogeneous Collaborative Perception
Li, Yang
Li, Weize
Yuan, Quan
Shao, Congzhang
Luo, Guiyang
Ba, Yunqi
Zhu, Xuanhan
Ding, Xinyuan
Fu, Xiaoyuan
Li, Jinglin
Computer Vision and Pattern Recognition
Artificial Intelligence
By sharing intermediate features, collaborative perception extends each agent's sensing beyond standalone limits, but real-world feature modality heterogeneity remains a key barrier to effective fusion. Most existing methods, including direct adaption and protocol-based transformation, typically rely on training adapters for newly emerging feature modalities and often require additional retraining or fine-tuning. Such repeated training is costly and is often infeasible across manufacturers due to model and data privacy constraints, limiting real-world scalability. To address this issue, we propose UniTrans, a universal any-to-any feature modality translation model that instantiates translators on the fly for arbitrary modalities. UniTrans pretrains a bank of translator expert parameters and learns their combination coefficients as a function of source-to-target modality mapping. The mapping is measured in a modality-intrinsic latent space, where an intrinsic encoder extracts modality-specific yet scene-invariant codes from single-frame intermediate features, enabling UniTrans to instantiate translators in a zero-shot manner. Experiments on OPV2V-H and DAIR-V2X demonstrate that UniTrans consistently outperforms state-of-the-art methods in both simulated and real-world settings, enabling efficient any-to-any translation through a universal model. The code is available at https://github.com/CheeryLeeyy/UniTrans.
title One Model to Translate Them All: Universal Any-to-Any Translation for Heterogeneous Collaborative Perception
topic Computer Vision and Pattern Recognition
Artificial Intelligence
url https://arxiv.org/abs/2605.17907