End-to-End RGB-IR Joint Image Compression With Channel-wise Cross-modality Entropy Model

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Wang, Haofeng, Zhou, Fangtao, Zhang, Qi, Chen, Zeyuan, Zhang, Enci, Wang, Zhao, Huang, Xiaofeng, Ma, Siwei
Natura: Preprint
Pubblicazione: 2025
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
_version_ 1866909661906599936
author Wang, Haofeng
Zhou, Fangtao
Zhang, Qi
Chen, Zeyuan
Zhang, Enci
Wang, Zhao
Huang, Xiaofeng
Ma, Siwei
author_facet Wang, Haofeng
Zhou, Fangtao
Zhang, Qi
Chen, Zeyuan
Zhang, Enci
Wang, Zhao
Huang, Xiaofeng
Ma, Siwei
contents RGB-IR(RGB-Infrared) image pairs are frequently applied simultaneously in various applications like intelligent surveillance. However, as the number of modalities increases, the required data storage and transmission costs also double. Therefore, efficient RGB-IR data compression is essential. This work proposes a joint compression framework for RGB-IR image pair. Specifically, to fully utilize cross-modality prior information for accurate context probability modeling within and between modalities, we propose a Channel-wise Cross-modality Entropy Model (CCEM). Among CCEM, a Low-frequency Context Extraction Block (LCEB) and a Low-frequency Context Fusion Block (LCFB) are designed for extracting and aggregating the global low-frequency information from both modalities, which assist the model in predicting entropy parameters more accurately. Experimental results demonstrate that our approach outperforms existing RGB-IR image pair and single-modality compression methods on LLVIP and KAIST datasets. For instance, the proposed framework achieves a 23.1% bit rate saving on LLVIP dataset compared to the state-of-the-art RGB-IR image codec presented at CVPR 2022.
format Preprint
id arxiv_https___arxiv_org_abs_2506_21851
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle End-to-End RGB-IR Joint Image Compression With Channel-wise Cross-modality Entropy Model
Wang, Haofeng
Zhou, Fangtao
Zhang, Qi
Chen, Zeyuan
Zhang, Enci
Wang, Zhao
Huang, Xiaofeng
Ma, Siwei
Computer Vision and Pattern Recognition
Multimedia
Image and Video Processing
RGB-IR(RGB-Infrared) image pairs are frequently applied simultaneously in various applications like intelligent surveillance. However, as the number of modalities increases, the required data storage and transmission costs also double. Therefore, efficient RGB-IR data compression is essential. This work proposes a joint compression framework for RGB-IR image pair. Specifically, to fully utilize cross-modality prior information for accurate context probability modeling within and between modalities, we propose a Channel-wise Cross-modality Entropy Model (CCEM). Among CCEM, a Low-frequency Context Extraction Block (LCEB) and a Low-frequency Context Fusion Block (LCFB) are designed for extracting and aggregating the global low-frequency information from both modalities, which assist the model in predicting entropy parameters more accurately. Experimental results demonstrate that our approach outperforms existing RGB-IR image pair and single-modality compression methods on LLVIP and KAIST datasets. For instance, the proposed framework achieves a 23.1% bit rate saving on LLVIP dataset compared to the state-of-the-art RGB-IR image codec presented at CVPR 2022.
title End-to-End RGB-IR Joint Image Compression With Channel-wise Cross-modality Entropy Model
topic Computer Vision and Pattern Recognition
Multimedia
Image and Video Processing
url https://arxiv.org/abs/2506.21851