A 28nm 0.22μJ/token memory-compute-intensity-aware CNN-Transformer accelerator with hybrid-attention-based layer-fusion and cascaded pruning for semantic-segmentation

Fuente: arXiv
Gespeichert in:
Bibliographische Detailangaben
Hauptverfasser: Dong, Pingcheng, Tan, Yonghao, Liu, Xuejiao, Luo, Peng, Liu, Yu, Liang, Luhong, Zhou, Yitong, Pang, Di, Yung, Man-To, Zhang, Dong, Huang, Xijie, Liu, Shih-Yang, Wu, Yongkun, Tian, Fengshi, Tsui, Chi-Ying, Tu, Fengbin, Cheng, Kwang-Ting
Format: Preprint
Veröffentlicht: 2025
Schlagworte:
Online-Zugang:
Tags: Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
_version_ 1866909979611496448
author Dong, Pingcheng
Tan, Yonghao
Liu, Xuejiao
Luo, Peng
Liu, Yu
Liang, Luhong
Zhou, Yitong
Pang, Di
Yung, Man-To
Zhang, Dong
Huang, Xijie
Liu, Shih-Yang
Wu, Yongkun
Tian, Fengshi
Tsui, Chi-Ying
Tu, Fengbin
Cheng, Kwang-Ting
author_facet Dong, Pingcheng
Tan, Yonghao
Liu, Xuejiao
Luo, Peng
Liu, Yu
Liang, Luhong
Zhou, Yitong
Pang, Di
Yung, Man-To
Zhang, Dong
Huang, Xijie
Liu, Shih-Yang
Wu, Yongkun
Tian, Fengshi
Tsui, Chi-Ying
Tu, Fengbin
Cheng, Kwang-Ting
contents This work presents a 28nm 13.93mm2 CNN-Transformer accelerator for semantic segmentation, achieving 3.86-to-10.91x energy reduction over previous designs. It features a hybrid attention unit, layer-fusion scheduler, and cascaded feature-map pruner, with peak energy efficiency of 52.90TOPS/W (INT8).
format Preprint
id arxiv_https___arxiv_org_abs_2512_17555
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle A 28nm 0.22μJ/token memory-compute-intensity-aware CNN-Transformer accelerator with hybrid-attention-based layer-fusion and cascaded pruning for semantic-segmentation
Dong, Pingcheng
Tan, Yonghao
Liu, Xuejiao
Luo, Peng
Liu, Yu
Liang, Luhong
Zhou, Yitong
Pang, Di
Yung, Man-To
Zhang, Dong
Huang, Xijie
Liu, Shih-Yang
Wu, Yongkun
Tian, Fengshi
Tsui, Chi-Ying
Tu, Fengbin
Cheng, Kwang-Ting
Image and Video Processing
This work presents a 28nm 13.93mm2 CNN-Transformer accelerator for semantic segmentation, achieving 3.86-to-10.91x energy reduction over previous designs. It features a hybrid attention unit, layer-fusion scheduler, and cascaded feature-map pruner, with peak energy efficiency of 52.90TOPS/W (INT8).
title A 28nm 0.22μJ/token memory-compute-intensity-aware CNN-Transformer accelerator with hybrid-attention-based layer-fusion and cascaded pruning for semantic-segmentation
topic Image and Video Processing
url https://arxiv.org/abs/2512.17555