CARMEN: CORDIC-Accelerated Resource-Efficient Multi-Precision Inference Engine for Deep Learning

Fuente: arXiv
Guardado en:
Detalles Bibliográficos
Autores principales: Kumar, Sonu, Lokhande, Mukul, Vishvakarma, Santosh Kumar, Teman, Adam
Formato: Preprint
Publicado: 2026
Materias:
Acceso en línea:
Etiquetas: Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
_version_ 1866911660811223040
author Kumar, Sonu
Lokhande, Mukul
Vishvakarma, Santosh Kumar
Teman, Adam
author_facet Kumar, Sonu
Lokhande, Mukul
Vishvakarma, Santosh Kumar
Teman, Adam
contents This paper presents CARMEN, a runtime-adaptive, CORDIC-accelerated multi-precision vector engine for resource-efficient deep learning inference. The key insight is that CORDIC iteration depth directly governs computational accuracy, enabling dynamic switching between approximate and accurate execution modes without hardware modification. The architecture integrates a low-resource iterative CORDIC-based MAC unit with a time-multiplexed multi-activation function block, supporting flexible 8/16-bit precision and high hardware utilization. ASIC implementation in 28 nm CMOS achieves up to 33% reduction in computation cycles and 21% power savings per MAC stage; a 256-PE configuration delivers 4.83 TOPS/mm2 compute density and 11.67 TOPS/W energy efficiency. FPGA deployment on PynqZ2 validates 154.6 ms latency at 0.43 W for real-time object detection.
format Preprint
id arxiv_https___arxiv_org_abs_2605_06878
institution arXiv
publishDate 2026
record_format arxiv
spellingShingle CARMEN: CORDIC-Accelerated Resource-Efficient Multi-Precision Inference Engine for Deep Learning
Kumar, Sonu
Lokhande, Mukul
Vishvakarma, Santosh Kumar
Teman, Adam
Hardware Architecture
Computational Complexity
Robotics
Image and Video Processing
This paper presents CARMEN, a runtime-adaptive, CORDIC-accelerated multi-precision vector engine for resource-efficient deep learning inference. The key insight is that CORDIC iteration depth directly governs computational accuracy, enabling dynamic switching between approximate and accurate execution modes without hardware modification. The architecture integrates a low-resource iterative CORDIC-based MAC unit with a time-multiplexed multi-activation function block, supporting flexible 8/16-bit precision and high hardware utilization. ASIC implementation in 28 nm CMOS achieves up to 33% reduction in computation cycles and 21% power savings per MAC stage; a 256-PE configuration delivers 4.83 TOPS/mm2 compute density and 11.67 TOPS/W energy efficiency. FPGA deployment on PynqZ2 validates 154.6 ms latency at 0.43 W for real-time object detection.
title CARMEN: CORDIC-Accelerated Resource-Efficient Multi-Precision Inference Engine for Deep Learning
topic Hardware Architecture
Computational Complexity
Robotics
Image and Video Processing
url https://arxiv.org/abs/2605.06878