Topkima-Former: Low-energy, Low-Latency Inference for Transformers using top-k In-memory ADC
Fuente:
arXiv
Saved in:
| Main Authors: | Dong, Shuai, Yang, Junyi, Peng, Xiaoqi, Shang, Hongyang, Ke, Ye, Yang, Xiaofeng, Liu, Hongjie, Basu, Arindam |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
CADC: Crossbar-Aware Dendritic Convolution for Efficient In-memory Computing
by: Dong, Shuai, et al.
Published: (2025)
by: Dong, Shuai, et al.
Published: (2025)
In-Memory ADC-Based Nonlinear Activation Quantization for Efficient In-Memory Computing
by: Dong, Shuai, et al.
Published: (2026)
by: Dong, Shuai, et al.
Published: (2026)
Near-Memory Architecture for Threshold-Ordinal Surface-Based Corner Detection of Event Cameras
by: Shang, Hongyang, et al.
Published: (2025)
by: Shang, Hongyang, et al.
Published: (2025)
A 33.6-136.2 TOPS/W Nonlinear Analog Computing-In-Memory Macro for Multi-bit LSTM Accelerator in 65 nm CMOS
by: Yang, Junyi, et al.
Published: (2025)
by: Yang, Junyi, et al.
Published: (2025)
3D Stack In-Sensor-Computing (3DS-ISC): Accelerating Time-Surface Construction for Neuromorphic Event Cameras
by: Shang, Hongyang, et al.
Published: (2025)
by: Shang, Hongyang, et al.
Published: (2025)
A Reconfigurable Computing In-Memory Macro with Charge-sharing-based Weighted Accumulator
by: Yang, Junyi, et al.
Published: (2026)
by: Yang, Junyi, et al.
Published: (2026)
SRAM-Based Compute-in-Memory Accelerator for Linear-decay Spiking Neural Networks
by: Shang, Hongyang, et al.
Published: (2026)
by: Shang, Hongyang, et al.
Published: (2026)
A System Architecture for Low Latency Multiprogramming Quantum Computing
by: Zhao, Yilun, et al.
Published: (2026)
by: Zhao, Yilun, et al.
Published: (2026)
TinyFormer: Efficient Transformer Design and Deployment on Tiny Devices
by: Yang, Jianlei, et al.
Published: (2023)
by: Yang, Jianlei, et al.
Published: (2023)
Distributed Inference with Minimal Off-Chip Traffic for Transformers on Low-Power MCUs
by: Bochem, Severin, et al.
Published: (2024)
by: Bochem, Severin, et al.
Published: (2024)
LinkBo: An Adaptive Single-Wire, Low-Latency, and Fault-Tolerant Communications Interface for Variable-Distance Chip-to-Chip Systems
by: Ye, Bochen, et al.
Published: (2025)
by: Ye, Bochen, et al.
Published: (2025)
Efficient Nonlinear Function Approximation in Analog Resistive Crossbars for Recurrent Neural Networks
by: Yang, Junyi, et al.
Published: (2024)
by: Yang, Junyi, et al.
Published: (2024)
Architectural Implications of Neural Network Inference for High Data-Rate, Low-Latency Scientific Applications
by: Weng, Olivia, et al.
Published: (2024)
by: Weng, Olivia, et al.
Published: (2024)
PolyLUT: Learning Piecewise Polynomials for Ultra-Low Latency FPGA LUT-based Inference
by: Andronic, Marta, et al.
Published: (2023)
by: Andronic, Marta, et al.
Published: (2023)
Evaluation of GPU Video Encoder for Low-Latency Real-Time 4K UHD Encoding
by: Arunruangsirilert, Kasidis, et al.
Published: (2025)
by: Arunruangsirilert, Kasidis, et al.
Published: (2025)
A Case for Kolmogorov-Arnold Networks in Prefetching: Towards Low-Latency, Generalizable ML-Based Prefetchers
by: Kulkarni, Dhruv, et al.
Published: (2025)
by: Kulkarni, Dhruv, et al.
Published: (2025)
A Low-Latency FFT-IFFT Cascade Architecture
by: Parhi, Keshab K.
Published: (2023)
by: Parhi, Keshab K.
Published: (2023)
Low Latency GNN Accelerator for Quantum Error Correction
by: Cicero, Alessio, et al.
Published: (2026)
by: Cicero, Alessio, et al.
Published: (2026)
Uncertainty-Guided Live Measurement Sequencing for Fast SAR ADC Linearity Testing
by: Schey, Thorben, et al.
Published: (2025)
by: Schey, Thorben, et al.
Published: (2025)
Hybrid JIT-CUDA Graph Optimization for Low-Latency Large Language Model Inference
by: Yadav, Divakar Kumar, et al.
Published: (2026)
by: Yadav, Divakar Kumar, et al.
Published: (2026)
PRIMAL: Processing-In-Memory Based Low-Rank Adaptation for LLM Inference Accelerator
by: Chong, Yue Jiet, et al.
Published: (2026)
by: Chong, Yue Jiet, et al.
Published: (2026)
LPU: A Latency-Optimized and Highly Scalable Processor for Large Language Model Inference
by: Moon, Seungjae, et al.
Published: (2024)
by: Moon, Seungjae, et al.
Published: (2024)
A Systematic Characterization of LLM Inference on GPUs
by: Wang, Haonan, et al.
Published: (2025)
by: Wang, Haonan, et al.
Published: (2025)
HCiM: ADC-Less Hybrid Analog-Digital Compute in Memory Accelerator for Deep Learning Workloads
by: Negi, Shubham, et al.
Published: (2024)
by: Negi, Shubham, et al.
Published: (2024)
Advanced Strategies for Uncertainty-Guided Live Measurement Sequencing in Fast, Robust SAR ADC Linearity Testing
by: Schey, Thorben, et al.
Published: (2025)
by: Schey, Thorben, et al.
Published: (2025)
Design of a 6-bit Threshold Inverter Quantization (TIQ) Flash Analog to Digital Converter (ADC)
by: Sarkar, Noyon Kumar, et al.
Published: (2025)
by: Sarkar, Noyon Kumar, et al.
Published: (2025)
In-Memory Computing Enabled Deep MIMO Detection to Support Ultra-Low-Latency Communications
by: Ding, Tingyu, et al.
Published: (2025)
by: Ding, Tingyu, et al.
Published: (2025)
T-MAN: Enabling End-to-End Low-Bit LLM Inference on NPUs via Unified Table Lookup
by: Wei, Jianyu, et al.
Published: (2025)
by: Wei, Jianyu, et al.
Published: (2025)
Achieving Trustworthy Real-Time Decision Support Systems with Low-Latency Interpretable AI Models
by: Deng, Zechun, et al.
Published: (2025)
by: Deng, Zechun, et al.
Published: (2025)
TMA-Adaptive FP8 Grouped GEMM: Eliminating Padding Requirements in Low-Precision Training and Inference on Hopper
by: Su, Zhongling, et al.
Published: (2025)
by: Su, Zhongling, et al.
Published: (2025)
MERE: Hardware-Software Co-Design for Masking Cache Miss Latency in Embedded Processors
by: You, Dean, et al.
Published: (2025)
by: You, Dean, et al.
Published: (2025)
PICNIC: Silicon Photonic Interconnected Chiplets with Computational Network and In-memory Computing for LLM Inference Acceleration
by: Chong, Yue Jiet, et al.
Published: (2025)
by: Chong, Yue Jiet, et al.
Published: (2025)
A Scalable Open-Source QEC System with Sub-Microsecond Decoding-Feedback Latency
by: Liu, Junyi, et al.
Published: (2026)
by: Liu, Junyi, et al.
Published: (2026)
Automated SAR ADC Sizing Using Analytical Equations
by: Li, Zhongyi, et al.
Published: (2025)
by: Li, Zhongyi, et al.
Published: (2025)
SSR: Spatial Sequential Hybrid Architecture for Latency Throughput Tradeoff in Transformer Acceleration
by: Zhuang, Jinming, et al.
Published: (2024)
by: Zhuang, Jinming, et al.
Published: (2024)
NL-DPE: An Analog In-memory Non-Linear Dot Product Engine for Efficient CNN and LLM Inference
by: Zhao, Lei, et al.
Published: (2025)
by: Zhao, Lei, et al.
Published: (2025)
CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge
by: Tian, Chunlin, et al.
Published: (2025)
by: Tian, Chunlin, et al.
Published: (2025)
Addressing memory bandwidth scalability in vector processors for streaming applications
by: Altayo, Jordi, et al.
Published: (2025)
by: Altayo, Jordi, et al.
Published: (2025)
NeuroBlend: Towards Low-Power yet Accurate Neural Network-Based Inference Engine Blending Binary and Fixed-Point Convolutions
by: Fayyazi, Arash, et al.
Published: (2023)
by: Fayyazi, Arash, et al.
Published: (2023)
Design and In-training Optimization of Binary Search ADC for Flexible Classifiers
by: Duarte, Paula Carolina Lozano, et al.
Published: (2024)
by: Duarte, Paula Carolina Lozano, et al.
Published: (2024)
Similar Items
-
CADC: Crossbar-Aware Dendritic Convolution for Efficient In-memory Computing
by: Dong, Shuai, et al.
Published: (2025) -
In-Memory ADC-Based Nonlinear Activation Quantization for Efficient In-Memory Computing
by: Dong, Shuai, et al.
Published: (2026) -
Near-Memory Architecture for Threshold-Ordinal Surface-Based Corner Detection of Event Cameras
by: Shang, Hongyang, et al.
Published: (2025) -
A 33.6-136.2 TOPS/W Nonlinear Analog Computing-In-Memory Macro for Multi-bit LSTM Accelerator in 65 nm CMOS
by: Yang, Junyi, et al.
Published: (2025) -
3D Stack In-Sensor-Computing (3DS-ISC): Accelerating Time-Surface Construction for Neuromorphic Event Cameras
by: Shang, Hongyang, et al.
Published: (2025)