A Flexible Precision Scaling Deep Neural Network Accelerator with Efficient Weight Combination
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhao, Liang, Shao, Kunming, Tian, Fengshi, Cheng, Tim Kwang-Ting, Tsui, Chi-Ying, Zou, Yi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DIRC-RAG: Accelerating Edge RAG with Robust High-Density and High-Loading-Bandwidth Digital In-ReRAM Computation
por: Shao, Kunming, et al.
Publicado: (2025)
por: Shao, Kunming, et al.
Publicado: (2025)
Balancing FP8 Computation Accuracy and Efficiency on Digital CIM via Shift-Aware On-the-fly Aligned-Mantissa Bitwidth Prediction
por: Zhao, Liang, et al.
Publicado: (2026)
por: Zhao, Liang, et al.
Publicado: (2026)
A Memory-Efficient Retrieval Architecture for RAG-Enabled Wearable Medical LLMs-Agents
por: Liao, Zhipeng, et al.
Publicado: (2025)
por: Liao, Zhipeng, et al.
Publicado: (2025)
DS-CIM: Digital Stochastic Computing-In-Memory Featuring Accurate OR-Accumulation via Sample Region Remapping for Edge AI Models
por: Shao, Kunming, et al.
Publicado: (2026)
por: Shao, Kunming, et al.
Publicado: (2026)
SynDCIM: A Performance-Aware Digital Computing-in-Memory Compiler with Multi-Spec-Oriented Subcircuit Synthesis
por: Shao, Kunming, et al.
Publicado: (2024)
por: Shao, Kunming, et al.
Publicado: (2024)
A Hybrid-Domain Floating-Point Compute-in-Memory Architecture for Efficient Acceleration of High-Precision Deep Neural Networks
por: Yi, Zhiqiang, et al.
Publicado: (2025)
por: Yi, Zhiqiang, et al.
Publicado: (2025)
31.1 A 14.08-to-135.69Token/s ReRAM-on-Logic Stacked Outlier-Free Large-Language-Model Accelerator with Block-Clustered Weight-Compression and Adaptive Parallel-Speculative-Decoding
por: Dong, Pingcheng, et al.
Publicado: (2026)
por: Dong, Pingcheng, et al.
Publicado: (2026)
FETTA: Flexible and Efficient Hardware Accelerator for Tensorized Neural Network Training
por: Lu, Jinming, et al.
Publicado: (2025)
por: Lu, Jinming, et al.
Publicado: (2025)
High Utilization Energy-Aware Real-Time Inference Deep Convolutional Neural Network Accelerator
por: Lin, Kuan-Ting, et al.
Publicado: (2025)
por: Lin, Kuan-Ting, et al.
Publicado: (2025)
Efficient Implementation of an Adaptive Transformer Accelerator for Massive MIMO Outdoor Localization
por: Yaman, Ilayda, et al.
Publicado: (2026)
por: Yaman, Ilayda, et al.
Publicado: (2026)
FGMP: Fine-Grained Mixed-Precision Weight and Activation Quantization for Hardware-Accelerated LLM Inference
por: Hooper, Coleman, et al.
Publicado: (2025)
por: Hooper, Coleman, et al.
Publicado: (2025)
CIMPool: Scalable Neural Network Acceleration for Compute-In-Memory using Weight Pools
por: Li, Shurui, et al.
Publicado: (2025)
por: Li, Shurui, et al.
Publicado: (2025)
Layer-wise Weight Selection for Power-Efficient Neural Network Acceleration
por: Fang, Jiaxun, et al.
Publicado: (2025)
por: Fang, Jiaxun, et al.
Publicado: (2025)
VitaLLM: A Versatile and Tiny Accelerator for Mixed-Precision LLM Inference on Edge Devices
por: Lin, Zi-Wei, et al.
Publicado: (2026)
por: Lin, Zi-Wei, et al.
Publicado: (2026)
StruM: Structured Mixed Precision for Efficient Deep Learning Hardware Codesign
por: Wu, Michael, et al.
Publicado: (2025)
por: Wu, Michael, et al.
Publicado: (2025)
Aging Aware Adaptive Voltage Scaling for Reliable and Efficient AI Accelerators
por: Xie, Tong, et al.
Publicado: (2026)
por: Xie, Tong, et al.
Publicado: (2026)
A Low-Power Sparse Deep Learning Accelerator with Optimized Data Reuse
por: Hsu, Kai-Chieh, et al.
Publicado: (2025)
por: Hsu, Kai-Chieh, et al.
Publicado: (2025)
Reuse and Blend: Energy-Efficient Optical Neural Network Enabled by Weight Sharing
por: Xu, Bo, et al.
Publicado: (2024)
por: Xu, Bo, et al.
Publicado: (2024)
SeDA: Secure and Efficient DNN Accelerators with Hardware/Software Synergy
por: Xuan, Wei, et al.
Publicado: (2025)
por: Xuan, Wei, et al.
Publicado: (2025)
Multilayer Dataflow: Orchestrate Butterfly Sparsity to Accelerate Attention Computation
por: Wu, Haibin, et al.
Publicado: (2024)
por: Wu, Haibin, et al.
Publicado: (2024)
Hardware Efficient Accelerator for Spiking Transformer With Reconfigurable Parallel Time Step Computing
por: Chen, Bo-Yu, et al.
Publicado: (2025)
por: Chen, Bo-Yu, et al.
Publicado: (2025)
SIRA: Scaled-Integer Range Analysis for Optimizing FPGA Dataflow Neural Network Accelerators
por: Umuroglu, Yaman, et al.
Publicado: (2025)
por: Umuroglu, Yaman, et al.
Publicado: (2025)
Platinum: Path-Adaptable LUT-Based Accelerator Tailored for Low-Bit Weight Matrix Multiplication
por: Shan, Haoxuan, et al.
Publicado: (2025)
por: Shan, Haoxuan, et al.
Publicado: (2025)
ONE-SA: Enabling Nonlinear Operations in Systolic Arrays for Efficient and Flexible Neural Network Inference
por: Sun, Ruiqi, et al.
Publicado: (2024)
por: Sun, Ruiqi, et al.
Publicado: (2024)
Beehive: A Flexible Network Stack for Direct-Attached Accelerators
por: Lim, Katie, et al.
Publicado: (2024)
por: Lim, Katie, et al.
Publicado: (2024)
Special Session: Sustainable Deployment of Deep Neural Networks on Non-Volatile Compute-in-Memory Accelerators
por: Qin, Yifan, et al.
Publicado: (2025)
por: Qin, Yifan, et al.
Publicado: (2025)
Analysis of Single Event Induced Bit Faults in a Deep Neural Network Accelerator Pipeline
por: Jonckers, Naïn, et al.
Publicado: (2025)
por: Jonckers, Naïn, et al.
Publicado: (2025)
SiTe CiM: Signed Ternary Computing-in-Memory for Ultra-Low Precision Deep Neural Networks
por: Thakuria, Niharika, et al.
Publicado: (2024)
por: Thakuria, Niharika, et al.
Publicado: (2024)
A PVT-Resilient Subthreshold SRAM-Based In-Memory Computing Accelerator with In-Situ Regulation for Energy-Efficient Spiking Neural Networks
por: Kao, Shih-Hang, et al.
Publicado: (2026)
por: Kao, Shih-Hang, et al.
Publicado: (2026)
Prosperity: Accelerating Spiking Neural Networks via Product Sparsity
por: Wei, Chiyue, et al.
Publicado: (2025)
por: Wei, Chiyue, et al.
Publicado: (2025)
Leveraging Application-Specific Knowledge for Energy-Efficient Deep Learning Accelerators on Resource-Constrained FPGAs
por: Qian, Chao
Publicado: (2025)
por: Qian, Chao
Publicado: (2025)
ADiP: Adaptive-Precision Systolic Array for Matrix Multiplication Acceleration
por: Abdelmaksoud, Ahmed J., et al.
Publicado: (2025)
por: Abdelmaksoud, Ahmed J., et al.
Publicado: (2025)
Memory-Guided Unified Hardware Accelerator for Mixed-Precision Scientific Computing
por: Wang, Chuanzhen, et al.
Publicado: (2026)
por: Wang, Chuanzhen, et al.
Publicado: (2026)
FILCO: Flexible Composing Architecture with Real-Time Reconfigurability for DNN Acceleration
por: Chen, Xingzhen, et al.
Publicado: (2026)
por: Chen, Xingzhen, et al.
Publicado: (2026)
Voxel-CIM: An Efficient Compute-in-Memory Accelerator for Voxel-based Point Cloud Neural Networks
por: Lin, Xipeng, et al.
Publicado: (2024)
por: Lin, Xipeng, et al.
Publicado: (2024)
LLMulator: Generalizable Cost Modeling for Dataflow Accelerators with Input-Adaptive Control Flow
por: Chang, Kaiyan, et al.
Publicado: (2025)
por: Chang, Kaiyan, et al.
Publicado: (2025)
RCW-CIM: A Digital CIM-based LLM Accelerator with Read-Compute/Write
por: Guo, Yan-Cheng, et al.
Publicado: (2026)
por: Guo, Yan-Cheng, et al.
Publicado: (2026)
A 10.60 $μ$W 150 GOPS Mixed-Bit-Width Sparse CNN Accelerator for Life-Threatening Ventricular Arrhythmia Detection
por: Qin, Yifan, et al.
Publicado: (2024)
por: Qin, Yifan, et al.
Publicado: (2024)
TATAA: Programmable Mixed-Precision Transformer Acceleration with a Transformable Arithmetic Architecture
por: Wu, Jiajun, et al.
Publicado: (2024)
por: Wu, Jiajun, et al.
Publicado: (2024)
MASQ: Accelerating Masked Diffusion via Stage-Wise Multi-Precision Quantization
por: Kim, Seeyeon, et al.
Publicado: (2026)
por: Kim, Seeyeon, et al.
Publicado: (2026)
Ejemplares similares
-
DIRC-RAG: Accelerating Edge RAG with Robust High-Density and High-Loading-Bandwidth Digital In-ReRAM Computation
por: Shao, Kunming, et al.
Publicado: (2025) -
Balancing FP8 Computation Accuracy and Efficiency on Digital CIM via Shift-Aware On-the-fly Aligned-Mantissa Bitwidth Prediction
por: Zhao, Liang, et al.
Publicado: (2026) -
A Memory-Efficient Retrieval Architecture for RAG-Enabled Wearable Medical LLMs-Agents
por: Liao, Zhipeng, et al.
Publicado: (2025) -
DS-CIM: Digital Stochastic Computing-In-Memory Featuring Accurate OR-Accumulation via Sample Region Remapping for Edge AI Models
por: Shao, Kunming, et al.
Publicado: (2026) -
SynDCIM: A Performance-Aware Digital Computing-in-Memory Compiler with Multi-Spec-Oriented Subcircuit Synthesis
por: Shao, Kunming, et al.
Publicado: (2024)