Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Ramachandran, Akshat, Kundu, Souvik, Raha, Arnab, Kundu, Shamik, Mathaikutty, Deepak K., Krishna, Tushar
Format: Preprint
Published: 2025
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!