Memory Is All You Need: An Overview of Compute-in-Memory Architectures for Accelerating Large Language Model Inference
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wolters, Christopher, Yang, Xiaoxuan, Schlichtmann, Ulf, Suzumura, Toyotaro |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CAMformer: Associative Memory is All You Need
par: Molom-Ochir, Tergel, et autres
Publié: (2025)
par: Molom-Ochir, Tergel, et autres
Publié: (2025)
End-to-End Transformer Acceleration Through Processing-in-Memory Architectures
par: Yang, Xiaoxuan, et autres
Publié: (2025)
par: Yang, Xiaoxuan, et autres
Publié: (2025)
OptINC: Optical In-Network-Computing for Scalable Distributed Learning
par: Fei, Sijie, et autres
Publié: (2026)
par: Fei, Sijie, et autres
Publié: (2026)
AI Accelerators for Large Language Model Inference: Architecture Analysis and Scaling Strategies
par: Sharma, Amit
Publié: (2025)
par: Sharma, Amit
Publié: (2025)
Pimba: A Processing-in-Memory Acceleration for Post-Transformer Large Language Model Serving
par: Kim, Wonung, et autres
Publié: (2025)
par: Kim, Wonung, et autres
Publié: (2025)
CHIME: Chiplet-based Heterogeneous Near-Memory Acceleration for Edge Multimodal LLM Inference
par: Chen, Yanru, et autres
Publié: (2025)
par: Chen, Yanru, et autres
Publié: (2025)
U-SWIM: Universal Selective Write-Verify for Computing-in-Memory Neural Accelerators
par: Yan, Zheyu, et autres
Publié: (2023)
par: Yan, Zheyu, et autres
Publié: (2023)
Binary Weight Multi-Bit Activation Quantization for Compute-in-Memory CNN Accelerators
par: Zhou, Wenyong, et autres
Publié: (2025)
par: Zhou, Wenyong, et autres
Publié: (2025)
SHIELD: A Segmented Hierarchical Memory Architecture for Energy-Efficient LLM Inference on Edge NPUs
par: Zhang, Jintao, et autres
Publié: (2026)
par: Zhang, Jintao, et autres
Publié: (2026)
Large Language Model Inference Acceleration: A Comprehensive Hardware Perspective
par: Li, Jinhao, et autres
Publié: (2024)
par: Li, Jinhao, et autres
Publié: (2024)
MEMHD: Memory-Efficient Multi-Centroid Hyperdimensional Computing for Fully-Utilized In-Memory Computing Architectures
par: Kang, Do Yeong, et autres
Publié: (2025)
par: Kang, Do Yeong, et autres
Publié: (2025)
Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator
par: Ramachandran, Akshat, et autres
Publié: (2025)
par: Ramachandran, Akshat, et autres
Publié: (2025)
PrefixGPT: Prefix Adder Optimization by a Generative Pre-trained Transformer
par: Ding, Ruogu, et autres
Publié: (2025)
par: Ding, Ruogu, et autres
Publié: (2025)
When Small Variations Become Big Failures: Reliability Challenges in Compute-in-Memory Neural Accelerators
par: Qin, Yifan, et autres
Publié: (2026)
par: Qin, Yifan, et autres
Publié: (2026)
PACiM: A Sparsity-Centric Hybrid Compute-in-Memory Architecture via Probabilistic Approximation
par: Zhang, Wenlun, et autres
Publié: (2024)
par: Zhang, Wenlun, et autres
Publié: (2024)
Memory Access Characterization of Large Language Models in CPU Environment and its Potential Impacts
par: Banasik, Spencer
Publié: (2025)
par: Banasik, Spencer
Publié: (2025)
SafeCiM: Investigating Resilience of Hybrid Floating-Point Compute-in-Memory Deep Learning Accelerators
par: Bhattacharya, Swastik, et autres
Publié: (2025)
par: Bhattacharya, Swastik, et autres
Publié: (2025)
Efficient In-Memory Acceleration of Sparse Block Diagonal LLMs
par: de Lima, João Paulo Cardoso, et autres
Publié: (2025)
par: de Lima, João Paulo Cardoso, et autres
Publié: (2025)
EPIM: Efficient Processing-In-Memory Accelerators based on Epitome
par: Wang, Chenyu, et autres
Publié: (2023)
par: Wang, Chenyu, et autres
Publié: (2023)
HPIM: Heterogeneous Processing-In-Memory-based Accelerator for Large Language Models Inference
par: Duan, Cenlin, et autres
Publié: (2025)
par: Duan, Cenlin, et autres
Publié: (2025)
AttentionLego: An Open-Source Building Block For Spatially-Scalable Large Language Model Accelerator With Processing-In-Memory Technology
par: Cong, Rongqing, et autres
Publié: (2024)
par: Cong, Rongqing, et autres
Publié: (2024)
Kernel Approximation using Analog In-Memory Computing
par: Büchel, Julian, et autres
Publié: (2024)
par: Büchel, Julian, et autres
Publié: (2024)
FusionCIM: Accelerating LLM Inference with Fusion-Driven Computing-in-Memory Architecture
par: Xuan, Zihao, et autres
Publié: (2026)
par: Xuan, Zihao, et autres
Publié: (2026)
Accelerating Computer Architecture Simulation through Machine Learning
par: Ali, Wajid, et autres
Publié: (2024)
par: Ali, Wajid, et autres
Publié: (2024)
Area-Efficient In-Memory Computing for Mixture-of-Experts via Multiplexing and Caching
par: Gao, Hanyuan, et autres
Publié: (2026)
par: Gao, Hanyuan, et autres
Publié: (2026)
EncodingNet: A Novel Encoding-based MAC Design for Efficient Neural Network Acceleration
par: Liu, Bo, et autres
Publié: (2024)
par: Liu, Bo, et autres
Publié: (2024)
RACE-IT: A Reconfigurable Analog Computing Engine for In-Memory Transformer Acceleration
par: Zhao, Lei, et autres
Publié: (2023)
par: Zhao, Lei, et autres
Publié: (2023)
COBRA: Algorithm-Architecture Co-optimized Binary Transformer Accelerator for Edge Inference
par: Qiao, Ye, et autres
Publié: (2025)
par: Qiao, Ye, et autres
Publié: (2025)
vMCU: Coordinated Memory Management and Kernel Optimization for DNN Inference on MCUs
par: Zheng, Size, et autres
Publié: (2024)
par: Zheng, Size, et autres
Publié: (2024)
A Persistent-State Dataflow Accelerator for Memory-Bound Linear Attention Decode on FPGA
par: Gupta, Neelesh, et autres
Publié: (2026)
par: Gupta, Neelesh, et autres
Publié: (2026)
AnalogNAS-Bench: A NAS Benchmark for Analog In-Memory Computing
par: Bessalah, Aniss, et autres
Publié: (2025)
par: Bessalah, Aniss, et autres
Publié: (2025)
H2PIPE: High throughput CNN Inference on FPGAs with High-Bandwidth Memory
par: Doumet, Mario, et autres
Publié: (2024)
par: Doumet, Mario, et autres
Publié: (2024)
CLSA-CIM: A Cross-Layer Scheduling Approach for Computing-in-Memory Architectures
par: Pelke, Rebecca, et autres
Publié: (2024)
par: Pelke, Rebecca, et autres
Publié: (2024)
Token-Picker: Accelerating Attention in Text Generation with Minimized Memory Transfer via Probability Estimation
par: Park, Junyoung, et autres
Publié: (2024)
par: Park, Junyoung, et autres
Publié: (2024)
Effective and Memory-Efficient Alternatives to ECC for Reliable Large-Scale DNNs
par: Ahmadilivani, Mohammad Hasan, et autres
Publié: (2026)
par: Ahmadilivani, Mohammad Hasan, et autres
Publié: (2026)
Column-wise Quantization of Weights and Partial Sums for Accurate and Efficient Compute-In-Memory Accelerators
par: Kim, Jiyoon, et autres
Publié: (2025)
par: Kim, Jiyoon, et autres
Publié: (2025)
NeFT: Negative Feedback Training to Improve Robustness of Compute-In-Memory DNN Accelerators
par: Qin, Yifan, et autres
Publié: (2023)
par: Qin, Yifan, et autres
Publié: (2023)
PIM Is All You Need: A CXL-Enabled GPU-Free System for Large Language Model Inference
par: Gu, Yufeng, et autres
Publié: (2025)
par: Gu, Yufeng, et autres
Publié: (2025)
GFormer: Accelerating Large Language Models with Optimized Transformers on Gaudi Processors
par: Zhang, Chengming, et autres
Publié: (2024)
par: Zhang, Chengming, et autres
Publié: (2024)
Autoformalizing Memory Specifications with Agents
par: Ernst, Jan Ole, et autres
Publié: (2026)
par: Ernst, Jan Ole, et autres
Publié: (2026)
Documents similaires
-
CAMformer: Associative Memory is All You Need
par: Molom-Ochir, Tergel, et autres
Publié: (2025) -
End-to-End Transformer Acceleration Through Processing-in-Memory Architectures
par: Yang, Xiaoxuan, et autres
Publié: (2025) -
OptINC: Optical In-Network-Computing for Scalable Distributed Learning
par: Fei, Sijie, et autres
Publié: (2026) -
AI Accelerators for Large Language Model Inference: Architecture Analysis and Scaling Strategies
par: Sharma, Amit
Publié: (2025) -
Pimba: A Processing-in-Memory Acceleration for Post-Transformer Large Language Model Serving
par: Kim, Wonung, et autres
Publié: (2025)