Leveraging Compute-in-Memory for Efficient Generative Model Inference in TPUs
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhu, Zhantong, Li, Hongou, Ren, Wenjie, Wu, Meng, Ye, Le, Huang, Ru, Jia, Tianyu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LP-Spec: Leveraging LPDDR PIM for Efficient LLM Mobile Speculative Inference with Architecture-Dataflow Co-Optimization
di: He, Siyuan, et al.
Pubblicazione: (2025)
di: He, Siyuan, et al.
Pubblicazione: (2025)
LUT-LLM: Efficient Large Language Model Inference with Memory-based Computations on FPGAs
di: He, Zifan, et al.
Pubblicazione: (2025)
di: He, Zifan, et al.
Pubblicazione: (2025)
ChipLight: Cross-Layer Optimization of Chiplet Design with Optical Interconnects for LLM Training
di: Bai, Kangbo, et al.
Pubblicazione: (2026)
di: Bai, Kangbo, et al.
Pubblicazione: (2026)
Efficient Deployment of CNN Models on Multiple In-Memory Computing Units
di: Bougioukou, Eleni, et al.
Pubblicazione: (2025)
di: Bougioukou, Eleni, et al.
Pubblicazione: (2025)
ELSA: An ELastic SNN Inference Architecture for Efficient Neuromorphic Computing
di: You, Kang, et al.
Pubblicazione: (2026)
di: You, Kang, et al.
Pubblicazione: (2026)
FlightLLM: Efficient Large Language Model Inference with a Complete Mapping Flow on FPGAs
di: Zeng, Shulin, et al.
Pubblicazione: (2024)
di: Zeng, Shulin, et al.
Pubblicazione: (2024)
EdgeMM: Multi-Core CPU with Heterogeneous AI-Extension and Activation-aware Weight Pruning for Multimodal LLMs at Edge
di: Bai, Kangbo, et al.
Pubblicazione: (2025)
di: Bai, Kangbo, et al.
Pubblicazione: (2025)
MICSim: A Modular Simulator for Mixed-signal Compute-in-Memory based AI Accelerator
di: Wang, Cong, et al.
Pubblicazione: (2024)
di: Wang, Cong, et al.
Pubblicazione: (2024)
Computing-In-Memory Dataflow for Minimal Buffer Traffic
di: Song, Choongseok, et al.
Pubblicazione: (2025)
di: Song, Choongseok, et al.
Pubblicazione: (2025)
MEMHD: Memory-Efficient Multi-Centroid Hyperdimensional Computing for Fully-Utilized In-Memory Computing Architectures
di: Kang, Do Yeong, et al.
Pubblicazione: (2025)
di: Kang, Do Yeong, et al.
Pubblicazione: (2025)
NeuralMatrix: Compute the Entire Neural Networks with Linear Matrix Operations for Efficient Inference
di: Sun, Ruiqi, et al.
Pubblicazione: (2023)
di: Sun, Ruiqi, et al.
Pubblicazione: (2023)
Efficient Calibration for RRAM-based In-Memory Computing using DoRA
di: Dong, Weirong, et al.
Pubblicazione: (2025)
di: Dong, Weirong, et al.
Pubblicazione: (2025)
Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference
di: Chen, Chun-Ting, et al.
Pubblicazione: (2025)
di: Chen, Chun-Ting, et al.
Pubblicazione: (2025)
Accelerating LLM Inference via Dynamic KV Cache Placement in Heterogeneous Memory System
di: Fang, Yunhua, et al.
Pubblicazione: (2025)
di: Fang, Yunhua, et al.
Pubblicazione: (2025)
ScaleRTL: Scaling LLMs with Reasoning Data and Test-Time Compute for Accurate RTL Code Generation
di: Deng, Chenhui, et al.
Pubblicazione: (2025)
di: Deng, Chenhui, et al.
Pubblicazione: (2025)
HALO: Memory-Centric Heterogeneous Accelerator with 2.5D Integration for Low-Batch LLM Inference
di: Negi, Shubham, et al.
Pubblicazione: (2025)
di: Negi, Shubham, et al.
Pubblicazione: (2025)
A Configurable and Efficient Memory Hierarchy for Neural Network Hardware Accelerator
di: Bause, Oliver, et al.
Pubblicazione: (2024)
di: Bause, Oliver, et al.
Pubblicazione: (2024)
CiMNet: Towards Joint Optimization for DNN Architecture and Configuration for Compute-In-Memory Hardware
di: Kundu, Souvik, et al.
Pubblicazione: (2024)
di: Kundu, Souvik, et al.
Pubblicazione: (2024)
KANtize: Exploring Low-bit Quantization of Kolmogorov-Arnold Networks for Efficient Inference
di: Errabii, Sohaib, et al.
Pubblicazione: (2026)
di: Errabii, Sohaib, et al.
Pubblicazione: (2026)
KVNAND: Efficient On-Device Large Language Model Inference Using DRAM-Free In-Flash Computing
di: Deng, Lishuo, et al.
Pubblicazione: (2025)
di: Deng, Lishuo, et al.
Pubblicazione: (2025)
Efficient LLM inference solution on Intel GPU
di: Wu, Hui, et al.
Pubblicazione: (2023)
di: Wu, Hui, et al.
Pubblicazione: (2023)
Scalable Processing-Near-Memory for 1M-Token LLM Inference: CXL-Enabled KV-Cache Management Beyond GPU Limits
di: Kim, Dowon, et al.
Pubblicazione: (2025)
di: Kim, Dowon, et al.
Pubblicazione: (2025)
ReasoningV: Efficient Verilog Code Generation with Adaptive Hybrid Reasoning Model
di: Qin, Haiyan, et al.
Pubblicazione: (2025)
di: Qin, Haiyan, et al.
Pubblicazione: (2025)
Location is Key: Leveraging Large Language Model for Functional Bug Localization in Verilog
di: Yao, Bingkun, et al.
Pubblicazione: (2024)
di: Yao, Bingkun, et al.
Pubblicazione: (2024)
Revisiting VerilogEval: A Year of Improvements in Large-Language Models for Hardware Code Generation
di: Pinckney, Nathaniel, et al.
Pubblicazione: (2024)
di: Pinckney, Nathaniel, et al.
Pubblicazione: (2024)
AC-Refiner: Efficient Arithmetic Circuit Optimization Using Conditional Diffusion Models
di: Xue, Chenhao, et al.
Pubblicazione: (2025)
di: Xue, Chenhao, et al.
Pubblicazione: (2025)
TReX- Reusing Vision Transformer's Attention for Efficient Xbar-based Computing
di: Moitra, Abhishek, et al.
Pubblicazione: (2024)
di: Moitra, Abhishek, et al.
Pubblicazione: (2024)
Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator
di: Ramachandran, Akshat, et al.
Pubblicazione: (2025)
di: Ramachandran, Akshat, et al.
Pubblicazione: (2025)
LLM4SecHW: Leveraging Domain Specific Large Language Model for Hardware Debugging
di: Fu, Weimin, et al.
Pubblicazione: (2024)
di: Fu, Weimin, et al.
Pubblicazione: (2024)
Assessing Large Language Models in Generating RTL Design Specifications
di: Huang, Hung-Ming, et al.
Pubblicazione: (2025)
di: Huang, Hung-Ming, et al.
Pubblicazione: (2025)
Enhancing LUT-based Deep Neural Networks Inference through Architecture and Connectivity Optimization
di: Lou, Binglei, et al.
Pubblicazione: (2026)
di: Lou, Binglei, et al.
Pubblicazione: (2026)
AttentionLego: An Open-Source Building Block For Spatially-Scalable Large Language Model Accelerator With Processing-In-Memory Technology
di: Cong, Rongqing, et al.
Pubblicazione: (2024)
di: Cong, Rongqing, et al.
Pubblicazione: (2024)
ApproXAI: Energy-Efficient Hardware Acceleration of Explainable AI using Approximate Computing
di: Siddique, Ayesha, et al.
Pubblicazione: (2025)
di: Siddique, Ayesha, et al.
Pubblicazione: (2025)
Column-wise Quantization of Weights and Partial Sums for Accurate and Efficient Compute-In-Memory Accelerators
di: Kim, Jiyoon, et al.
Pubblicazione: (2025)
di: Kim, Jiyoon, et al.
Pubblicazione: (2025)
HAVEN: Hybrid Automated Verification ENgine for UVM Testbench Synthesis with LLMs
di: Meng, Chang-Chih, et al.
Pubblicazione: (2026)
di: Meng, Chang-Chih, et al.
Pubblicazione: (2026)
ChatSVA: Bridging SVA Generation for Hardware Verification via Task-Specific LLMs
di: Fu, Lik Tung, et al.
Pubblicazione: (2026)
di: Fu, Lik Tung, et al.
Pubblicazione: (2026)
YOCO: A Hybrid In-Memory Computing Architecture with 8-bit Sub-PetaOps/W In-Situ Multiply Arithmetic for Large-Scale AI
di: Xuan, Zihao, et al.
Pubblicazione: (2023)
di: Xuan, Zihao, et al.
Pubblicazione: (2023)
Kelle: Co-design KV Caching and eDRAM for Efficient LLM Serving in Edge Computing
di: Xia, Tianhua, et al.
Pubblicazione: (2025)
di: Xia, Tianhua, et al.
Pubblicazione: (2025)
Architectural Limits of Cloud TPUs in Finite-Field Cryptography
di: Dang, Hung, et al.
Pubblicazione: (2026)
di: Dang, Hung, et al.
Pubblicazione: (2026)
FractalCloud: A Fractal-Inspired Architecture for Efficient Large-Scale Point Cloud Processing
di: Fu, Yuzhe, et al.
Pubblicazione: (2025)
di: Fu, Yuzhe, et al.
Pubblicazione: (2025)
Documenti analoghi
-
LP-Spec: Leveraging LPDDR PIM for Efficient LLM Mobile Speculative Inference with Architecture-Dataflow Co-Optimization
di: He, Siyuan, et al.
Pubblicazione: (2025) -
LUT-LLM: Efficient Large Language Model Inference with Memory-based Computations on FPGAs
di: He, Zifan, et al.
Pubblicazione: (2025) -
ChipLight: Cross-Layer Optimization of Chiplet Design with Optical Interconnects for LLM Training
di: Bai, Kangbo, et al.
Pubblicazione: (2026) -
Efficient Deployment of CNN Models on Multiple In-Memory Computing Units
di: Bougioukou, Eleni, et al.
Pubblicazione: (2025) -
ELSA: An ELastic SNN Inference Architecture for Efficient Neuromorphic Computing
di: You, Kang, et al.
Pubblicazione: (2026)