Efficient Sparse Processing-in-Memory Architecture (ESPIM) for Machine Learning Inference
Fuente:
arXiv
Salvato in:
| Autori principali: | He, Mingxuan, Thottethodi, Mithuna, Vijaykumar, T. N. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
QED: Scalable Verification of Hardware Memory Consistency
di: Ravi, Gokulan, et al.
Pubblicazione: (2024)
di: Ravi, Gokulan, et al.
Pubblicazione: (2024)
NetSmith: An Optimization Framework for Machine-Discovered Network Topologies
di: Green, Conor, et al.
Pubblicazione: (2024)
di: Green, Conor, et al.
Pubblicazione: (2024)
PUMA: Efficient and Low-Cost Memory Allocation and Alignment Support for Processing-Using-Memory Architectures
di: Oliveira, Geraldo F., et al.
Pubblicazione: (2024)
di: Oliveira, Geraldo F., et al.
Pubblicazione: (2024)
A Composable Dynamic Sparse Dataflow Architecture for Efficient Event-based Vision Processing on FPGA
di: Gao, Yizhao, et al.
Pubblicazione: (2024)
di: Gao, Yizhao, et al.
Pubblicazione: (2024)
Splatonic: Architecture Support for 3D Gaussian Splatting SLAM via Sparse Processing
di: Huang, Xiaotong, et al.
Pubblicazione: (2025)
di: Huang, Xiaotong, et al.
Pubblicazione: (2025)
APACHE: A Processing-Near-Memory Architecture for Multi-Scheme Fully Homomorphic Encryption
di: Ding, Lin, et al.
Pubblicazione: (2024)
di: Ding, Lin, et al.
Pubblicazione: (2024)
In-Memory Computing Architecture for Efficient Hardware Security
di: Ajmi, Hala, et al.
Pubblicazione: (2024)
di: Ajmi, Hala, et al.
Pubblicazione: (2024)
XtraMAC: An Efficient MAC Architecture for Mixed-Precision LLM Inference on FPGA
di: Yu, Feng, et al.
Pubblicazione: (2026)
di: Yu, Feng, et al.
Pubblicazione: (2026)
HPIM: Heterogeneous Processing-In-Memory-based Accelerator for Large Language Models Inference
di: Duan, Cenlin, et al.
Pubblicazione: (2025)
di: Duan, Cenlin, et al.
Pubblicazione: (2025)
LP-Spec: Leveraging LPDDR PIM for Efficient LLM Mobile Speculative Inference with Architecture-Dataflow Co-Optimization
di: He, Siyuan, et al.
Pubblicazione: (2025)
di: He, Siyuan, et al.
Pubblicazione: (2025)
Harmonia: Algorithm-Hardware Co-Design for Memory- and Compute-Efficient BFP-based LLM Inference
di: Wang, Xinyu, et al.
Pubblicazione: (2026)
di: Wang, Xinyu, et al.
Pubblicazione: (2026)
FusionCIM: Accelerating LLM Inference with Fusion-Driven Computing-in-Memory Architecture
di: Xuan, Zihao, et al.
Pubblicazione: (2026)
di: Xuan, Zihao, et al.
Pubblicazione: (2026)
PIM-malloc: A Fast and Scalable Dynamic Memory Allocator for Processing-In-Memory (PIM) Architectures
di: Lee, Dongjae, et al.
Pubblicazione: (2025)
di: Lee, Dongjae, et al.
Pubblicazione: (2025)
A Switch-Centric In-Network Architecture for Accelerating LLM Inference in Shared-Memory Network
di: Jiang, Aojie, et al.
Pubblicazione: (2026)
di: Jiang, Aojie, et al.
Pubblicazione: (2026)
Accelerating Multi-Scale Deformable Attention Using Near-Memory-Processing Architecture
di: Li, Huize, et al.
Pubblicazione: (2026)
di: Li, Huize, et al.
Pubblicazione: (2026)
DaPPA: A Data-Parallel Programming Framework for Processing-in-Memory Architectures
di: Oliveira, Geraldo F., et al.
Pubblicazione: (2023)
di: Oliveira, Geraldo F., et al.
Pubblicazione: (2023)
PRIMAL: Processing-In-Memory Based Low-Rank Adaptation for LLM Inference Accelerator
di: Chong, Yue Jiet, et al.
Pubblicazione: (2026)
di: Chong, Yue Jiet, et al.
Pubblicazione: (2026)
LoopLynx: A Scalable Dataflow Architecture for Efficient LLM Inference
di: Zheng, Jianing, et al.
Pubblicazione: (2025)
di: Zheng, Jianing, et al.
Pubblicazione: (2025)
Enabling Efficient Transaction Processing on CXL-Based Memory Sharing
di: Wang, Zhao, et al.
Pubblicazione: (2025)
di: Wang, Zhao, et al.
Pubblicazione: (2025)
IBEX: Internal Bandwidth-Efficient Compression Architecture for Scalable CXL Memory Expansion
di: Ko, Younghoon, et al.
Pubblicazione: (2026)
di: Ko, Younghoon, et al.
Pubblicazione: (2026)
CIMinus: Empowering Sparse DNN Workloads Modeling and Exploration on SRAM-based CIM Architectures
di: Qi, Yingjie, et al.
Pubblicazione: (2025)
di: Qi, Yingjie, et al.
Pubblicazione: (2025)
GCC: A 3DGS Inference Architecture with Gaussian-Wise and Cross-Stage Conditional Processing
di: Pei, Minnan, et al.
Pubblicazione: (2025)
di: Pei, Minnan, et al.
Pubblicazione: (2025)
A Memory-Efficient Retrieval Architecture for RAG-Enabled Wearable Medical LLMs-Agents
di: Liao, Zhipeng, et al.
Pubblicazione: (2025)
di: Liao, Zhipeng, et al.
Pubblicazione: (2025)
Tasa: Thermal-aware 3D-Stacked Architecture Design with Bandwidth Sharing for LLM Inference
di: He, Siyuan, et al.
Pubblicazione: (2025)
di: He, Siyuan, et al.
Pubblicazione: (2025)
SHIELD: A Segmented Hierarchical Memory Architecture for Energy-Efficient LLM Inference on Edge NPUs
di: Zhang, Jintao, et al.
Pubblicazione: (2026)
di: Zhang, Jintao, et al.
Pubblicazione: (2026)
TENET: An Efficient Sparsity-Aware LUT-Centric Architecture for Ternary LLM Inference On Edge
di: Huang, Zhirui, et al.
Pubblicazione: (2025)
di: Huang, Zhirui, et al.
Pubblicazione: (2025)
3D-TrIM: A Memory-Efficient Spatial Computing Architecture for Convolution Workloads
di: Sestito, Cristian, et al.
Pubblicazione: (2025)
di: Sestito, Cristian, et al.
Pubblicazione: (2025)
Modeling and Simulation Frameworks for Processing-in-Memory Architectures
di: Aghaei, Mahdi, et al.
Pubblicazione: (2025)
di: Aghaei, Mahdi, et al.
Pubblicazione: (2025)
The Immutable Tensor Architecture: A Pure Dataflow Approach for Secure, Energy-Efficient AI Inference
di: Li, Fang
Pubblicazione: (2025)
di: Li, Fang
Pubblicazione: (2025)
Hybrid SLC-MLC RRAM Mixed-Signal Processing-in-Memory Architecture for Transformer Acceleration via Gradient Redistribution
di: Song, Chang Eun, et al.
Pubblicazione: (2025)
di: Song, Chang Eun, et al.
Pubblicazione: (2025)
ELSA: An ELastic SNN Inference Architecture for Efficient Neuromorphic Computing
di: You, Kang, et al.
Pubblicazione: (2026)
di: You, Kang, et al.
Pubblicazione: (2026)
SmaRTLy: RTL Optimization with Logic Inferencing and Structural Rebuilding
di: Li, Chengxi, et al.
Pubblicazione: (2025)
di: Li, Chengxi, et al.
Pubblicazione: (2025)
Efficient In-Memory Acceleration of Sparse Block Diagonal LLMs
di: de Lima, João Paulo Cardoso, et al.
Pubblicazione: (2025)
di: de Lima, João Paulo Cardoso, et al.
Pubblicazione: (2025)
Reimagining Memory Access for LLM Inference: Compression-Aware Memory Controller Design
di: Xie, Rui, et al.
Pubblicazione: (2025)
di: Xie, Rui, et al.
Pubblicazione: (2025)
Octopus: Enhancing CXL Memory Pods via Sparse Topology
di: Zhong, Yuhong, et al.
Pubblicazione: (2025)
di: Zhong, Yuhong, et al.
Pubblicazione: (2025)
NDPage: Efficient Address Translation for Near-Data Processing Architectures via Tailored Page Table
di: Jiang, Qingcai, et al.
Pubblicazione: (2025)
di: Jiang, Qingcai, et al.
Pubblicazione: (2025)
SAL-PIM: A Subarray-level Processing-in-Memory Architecture with LUT-based Linear Interpolation for Transformer-based Text Generation
di: Han, Wontak, et al.
Pubblicazione: (2024)
di: Han, Wontak, et al.
Pubblicazione: (2024)
MCBP: A Memory-Compute Efficient LLM Inference Accelerator Leveraging Bit-Slice-enabled Sparsity and Repetitiveness
di: Wang, Huizheng, et al.
Pubblicazione: (2025)
di: Wang, Huizheng, et al.
Pubblicazione: (2025)
Adaptive Hybrid FFT: A Novel Pipeline and Memory-Based Architecture for Radix-$2^k$ FFT in Large Size Processing
di: Zhao, Fangyu, et al.
Pubblicazione: (2025)
di: Zhao, Fangyu, et al.
Pubblicazione: (2025)
In-Pipeline Integration of Digital In-Memory-Computing into RISC-V Vector Architecture to Accelerate Deep Learning
di: Spagnolo, Tommaso, et al.
Pubblicazione: (2026)
di: Spagnolo, Tommaso, et al.
Pubblicazione: (2026)
Documenti analoghi
-
QED: Scalable Verification of Hardware Memory Consistency
di: Ravi, Gokulan, et al.
Pubblicazione: (2024) -
NetSmith: An Optimization Framework for Machine-Discovered Network Topologies
di: Green, Conor, et al.
Pubblicazione: (2024) -
PUMA: Efficient and Low-Cost Memory Allocation and Alignment Support for Processing-Using-Memory Architectures
di: Oliveira, Geraldo F., et al.
Pubblicazione: (2024) -
A Composable Dynamic Sparse Dataflow Architecture for Efficient Event-based Vision Processing on FPGA
di: Gao, Yizhao, et al.
Pubblicazione: (2024) -
Splatonic: Architecture Support for 3D Gaussian Splatting SLAM via Sparse Processing
di: Huang, Xiaotong, et al.
Pubblicazione: (2025)