The BRAM is the Limit: Shattering Myths, Shaping Standards, and Building Scalable PIM Accelerators
Fuente:
arXiv
Guardado en:
| Autores principales: | Kabir, MD Arafat, Kamucheka, Tendayi, Fredricks, Nathaniel, Mandebi, Joel, Bakos, Jason, Huang, Miaoqing, Andrews, David |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
IMAGine: An In-Memory Accelerated GEMV Engine Overlay
por: Kabir, MD Arafat, et al.
Publicado: (2024)
por: Kabir, MD Arafat, et al.
Publicado: (2024)
A Runtime-Adaptive Transformer Neural Network Accelerator on FPGAs
por: Kabir, Ehsan, et al.
Publicado: (2024)
por: Kabir, Ehsan, et al.
Publicado: (2024)
FAMOUS: Flexible Accelerator for the Attention Mechanism of Transformer on UltraScale+ FPGAs
por: Kabir, Ehsan, et al.
Publicado: (2024)
por: Kabir, Ehsan, et al.
Publicado: (2024)
ProTEA: Programmable Transformer Encoder Acceleration on FPGA
por: Kabir, Ehsan, et al.
Publicado: (2024)
por: Kabir, Ehsan, et al.
Publicado: (2024)
N-TORC: Native Tensor Optimizer for Real-time Constraints
por: Singh, Suyash Vardhan, et al.
Publicado: (2025)
por: Singh, Suyash Vardhan, et al.
Publicado: (2025)
ProactivePIM: Accelerating Weight-Sharing Embedding Layer with PIM for Scalable Recommendation System
por: Kim, Youngsuk, et al.
Publicado: (2024)
por: Kim, Youngsuk, et al.
Publicado: (2024)
Inclusive-PIM: Hardware-Software Co-design for Broad Acceleration on Commercial PIM Architectures
por: Alsop, Johnathan, et al.
Publicado: (2023)
por: Alsop, Johnathan, et al.
Publicado: (2023)
PIM-malloc: A Fast and Scalable Dynamic Memory Allocator for Processing-In-Memory (PIM) Architectures
por: Lee, Dongjae, et al.
Publicado: (2025)
por: Lee, Dongjae, et al.
Publicado: (2025)
PIM-MMU: A Memory Management Unit for Accelerating Data Transfers in Commercial PIM Systems
por: Lee, Dongjae, et al.
Publicado: (2024)
por: Lee, Dongjae, et al.
Publicado: (2024)
CrossNAS: A Cross-Layer Neural Architecture Search Framework for PIM Systems
por: Amin, Md Hasibul, et al.
Publicado: (2025)
por: Amin, Md Hasibul, et al.
Publicado: (2025)
AME-PIM: Can Memory be Your Next Tensor Accelerator?
por: Venieri, Emanuele, et al.
Publicado: (2026)
por: Venieri, Emanuele, et al.
Publicado: (2026)
CD-PIM: A High-Bandwidth and Compute-Efficient LPDDR5-Based PIM for Low-Batch LLM Acceleration on Edge-Device
por: Lin, Ye, et al.
Publicado: (2026)
por: Lin, Ye, et al.
Publicado: (2026)
Membrane: Accelerating Database Analytics with Bank-Level DRAM-PIM Filtering
por: Shekar, Akhil, et al.
Publicado: (2025)
por: Shekar, Akhil, et al.
Publicado: (2025)
PIM-GPT: A Hybrid Process-in-Memory Accelerator for Autoregressive Transformers
por: Wu, Yuting, et al.
Publicado: (2023)
por: Wu, Yuting, et al.
Publicado: (2023)
NeuPIMs: NPU-PIM Heterogeneous Acceleration for Batched LLM Inferencing
por: Heo, Guseul, et al.
Publicado: (2024)
por: Heo, Guseul, et al.
Publicado: (2024)
IANUS: Integrated Accelerator based on NPU-PIM Unified Memory System
por: Seo, Minseok, et al.
Publicado: (2024)
por: Seo, Minseok, et al.
Publicado: (2024)
Energy-Efficient p-Bit-Based Fully-Connected Quantum-Inspired Simulated Annealer with Dual BRAM Architecture
por: Onizawa, Naoya, et al.
Publicado: (2026)
por: Onizawa, Naoya, et al.
Publicado: (2026)
Sieve: Dynamic Expert-Aware PIM Acceleration for Evolving Mixture-of-Experts Models
por: Kim, Jungwoo, et al.
Publicado: (2026)
por: Kim, Jungwoo, et al.
Publicado: (2026)
Pathfinding Future PIM Architectures by Demystifying a Commercial PIM Technology
por: Hyun, Bongjoon, et al.
Publicado: (2023)
por: Hyun, Bongjoon, et al.
Publicado: (2023)
Annotated PIM Bibliography
por: Kogge, Peter M.
Publicado: (2026)
por: Kogge, Peter M.
Publicado: (2026)
Towards Efficient LUT-based PIM: A Scalable and Low-Power Approach for Modern Workloads
por: Khabbazan, Bahareh, et al.
Publicado: (2025)
por: Khabbazan, Bahareh, et al.
Publicado: (2025)
LEAP: LLM Inference on Scalable PIM-NoC Architecture with Balanced Dataflow and Fine-Grained Parallelism
por: Wang, Yimin, et al.
Publicado: (2025)
por: Wang, Yimin, et al.
Publicado: (2025)
Fast-OverlaPIM: A Fast Overlap-driven Mapping Framework for Processing In-Memory Neural Network Acceleration
por: Wang, Xuan, et al.
Publicado: (2024)
por: Wang, Xuan, et al.
Publicado: (2024)
DL-PIM: Improving Data Locality in Processing-in-Memory Systems
por: Tian, Parker Hao, et al.
Publicado: (2025)
por: Tian, Parker Hao, et al.
Publicado: (2025)
Sangam: Chiplet-Based DRAM-PIM Accelerator with CXL Integration for LLM Inferencing
por: Kiyawat, Khyati, et al.
Publicado: (2025)
por: Kiyawat, Khyati, et al.
Publicado: (2025)
L3: DIMM-PIM Integrated Architecture and Coordination for Scalable Long-Context LLM Inference
por: Liu, Qingyuan, et al.
Publicado: (2025)
por: Liu, Qingyuan, et al.
Publicado: (2025)
Shared-PIM: Enabling Concurrent Computation and Data Flow for Faster Processing-in-DRAM
por: Mamdouh, Ahmed, et al.
Publicado: (2024)
por: Mamdouh, Ahmed, et al.
Publicado: (2024)
LOCALUT: Harnessing Capacity-Computation Tradeoffs for LUT-Based Inference in DRAM-PIM
por: Hong, Junguk, et al.
Publicado: (2026)
por: Hong, Junguk, et al.
Publicado: (2026)
ATLAAS: Automatic Tensor-Level Abstraction of Accelerator Semantics
por: Gao, Ruijie, et al.
Publicado: (2026)
por: Gao, Ruijie, et al.
Publicado: (2026)
PIM-LLM: A High-Throughput Hybrid PIM Architecture for 1-bit LLMs
por: Malekar, Jinendra, et al.
Publicado: (2025)
por: Malekar, Jinendra, et al.
Publicado: (2025)
JSPIM: A Skew-Aware PIM Accelerator for High-Performance Databases Join and Select Operations
por: Tajdari, Sabiha, et al.
Publicado: (2025)
por: Tajdari, Sabiha, et al.
Publicado: (2025)
HH-PIM: Dynamic Optimization of Power and Performance with Heterogeneous-Hybrid PIM for Edge AI Devices
por: Jeon, Sangmin, et al.
Publicado: (2025)
por: Jeon, Sangmin, et al.
Publicado: (2025)
UpANNS: Enhancing Billion-Scale ANNS Efficiency with Real-World PIM Architecture
por: Chen, Sitian, et al.
Publicado: (2024)
por: Chen, Sitian, et al.
Publicado: (2024)
Towards Efficient SRAM-PIM Architecture Design by Exploiting Unstructured Bit-Level Sparsity
por: Duan, Cenlin, et al.
Publicado: (2024)
por: Duan, Cenlin, et al.
Publicado: (2024)
PIM-FW: Hardware-Software Co-Design of All-pairs Shortest Paths in DRAM
por: Lu, Tsung-Han, et al.
Publicado: (2025)
por: Lu, Tsung-Han, et al.
Publicado: (2025)
PyPIM: Integrating Digital Processing-in-Memory from Microarchitectural Design to Python Tensors
por: Leitersdorf, Orian, et al.
Publicado: (2023)
por: Leitersdorf, Orian, et al.
Publicado: (2023)
CRYPTONITE: Scalable Accelerator Design for Cryptographic Primitives and Algorithms
por: Maheswaran, Karthikeya Sharma, et al.
Publicado: (2025)
por: Maheswaran, Karthikeya Sharma, et al.
Publicado: (2025)
Efficient SRAM-PIM Co-design by Joint Exploration of Value-Level and Bit-Level Sparsity
por: Duan, Cenlin, et al.
Publicado: (2025)
por: Duan, Cenlin, et al.
Publicado: (2025)
PIMfused: Near-Bank DRAM-PIM with Fused-layer Dataflow for CNN Data Transfer Optimization
por: Yang, Simei, et al.
Publicado: (2025)
por: Yang, Simei, et al.
Publicado: (2025)
Stream-HLS: Towards Automatic Dataflow Acceleration
por: Basalama, Suhail, et al.
Publicado: (2025)
por: Basalama, Suhail, et al.
Publicado: (2025)
Ejemplares similares
-
IMAGine: An In-Memory Accelerated GEMV Engine Overlay
por: Kabir, MD Arafat, et al.
Publicado: (2024) -
A Runtime-Adaptive Transformer Neural Network Accelerator on FPGAs
por: Kabir, Ehsan, et al.
Publicado: (2024) -
FAMOUS: Flexible Accelerator for the Attention Mechanism of Transformer on UltraScale+ FPGAs
por: Kabir, Ehsan, et al.
Publicado: (2024) -
ProTEA: Programmable Transformer Encoder Acceleration on FPGA
por: Kabir, Ehsan, et al.
Publicado: (2024) -
N-TORC: Native Tensor Optimizer for Real-time Constraints
por: Singh, Suyash Vardhan, et al.
Publicado: (2025)