PIM-GPT: A Hybrid Process-in-Memory Accelerator for Autoregressive Transformers
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wu, Yuting, Wang, Ziyu, Lu, Wei D. |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
PIM-malloc: A Fast and Scalable Dynamic Memory Allocator for Processing-In-Memory (PIM) Architectures
par: Lee, Dongjae, et autres
Publié: (2025)
par: Lee, Dongjae, et autres
Publié: (2025)
PIM-MMU: A Memory Management Unit for Accelerating Data Transfers in Commercial PIM Systems
par: Lee, Dongjae, et autres
Publié: (2024)
par: Lee, Dongjae, et autres
Publié: (2024)
Fast-OverlaPIM: A Fast Overlap-driven Mapping Framework for Processing In-Memory Neural Network Acceleration
par: Wang, Xuan, et autres
Publié: (2024)
par: Wang, Xuan, et autres
Publié: (2024)
AME-PIM: Can Memory be Your Next Tensor Accelerator?
par: Venieri, Emanuele, et autres
Publié: (2026)
par: Venieri, Emanuele, et autres
Publié: (2026)
IANUS: Integrated Accelerator based on NPU-PIM Unified Memory System
par: Seo, Minseok, et autres
Publié: (2024)
par: Seo, Minseok, et autres
Publié: (2024)
DL-PIM: Improving Data Locality in Processing-in-Memory Systems
par: Tian, Parker Hao, et autres
Publié: (2025)
par: Tian, Parker Hao, et autres
Publié: (2025)
Inclusive-PIM: Hardware-Software Co-design for Broad Acceleration on Commercial PIM Architectures
par: Alsop, Johnathan, et autres
Publié: (2023)
par: Alsop, Johnathan, et autres
Publié: (2023)
SAL-PIM: A Subarray-level Processing-in-Memory Architecture with LUT-based Linear Interpolation for Transformer-based Text Generation
par: Han, Wontak, et autres
Publié: (2024)
par: Han, Wontak, et autres
Publié: (2024)
A$^3$PIM: An Automated, Analytic and Accurate Processing-in-Memory Offloader
par: Jiang, Qingcai, et autres
Publié: (2024)
par: Jiang, Qingcai, et autres
Publié: (2024)
PyPIM: Integrating Digital Processing-in-Memory from Microarchitectural Design to Python Tensors
par: Leitersdorf, Orian, et autres
Publié: (2023)
par: Leitersdorf, Orian, et autres
Publié: (2023)
CD-PIM: A High-Bandwidth and Compute-Efficient LPDDR5-Based PIM for Low-Batch LLM Acceleration on Edge-Device
par: Lin, Ye, et autres
Publié: (2026)
par: Lin, Ye, et autres
Publié: (2026)
Membrane: Accelerating Database Analytics with Bank-Level DRAM-PIM Filtering
par: Shekar, Akhil, et autres
Publié: (2025)
par: Shekar, Akhil, et autres
Publié: (2025)
Hybrid SLC-MLC RRAM Mixed-Signal Processing-in-Memory Architecture for Transformer Acceleration via Gradient Redistribution
par: Song, Chang Eun, et autres
Publié: (2025)
par: Song, Chang Eun, et autres
Publié: (2025)
NeuPIMs: NPU-PIM Heterogeneous Acceleration for Batched LLM Inferencing
par: Heo, Guseul, et autres
Publié: (2024)
par: Heo, Guseul, et autres
Publié: (2024)
Sieve: Dynamic Expert-Aware PIM Acceleration for Evolving Mixture-of-Experts Models
par: Kim, Jungwoo, et autres
Publié: (2026)
par: Kim, Jungwoo, et autres
Publié: (2026)
The BRAM is the Limit: Shattering Myths, Shaping Standards, and Building Scalable PIM Accelerators
par: Kabir, MD Arafat, et autres
Publié: (2024)
par: Kabir, MD Arafat, et autres
Publié: (2024)
Pathfinding Future PIM Architectures by Demystifying a Commercial PIM Technology
par: Hyun, Bongjoon, et autres
Publié: (2023)
par: Hyun, Bongjoon, et autres
Publié: (2023)
PIM-LLM: A High-Throughput Hybrid PIM Architecture for 1-bit LLMs
par: Malekar, Jinendra, et autres
Publié: (2025)
par: Malekar, Jinendra, et autres
Publié: (2025)
ProactivePIM: Accelerating Weight-Sharing Embedding Layer with PIM for Scalable Recommendation System
par: Kim, Youngsuk, et autres
Publié: (2024)
par: Kim, Youngsuk, et autres
Publié: (2024)
Annotated PIM Bibliography
par: Kogge, Peter M.
Publié: (2026)
par: Kogge, Peter M.
Publié: (2026)
PRIMAL: Processing-In-Memory Based Low-Rank Adaptation for LLM Inference Accelerator
par: Chong, Yue Jiet, et autres
Publié: (2026)
par: Chong, Yue Jiet, et autres
Publié: (2026)
P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats
par: Chen, Yuzong, et autres
Publié: (2025)
par: Chen, Yuzong, et autres
Publié: (2025)
Shared-PIM: Enabling Concurrent Computation and Data Flow for Faster Processing-in-DRAM
par: Mamdouh, Ahmed, et autres
Publié: (2024)
par: Mamdouh, Ahmed, et autres
Publié: (2024)
HH-PIM: Dynamic Optimization of Power and Performance with Heterogeneous-Hybrid PIM for Edge AI Devices
par: Jeon, Sangmin, et autres
Publié: (2025)
par: Jeon, Sangmin, et autres
Publié: (2025)
PIMCOMP: An End-to-End DNN Compiler for Processing-In-Memory Accelerators
par: Sun, Xiaotian, et autres
Publié: (2024)
par: Sun, Xiaotian, et autres
Publié: (2024)
Generalized Ping-Pong: Off-Chip Memory Bandwidth Centric Pipelining Strategy for Processing-In-Memory Accelerators
par: Wang, Ruibao, et autres
Publié: (2024)
par: Wang, Ruibao, et autres
Publié: (2024)
PIMSIM-NN: An ISA-based Simulation Framework for Processing-in-Memory Accelerators
par: Wang, Xinyu, et autres
Publié: (2024)
par: Wang, Xinyu, et autres
Publié: (2024)
HPIM: Heterogeneous Processing-In-Memory-based Accelerator for Large Language Models Inference
par: Duan, Cenlin, et autres
Publié: (2025)
par: Duan, Cenlin, et autres
Publié: (2025)
AutoRAC: Automated Processing-in-Memory Accelerator Design for Recommender Systems
par: Cheng, Feng, et autres
Publié: (2025)
par: Cheng, Feng, et autres
Publié: (2025)
End-to-End Transformer Acceleration Through Processing-in-Memory Architectures
par: Yang, Xiaoxuan, et autres
Publié: (2025)
par: Yang, Xiaoxuan, et autres
Publié: (2025)
PIMfused: Near-Bank DRAM-PIM with Fused-layer Dataflow for CNN Data Transfer Optimization
par: Yang, Simei, et autres
Publié: (2025)
par: Yang, Simei, et autres
Publié: (2025)
Accelerating Multi-Scale Deformable Attention Using Near-Memory-Processing Architecture
par: Li, Huize, et autres
Publié: (2026)
par: Li, Huize, et autres
Publié: (2026)
PIM-FW: Hardware-Software Co-Design of All-pairs Shortest Paths in DRAM
par: Lu, Tsung-Han, et autres
Publié: (2025)
par: Lu, Tsung-Han, et autres
Publié: (2025)
Allspark: Workload Orchestration for Visual Transformers on Processing In-Memory Systems
par: Ge, Mengke, et autres
Publié: (2024)
par: Ge, Mengke, et autres
Publié: (2024)
Ironman: Accelerating Oblivious Transfer Extension for Privacy-Preserving AI with Near-Memory Processing
par: Lin, Chenqi, et autres
Publié: (2025)
par: Lin, Chenqi, et autres
Publié: (2025)
Xpikeformer: Hybrid Analog-Digital Hardware Acceleration for Spiking Transformers
par: Song, Zihang, et autres
Publié: (2024)
par: Song, Zihang, et autres
Publié: (2024)
Toleo: Scaling Freshness to Tera-scale Memory using CXL and PIM
par: Dong, Juechu, et autres
Publié: (2024)
par: Dong, Juechu, et autres
Publié: (2024)
Bulk-Switching Memristor-based Compute-In-Memory Module for Deep Neural Network Training
par: Wu, Yuting, et autres
Publié: (2023)
par: Wu, Yuting, et autres
Publié: (2023)
Accelerating Time Series Analysis via Processing using Non-Volatile Memories
par: Fernandez, Ivan, et autres
Publié: (2022)
par: Fernandez, Ivan, et autres
Publié: (2022)
Pimba: A Processing-in-Memory Acceleration for Post-Transformer Large Language Model Serving
par: Kim, Wonung, et autres
Publié: (2025)
par: Kim, Wonung, et autres
Publié: (2025)
Documents similaires
-
PIM-malloc: A Fast and Scalable Dynamic Memory Allocator for Processing-In-Memory (PIM) Architectures
par: Lee, Dongjae, et autres
Publié: (2025) -
PIM-MMU: A Memory Management Unit for Accelerating Data Transfers in Commercial PIM Systems
par: Lee, Dongjae, et autres
Publié: (2024) -
Fast-OverlaPIM: A Fast Overlap-driven Mapping Framework for Processing In-Memory Neural Network Acceleration
par: Wang, Xuan, et autres
Publié: (2024) -
AME-PIM: Can Memory be Your Next Tensor Accelerator?
par: Venieri, Emanuele, et autres
Publié: (2026) -
IANUS: Integrated Accelerator based on NPU-PIM Unified Memory System
par: Seo, Minseok, et autres
Publié: (2024)