Pimba: A Processing-in-Memory Acceleration for Post-Transformer Large Language Model Serving
Fuente:
arXiv
Salvato in:
| Autori principali: | Kim, Wonung, Lee, Yubin, Kim, Yoonsung, Hwang, Jinwoo, Oh, Seongryong, Jung, Jiyong, Huseynov, Aziz, Park, Woong Gyu, Park, Chang Hyun, Mahajan, Divya, Park, Jongse |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DaCapo: Accelerating Continuous Learning in Autonomous Systems for Video Analytics
di: Kim, Yoonsung, et al.
Pubblicazione: (2024)
di: Kim, Yoonsung, et al.
Pubblicazione: (2024)
Neo: Real-Time On-Device 3D Gaussian Splatting with Reuse-and-Update Sorting Acceleration
di: Oh, Changhun, et al.
Pubblicazione: (2025)
di: Oh, Changhun, et al.
Pubblicazione: (2025)
MixDiT: Accelerating Image Diffusion Transformer Inference with Mixed-Precision MX Quantization
di: Kim, Daeun, et al.
Pubblicazione: (2025)
di: Kim, Daeun, et al.
Pubblicazione: (2025)
Accelerating String-Key Learned Index Structures via Memoization-based Incremental Training
di: Kim, Minsu, et al.
Pubblicazione: (2024)
di: Kim, Minsu, et al.
Pubblicazione: (2024)
NeuPIMs: NPU-PIM Heterogeneous Acceleration for Batched LLM Inferencing
di: Heo, Guseul, et al.
Pubblicazione: (2024)
di: Heo, Guseul, et al.
Pubblicazione: (2024)
Oaken: Fast and Efficient LLM Serving with Online-Offline Hybrid KV Cache Quantization
di: Kim, Minsu, et al.
Pubblicazione: (2025)
di: Kim, Minsu, et al.
Pubblicazione: (2025)
IANUS: Integrated Accelerator based on NPU-PIM Unified Memory System
di: Seo, Minseok, et al.
Pubblicazione: (2024)
di: Seo, Minseok, et al.
Pubblicazione: (2024)
Theodosian: A Deep Dive into Memory-Hierarchy-Centric FHE Acceleration
di: Choi, Wonseok, et al.
Pubblicazione: (2025)
di: Choi, Wonseok, et al.
Pubblicazione: (2025)
Low-Complexity Beamspace Channel Denoiser for mmWave Massive MIMO with Low-Resolution ADCs
di: Park, Hanyoung, et al.
Pubblicazione: (2026)
di: Park, Hanyoung, et al.
Pubblicazione: (2026)
LPU: A Latency-Optimized and Highly Scalable Processor for Large Language Model Inference
di: Moon, Seungjae, et al.
Pubblicazione: (2024)
di: Moon, Seungjae, et al.
Pubblicazione: (2024)
Token-Picker: Accelerating Attention in Text Generation with Minimized Memory Transfer via Probability Estimation
di: Park, Junyoung, et al.
Pubblicazione: (2024)
di: Park, Junyoung, et al.
Pubblicazione: (2024)
FIGLUT: An Energy-Efficient Accelerator Design for FP-INT GEMM Using Look-Up Tables
di: Park, Gunho, et al.
Pubblicazione: (2025)
di: Park, Gunho, et al.
Pubblicazione: (2025)
ONNXim: A Fast, Cycle-level Multi-core NPU Simulator
di: Ham, Hyungkyu, et al.
Pubblicazione: (2024)
di: Ham, Hyungkyu, et al.
Pubblicazione: (2024)
IVE: An Accelerator for Single-Server Private Information Retrieval Using Versatile Processing Elements
di: Kim, Sangpyo, et al.
Pubblicazione: (2025)
di: Kim, Sangpyo, et al.
Pubblicazione: (2025)
A Review on Proprietary Accelerators for Large Language Models
di: Park, Sihyeong, et al.
Pubblicazione: (2025)
di: Park, Sihyeong, et al.
Pubblicazione: (2025)
AME-PIM: Can Memory be Your Next Tensor Accelerator?
di: Venieri, Emanuele, et al.
Pubblicazione: (2026)
di: Venieri, Emanuele, et al.
Pubblicazione: (2026)
PIM-MMU: A Memory Management Unit for Accelerating Data Transfers in Commercial PIM Systems
di: Lee, Dongjae, et al.
Pubblicazione: (2024)
di: Lee, Dongjae, et al.
Pubblicazione: (2024)
SliceMoE: Bit-Sliced Expert Caching under Miss-Rate Constraints for Efficient MoE Inference
di: Choi, Yuseon, et al.
Pubblicazione: (2025)
di: Choi, Yuseon, et al.
Pubblicazione: (2025)
Bandwidth-Effective DRAM Cache for GPUs with Storage-Class Memory
di: Hong, Jeongmin, et al.
Pubblicazione: (2024)
di: Hong, Jeongmin, et al.
Pubblicazione: (2024)
Low-overhead General-purpose Near-Data Processing in CXL Memory Expanders
di: Ham, Hyungkyu, et al.
Pubblicazione: (2024)
di: Ham, Hyungkyu, et al.
Pubblicazione: (2024)
DRAMScope: Uncovering DRAM Microarchitecture and Characteristics by Issuing Memory Commands
di: Nam, Hwayong, et al.
Pubblicazione: (2024)
di: Nam, Hwayong, et al.
Pubblicazione: (2024)
COMPASS: A Compiler Framework for Resource-Constrained Crossbar-Array Based In-Memory Deep Learning Accelerators
di: Park, Jihoon, et al.
Pubblicazione: (2025)
di: Park, Jihoon, et al.
Pubblicazione: (2025)
TriGen: NPU Architecture for End-to-End Acceleration of Large Language Models based on SW-HW Co-Design
di: Lee, Jonghun, et al.
Pubblicazione: (2026)
di: Lee, Jonghun, et al.
Pubblicazione: (2026)
Hardware-based Heterogeneous Memory Management for Large Language Model Inference
di: Hwang, Soojin, et al.
Pubblicazione: (2025)
di: Hwang, Soojin, et al.
Pubblicazione: (2025)
A Host-SSD Collaborative Write Accelerator for LSM-Tree-Based Key-Value Stores
di: Kim, KiHwan, et al.
Pubblicazione: (2024)
di: Kim, KiHwan, et al.
Pubblicazione: (2024)
Cocoon: A System Architecture for Differentially Private Training with Correlated Noises
di: Kim, Donghwan, et al.
Pubblicazione: (2025)
di: Kim, Donghwan, et al.
Pubblicazione: (2025)
Characterizing Compute-Communication Overlap in GPU-Accelerated Distributed Deep Learning: Performance and Power Implications
di: Lee, Seonho, et al.
Pubblicazione: (2025)
di: Lee, Seonho, et al.
Pubblicazione: (2025)
OPAL: Outlier-Preserved Microscaling Quantization Accelerator for Generative Large Language Models
di: Koo, Jahyun, et al.
Pubblicazione: (2024)
di: Koo, Jahyun, et al.
Pubblicazione: (2024)
SAIL: SRAM-Accelerated LLM Inference System with Lookup-Table-based GEMV
di: Zhang, Jingyao, et al.
Pubblicazione: (2025)
di: Zhang, Jingyao, et al.
Pubblicazione: (2025)
Heterogeneous Acceleration Pipeline for Recommendation System Training
di: Adnan, Muhammad, et al.
Pubblicazione: (2022)
di: Adnan, Muhammad, et al.
Pubblicazione: (2022)
STRAW: A Stress-Aware WL-Based Read Reclaim Technique for High-Density NAND Flash-Based SSDs
di: Chun, Myoungjun, et al.
Pubblicazione: (2025)
di: Chun, Myoungjun, et al.
Pubblicazione: (2025)
MX+: Pushing the Limits of Microscaling Formats for Efficient Large Language Model Serving
di: Lee, Jungi, et al.
Pubblicazione: (2025)
di: Lee, Jungi, et al.
Pubblicazione: (2025)
Hardware-Software Co-Design for Accelerating Transformer Inference Leveraging Compute-in-Memory
di: Kim, Dong Eun, et al.
Pubblicazione: (2025)
di: Kim, Dong Eun, et al.
Pubblicazione: (2025)
IBEX: Internal Bandwidth-Efficient Compression Architecture for Scalable CXL Memory Expansion
di: Ko, Younghoon, et al.
Pubblicazione: (2026)
di: Ko, Younghoon, et al.
Pubblicazione: (2026)
ODMA: On-Demand Memory Allocation Strategy for LLM Serving on LPDDR-Class Accelerators
di: Zou, Guoqiang, et al.
Pubblicazione: (2025)
di: Zou, Guoqiang, et al.
Pubblicazione: (2025)
PRISM: Breaking the O(n) Memory Wall in Long-Context LLM Inference via O(1) Photonic Block Selection
di: Park, Hyoseok, et al.
Pubblicazione: (2026)
di: Park, Hyoseok, et al.
Pubblicazione: (2026)
RoMe: Row Granularity Access Memory System for Large Language Models
di: Nam, Hwayong, et al.
Pubblicazione: (2025)
di: Nam, Hwayong, et al.
Pubblicazione: (2025)
Smart-Infinity: Fast Large Language Model Training using Near-Storage Processing on a Real System
di: Jang, Hongsun, et al.
Pubblicazione: (2024)
di: Jang, Hongsun, et al.
Pubblicazione: (2024)
A4: Microarchitecture-Aware LLC Management for Datacenter Servers with Emerging I/O Devices
di: Park, Haneul, et al.
Pubblicazione: (2025)
di: Park, Haneul, et al.
Pubblicazione: (2025)
AERO: Adaptive Erase Operation for Improving Lifetime and Performance of Modern NAND Flash-Based SSDs
di: Cho, Sungjun, et al.
Pubblicazione: (2024)
di: Cho, Sungjun, et al.
Pubblicazione: (2024)
Documenti analoghi
-
DaCapo: Accelerating Continuous Learning in Autonomous Systems for Video Analytics
di: Kim, Yoonsung, et al.
Pubblicazione: (2024) -
Neo: Real-Time On-Device 3D Gaussian Splatting with Reuse-and-Update Sorting Acceleration
di: Oh, Changhun, et al.
Pubblicazione: (2025) -
MixDiT: Accelerating Image Diffusion Transformer Inference with Mixed-Precision MX Quantization
di: Kim, Daeun, et al.
Pubblicazione: (2025) -
Accelerating String-Key Learned Index Structures via Memoization-based Incremental Training
di: Kim, Minsu, et al.
Pubblicazione: (2024) -
NeuPIMs: NPU-PIM Heterogeneous Acceleration for Batched LLM Inferencing
di: Heo, Guseul, et al.
Pubblicazione: (2024)