PAPI: Exploiting Dynamic Parallelism in Large Language Model Decoding with a Processing-In-Memory-Enabled Computing System
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | He, Yintao, Mao, Haiyu, Giannoula, Christina, Sadrosadati, Mohammad, Gómez-Luna, Juan, Li, Huawei, Li, Xiaowei, Wang, Ying, Mutlu, Onur |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ALPHA-PIM: Analysis of Linear Algebraic Processing for High-Performance Graph Applications on a Real Processing-In-Memory System
par: Barkhordar, Marzieh, et autres
Publié: (2026)
par: Barkhordar, Marzieh, et autres
Publié: (2026)
Accelerating Triangle Counting with Real Processing-in-Memory Systems
par: Asquini, Lorenzo, et autres
Publié: (2025)
par: Asquini, Lorenzo, et autres
Publié: (2025)
A Modern Primer on Processing in Memory
par: Mutlu, Onur, et autres
Publié: (2020)
par: Mutlu, Onur, et autres
Publié: (2020)
DCC: Data-Centric Compilation of Machine Learning Kernels for Processing-In-Memory Architectures
par: Yang, Peiming, et autres
Publié: (2025)
par: Yang, Peiming, et autres
Publié: (2025)
PIMDAL: Mitigating the Memory Bottleneck in Data Analytics using a Real Processing-in-Memory System
par: Frouzakis, Manos, et autres
Publié: (2025)
par: Frouzakis, Manos, et autres
Publié: (2025)
RevaMp3D: Architecting the Processor Core and Cache Hierarchy for Systems with Monolithically-Integrated Logic and Memory
par: Ghiasi, Nika Mansouri, et autres
Publié: (2022)
par: Ghiasi, Nika Mansouri, et autres
Publié: (2022)
PyGim: An Efficient Graph Neural Network Library for Real Processing-In-Memory Architectures
par: Giannoula, Christina, et autres
Publié: (2024)
par: Giannoula, Christina, et autres
Publié: (2024)
CIPHERMATCH: Accelerating Homomorphic Encryption-Based String Matching via Memory-Efficient Data Packing and In-Flash Processing
par: Kabra, Mayank, et autres
Publié: (2025)
par: Kabra, Mayank, et autres
Publié: (2025)
Taking Cryptography Out of the Data Path via Near-Memory Processing in DRAM
par: Barcarolo, Nicola, et autres
Publié: (2026)
par: Barcarolo, Nicola, et autres
Publié: (2026)
Proteus: Enabling High-Performance Processing-Using-DRAM with Dynamic Bit-Precision, Adaptive Data Representation, and Flexible Arithmetic
par: Oliveira, Geraldo F., et autres
Publié: (2025)
par: Oliveira, Geraldo F., et autres
Publié: (2025)
Memory-Centric Computing: Recent Advances in Processing-in-DRAM
par: Mutlu, Onur, et autres
Publié: (2024)
par: Mutlu, Onur, et autres
Publié: (2024)
MegIS: High-Performance, Energy-Efficient, and Low-Cost Metagenomic Analysis with In-Storage Processing
par: Ghiasi, Nika Mansouri, et autres
Publié: (2024)
par: Ghiasi, Nika Mansouri, et autres
Publié: (2024)
Memory-Centric Computing: Solving Computing's Memory Problem
par: Mutlu, Onur, et autres
Publié: (2025)
par: Mutlu, Onur, et autres
Publié: (2025)
SAGe: A Lightweight Algorithm-Architecture Co-Design for Mitigating the Data Preparation Bottleneck in Large-Scale Genome Sequence Analysis
par: Ghiasi, Nika Mansouri, et autres
Publié: (2025)
par: Ghiasi, Nika Mansouri, et autres
Publié: (2025)
Conduit: Programmer-Transparent Near-Data Processing Using Multiple Compute-Capable Resources in Solid State Drives
par: Nadig, Rakesh, et autres
Publié: (2026)
par: Nadig, Rakesh, et autres
Publié: (2026)
Functionally-Complete Boolean Logic in Real DRAM Chips: Experimental Characterization and Analysis
par: Yuksel, Ismail Emir, et autres
Publié: (2024)
par: Yuksel, Ismail Emir, et autres
Publié: (2024)
PIM-Opt: Demystifying Distributed Optimization Algorithms on a Real-World Processing-In-Memory System
par: Rhyner, Steve, et autres
Publié: (2024)
par: Rhyner, Steve, et autres
Publié: (2024)
PULSAR: Simultaneous Many-Row Activation for Reliable and High-Performance Computing in Off-the-Shelf DRAM Chips
par: Yuksel, Ismail Emir, et autres
Publié: (2023)
par: Yuksel, Ismail Emir, et autres
Publié: (2023)
Simultaneous Many-Row Activation in Off-the-Shelf DRAM Chips: Experimental Characterization and Analysis
par: Yuksel, Ismail Emir, et autres
Publié: (2024)
par: Yuksel, Ismail Emir, et autres
Publié: (2024)
MIMDRAM: An End-to-End Processing-Using-DRAM System for High-Throughput, Energy-Efficient and Programmer-Transparent Multiple-Instruction Multiple-Data Processing
par: Oliveira, Geraldo F., et autres
Publié: (2024)
par: Oliveira, Geraldo F., et autres
Publié: (2024)
PAM: Processing Across Memory Hierarchy for Efficient KV-centric LLM Serving System
par: Liu, Lian, et autres
Publié: (2026)
par: Liu, Lian, et autres
Publié: (2026)
Spira: Exploiting Voxel Data Structural Properties for Efficient Sparse Convolution in Point Cloud Networks
par: Adamopoulos, Dionysios, et autres
Publié: (2025)
par: Adamopoulos, Dionysios, et autres
Publié: (2025)
In-DRAM True Random Number Generation Using Simultaneous Multiple-Row Activation: An Experimental Study of Real DRAM Chips
par: Yuksel, Ismail Emir, et autres
Publié: (2025)
par: Yuksel, Ismail Emir, et autres
Publié: (2025)
Athena: Synergizing Data Prefetching and Off-Chip Prediction via Online Reinforcement Learning
par: Bera, Rahul, et autres
Publié: (2026)
par: Bera, Rahul, et autres
Publié: (2026)
pLUTo: Enabling Massively Parallel Computation in DRAM via Lookup Tables
par: Ferreira, João Dinis, et autres
Publié: (2021)
par: Ferreira, João Dinis, et autres
Publié: (2021)
CMDS: Cross-layer Dataflow Optimization for DNN Accelerators Exploiting Multi-bank Memories
par: Shi, Man, et autres
Publié: (2024)
par: Shi, Man, et autres
Publié: (2024)
Balanced Data Placement for GEMV Acceleration with Processing-In-Memory
par: Ibrahim, Mohamed Assem, et autres
Publié: (2024)
par: Ibrahim, Mohamed Assem, et autres
Publié: (2024)
RAPID-Graph: Recursive All-Pairs Shortest Paths Using Processing-in-Memory for Dynamic Programming on Graphs
par: Chen, Yanru, et autres
Publié: (2025)
par: Chen, Yanru, et autres
Publié: (2025)
New Tools, Programming Models, and System Support for Processing-in-Memory Architectures
par: Oliveira, Geraldo F.
Publié: (2025)
par: Oliveira, Geraldo F.
Publié: (2025)
RUBICON: A Framework for Designing Efficient Deep Learning-Based Genomic Basecallers
par: Singh, Gagandeep, et autres
Publié: (2022)
par: Singh, Gagandeep, et autres
Publié: (2022)
Towards Compute-Aware In-Switch Computing for LLMs Tensor-Parallelism on Multi-GPU Systems
par: Zhang, Chen, et autres
Publié: (2026)
par: Zhang, Chen, et autres
Publié: (2026)
Parendi: Thousand-Way Parallel RTL Simulation
par: Emami, Mahyar, et autres
Publié: (2024)
par: Emami, Mahyar, et autres
Publié: (2024)
FengHuang: Next-Generation Memory Orchestration for AI Inferencing
par: Li, Jiamin, et autres
Publié: (2025)
par: Li, Jiamin, et autres
Publié: (2025)
Deep Learning and Machine Learning with GPGPU and CUDA: Unlocking the Power of Parallel Computing
par: Li, Ming, et autres
Publié: (2024)
par: Li, Ming, et autres
Publié: (2024)
Survey of Disaggregated Memory: Cross-layer Technique Insights for Next-Generation Datacenters
par: Wang, Jing, et autres
Publié: (2025)
par: Wang, Jing, et autres
Publié: (2025)
FlexStep: Enabling Flexible Error Detection in Multi/Many-core Real-time Systems
par: Wang, Tinglue, et autres
Publié: (2025)
par: Wang, Tinglue, et autres
Publié: (2025)
Datapath Combinational Equivalence Checking With Hybrid Sweeping Engines and Parallelization
par: Chen, Zhihan, et autres
Publié: (2024)
par: Chen, Zhihan, et autres
Publié: (2024)
Analyzing a Two-Tier Disaggregated Memory Protection Scheme Based on Memory Replication
par: Volos, Haris, et autres
Publié: (2025)
par: Volos, Haris, et autres
Publié: (2025)
SpeedMalloc: Improving Multi-threaded Applications via a Lightweight Core for Memory Allocation
par: Li, Ruihao, et autres
Publié: (2025)
par: Li, Ruihao, et autres
Publié: (2025)
TriMoE: Augmenting GPU with AMX-Enabled CPU and DIMM-NDP for High-Throughput MoE Inference via Offloading
par: Pan, Yudong, et autres
Publié: (2026)
par: Pan, Yudong, et autres
Publié: (2026)
Documents similaires
-
ALPHA-PIM: Analysis of Linear Algebraic Processing for High-Performance Graph Applications on a Real Processing-In-Memory System
par: Barkhordar, Marzieh, et autres
Publié: (2026) -
Accelerating Triangle Counting with Real Processing-in-Memory Systems
par: Asquini, Lorenzo, et autres
Publié: (2025) -
A Modern Primer on Processing in Memory
par: Mutlu, Onur, et autres
Publié: (2020) -
DCC: Data-Centric Compilation of Machine Learning Kernels for Processing-In-Memory Architectures
par: Yang, Peiming, et autres
Publié: (2025) -
PIMDAL: Mitigating the Memory Bottleneck in Data Analytics using a Real Processing-in-Memory System
par: Frouzakis, Manos, et autres
Publié: (2025)