Tangram: Accelerating Serverless LLM Loading through GPU Memory Reuse and Affinity
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhu, Wenbin, Shen, Zhaoyan, Shao, Zili, Dai, Hongjun, Chen, Feng |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Sparse MTTKRP Acceleration for Tensor Decomposition on GPU
par: Wijeratne, Sasindu, et autres
Publié: (2024)
par: Wijeratne, Sasindu, et autres
Publié: (2024)
Adaptive KV Cache Reuse for Fast Long-Context LLM Serving
par: li, Fei, et autres
Publié: (2026)
par: li, Fei, et autres
Publié: (2026)
Application Experiences on a GPU-Accelerated Arm-based HPC Testbed
par: Elwasif, Wael, et autres
Publié: (2022)
par: Elwasif, Wael, et autres
Publié: (2022)
Characterizing CPU-Induced Slowdowns in Multi-GPU LLM Inference
par: Chung, Euijun, et autres
Publié: (2026)
par: Chung, Euijun, et autres
Publié: (2026)
An Evaluation and Comparison of GPU Hardware and Solver Libraries for Accelerating the OPM Flow Reservoir Simulator
par: Qiu, Tong Dong, et autres
Publié: (2023)
par: Qiu, Tong Dong, et autres
Publié: (2023)
Accelerating Triangle Counting with Real Processing-in-Memory Systems
par: Asquini, Lorenzo, et autres
Publié: (2025)
par: Asquini, Lorenzo, et autres
Publié: (2025)
Balanced Data Placement for GEMV Acceleration with Processing-In-Memory
par: Ibrahim, Mohamed Assem, et autres
Publié: (2024)
par: Ibrahim, Mohamed Assem, et autres
Publié: (2024)
MoE-Hub: Taming Software Complexity for Seamless MoE Overlap with Hardware-Accelerated Communication on Multi-GPU Systems
par: Zhou, Zhuoshan, et autres
Publié: (2026)
par: Zhou, Zhuoshan, et autres
Publié: (2026)
Chopper: A Multi-Level GPU Characterization Tool & Derived Insights Into LLM Training Inefficiency
par: Kurzynski, Marco, et autres
Publié: (2025)
par: Kurzynski, Marco, et autres
Publié: (2025)
CMDS: Cross-layer Dataflow Optimization for DNN Accelerators Exploiting Multi-bank Memories
par: Shi, Man, et autres
Publié: (2024)
par: Shi, Man, et autres
Publié: (2024)
CELLO: Co-designing Schedule and Hybrid Implicit/Explicit Buffer for Complex Tensor Reuse
par: Garg, Raveesh, et autres
Publié: (2023)
par: Garg, Raveesh, et autres
Publié: (2023)
MVDRAM: Enabling GeMV Execution in Unmodified DRAM for Low-Bit LLM Acceleration
par: Kubo, Tatsuya, et autres
Publié: (2025)
par: Kubo, Tatsuya, et autres
Publié: (2025)
PAM: Processing Across Memory Hierarchy for Efficient KV-centric LLM Serving System
par: Liu, Lian, et autres
Publié: (2026)
par: Liu, Lian, et autres
Publié: (2026)
HetGPU: The pursuit of making binary compatibility towards GPUs
par: Yang, Yiwei, et autres
Publié: (2025)
par: Yang, Yiwei, et autres
Publié: (2025)
Optimizing ML Concurrent Computation and Communication with GPU DMA Engines
par: Agrawal, Anirudha, et autres
Publié: (2024)
par: Agrawal, Anirudha, et autres
Publié: (2024)
Towards Compute-Aware In-Switch Computing for LLMs Tensor-Parallelism on Multi-GPU Systems
par: Zhang, Chen, et autres
Publié: (2026)
par: Zhang, Chen, et autres
Publié: (2026)
Accelerating Recommender Model ETL with a Streaming FPGA-GPU Dataflow
par: Zhu, Yu, et autres
Publié: (2025)
par: Zhu, Yu, et autres
Publié: (2025)
Microbenchmark-Driven Analytical Performance Modeling Across Modern GPU Architectures
par: Jarmusch, Aaron, et autres
Publié: (2026)
par: Jarmusch, Aaron, et autres
Publié: (2026)
Design in Tiles: Automating GEMM Deployment on Tile-Based Many-PE Accelerators
par: Shen, Aofeng, et autres
Publié: (2025)
par: Shen, Aofeng, et autres
Publié: (2025)
Efficient Architecture for RISC-V Vector Memory Access
par: Guan, Hongyi, et autres
Publié: (2025)
par: Guan, Hongyi, et autres
Publié: (2025)
Analyzing Reverse Address Translation Overheads in Multi-GPU Scale-Up Pods
par: Fatima, Amel, et autres
Publié: (2026)
par: Fatima, Amel, et autres
Publié: (2026)
FinGraV: Methodology for Fine-Grain GPU Power Visibility and Insights
par: Singhania, Varsha, et autres
Publié: (2024)
par: Singhania, Varsha, et autres
Publié: (2024)
Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache
par: Lin, Bin, et autres
Publié: (2024)
par: Lin, Bin, et autres
Publié: (2024)
Memory-Centric Computing: Solving Computing's Memory Problem
par: Mutlu, Onur, et autres
Publié: (2025)
par: Mutlu, Onur, et autres
Publié: (2025)
TeraPool: A Physical Design Aware, 1024 RISC-V Cores Shared-L1-Memory Scaled-up Cluster Design with High Bandwidth Main Memory Link
par: Zhang, Yichao, et autres
Publié: (2026)
par: Zhang, Yichao, et autres
Publié: (2026)
Scheduling Techniques of AI Models on Modern Heterogeneous Edge GPU -- A Critical Review
par: Majeed, Ashiyana Abdul, et autres
Publié: (2025)
par: Majeed, Ashiyana Abdul, et autres
Publié: (2025)
Improving Multi-Instance GPU Efficiency via Sub-Entry Sharing TLB Design
par: Li, Bingyao, et autres
Publié: (2024)
par: Li, Bingyao, et autres
Publié: (2024)
Fine-Grained Power and Energy Attribution on AMD GPU/APU-Based Exascale Nodes
par: McDaniel, Adam, et autres
Publié: (2026)
par: McDaniel, Adam, et autres
Publié: (2026)
Multi-Partner Project: Multi-GPU Performance Portability Analysis for CFD Simulations at Scale
par: Eleftherakis, Panagiotis-Eleftherios, et autres
Publié: (2026)
par: Eleftherakis, Panagiotis-Eleftherios, et autres
Publié: (2026)
DeFiNES: Enabling Fast Exploration of the Depth-first Scheduling Space for DNN Accelerators through Analytical Modeling
par: Mei, Linyan, et autres
Publié: (2022)
par: Mei, Linyan, et autres
Publié: (2022)
CCSS: Hardware-Accelerated RTL Simulation with Fast Combinational Logic Computing and Sequential Logic Synchronization
par: Feng, Weigang, et autres
Publié: (2025)
par: Feng, Weigang, et autres
Publié: (2025)
Analyzing a Two-Tier Disaggregated Memory Protection Scheme Based on Memory Replication
par: Volos, Haris, et autres
Publié: (2025)
par: Volos, Haris, et autres
Publié: (2025)
SwarmIO: Towards 100 Million IOPS SSD Emulation for Next-generation GPU-centric Storage Systems
par: Kim, Hyeseong, et autres
Publié: (2026)
par: Kim, Hyeseong, et autres
Publié: (2026)
Evaluation of computational and energy performance in matrix multiplication algorithms on CPU and GPU using MKL, cuBLAS and SYCL
par: Torres, L. A., et autres
Publié: (2024)
par: Torres, L. A., et autres
Publié: (2024)
Pooling Engram Conditional Memory in Large Language Models using CXL
par: Ma, Ruiyang, et autres
Publié: (2026)
par: Ma, Ruiyang, et autres
Publié: (2026)
EDEA: Efficient Dual-Engine Accelerator for Depthwise Separable Convolution with Direct Data Transfer
par: Chen, Yi, et autres
Publié: (2025)
par: Chen, Yi, et autres
Publié: (2025)
Accelerating MoE with Dynamic In-Switch Computing on Multi-GPUs
par: Zhang, Qijun, et autres
Publié: (2026)
par: Zhang, Qijun, et autres
Publié: (2026)
FastGL: A GPU-Efficient Framework for Accelerating Sampling-Based GNN Training at Large Scale
par: Zhu, Zeyu, et autres
Publié: (2024)
par: Zhu, Zeyu, et autres
Publié: (2024)
A Modern Primer on Processing in Memory
par: Mutlu, Onur, et autres
Publié: (2020)
par: Mutlu, Onur, et autres
Publié: (2020)
A Lightweight High-Throughput Collective-Capable NoC for Large-Scale ML Accelerators
par: Colagrande, Luca, et autres
Publié: (2026)
par: Colagrande, Luca, et autres
Publié: (2026)
Documents similaires
-
Sparse MTTKRP Acceleration for Tensor Decomposition on GPU
par: Wijeratne, Sasindu, et autres
Publié: (2024) -
Adaptive KV Cache Reuse for Fast Long-Context LLM Serving
par: li, Fei, et autres
Publié: (2026) -
Application Experiences on a GPU-Accelerated Arm-based HPC Testbed
par: Elwasif, Wael, et autres
Publié: (2022) -
Characterizing CPU-Induced Slowdowns in Multi-GPU LLM Inference
par: Chung, Euijun, et autres
Publié: (2026) -
An Evaluation and Comparison of GPU Hardware and Solver Libraries for Accelerating the OPM Flow Reservoir Simulator
par: Qiu, Tong Dong, et autres
Publié: (2023)