Revisiting Disaggregated Large Language Model Serving for Performance and Energy Implications
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Jiaxi, Zhu, Yue, Lee, Eun Kyung, Nahrstedt, Klara |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Performance Implications of Multi-Chiplet Neural Processing Units on Autonomous Driving Perception
par: Odema, Mohanad, et autres
Publié: (2024)
par: Odema, Mohanad, et autres
Publié: (2024)
Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving
par: Qin, Ruoyu, et autres
Publié: (2024)
par: Qin, Ruoyu, et autres
Publié: (2024)
COMET: Neural Cost Model Explanation Framework
par: Chaudhary, Isha, et autres
Publié: (2023)
par: Chaudhary, Isha, et autres
Publié: (2023)
GPT-OSS-20B: A Comprehensive Deployment-Centric Analysis of OpenAI's Open-Weight Mixture of Experts Model
par: Kumar, Deepak, et autres
Publié: (2025)
par: Kumar, Deepak, et autres
Publié: (2025)
ARKV: Adaptive and Resource-Efficient KV Cache Management under Limited Memory Budget for Long-Context Inference in LLMs
par: Lei, Jianlong, et autres
Publié: (2026)
par: Lei, Jianlong, et autres
Publié: (2026)
Characterizing and Optimizing LLM Inference Workloads on CPU-GPU Coupled Architectures
par: Vellaisamy, Prabhu, et autres
Publié: (2025)
par: Vellaisamy, Prabhu, et autres
Publié: (2025)
Cloud to Edge: Benchmarking LLM Inference On Hardware-Accelerated Single-Board Computers
par: Renney, Harri, et autres
Publié: (2026)
par: Renney, Harri, et autres
Publié: (2026)
RedFuser: An Automatic Operator Fusion Framework for Cascaded Reductions on AI Accelerators
par: Tang, Xinsheng, et autres
Publié: (2026)
par: Tang, Xinsheng, et autres
Publié: (2026)
Systematic Characterization of LLM Quantization: A Performance, Energy, and Quality Perspective
par: Shi, Tianyao, et autres
Publié: (2025)
par: Shi, Tianyao, et autres
Publié: (2025)
GreenLLM: Disaggregating Large Language Model Serving on Heterogeneous GPUs for Lower Carbon Emissions
par: Shi, Tianyao, et autres
Publié: (2024)
par: Shi, Tianyao, et autres
Publié: (2024)
The Energy Blind Spot: NVIDIA's Flagship Edge AI Hardware Cannot Support Process-Level Energy Attribution
par: Panigrahy, Deepak, et autres
Publié: (2026)
par: Panigrahy, Deepak, et autres
Publié: (2026)
Scaling Intelligence: Designing Data Centers for Next-Gen Language Models
par: Tithi, Jesmin Jahan, et autres
Publié: (2025)
par: Tithi, Jesmin Jahan, et autres
Publié: (2025)
Performance Analysis of HPC applications on the Aurora Supercomputer: Exploring the Impact of HBM-Enabled Intel Xeon Max CPUs
par: Ibeid, Huda, et autres
Publié: (2025)
par: Ibeid, Huda, et autres
Publié: (2025)
Performance and Power: Systematic Evaluation of AI Workloads on Accelerators with CARAML
par: John, Chelsea Maria, et autres
Publié: (2024)
par: John, Chelsea Maria, et autres
Publié: (2024)
SCAR: Scheduling Multi-Model AI Workloads on Heterogeneous Multi-Chiplet Module Accelerators
par: Odema, Mohanad, et autres
Publié: (2024)
par: Odema, Mohanad, et autres
Publié: (2024)
GigaAPI for GPU Parallelization
par: Suvarna, M., et autres
Publié: (2025)
par: Suvarna, M., et autres
Publié: (2025)
UPMEM Unleashed: Software Secrets for Speed
par: Chmielewski, Krystian, et autres
Publié: (2025)
par: Chmielewski, Krystian, et autres
Publié: (2025)
Dissecting the NVIDIA Hopper Architecture through Microbenchmarking and Multiple Level Analysis
par: Luo, Weile, et autres
Publié: (2025)
par: Luo, Weile, et autres
Publié: (2025)
Experimental Assessment of Containers Running on Top of Virtual Machines
par: Aqasizade, Hossein, et autres
Publié: (2024)
par: Aqasizade, Hossein, et autres
Publié: (2024)
Compiler Support for Speculation in Decoupled Access/Execute Architectures
par: Szafarczyk, Robert, et autres
Publié: (2025)
par: Szafarczyk, Robert, et autres
Publié: (2025)
Profiling Concurrent Vision Inference Workloads on NVIDIA Jetson -- Extended
par: Chakraborty, Abhinaba, et autres
Publié: (2025)
par: Chakraborty, Abhinaba, et autres
Publié: (2025)
Exploring and Evaluating Real-world CXL: Use Cases and System Adoption
par: Wang, Xi, et autres
Publié: (2024)
par: Wang, Xi, et autres
Publié: (2024)
Parallelizing a modern GPU simulator
par: Huerta, Rodrigo, et autres
Publié: (2025)
par: Huerta, Rodrigo, et autres
Publié: (2025)
Can Asymmetric Tile Buffering Be Beneficial?
par: Wang, Chengyue, et autres
Publié: (2025)
par: Wang, Chengyue, et autres
Publié: (2025)
Exploiting long vectors with a CFD code: a co-design show case
par: Blancafort, Marc, et autres
Publié: (2024)
par: Blancafort, Marc, et autres
Publié: (2024)
Fusing Depthwise and Pointwise Convolutions for Efficient Inference on GPUs
par: Qararyah, Fareed, et autres
Publié: (2024)
par: Qararyah, Fareed, et autres
Publié: (2024)
Simopt -- Simulation pass for Speculative Optimisation of FPGA-CAD flow
par: Wadhwa, Eashan, et autres
Publié: (2024)
par: Wadhwa, Eashan, et autres
Publié: (2024)
ZipServ: Fast and Memory-Efficient LLM Inference with Hardware-Aware Lossless Compression
par: Fan, Ruibo, et autres
Publié: (2026)
par: Fan, Ruibo, et autres
Publié: (2026)
Serving Large Language Models on Huawei CloudMatrix384
par: Zuo, Pengfei, et autres
Publié: (2025)
par: Zuo, Pengfei, et autres
Publié: (2025)
PRESERVE: Prefetching Model Weights and KV-Cache in Distributed LLM Serving
par: Yüzügüler, Ahmet Caner, et autres
Publié: (2025)
par: Yüzügüler, Ahmet Caner, et autres
Publié: (2025)
Wattlytics: A Web Platform for Co-Optimizing Performance, Energy, and TCO in HPC Clusters
par: Afzal, Ayesha, et autres
Publié: (2026)
par: Afzal, Ayesha, et autres
Publié: (2026)
DABench-LLM: Standardized and In-Depth Benchmarking of Post-Moore Dataflow AI Accelerators for LLMs
par: Hu, Ziyu, et autres
Publié: (2025)
par: Hu, Ziyu, et autres
Publié: (2025)
Flex-TPU: A Flexible TPU with Runtime Reconfigurable Dataflow Architecture
par: Elbtity, Mohammed, et autres
Publié: (2024)
par: Elbtity, Mohammed, et autres
Publié: (2024)
DynamoLLM: Designing LLM Inference Clusters for Performance and Energy Efficiency
par: Stojkovic, Jovan, et autres
Publié: (2024)
par: Stojkovic, Jovan, et autres
Publié: (2024)
ZKProphet: Understanding Performance of Zero-Knowledge Proofs on GPUs
par: Verma, Tarunesh, et autres
Publié: (2025)
par: Verma, Tarunesh, et autres
Publié: (2025)
Vector-Centric Machine Learning Systems: A Cross-Stack Approach
par: Jiang, Wenqi
Publié: (2025)
par: Jiang, Wenqi
Publié: (2025)
HyperOffload: Graph-Driven Hierarchical Memory Management for Large Language Models on SuperNode Architectures
par: Liu, Fangxin, et autres
Publié: (2026)
par: Liu, Fangxin, et autres
Publié: (2026)
Design and Implementation of an IoT Cluster with Raspberry Pi Powered by Solar Energy: A Theoretical Approach
par: Portillo, Noel
Publié: (2025)
par: Portillo, Noel
Publié: (2025)
OPMOS: Ordered Parallel Algorithm for Multi-Objective Shortest-Paths
par: Gold, Leo, et autres
Publié: (2024)
par: Gold, Leo, et autres
Publié: (2024)
Cache Your Prompt When It's Green: Carbon-Aware Caching for Large Language Model Serving
par: Tian, Yuyang, et autres
Publié: (2025)
par: Tian, Yuyang, et autres
Publié: (2025)
Documents similaires
-
Performance Implications of Multi-Chiplet Neural Processing Units on Autonomous Driving Perception
par: Odema, Mohanad, et autres
Publié: (2024) -
Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving
par: Qin, Ruoyu, et autres
Publié: (2024) -
COMET: Neural Cost Model Explanation Framework
par: Chaudhary, Isha, et autres
Publié: (2023) -
GPT-OSS-20B: A Comprehensive Deployment-Centric Analysis of OpenAI's Open-Weight Mixture of Experts Model
par: Kumar, Deepak, et autres
Publié: (2025) -
ARKV: Adaptive and Resource-Efficient KV Cache Management under Limited Memory Budget for Long-Context Inference in LLMs
par: Lei, Jianlong, et autres
Publié: (2026)