Large-Scale LLM Inference with Heterogeneous Workloads: Prefill-Decode Contention and Asymptotically Optimal Control
Fuente:
arXiv
Salvato in:
| Autori principali: | Lin, Ruihan, Ding, Zezhen, Han, Zean, Zhang, Jiheng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Green-LLM: Optimal Workload Allocation for Environmentally-Aware Distributed Inference
di: Cheng, Jiaming, et al.
Pubblicazione: (2025)
di: Cheng, Jiaming, et al.
Pubblicazione: (2025)
From Sequential to Parallel: Reformulating Dynamic Programming as GPU Kernels for Large-Scale Stochastic Combinatorial Optimization
di: Zhao, Jingyi, et al.
Pubblicazione: (2026)
di: Zhao, Jingyi, et al.
Pubblicazione: (2026)
PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications
di: Du, Kuntai, et al.
Pubblicazione: (2025)
di: Du, Kuntai, et al.
Pubblicazione: (2025)
Modeling Task Mapping for Data-intensive Applications in Heterogeneous Systems
di: Wilhelm, Martin, et al.
Pubblicazione: (2022)
di: Wilhelm, Martin, et al.
Pubblicazione: (2022)
First Provably Optimal Asynchronous SGD for Homogeneous and Heterogeneous Data
di: Maranjyan, Artavazd
Pubblicazione: (2026)
di: Maranjyan, Artavazd
Pubblicazione: (2026)
A GPU-Accelerated Distributed Algorithm for Optimal Power Flow in Distribution Systems
di: Ryu, Minseok, et al.
Pubblicazione: (2025)
di: Ryu, Minseok, et al.
Pubblicazione: (2025)
Decentralized Nonconvex Optimization under Heavy-Tailed Noise: Normalization and Optimal Convergence
di: Yu, Shuhua, et al.
Pubblicazione: (2025)
di: Yu, Shuhua, et al.
Pubblicazione: (2025)
Distributed Stochastic Momentum Tracking with Local Updates: Achieving Optimal Communication and Iteration Complexities
di: Huang, Kun, et al.
Pubblicazione: (2025)
di: Huang, Kun, et al.
Pubblicazione: (2025)
D-PDLP: Scaling PDLP to Distributed Multi-GPU Systems
di: Li, Hongpei, et al.
Pubblicazione: (2026)
di: Li, Hongpei, et al.
Pubblicazione: (2026)
Accelerating Optimal Power Flow with GPUs: SIMD Abstraction of Nonlinear Programs and Condensed-Space Interior-Point Methods
di: Shin, Sungho, et al.
Pubblicazione: (2023)
di: Shin, Sungho, et al.
Pubblicazione: (2023)
Rescaled Asynchronous SGD: Optimal Distributed Optimization under Data and System Heterogeneity
di: Mahran, Ammar, et al.
Pubblicazione: (2026)
di: Mahran, Ammar, et al.
Pubblicazione: (2026)
Ringleader ASGD: The First Asynchronous SGD with Optimal Time Complexity under Data Heterogeneity
di: Maranjyan, Artavazd, et al.
Pubblicazione: (2025)
di: Maranjyan, Artavazd, et al.
Pubblicazione: (2025)
Temporal Parallelisation of the HJB Equation and Continuous-Time Linear Quadratic Control
di: Särkkä, Simo, et al.
Pubblicazione: (2022)
di: Särkkä, Simo, et al.
Pubblicazione: (2022)
Decentralized Gradient-Free Methods for Stochastic Non-Smooth Non-Convex Optimization
di: Lin, Zhenwei, et al.
Pubblicazione: (2023)
di: Lin, Zhenwei, et al.
Pubblicazione: (2023)
Optimality in Decentralized Optimization under Bandwidth Constraints
di: Tyurin, Alexander
Pubblicazione: (2026)
di: Tyurin, Alexander
Pubblicazione: (2026)
OptPipe: Memory- and Scheduling-Optimized Pipeline Parallelism for LLM Training
di: Li, Hongpei, et al.
Pubblicazione: (2025)
di: Li, Hongpei, et al.
Pubblicazione: (2025)
Distributed Constrained Combinatorial Optimization leveraging Hypergraph Neural Networks
di: Heydaribeni, Nasimeh, et al.
Pubblicazione: (2023)
di: Heydaribeni, Nasimeh, et al.
Pubblicazione: (2023)
Offline Energy-Optimal LLM Serving: Workload-Based Energy Models for LLM Inference on Heterogeneous Systems
di: Wilkins, Grant, et al.
Pubblicazione: (2024)
di: Wilkins, Grant, et al.
Pubblicazione: (2024)
Load Balancing with Network Latencies via Distributed Gradient Descent
di: Balseiro, Santiago R., et al.
Pubblicazione: (2025)
di: Balseiro, Santiago R., et al.
Pubblicazione: (2025)
An Optimistic Gradient Tracking Method for Distributed Minimax Optimization
di: Huang, Yan, et al.
Pubblicazione: (2025)
di: Huang, Yan, et al.
Pubblicazione: (2025)
Tailoring Gradient Methods for Differentially-Private Distributed Optimization
di: Wang, Yongqiang, et al.
Pubblicazione: (2022)
di: Wang, Yongqiang, et al.
Pubblicazione: (2022)
A First-Order Algorithm for Decentralised Min-Max Problems
di: Malitsky, Yura, et al.
Pubblicazione: (2023)
di: Malitsky, Yura, et al.
Pubblicazione: (2023)
Problem-Parameter-Free Decentralized Nonconvex Stochastic Optimization
di: Li, Jiaxiang, et al.
Pubblicazione: (2024)
di: Li, Jiaxiang, et al.
Pubblicazione: (2024)
Decentralized Distributed Optimization for Saddle Point Problems
di: Rogozin, Alexander, et al.
Pubblicazione: (2021)
di: Rogozin, Alexander, et al.
Pubblicazione: (2021)
Decentralized Nonsmooth Nonconvex Optimization with Client Sampling
di: Chen, Xinyan, et al.
Pubblicazione: (2026)
di: Chen, Xinyan, et al.
Pubblicazione: (2026)
Non-ergodic linear convergence property of the delayed gradient descent under the strongly convexity and the Polyak-Łojasiewicz condition
di: Choi, Hyung Jun, et al.
Pubblicazione: (2023)
di: Choi, Hyung Jun, et al.
Pubblicazione: (2023)
Krylov Solvers for Interior Point Methods with Applications in Radiation Therapy and Support Vector Machines
di: Liu, Felix, et al.
Pubblicazione: (2023)
di: Liu, Felix, et al.
Pubblicazione: (2023)
Smoothed Gradient Clipping and Error Feedback for Decentralized Optimization under Symmetric Heavy-Tailed Noise
di: Yu, Shuhua, et al.
Pubblicazione: (2023)
di: Yu, Shuhua, et al.
Pubblicazione: (2023)
Distributed Constraint-Coupled Optimization: Harnessing ADMM-consensus for robustness
di: Messilem, Mohamed Abdelmouamin, et al.
Pubblicazione: (2025)
di: Messilem, Mohamed Abdelmouamin, et al.
Pubblicazione: (2025)
An efficient implementation of parallel simulated annealing algorithm in GPUs
di: Ferreiro, A. M., et al.
Pubblicazione: (2024)
di: Ferreiro, A. M., et al.
Pubblicazione: (2024)
One-Point Feedback for Composite Optimization with Applications to Distributed and Federated Learning
di: Beznosikov, Aleksandr, et al.
Pubblicazione: (2021)
di: Beznosikov, Aleksandr, et al.
Pubblicazione: (2021)
Average-case optimization analysis for distributed consensus algorithms on regular graphs
di: Nguyen, Nhat Trung, et al.
Pubblicazione: (2024)
di: Nguyen, Nhat Trung, et al.
Pubblicazione: (2024)
GPU-Accelerated Primal Heuristics for Mixed Integer Programming
di: Çördük, Akif, et al.
Pubblicazione: (2025)
di: Çördük, Akif, et al.
Pubblicazione: (2025)
Disaggregated Prefill and Decoding Inference System for Large Language Model Serving on Multi-Vendor GPUs
di: Chen, Xing, et al.
Pubblicazione: (2025)
di: Chen, Xing, et al.
Pubblicazione: (2025)
Intelligent Router for LLM Workloads: Improving Performance Through Workload-Aware Load Balancing
di: Jain, Kunal, et al.
Pubblicazione: (2024)
di: Jain, Kunal, et al.
Pubblicazione: (2024)
The Limits and Potentials of Local SGD for Distributed Heterogeneous Learning with Intermittent Communication
di: Patel, Kumar Kshitij, et al.
Pubblicazione: (2024)
di: Patel, Kumar Kshitij, et al.
Pubblicazione: (2024)
Efficient Federated Learning against Heterogeneous and Non-stationary Client Unavailability
di: Xiang, Ming, et al.
Pubblicazione: (2024)
di: Xiang, Ming, et al.
Pubblicazione: (2024)
Uncoded Storage Coded Transmission Elastic Computing with Straggler Tolerance in Heterogeneous Systems
di: Zhong, Xi, et al.
Pubblicazione: (2024)
di: Zhong, Xi, et al.
Pubblicazione: (2024)
FIARSE: Model-Heterogeneous Federated Learning via Importance-Aware Submodel Extraction
di: Wu, Feijie, et al.
Pubblicazione: (2024)
di: Wu, Feijie, et al.
Pubblicazione: (2024)
FedCanon: Non-Convex Composite Federated Learning with Efficient Proximal Operation on Heterogeneous Data
di: Zhou, Yuan, et al.
Pubblicazione: (2025)
di: Zhou, Yuan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Green-LLM: Optimal Workload Allocation for Environmentally-Aware Distributed Inference
di: Cheng, Jiaming, et al.
Pubblicazione: (2025) -
From Sequential to Parallel: Reformulating Dynamic Programming as GPU Kernels for Large-Scale Stochastic Combinatorial Optimization
di: Zhao, Jingyi, et al.
Pubblicazione: (2026) -
PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications
di: Du, Kuntai, et al.
Pubblicazione: (2025) -
Modeling Task Mapping for Data-intensive Applications in Heterogeneous Systems
di: Wilhelm, Martin, et al.
Pubblicazione: (2022) -
First Provably Optimal Asynchronous SGD for Homogeneous and Heterogeneous Data
di: Maranjyan, Artavazd
Pubblicazione: (2026)