Justitia: Fair and Efficient Scheduling of Task-parallel LLM Agents with Selective Pampering
Fuente:
arXiv
Salvato in:
| Autori principali: | Yang, Mingyan, Wang, Guanjie, Luo, Manqi, Liu, Yifei, Chen, Chen, Zhao, Han, Feng, Yu, Chen, Quan, Guo, Minyi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SageSched: Efficient LLM Scheduling Confronting Demand Uncertainty and Hybridity
di: Gan, Zhenghao, et al.
Pubblicazione: (2026)
di: Gan, Zhenghao, et al.
Pubblicazione: (2026)
S-HPLB: Efficient LLM Attention Serving via Sparsity-Aware Head Parallelism Load Balance
di: Liu, Di, et al.
Pubblicazione: (2026)
di: Liu, Di, et al.
Pubblicazione: (2026)
Towards Resource-Efficient Serverless LLM Inference with SLINFER
di: Xu, Chuhao, et al.
Pubblicazione: (2025)
di: Xu, Chuhao, et al.
Pubblicazione: (2025)
Kairos: Low-latency Multi-Agent Serving with Shared LLMs and Excessive Loads in the Public Cloud
di: Chen, Jinyuan, et al.
Pubblicazione: (2025)
di: Chen, Jinyuan, et al.
Pubblicazione: (2025)
MuxTune: Efficient Multi-Task LLM Fine-Tuning in Multi-Tenant Datacenters via Spatial-Temporal Backbone Multiplexing
di: Xue, Chunyu, et al.
Pubblicazione: (2026)
di: Xue, Chunyu, et al.
Pubblicazione: (2026)
AB-Sparse: Sparse Attention with Adaptive Block Size for Accurate and Efficient Long-Context Inference
di: Liu, Di, et al.
Pubblicazione: (2026)
di: Liu, Di, et al.
Pubblicazione: (2026)
LLMSched: Uncertainty-Aware Workload Scheduling for Compound LLM Applications
di: Zhu, Botao, et al.
Pubblicazione: (2025)
di: Zhu, Botao, et al.
Pubblicazione: (2025)
FREESH: Fair, Resource- and Energy-Efficient Scheduling for LLM Serving on Heterogeneous GPUs
di: He, Xuan, et al.
Pubblicazione: (2025)
di: He, Xuan, et al.
Pubblicazione: (2025)
Efficient Unified Caching for Accelerating Heterogeneous AI Workloads
di: Wang, Tianze, et al.
Pubblicazione: (2025)
di: Wang, Tianze, et al.
Pubblicazione: (2025)
Arena: Efficiently Training Large Models via Dynamic Scheduling and Adaptive Parallelism Co-Design
di: Xue, Chunyu, et al.
Pubblicazione: (2024)
di: Xue, Chunyu, et al.
Pubblicazione: (2024)
DASH: Deterministic Attention Scheduling for High-throughput Reproducible LLM Training
di: Qiang, Xinwei, et al.
Pubblicazione: (2026)
di: Qiang, Xinwei, et al.
Pubblicazione: (2026)
GoodServe: Towards High-Goodput Serving of Agentic LLM Inferences over Heterogeneous Resources
di: Du, Boxiao, et al.
Pubblicazione: (2026)
di: Du, Boxiao, et al.
Pubblicazione: (2026)
DPBalance: Efficient and Fair Privacy Budget Scheduling for Federated Learning as a Service
di: Liu, Yu, et al.
Pubblicazione: (2024)
di: Liu, Yu, et al.
Pubblicazione: (2024)
Agent.xpu: Efficient Scheduling of Agentic LLM Workloads on Heterogeneous SoC
di: Wei, Xinming, et al.
Pubblicazione: (2025)
di: Wei, Xinming, et al.
Pubblicazione: (2025)
Efficient Serving of LLM Applications with Probabilistic Demand Modeling
di: Liu, Yifei, et al.
Pubblicazione: (2025)
di: Liu, Yifei, et al.
Pubblicazione: (2025)
Harli: SLO-Aware Co-location of LLM Inference and PEFT-based Finetuning on Model-as-a-Service Platforms
di: Xu, Ao, et al.
Pubblicazione: (2025)
di: Xu, Ao, et al.
Pubblicazione: (2025)
Towards Fast Setup and High Throughput of GPU Serverless Computing
di: Zhao, Han, et al.
Pubblicazione: (2024)
di: Zhao, Han, et al.
Pubblicazione: (2024)
VQ-LLM: High-performance Code Generation for Vector Quantization Augmented LLM Inference
di: Liu, Zihan, et al.
Pubblicazione: (2025)
di: Liu, Zihan, et al.
Pubblicazione: (2025)
Data-Locality-Aware Task Assignment and Scheduling for Distributed Job Executions
di: Zhao, Hailiang, et al.
Pubblicazione: (2024)
di: Zhao, Hailiang, et al.
Pubblicazione: (2024)
CALVO: Improve Serving Efficiency for LLM Inferences with Intense Network Demands
di: Wang, Weiye, et al.
Pubblicazione: (2026)
di: Wang, Weiye, et al.
Pubblicazione: (2026)
Accelerating Sparse DNNs Based on Tiled GEMM
di: Guo, Cong, et al.
Pubblicazione: (2024)
di: Guo, Cong, et al.
Pubblicazione: (2024)
eLLM: Elastic Memory Management Framework for Efficient LLM Serving
di: Xu, Jiale, et al.
Pubblicazione: (2025)
di: Xu, Jiale, et al.
Pubblicazione: (2025)
HexAGenT: Efficient Agentic LLM Serving via Workflow- and Heterogeneity-Aware Scheduling
di: Peng, You, et al.
Pubblicazione: (2026)
di: Peng, You, et al.
Pubblicazione: (2026)
Bandwidth-Aware and Cost-Efficient Pipeline Parallel Scheduling in Geo-Distributed LLM Training
di: Zhang, Han, et al.
Pubblicazione: (2026)
di: Zhang, Han, et al.
Pubblicazione: (2026)
Next-Gen Computing Systems with Compute Express Link: a Comprehensive Survey
di: Chen, Chen, et al.
Pubblicazione: (2024)
di: Chen, Chen, et al.
Pubblicazione: (2024)
Eliminating Timing Anomalies in Scheduling Periodic Segmented Self-Suspending Tasks with Release Jitter
di: Lin, Ching-Chi, et al.
Pubblicazione: (2024)
di: Lin, Ching-Chi, et al.
Pubblicazione: (2024)
Efficient Task Graph Scheduling for Parallel QR Factorization in SLSQP
di: Chatterjee, Soumyajit, et al.
Pubblicazione: (2025)
di: Chatterjee, Soumyajit, et al.
Pubblicazione: (2025)
Mosaic: Towards Efficient Training of Multimodal Models with Spatial Resource Multiplexing
di: Wang, Yanbo, et al.
Pubblicazione: (2026)
di: Wang, Yanbo, et al.
Pubblicazione: (2026)
Locality-aware Fair Scheduling in LLM Serving
di: Cao, Shiyi, et al.
Pubblicazione: (2025)
di: Cao, Shiyi, et al.
Pubblicazione: (2025)
Hyperion: Hierarchical Scheduling for Parallel LLM Acceleration in Multi-tier Networks
di: Ma, Mulei, et al.
Pubblicazione: (2025)
di: Ma, Mulei, et al.
Pubblicazione: (2025)
A Predictive and Synergistic Two-Layer Scheduling Framework for LLM Serving
di: Zhang, Yue, et al.
Pubblicazione: (2025)
di: Zhang, Yue, et al.
Pubblicazione: (2025)
Efficient Scheduling of Vehicular Tasks on Edge Systems with Green Energy and Battery Storage
di: Sarkar, Suvarthi, et al.
Pubblicazione: (2024)
di: Sarkar, Suvarthi, et al.
Pubblicazione: (2024)
Megha: Decentralized Global Fair Scheduling for Federated Clusters
di: Thiyyakat, Meghana, et al.
Pubblicazione: (2021)
di: Thiyyakat, Meghana, et al.
Pubblicazione: (2021)
Schedule-Level Shared-Prefix Reuse for LLM RL Training
di: Li, Pengbo, et al.
Pubblicazione: (2026)
di: Li, Pengbo, et al.
Pubblicazione: (2026)
Argus: Token Aware Distributed LLM Inference Optimization
di: Wu, Panlong, et al.
Pubblicazione: (2025)
di: Wu, Panlong, et al.
Pubblicazione: (2025)
QoE-oriented Dependent Task Scheduling under Multi-dimensional QoS Constraints over Distributed Networks
di: Fan, Xuwei, et al.
Pubblicazione: (2023)
di: Fan, Xuwei, et al.
Pubblicazione: (2023)
FATE: Future-State-Aware Scheduling for Heterogeneous LLM Workflows
di: Huang, Zirui, et al.
Pubblicazione: (2026)
di: Huang, Zirui, et al.
Pubblicazione: (2026)
Equinox: Holistic Fair Scheduling in Serving Large Language Models
di: Wei, Zhixiang, et al.
Pubblicazione: (2025)
di: Wei, Zhixiang, et al.
Pubblicazione: (2025)
FlashFuser: Expanding the Scale of Kernel Fusion for Compute-Intensive Operators via Inter-Core Connection
di: Huang, Ziyu, et al.
Pubblicazione: (2025)
di: Huang, Ziyu, et al.
Pubblicazione: (2025)
GMLake: Efficient and Transparent GPU Memory Defragmentation for Large-scale DNN Training with Virtual Memory Stitching
di: Guo, Cong, et al.
Pubblicazione: (2024)
di: Guo, Cong, et al.
Pubblicazione: (2024)
Documenti analoghi
-
SageSched: Efficient LLM Scheduling Confronting Demand Uncertainty and Hybridity
di: Gan, Zhenghao, et al.
Pubblicazione: (2026) -
S-HPLB: Efficient LLM Attention Serving via Sparsity-Aware Head Parallelism Load Balance
di: Liu, Di, et al.
Pubblicazione: (2026) -
Towards Resource-Efficient Serverless LLM Inference with SLINFER
di: Xu, Chuhao, et al.
Pubblicazione: (2025) -
Kairos: Low-latency Multi-Agent Serving with Shared LLMs and Excessive Loads in the Public Cloud
di: Chen, Jinyuan, et al.
Pubblicazione: (2025) -
MuxTune: Efficient Multi-Task LLM Fine-Tuning in Multi-Tenant Datacenters via Spatial-Temporal Backbone Multiplexing
di: Xue, Chunyu, et al.
Pubblicazione: (2026)