LMetric: Simple is Better - Multiplication May Be All You Need for LLM Request Scheduling
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Dingyan, Han, Jinbo, Zhang, Kaixi, Wei, Xingda, Shen, Sijie, Fang, Chenguang, Yu, Wenyuan, Zhou, Jingren, Chen, Rong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
BLITZSCALE: Fast and Live Large Model Autoscaling with O(1) Host Caching
di: Zhang, Dingyan, et al.
Pubblicazione: (2024)
di: Zhang, Dingyan, et al.
Pubblicazione: (2024)
KVCache Cache in the Wild: Characterizing and Optimizing KVCache Cache at a Large Cloud Provider
di: Wang, Jiahao, et al.
Pubblicazione: (2025)
di: Wang, Jiahao, et al.
Pubblicazione: (2025)
PhoenixOS: Concurrent OS-level GPU Checkpoint and Restore with Validated Speculation
di: Wei, Xingda, et al.
Pubblicazione: (2024)
di: Wei, Xingda, et al.
Pubblicazione: (2024)
Ensuring Data Freshness in Multi-Rate Task Chains Scheduling
di: Hoffmann, José Luis Conradi, et al.
Pubblicazione: (2026)
di: Hoffmann, José Luis Conradi, et al.
Pubblicazione: (2026)
Mitigating context switching in densely packed Linux clusters with Latency-Aware Group Scheduling
di: Isstaif, Al Amjad Tawfiq, et al.
Pubblicazione: (2025)
di: Isstaif, Al Amjad Tawfiq, et al.
Pubblicazione: (2025)
THEMIS: Time, Heterogeneity, and Energy Minded Scheduling for Fair Multi-Tenant Use in FPGAs
di: Karabulut, Emre, et al.
Pubblicazione: (2024)
di: Karabulut, Emre, et al.
Pubblicazione: (2024)
Rethinking Thread Scheduling under Oversubscription: A User-Space Framework for Coordinating Multi-runtime and Multi-process Workloads
di: Roca, Aleix, et al.
Pubblicazione: (2026)
di: Roca, Aleix, et al.
Pubblicazione: (2026)
Optimizing Task Scheduling in Heterogeneous Computing Environments: A Comparative Analysis of CPU, GPU, and ASIC Platforms Using E2C Simulator
di: Mohammadjafari, Ali, et al.
Pubblicazione: (2024)
di: Mohammadjafari, Ali, et al.
Pubblicazione: (2024)
Towards Efficient and Practical GPU Multitasking in the Era of LLM
di: Xing, Jiarong, et al.
Pubblicazione: (2025)
di: Xing, Jiarong, et al.
Pubblicazione: (2025)
ContiguousKV: Accelerating LLM Prefill with Granularity-Aligned KV Cache Management
di: Zou, Jing, et al.
Pubblicazione: (2026)
di: Zou, Jing, et al.
Pubblicazione: (2026)
Demystifying Serverless Costs on Public Platforms: Bridging Billing, Architecture, and OS Scheduling
di: Lin, Changyuan, et al.
Pubblicazione: (2025)
di: Lin, Changyuan, et al.
Pubblicazione: (2025)
TIDAL: Recovering Temporal Phase for Cloud Block Storage Placement from LLM-Derived Semantics
di: Tan, Difan, et al.
Pubblicazione: (2026)
di: Tan, Difan, et al.
Pubblicazione: (2026)
PROSERVE: Unified Multi-Priority Request Scheduling for LLM Serving
di: Huang, Weizhe, et al.
Pubblicazione: (2025)
di: Huang, Weizhe, et al.
Pubblicazione: (2025)
Telepathic Datacenters: Fast RPCs using Shared CXL Memory
di: Mahar, Suyash, et al.
Pubblicazione: (2024)
di: Mahar, Suyash, et al.
Pubblicazione: (2024)
TrEnv-X: Transparently Share Serverless Execution Environments Across Different Functions and Nodes
di: Huang, Jialiang, et al.
Pubblicazione: (2025)
di: Huang, Jialiang, et al.
Pubblicazione: (2025)
DPC: A Distributed Page Cache over CXL
di: Bergman, Shai, et al.
Pubblicazione: (2026)
di: Bergman, Shai, et al.
Pubblicazione: (2026)
Mercury: QoS-Aware Tiered Memory System
di: Lu, Jiaheng, et al.
Pubblicazione: (2024)
di: Lu, Jiaheng, et al.
Pubblicazione: (2024)
Nexus: Transparent I/O Offloading for High-Density Serverless Computing
di: Park, JooYoung, et al.
Pubblicazione: (2026)
di: Park, JooYoung, et al.
Pubblicazione: (2026)
FALCON: Pinpointing and Mitigating Stragglers for Large-Scale Hybrid-Parallel Training
di: Wu, Tianyuan, et al.
Pubblicazione: (2024)
di: Wu, Tianyuan, et al.
Pubblicazione: (2024)
Affinity Tailor: Dynamic Locality-Aware Scheduling at Scale
di: Ng, Jin Xin, et al.
Pubblicazione: (2026)
di: Ng, Jin Xin, et al.
Pubblicazione: (2026)
Equinox: Decentralized Scheduling for Hardware-Aware Orbital Intelligence
di: Erol, Ansel Kaplan, et al.
Pubblicazione: (2026)
di: Erol, Ansel Kaplan, et al.
Pubblicazione: (2026)
Unlocking True Elasticity for the Cloud-Native Era with Dandelion
di: Kuchler, Tom, et al.
Pubblicazione: (2025)
di: Kuchler, Tom, et al.
Pubblicazione: (2025)
Space Filling Curves is All You Need: Communication-Avoiding Matrix Multiplication Made Simple
di: Georganas, Evangelos, et al.
Pubblicazione: (2026)
di: Georganas, Evangelos, et al.
Pubblicazione: (2026)
EdgeFlow: Fast Cold Starts for LLMs on Mobile Devices
di: Yan, Yongsheng, et al.
Pubblicazione: (2026)
di: Yan, Yongsheng, et al.
Pubblicazione: (2026)
A Periodic Space of Distributed Computing: Vision & Framework
di: Salehi, Mohsen Amini, et al.
Pubblicazione: (2026)
di: Salehi, Mohsen Amini, et al.
Pubblicazione: (2026)
Formal Definitions and Performance Comparison of Consistency Models for Parallel File Systems
di: Wang, Chen, et al.
Pubblicazione: (2024)
di: Wang, Chen, et al.
Pubblicazione: (2024)
Mewz: Lightweight Execution Environment for WebAssembly with High Isolation and Portability using Unikernels
di: Ueda, Soichiro, et al.
Pubblicazione: (2024)
di: Ueda, Soichiro, et al.
Pubblicazione: (2024)
Taming Serverless Cold Starts Through OS Co-Design
di: Holmes, Ben, et al.
Pubblicazione: (2025)
di: Holmes, Ben, et al.
Pubblicazione: (2025)
Fix: externalizing network I/O in serverless computing
di: Deng, Yuhan, et al.
Pubblicazione: (2025)
di: Deng, Yuhan, et al.
Pubblicazione: (2025)
RAGDoll: Efficient Offloading-based Online RAG System on a Single GPU
di: Yu, Weiping, et al.
Pubblicazione: (2025)
di: Yu, Weiping, et al.
Pubblicazione: (2025)
Performance Isolation and Semantic Determinism in Efficient GPU Spatial Sharing
di: Yang, Zhenyuan, et al.
Pubblicazione: (2026)
di: Yang, Zhenyuan, et al.
Pubblicazione: (2026)
Equilibria: Fair Multi-Tenant CXL Memory Tiering At Scale
di: Zhao, Kaiyang, et al.
Pubblicazione: (2026)
di: Zhao, Kaiyang, et al.
Pubblicazione: (2026)
CvxCluster: Solving Large, Complex, Granular Resource Allocation Problems 100-1000x Faster
di: Nnorom Jr, Obi, et al.
Pubblicazione: (2026)
di: Nnorom Jr, Obi, et al.
Pubblicazione: (2026)
Agent Centric Operating System -- a Comprehensive Review and Outlook for Operating System
di: Jia, Shian, et al.
Pubblicazione: (2024)
di: Jia, Shian, et al.
Pubblicazione: (2024)
GPUOS: A GPU Operating System Primitive for Transparent Operation Fusion
di: Yang, Yiwei, et al.
Pubblicazione: (2026)
di: Yang, Yiwei, et al.
Pubblicazione: (2026)
"Range as a Key" is the Key! Fast and Compact Cloud Block Store Index with RASK
di: Zhao, Haoru, et al.
Pubblicazione: (2026)
di: Zhao, Haoru, et al.
Pubblicazione: (2026)
LEFT-RS: A Lock-Free Fault-Tolerant Resource Sharing Protocol for Multicore Real-Time Systems
di: Chen, Nan, et al.
Pubblicazione: (2025)
di: Chen, Nan, et al.
Pubblicazione: (2025)
Funky: Cloud-Native FPGA Virtualization and Orchestration
di: Koshiba, Atsushi, et al.
Pubblicazione: (2025)
di: Koshiba, Atsushi, et al.
Pubblicazione: (2025)
Rethinking Inter-Process Communication with Memory Operation Offloading
di: Park, Misun, et al.
Pubblicazione: (2026)
di: Park, Misun, et al.
Pubblicazione: (2026)
Why iCloud Fails: The Category Mistake of Cloud Synchronization
di: Borrill, Paul
Pubblicazione: (2026)
di: Borrill, Paul
Pubblicazione: (2026)
Documenti analoghi
-
BLITZSCALE: Fast and Live Large Model Autoscaling with O(1) Host Caching
di: Zhang, Dingyan, et al.
Pubblicazione: (2024) -
KVCache Cache in the Wild: Characterizing and Optimizing KVCache Cache at a Large Cloud Provider
di: Wang, Jiahao, et al.
Pubblicazione: (2025) -
PhoenixOS: Concurrent OS-level GPU Checkpoint and Restore with Validated Speculation
di: Wei, Xingda, et al.
Pubblicazione: (2024) -
Ensuring Data Freshness in Multi-Rate Task Chains Scheduling
di: Hoffmann, José Luis Conradi, et al.
Pubblicazione: (2026) -
Mitigating context switching in densely packed Linux clusters with Latency-Aware Group Scheduling
di: Isstaif, Al Amjad Tawfiq, et al.
Pubblicazione: (2025)