Enregistré dans:
| Auteurs principaux: | Ye, Zihao, Chen, Lequn, Lai, Ruihang, Lin, Wuwei, Zhang, Yineng, Wang, Stephanie, Chen, Tianqi, Kasikci, Baris, Grover, Vinod, Krishnamurthy, Arvind, Ceze, Luis |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2501.01005 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
FlashInfer-Bench: Building the Virtuous Cycle for AI-driven LLM Systems
par: Xing, Shanli, et autres
Publié: (2026)
par: Xing, Shanli, et autres
Publié: (2026)
Atom: Low-bit Quantization for Efficient and Accurate LLM Serving
par: Zhao, Yilong, et autres
Publié: (2023)
par: Zhao, Yilong, et autres
Publié: (2023)
PolyServe: Efficient Multi-SLO Serving at Scale
par: Zhu, Kan, et autres
Publié: (2025)
par: Zhu, Kan, et autres
Publié: (2025)
VoxServe: Streaming-Centric Serving System for Speech Language Models
par: Kamahori, Keisuke, et autres
Publié: (2026)
par: Kamahori, Keisuke, et autres
Publié: (2026)
TeleRAG: Efficient Retrieval-Augmented Generation Inference with Lookahead Retrieval
par: Lin, Chien-Yu, et autres
Publié: (2025)
par: Lin, Chien-Yu, et autres
Publié: (2025)
Symphony: Optimized DNN Model Serving using Deferred Batch Scheduling
par: Chen, Lequn, et autres
Publié: (2023)
par: Chen, Lequn, et autres
Publié: (2023)
VibeServe: Can AI Agents Build Bespoke LLM Serving Systems?
par: Kamahori, Keisuke, et autres
Publié: (2026)
par: Kamahori, Keisuke, et autres
Publié: (2026)
NanoFlow: Towards Optimal Large Language Model Serving Throughput
par: Zhu, Kan, et autres
Publié: (2024)
par: Zhu, Kan, et autres
Publié: (2024)
SLOs-Serve: Optimized Serving of Multi-SLO LLMs
par: Chen, Siyuan, et autres
Publié: (2025)
par: Chen, Siyuan, et autres
Publié: (2025)
Cortex: Workflow-Aware Resource Pooling and Scheduling for Agentic Serving
par: Pagonas, Nikos, et autres
Publié: (2025)
par: Pagonas, Nikos, et autres
Publié: (2025)
Fiddler: CPU-GPU Orchestration for Fast Inference of Mixture-of-Experts Models
par: Kamahori, Keisuke, et autres
Publié: (2024)
par: Kamahori, Keisuke, et autres
Publié: (2024)
PackInfer: Compute- and I/O-Efficient Attention for Batched LLM Inference
par: Ning, Rui, et autres
Publié: (2026)
par: Ning, Rui, et autres
Publié: (2026)
TENT: A Declarative Slice Spraying Engine for Performant and Resilient Data Movement in Disaggregated LLM Serving
par: Ren, Feng, et autres
Publié: (2026)
par: Ren, Feng, et autres
Publié: (2026)
Fake Runs, Real Fixes -- Analyzing xPU Performance Through Simulation
par: Zarkadas, Ioannis, et autres
Publié: (2025)
par: Zarkadas, Ioannis, et autres
Publié: (2025)
Axe: A Simple Unified Layout Abstraction for Machine Learning Compilers
par: Hou, Bohan, et autres
Publié: (2026)
par: Hou, Bohan, et autres
Publié: (2026)
A System for Microserving of LLMs
par: Jin, Hongyi, et autres
Publié: (2024)
par: Jin, Hongyi, et autres
Publié: (2024)
Unleashing Scalable Context Parallelism for Foundation Models Pre-Training via FCP
par: Zhao, Yilong, et autres
Publié: (2026)
par: Zhao, Yilong, et autres
Publié: (2026)
GENSERVE: Efficient Co-Serving of Heterogeneous Diffusion Model Workloads
par: Ye, Fanjiang, et autres
Publié: (2026)
par: Ye, Fanjiang, et autres
Publié: (2026)
fabric-lib: RDMA Point-to-Point Communication for LLM Systems
par: Licker, Nandor, et autres
Publié: (2025)
par: Licker, Nandor, et autres
Publié: (2025)
Magneton: Optimizing Energy Efficiency of ML Systems via Differential Energy Debugging
par: Pan, Yi, et autres
Publié: (2025)
par: Pan, Yi, et autres
Publié: (2025)
Scaling Deep Learning Training with MPMD Pipeline Parallelism
par: Xhebraj, Anxhelo, et autres
Publié: (2024)
par: Xhebraj, Anxhelo, et autres
Publié: (2024)
DynaFlow: Transparent and Flexible Intra-Device Parallelism via Programmable Operator Scheduling
par: Pan, Yi, et autres
Publié: (2026)
par: Pan, Yi, et autres
Publié: (2026)
Event Tensor: A Unified Abstraction for Compiling Dynamic Megakernel
par: Jin, Hongyi, et autres
Publié: (2026)
par: Jin, Hongyi, et autres
Publié: (2026)
Is Flash Attention Stable?
par: Golden, Alicia, et autres
Publié: (2024)
par: Golden, Alicia, et autres
Publié: (2024)
GoodServe: Towards High-Goodput Serving of Agentic LLM Inferences over Heterogeneous Resources
par: Du, Boxiao, et autres
Publié: (2026)
par: Du, Boxiao, et autres
Publié: (2026)
SpecInfer: Accelerating Generative Large Language Model Serving with Tree-based Speculative Inference and Verification
par: Miao, Xupeng, et autres
Publié: (2023)
par: Miao, Xupeng, et autres
Publié: (2023)
KunServe: Parameter-centric Memory Management for Efficient Memory Overloading Handling in LLM Serving
par: Cheng, Rongxin, et autres
Publié: (2024)
par: Cheng, Rongxin, et autres
Publié: (2024)
OmniInfer: System-Wide Acceleration Techniques for Optimizing LLM Serving Throughput and Latency
par: Wang, Jun, et autres
Publié: (2025)
par: Wang, Jun, et autres
Publié: (2025)
CALVO: Improve Serving Efficiency for LLM Inferences with Intense Network Demands
par: Wang, Weiye, et autres
Publié: (2026)
par: Wang, Weiye, et autres
Publié: (2026)
CaraServe: CPU-Assisted and Rank-Aware LoRA Serving for Generative LLM Inference
par: Li, Suyi, et autres
Publié: (2024)
par: Li, Suyi, et autres
Publié: (2024)
ConsumerBench: Benchmarking Generative AI Applications on End-User Devices
par: Gu, Yile, et autres
Publié: (2025)
par: Gu, Yile, et autres
Publié: (2025)
HydraInfer: Hybrid Disaggregated Scheduling for Multimodal Large Language Model Serving
par: Dong, Xianzhe, et autres
Publié: (2025)
par: Dong, Xianzhe, et autres
Publié: (2025)
Autellix: An Efficient Serving Engine for LLM Agents as General Programs
par: Luo, Michael, et autres
Publié: (2025)
par: Luo, Michael, et autres
Publié: (2025)
Argos: Agentic Time-Series Anomaly Detection with Autonomous Rule Generation via Large Language Models
par: Gu, Yile, et autres
Publié: (2025)
par: Gu, Yile, et autres
Publié: (2025)
S-HPLB: Efficient LLM Attention Serving via Sparsity-Aware Head Parallelism Load Balance
par: Liu, Di, et autres
Publié: (2026)
par: Liu, Di, et autres
Publié: (2026)
Fail Fast, Win Big: Rethinking the Drafting Strategy in Speculative Decoding via Diffusion LLMs
par: Pan, Rui, et autres
Publié: (2025)
par: Pan, Rui, et autres
Publié: (2025)
Locality-aware Fair Scheduling in LLM Serving
par: Cao, Shiyi, et autres
Publié: (2025)
par: Cao, Shiyi, et autres
Publié: (2025)
CascadeInfer: Length-Aware Scheduling of LLM Serving with Low Latency and Load Balancing
par: Yuan, Yitao, et autres
Publié: (2025)
par: Yuan, Yitao, et autres
Publié: (2025)
CascadeServe: Unlocking Model Cascades for Inference Serving
par: Kossmann, Ferdi, et autres
Publié: (2024)
par: Kossmann, Ferdi, et autres
Publié: (2024)
EPD-Serve: A Flexible Multimodal EPD Disaggregation Inference Serving System On Ascend
par: Bai, Fan, et autres
Publié: (2026)
par: Bai, Fan, et autres
Publié: (2026)
Documents similaires
-
FlashInfer-Bench: Building the Virtuous Cycle for AI-driven LLM Systems
par: Xing, Shanli, et autres
Publié: (2026) -
Atom: Low-bit Quantization for Efficient and Accurate LLM Serving
par: Zhao, Yilong, et autres
Publié: (2023) -
PolyServe: Efficient Multi-SLO Serving at Scale
par: Zhu, Kan, et autres
Publié: (2025) -
VoxServe: Streaming-Centric Serving System for Speech Language Models
par: Kamahori, Keisuke, et autres
Publié: (2026) -
TeleRAG: Efficient Retrieval-Augmented Generation Inference with Lookahead Retrieval
par: Lin, Chien-Yu, et autres
Publié: (2025)