Towards Fast Setup and High Throughput of GPU Serverless Computing
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhao, Han, Cui, Weihao, Chen, Quan, Zhang, Shulai, Li, Zijun, Leng, Jingwen, Li, Chao, Zeng, Deze, Guo, Minyi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Towards Resource-Efficient Serverless LLM Inference with SLINFER
di: Xu, Chuhao, et al.
Pubblicazione: (2025)
di: Xu, Chuhao, et al.
Pubblicazione: (2025)
MuxTune: Efficient Multi-Task LLM Fine-Tuning in Multi-Tenant Datacenters via Spatial-Temporal Backbone Multiplexing
di: Xue, Chunyu, et al.
Pubblicazione: (2026)
di: Xue, Chunyu, et al.
Pubblicazione: (2026)
Accelerating Sparse DNNs Based on Tiled GEMM
di: Guo, Cong, et al.
Pubblicazione: (2024)
di: Guo, Cong, et al.
Pubblicazione: (2024)
Towards Compute-Aware In-Switch Computing for LLMs Tensor-Parallelism on Multi-GPU Systems
di: Zhang, Chen, et al.
Pubblicazione: (2026)
di: Zhang, Chen, et al.
Pubblicazione: (2026)
Harli: SLO-Aware Co-location of LLM Inference and PEFT-based Finetuning on Model-as-a-Service Platforms
di: Xu, Ao, et al.
Pubblicazione: (2025)
di: Xu, Ao, et al.
Pubblicazione: (2025)
Torpor: GPU-Enabled Serverless Computing for Low-Latency, Resource-Efficient Inference
di: Yu, Minchen, et al.
Pubblicazione: (2023)
di: Yu, Minchen, et al.
Pubblicazione: (2023)
VQ-LLM: High-performance Code Generation for Vector Quantization Augmented LLM Inference
di: Liu, Zihan, et al.
Pubblicazione: (2025)
di: Liu, Zihan, et al.
Pubblicazione: (2025)
GMLake: Efficient and Transparent GPU Memory Defragmentation for Large-scale DNN Training with Virtual Memory Stitching
di: Guo, Cong, et al.
Pubblicazione: (2024)
di: Guo, Cong, et al.
Pubblicazione: (2024)
FaaSTube: Optimizing GPU-oriented Data Transfer for Serverless Computing
di: Wu, Hao, et al.
Pubblicazione: (2024)
di: Wu, Hao, et al.
Pubblicazione: (2024)
GoodServe: Towards High-Goodput Serving of Agentic LLM Inferences over Heterogeneous Resources
di: Du, Boxiao, et al.
Pubblicazione: (2026)
di: Du, Boxiao, et al.
Pubblicazione: (2026)
Arena: Efficiently Training Large Models via Dynamic Scheduling and Adaptive Parallelism Co-Design
di: Xue, Chunyu, et al.
Pubblicazione: (2024)
di: Xue, Chunyu, et al.
Pubblicazione: (2024)
Making Serverless Computing Extensible: A Case Study of Serverless Data Analytics
di: Yu, Minchen, et al.
Pubblicazione: (2025)
di: Yu, Minchen, et al.
Pubblicazione: (2025)
DASH: Deterministic Attention Scheduling for High-throughput Reproducible LLM Training
di: Qiang, Xinwei, et al.
Pubblicazione: (2026)
di: Qiang, Xinwei, et al.
Pubblicazione: (2026)
Towards Energy-Efficient Serverless Computing with Hardware Isolation
di: Carl, Natalie, et al.
Pubblicazione: (2025)
di: Carl, Natalie, et al.
Pubblicazione: (2025)
Shoal++: High Throughput DAG BFT Can Be Fast!
di: Arun, Balaji, et al.
Pubblicazione: (2024)
di: Arun, Balaji, et al.
Pubblicazione: (2024)
Towards Seamless Serverless Computing Across an Edge-Cloud Continuum
di: Simion, Emilian, et al.
Pubblicazione: (2024)
di: Simion, Emilian, et al.
Pubblicazione: (2024)
Frenzy: A Memory-Aware Serverless LLM Training System for Heterogeneous GPU Clusters
di: Chang, Zihan, et al.
Pubblicazione: (2024)
di: Chang, Zihan, et al.
Pubblicazione: (2024)
InfiniLoRA: Disaggregated Multi-LoRA Serving for Large Language Models
di: Chen, Hongyu, et al.
Pubblicazione: (2026)
di: Chen, Hongyu, et al.
Pubblicazione: (2026)
FlowWalker: A Memory-efficient and High-performance GPU-based Dynamic Graph Random Walk Framework
di: Mei, Junyi, et al.
Pubblicazione: (2024)
di: Mei, Junyi, et al.
Pubblicazione: (2024)
FlashFuser: Expanding the Scale of Kernel Fusion for Compute-Intensive Operators via Inter-Core Connection
di: Huang, Ziyu, et al.
Pubblicazione: (2025)
di: Huang, Ziyu, et al.
Pubblicazione: (2025)
HotSwap: Enabling Live Dependency Sharing in Serverless Computing
di: Li, Rui, et al.
Pubblicazione: (2024)
di: Li, Rui, et al.
Pubblicazione: (2024)
PipeBoost: Resilient Pipelined Architecture for Fast Serverless LLM Scaling
di: Liu, Chongpeng, et al.
Pubblicazione: (2025)
di: Liu, Chongpeng, et al.
Pubblicazione: (2025)
HAS-GPU: Efficient Hybrid Auto-scaling with Fine-grained GPU Allocation for SLO-aware Serverless Inferences
di: Gu, Jianfeng, et al.
Pubblicazione: (2025)
di: Gu, Jianfeng, et al.
Pubblicazione: (2025)
Kairos: Low-latency Multi-Agent Serving with Shared LLMs and Excessive Loads in the Public Cloud
di: Chen, Jinyuan, et al.
Pubblicazione: (2025)
di: Chen, Jinyuan, et al.
Pubblicazione: (2025)
Multi-Event Triggers for Serverless Computing
di: Carl, Natalie, et al.
Pubblicazione: (2025)
di: Carl, Natalie, et al.
Pubblicazione: (2025)
Litmus: Fair Pricing for Serverless Computing
di: Pei, Qi, et al.
Pubblicazione: (2024)
di: Pei, Qi, et al.
Pubblicazione: (2024)
Serverless Computing: Architecture, Concepts, and Applications
di: Ghorbian, Mohsen, et al.
Pubblicazione: (2025)
di: Ghorbian, Mohsen, et al.
Pubblicazione: (2025)
OTAS: An Elastic Transformer Serving System via Token Adaptation
di: Chen, Jinyu, et al.
Pubblicazione: (2024)
di: Chen, Jinyu, et al.
Pubblicazione: (2024)
EcoLife: Carbon-Aware Serverless Function Scheduling for Sustainable Computing
di: Jiang, Yankai, et al.
Pubblicazione: (2024)
di: Jiang, Yankai, et al.
Pubblicazione: (2024)
Dilu: Enabling GPU Resourcing-on-Demand for Serverless DL Serving via Introspective Elasticity
di: Lv, Cunchi, et al.
Pubblicazione: (2025)
di: Lv, Cunchi, et al.
Pubblicazione: (2025)
FaasMeter: Energy-First Serverless Computing
di: Rehman, Abdul, et al.
Pubblicazione: (2024)
di: Rehman, Abdul, et al.
Pubblicazione: (2024)
Caching Aided Multi-Tenant Serverless Computing
di: Qiao, Chu, et al.
Pubblicazione: (2024)
di: Qiao, Chu, et al.
Pubblicazione: (2024)
Software Resource Disaggregation for HPC with Serverless Computing
di: Copik, Marcin, et al.
Pubblicazione: (2024)
di: Copik, Marcin, et al.
Pubblicazione: (2024)
Cicada: A Pipeline-Efficient Approach to Serverless Inference with Decoupled Management
di: Wu, Z., et al.
Pubblicazione: (2025)
di: Wu, Z., et al.
Pubblicazione: (2025)
Optimizing STAR Aligner for High Throughput Computing in the Cloud
di: Kica, Piotr, et al.
Pubblicazione: (2024)
di: Kica, Piotr, et al.
Pubblicazione: (2024)
GreenWhisk: Emission-Aware Computing for Serverless Platform
di: Serenari, Jayden, et al.
Pubblicazione: (2024)
di: Serenari, Jayden, et al.
Pubblicazione: (2024)
Towards Scalable GPU-Accelerated SNN Training via Temporal Fusion
di: Li, Yanchen, et al.
Pubblicazione: (2024)
di: Li, Yanchen, et al.
Pubblicazione: (2024)
Tangram: High-resolution Video Analytics on Serverless Platform with SLO-aware Batching
di: Peng, Haosong, et al.
Pubblicazione: (2024)
di: Peng, Haosong, et al.
Pubblicazione: (2024)
Cost-Performance Analysis: A Comparative Study of CPU-Based Serverless and GPU-Based Training Architectures
di: Barrak, Amine, et al.
Pubblicazione: (2025)
di: Barrak, Amine, et al.
Pubblicazione: (2025)
ICPS: Real-Time Resource Configuration for Cloud Serverless Functions Considering Affinity
di: Chen, Long, et al.
Pubblicazione: (2025)
di: Chen, Long, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Towards Resource-Efficient Serverless LLM Inference with SLINFER
di: Xu, Chuhao, et al.
Pubblicazione: (2025) -
MuxTune: Efficient Multi-Task LLM Fine-Tuning in Multi-Tenant Datacenters via Spatial-Temporal Backbone Multiplexing
di: Xue, Chunyu, et al.
Pubblicazione: (2026) -
Accelerating Sparse DNNs Based on Tiled GEMM
di: Guo, Cong, et al.
Pubblicazione: (2024) -
Towards Compute-Aware In-Switch Computing for LLMs Tensor-Parallelism on Multi-GPU Systems
di: Zhang, Chen, et al.
Pubblicazione: (2026) -
Harli: SLO-Aware Co-location of LLM Inference and PEFT-based Finetuning on Model-as-a-Service Platforms
di: Xu, Ao, et al.
Pubblicazione: (2025)