MUSE: Multi-Tenant Model Serving With Seamless Model Updates
Fuente:
arXiv
Salvato in:
| Autori principali: | Correia, Cláudio, Ferreira, Alberto E. A., Martins, Lucas, Bento, Miguel P., Guerreiro, Sofia, Pereira, Ricardo Ribeiro, Gomes, Ana Sofia, Bono, Jacopo, Ferreira, Hugo, Bizarro, Pedro |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Enabling Seamless Data Security, Consensus, and Trading in Vehicular Networks
di: Vieira, Emanuel, et al.
Pubblicazione: (2024)
di: Vieira, Emanuel, et al.
Pubblicazione: (2024)
FaaSMoE: A Serverless Framework for Multi-Tenant Mixture-of-Experts Serving
di: Wang, Minghe, et al.
Pubblicazione: (2026)
di: Wang, Minghe, et al.
Pubblicazione: (2026)
Caching Aided Multi-Tenant Serverless Computing
di: Qiao, Chu, et al.
Pubblicazione: (2024)
di: Qiao, Chu, et al.
Pubblicazione: (2024)
DeepServe: Serverless Large Language Model Serving at Scale
di: Hu, Junhao, et al.
Pubblicazione: (2025)
di: Hu, Junhao, et al.
Pubblicazione: (2025)
Guardian: Safe GPU Sharing in Multi-Tenant Environments
di: Pavlidakis, Manos, et al.
Pubblicazione: (2024)
di: Pavlidakis, Manos, et al.
Pubblicazione: (2024)
DiffServe: Efficiently Serving Text-to-Image Diffusion Models with Query-Aware Model Scaling
di: Ahmad, Sohaib, et al.
Pubblicazione: (2024)
di: Ahmad, Sohaib, et al.
Pubblicazione: (2024)
ServeGen: Workload Characterization and Generation of Large Language Model Serving in Production
di: Xiang, Yuxing, et al.
Pubblicazione: (2025)
di: Xiang, Yuxing, et al.
Pubblicazione: (2025)
DistServe: Disaggregating Prefill and Decoding for Goodput-optimized Large Language Model Serving
di: Zhong, Yinmin, et al.
Pubblicazione: (2024)
di: Zhong, Yinmin, et al.
Pubblicazione: (2024)
The National Research Platform: Stretched, Multi-Tenant, Scientific Kubernetes Cluster
di: Weitzel, Derek, et al.
Pubblicazione: (2025)
di: Weitzel, Derek, et al.
Pubblicazione: (2025)
Trabant: A Serverless Architecture for Multi-Tenant Orbital Edge Computing
di: Pfandzelter, Tobias, et al.
Pubblicazione: (2025)
di: Pfandzelter, Tobias, et al.
Pubblicazione: (2025)
Enabling Seamless Transitions from Experimental to Production HPC for Interactive Workflows
di: Etz, Brian D., et al.
Pubblicazione: (2025)
di: Etz, Brian D., et al.
Pubblicazione: (2025)
Enabling Elastic Model Serving with MultiWorld
di: Lee, Myungjin, et al.
Pubblicazione: (2024)
di: Lee, Myungjin, et al.
Pubblicazione: (2024)
Autobahn: Seamless high speed BFT
di: Giridharan, Neil, et al.
Pubblicazione: (2024)
di: Giridharan, Neil, et al.
Pubblicazione: (2024)
A Reinforcement Learning-Driven Task Scheduling Algorithm for Multi-Tenant Distributed Systems
di: Zhang, Xiaopei, et al.
Pubblicazione: (2025)
di: Zhang, Xiaopei, et al.
Pubblicazione: (2025)
MixServe: An Automatic Distributed Serving System for MoE Models with Hybrid Parallelism Based on Fused Communication Algorithm
di: Zhou, Bowen, et al.
Pubblicazione: (2026)
di: Zhou, Bowen, et al.
Pubblicazione: (2026)
MoLink: Distributed and Efficient Serving Framework for Large Models
di: Jin, Lewei, et al.
Pubblicazione: (2025)
di: Jin, Lewei, et al.
Pubblicazione: (2025)
Cascadia: An Efficient Cascade Serving System for Large Language Models
di: Jiang, Youhe, et al.
Pubblicazione: (2025)
di: Jiang, Youhe, et al.
Pubblicazione: (2025)
GENSERVE: Efficient Co-Serving of Heterogeneous Diffusion Model Workloads
di: Ye, Fanjiang, et al.
Pubblicazione: (2026)
di: Ye, Fanjiang, et al.
Pubblicazione: (2026)
Communication-Efficient Serving for Video Diffusion Models with Latent Parallelism
di: Wu, Zhiyuan, et al.
Pubblicazione: (2025)
di: Wu, Zhiyuan, et al.
Pubblicazione: (2025)
DDiT: Dynamic Resource Allocation for Diffusion Transformer Model Serving
di: Huang, Heyang, et al.
Pubblicazione: (2025)
di: Huang, Heyang, et al.
Pubblicazione: (2025)
Scheduling Deep Learning Jobs in Multi-Tenant GPU Clusters via Wise Resource Sharing
di: Luo, Yizhou, et al.
Pubblicazione: (2024)
di: Luo, Yizhou, et al.
Pubblicazione: (2024)
Aragog: Just-in-Time Model Routing for Scalable Serving of Agentic Workflows
di: Dai, Yinwei, et al.
Pubblicazione: (2025)
di: Dai, Yinwei, et al.
Pubblicazione: (2025)
NanoFlow: Towards Optimal Large Language Model Serving Throughput
di: Zhu, Kan, et al.
Pubblicazione: (2024)
di: Zhu, Kan, et al.
Pubblicazione: (2024)
Strata: Hierarchical Context Caching for Long Context Language Model Serving
di: Xie, Zhiqiang, et al.
Pubblicazione: (2025)
di: Xie, Zhiqiang, et al.
Pubblicazione: (2025)
FLYING SERVING: On-the-Fly Parallelism Switching for Large Language Model Serving
di: Gao, Shouwei, et al.
Pubblicazione: (2026)
di: Gao, Shouwei, et al.
Pubblicazione: (2026)
EdgeLoRA: An Efficient Multi-Tenant LLM Serving System on Edge Devices
di: Shen, Zheyu, et al.
Pubblicazione: (2025)
di: Shen, Zheyu, et al.
Pubblicazione: (2025)
OCTOPINF: Workload-Aware Inference Serving for Edge Video Analytics
di: Nguyen, Thanh-Tung, et al.
Pubblicazione: (2025)
di: Nguyen, Thanh-Tung, et al.
Pubblicazione: (2025)
Multi Armed Bandit Algorithms Based Virtual Machine Allocation Policy for Security in Multi-Tenant Distributed Systems
di: Patil, Pravin, et al.
Pubblicazione: (2024)
di: Patil, Pravin, et al.
Pubblicazione: (2024)
HADIS: Hybrid Adaptive Diffusion Model Serving for Efficient Text-to-Image Generation
di: Yang, Qizheng, et al.
Pubblicazione: (2025)
di: Yang, Qizheng, et al.
Pubblicazione: (2025)
MoDM: Efficient Serving for Image Generation via Mixture-of-Diffusion Models
di: Xia, Yuchen, et al.
Pubblicazione: (2025)
di: Xia, Yuchen, et al.
Pubblicazione: (2025)
HydraInfer: Hybrid Disaggregated Scheduling for Multimodal Large Language Model Serving
di: Dong, Xianzhe, et al.
Pubblicazione: (2025)
di: Dong, Xianzhe, et al.
Pubblicazione: (2025)
BlockLLM: Multi-tenant Finer-grained Serving for Large Language Models
di: Hu, Bodun, et al.
Pubblicazione: (2024)
di: Hu, Bodun, et al.
Pubblicazione: (2024)
SneakPeek: Data-Aware Model Selection and Scheduling for Inference Serving on the Edge
di: Wolfrath, Joel, et al.
Pubblicazione: (2025)
di: Wolfrath, Joel, et al.
Pubblicazione: (2025)
FailLite: Failure-Resilient Model Serving for Resource-Constrained Edge Environments
di: Wu, Li, et al.
Pubblicazione: (2025)
di: Wu, Li, et al.
Pubblicazione: (2025)
vLLM-Omni: Fully Disaggregated Serving for Any-to-Any Multimodal Models
di: Yin, Peiqi, et al.
Pubblicazione: (2026)
di: Yin, Peiqi, et al.
Pubblicazione: (2026)
Collaborative Processing for Multi-Tenant Inference on Memory-Constrained Edge TPUs
di: Ng, Nathan, et al.
Pubblicazione: (2026)
di: Ng, Nathan, et al.
Pubblicazione: (2026)
Delta Fair Sharing: Performance Isolation for Multi-Tenant Storage Systems
di: Griggs, Tyler, et al.
Pubblicazione: (2026)
di: Griggs, Tyler, et al.
Pubblicazione: (2026)
Seamless Transitions: A Comprehensive Review of Live Migration Technologies
di: Attar-Khorasani, Sima, et al.
Pubblicazione: (2025)
di: Attar-Khorasani, Sima, et al.
Pubblicazione: (2025)
Towards Seamless Serverless Computing Across an Edge-Cloud Continuum
di: Simion, Emilian, et al.
Pubblicazione: (2024)
di: Simion, Emilian, et al.
Pubblicazione: (2024)
EdgeServing: Deadline-Aware Multi-DNN Serving at the Edge
di: Cao, Jiahe, et al.
Pubblicazione: (2026)
di: Cao, Jiahe, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Enabling Seamless Data Security, Consensus, and Trading in Vehicular Networks
di: Vieira, Emanuel, et al.
Pubblicazione: (2024) -
FaaSMoE: A Serverless Framework for Multi-Tenant Mixture-of-Experts Serving
di: Wang, Minghe, et al.
Pubblicazione: (2026) -
Caching Aided Multi-Tenant Serverless Computing
di: Qiao, Chu, et al.
Pubblicazione: (2024) -
DeepServe: Serverless Large Language Model Serving at Scale
di: Hu, Junhao, et al.
Pubblicazione: (2025) -
Guardian: Safe GPU Sharing in Multi-Tenant Environments
di: Pavlidakis, Manos, et al.
Pubblicazione: (2024)