MUSE: Multi-Tenant Model Serving With Seamless Model Updates
Fuente:
arXiv
Guardado en:
| Autores principales: | Correia, Cláudio, Ferreira, Alberto E. A., Martins, Lucas, Bento, Miguel P., Guerreiro, Sofia, Pereira, Ricardo Ribeiro, Gomes, Ana Sofia, Bono, Jacopo, Ferreira, Hugo, Bizarro, Pedro |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Enabling Seamless Data Security, Consensus, and Trading in Vehicular Networks
por: Vieira, Emanuel, et al.
Publicado: (2024)
por: Vieira, Emanuel, et al.
Publicado: (2024)
FaaSMoE: A Serverless Framework for Multi-Tenant Mixture-of-Experts Serving
por: Wang, Minghe, et al.
Publicado: (2026)
por: Wang, Minghe, et al.
Publicado: (2026)
Caching Aided Multi-Tenant Serverless Computing
por: Qiao, Chu, et al.
Publicado: (2024)
por: Qiao, Chu, et al.
Publicado: (2024)
DeepServe: Serverless Large Language Model Serving at Scale
por: Hu, Junhao, et al.
Publicado: (2025)
por: Hu, Junhao, et al.
Publicado: (2025)
Guardian: Safe GPU Sharing in Multi-Tenant Environments
por: Pavlidakis, Manos, et al.
Publicado: (2024)
por: Pavlidakis, Manos, et al.
Publicado: (2024)
DiffServe: Efficiently Serving Text-to-Image Diffusion Models with Query-Aware Model Scaling
por: Ahmad, Sohaib, et al.
Publicado: (2024)
por: Ahmad, Sohaib, et al.
Publicado: (2024)
ServeGen: Workload Characterization and Generation of Large Language Model Serving in Production
por: Xiang, Yuxing, et al.
Publicado: (2025)
por: Xiang, Yuxing, et al.
Publicado: (2025)
DistServe: Disaggregating Prefill and Decoding for Goodput-optimized Large Language Model Serving
por: Zhong, Yinmin, et al.
Publicado: (2024)
por: Zhong, Yinmin, et al.
Publicado: (2024)
The National Research Platform: Stretched, Multi-Tenant, Scientific Kubernetes Cluster
por: Weitzel, Derek, et al.
Publicado: (2025)
por: Weitzel, Derek, et al.
Publicado: (2025)
Trabant: A Serverless Architecture for Multi-Tenant Orbital Edge Computing
por: Pfandzelter, Tobias, et al.
Publicado: (2025)
por: Pfandzelter, Tobias, et al.
Publicado: (2025)
Enabling Seamless Transitions from Experimental to Production HPC for Interactive Workflows
por: Etz, Brian D., et al.
Publicado: (2025)
por: Etz, Brian D., et al.
Publicado: (2025)
Enabling Elastic Model Serving with MultiWorld
por: Lee, Myungjin, et al.
Publicado: (2024)
por: Lee, Myungjin, et al.
Publicado: (2024)
Autobahn: Seamless high speed BFT
por: Giridharan, Neil, et al.
Publicado: (2024)
por: Giridharan, Neil, et al.
Publicado: (2024)
A Reinforcement Learning-Driven Task Scheduling Algorithm for Multi-Tenant Distributed Systems
por: Zhang, Xiaopei, et al.
Publicado: (2025)
por: Zhang, Xiaopei, et al.
Publicado: (2025)
MixServe: An Automatic Distributed Serving System for MoE Models with Hybrid Parallelism Based on Fused Communication Algorithm
por: Zhou, Bowen, et al.
Publicado: (2026)
por: Zhou, Bowen, et al.
Publicado: (2026)
MoLink: Distributed and Efficient Serving Framework for Large Models
por: Jin, Lewei, et al.
Publicado: (2025)
por: Jin, Lewei, et al.
Publicado: (2025)
Cascadia: An Efficient Cascade Serving System for Large Language Models
por: Jiang, Youhe, et al.
Publicado: (2025)
por: Jiang, Youhe, et al.
Publicado: (2025)
GENSERVE: Efficient Co-Serving of Heterogeneous Diffusion Model Workloads
por: Ye, Fanjiang, et al.
Publicado: (2026)
por: Ye, Fanjiang, et al.
Publicado: (2026)
Communication-Efficient Serving for Video Diffusion Models with Latent Parallelism
por: Wu, Zhiyuan, et al.
Publicado: (2025)
por: Wu, Zhiyuan, et al.
Publicado: (2025)
DDiT: Dynamic Resource Allocation for Diffusion Transformer Model Serving
por: Huang, Heyang, et al.
Publicado: (2025)
por: Huang, Heyang, et al.
Publicado: (2025)
Scheduling Deep Learning Jobs in Multi-Tenant GPU Clusters via Wise Resource Sharing
por: Luo, Yizhou, et al.
Publicado: (2024)
por: Luo, Yizhou, et al.
Publicado: (2024)
Aragog: Just-in-Time Model Routing for Scalable Serving of Agentic Workflows
por: Dai, Yinwei, et al.
Publicado: (2025)
por: Dai, Yinwei, et al.
Publicado: (2025)
NanoFlow: Towards Optimal Large Language Model Serving Throughput
por: Zhu, Kan, et al.
Publicado: (2024)
por: Zhu, Kan, et al.
Publicado: (2024)
Strata: Hierarchical Context Caching for Long Context Language Model Serving
por: Xie, Zhiqiang, et al.
Publicado: (2025)
por: Xie, Zhiqiang, et al.
Publicado: (2025)
FLYING SERVING: On-the-Fly Parallelism Switching for Large Language Model Serving
por: Gao, Shouwei, et al.
Publicado: (2026)
por: Gao, Shouwei, et al.
Publicado: (2026)
EdgeLoRA: An Efficient Multi-Tenant LLM Serving System on Edge Devices
por: Shen, Zheyu, et al.
Publicado: (2025)
por: Shen, Zheyu, et al.
Publicado: (2025)
OCTOPINF: Workload-Aware Inference Serving for Edge Video Analytics
por: Nguyen, Thanh-Tung, et al.
Publicado: (2025)
por: Nguyen, Thanh-Tung, et al.
Publicado: (2025)
Multi Armed Bandit Algorithms Based Virtual Machine Allocation Policy for Security in Multi-Tenant Distributed Systems
por: Patil, Pravin, et al.
Publicado: (2024)
por: Patil, Pravin, et al.
Publicado: (2024)
HADIS: Hybrid Adaptive Diffusion Model Serving for Efficient Text-to-Image Generation
por: Yang, Qizheng, et al.
Publicado: (2025)
por: Yang, Qizheng, et al.
Publicado: (2025)
MoDM: Efficient Serving for Image Generation via Mixture-of-Diffusion Models
por: Xia, Yuchen, et al.
Publicado: (2025)
por: Xia, Yuchen, et al.
Publicado: (2025)
HydraInfer: Hybrid Disaggregated Scheduling for Multimodal Large Language Model Serving
por: Dong, Xianzhe, et al.
Publicado: (2025)
por: Dong, Xianzhe, et al.
Publicado: (2025)
BlockLLM: Multi-tenant Finer-grained Serving for Large Language Models
por: Hu, Bodun, et al.
Publicado: (2024)
por: Hu, Bodun, et al.
Publicado: (2024)
SneakPeek: Data-Aware Model Selection and Scheduling for Inference Serving on the Edge
por: Wolfrath, Joel, et al.
Publicado: (2025)
por: Wolfrath, Joel, et al.
Publicado: (2025)
FailLite: Failure-Resilient Model Serving for Resource-Constrained Edge Environments
por: Wu, Li, et al.
Publicado: (2025)
por: Wu, Li, et al.
Publicado: (2025)
vLLM-Omni: Fully Disaggregated Serving for Any-to-Any Multimodal Models
por: Yin, Peiqi, et al.
Publicado: (2026)
por: Yin, Peiqi, et al.
Publicado: (2026)
Collaborative Processing for Multi-Tenant Inference on Memory-Constrained Edge TPUs
por: Ng, Nathan, et al.
Publicado: (2026)
por: Ng, Nathan, et al.
Publicado: (2026)
Delta Fair Sharing: Performance Isolation for Multi-Tenant Storage Systems
por: Griggs, Tyler, et al.
Publicado: (2026)
por: Griggs, Tyler, et al.
Publicado: (2026)
Seamless Transitions: A Comprehensive Review of Live Migration Technologies
por: Attar-Khorasani, Sima, et al.
Publicado: (2025)
por: Attar-Khorasani, Sima, et al.
Publicado: (2025)
Towards Seamless Serverless Computing Across an Edge-Cloud Continuum
por: Simion, Emilian, et al.
Publicado: (2024)
por: Simion, Emilian, et al.
Publicado: (2024)
EdgeServing: Deadline-Aware Multi-DNN Serving at the Edge
por: Cao, Jiahe, et al.
Publicado: (2026)
por: Cao, Jiahe, et al.
Publicado: (2026)
Ejemplares similares
-
Enabling Seamless Data Security, Consensus, and Trading in Vehicular Networks
por: Vieira, Emanuel, et al.
Publicado: (2024) -
FaaSMoE: A Serverless Framework for Multi-Tenant Mixture-of-Experts Serving
por: Wang, Minghe, et al.
Publicado: (2026) -
Caching Aided Multi-Tenant Serverless Computing
por: Qiao, Chu, et al.
Publicado: (2024) -
DeepServe: Serverless Large Language Model Serving at Scale
por: Hu, Junhao, et al.
Publicado: (2025) -
Guardian: Safe GPU Sharing in Multi-Tenant Environments
por: Pavlidakis, Manos, et al.
Publicado: (2024)