From Models to Operators: Rethinking Autoscaling Granularity for Large Generative Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Cui, Xingqi, Liang, Chieh-Jan Mike, Xing, Jiarong, Qiu, Haoran |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Mitigating Temporal Blindness in Kubernetes Autoscaling: An Attention-Double-LSTM Framework
di: Shaikh, Faraz, et al.
Pubblicazione: (2026)
di: Shaikh, Faraz, et al.
Pubblicazione: (2026)
Autothrottle: A Practical Bi-Level Approach to Resource Management for SLO-Targeted Microservices
di: Wang, Zibo, et al.
Pubblicazione: (2022)
di: Wang, Zibo, et al.
Pubblicazione: (2022)
GAS: Generative Activation-Aided Asynchronous Split Federated Learning
di: Yang, Jiarong, et al.
Pubblicazione: (2024)
di: Yang, Jiarong, et al.
Pubblicazione: (2024)
SAIR: Cost-Efficient Multi-Stage ML Pipeline Autoscaling via In-Context Reinforcement Learning
di: Su, Jianchang, et al.
Pubblicazione: (2026)
di: Su, Jianchang, et al.
Pubblicazione: (2026)
MAS-H2: A Hierarchical Multi-Agent System for Holistic Cloud-Native Autoscaling
di: Hamzeh, Hamed, et al.
Pubblicazione: (2026)
di: Hamzeh, Hamed, et al.
Pubblicazione: (2026)
Computing in the Era of Large Generative Models: From Cloud-Native to AI-Native
di: Lu, Yao, et al.
Pubblicazione: (2024)
di: Lu, Yao, et al.
Pubblicazione: (2024)
Characterization-Guided GPU Fault Resilience in NVIDIA MPS
di: Liu, Rixin, et al.
Pubblicazione: (2026)
di: Liu, Rixin, et al.
Pubblicazione: (2026)
Tessera: Unlocking Heterogeneous GPUs through Kernel-Granularity Disaggregation
di: Hu, Tiancheng, et al.
Pubblicazione: (2026)
di: Hu, Tiancheng, et al.
Pubblicazione: (2026)
ConServe: Fine-Grained GPU Harvesting for LLM Online and Offline Co-Serving
di: Qiao, Yifan, et al.
Pubblicazione: (2024)
di: Qiao, Yifan, et al.
Pubblicazione: (2024)
Hierarchical Autoscaling for Large Language Model Serving with Chiron
di: Patke, Archit, et al.
Pubblicazione: (2025)
di: Patke, Archit, et al.
Pubblicazione: (2025)
Spindle: Efficient Distributed Training of Multi-Task Large Models via Wavefront Scheduling
di: Wang, Yujie, et al.
Pubblicazione: (2024)
di: Wang, Yujie, et al.
Pubblicazione: (2024)
FlexSP: Accelerating Large Language Model Training via Flexible Sequence Parallelism
di: Wang, Yujie, et al.
Pubblicazione: (2024)
di: Wang, Yujie, et al.
Pubblicazione: (2024)
Scalable High-Dimensional Multivariate Linear Regression for Feature-Distributed Data
di: Huang, Shuo-Chieh, et al.
Pubblicazione: (2023)
di: Huang, Shuo-Chieh, et al.
Pubblicazione: (2023)
EDGE-LLM: Enabling Efficient Large Language Model Adaptation on Edge Devices via Layerwise Unified Compression and Adaptive Layer Tuning and Voting
di: Yu, Zhongzhi, et al.
Pubblicazione: (2024)
di: Yu, Zhongzhi, et al.
Pubblicazione: (2024)
InfiniGen: Efficient Generative Inference of Large Language Models with Dynamic KV Cache Management
di: Lee, Wonbeom, et al.
Pubblicazione: (2024)
di: Lee, Wonbeom, et al.
Pubblicazione: (2024)
Taming Latency-Memory Trade-Off in MoE-Based LLM Serving via Fine-Grained Expert Offloading
di: Yu, Hanfei, et al.
Pubblicazione: (2025)
di: Yu, Hanfei, et al.
Pubblicazione: (2025)
Context-Driven Performance Modeling for Causal Inference Operators on Neural Processing Units
di: Gupta, Neelesh, et al.
Pubblicazione: (2025)
di: Gupta, Neelesh, et al.
Pubblicazione: (2025)
MegaScale: Scaling Large Language Model Training to More Than 10,000 GPUs
di: Jiang, Ziheng, et al.
Pubblicazione: (2024)
di: Jiang, Ziheng, et al.
Pubblicazione: (2024)
Multi-Dimensional Autoscaling of Stream Processing Services on Edge Devices
di: Sedlak, Boris, et al.
Pubblicazione: (2025)
di: Sedlak, Boris, et al.
Pubblicazione: (2025)
Hydraulis: Balancing Large Transformer Model Training via Co-designing Parallel Strategies and Data Assignment
di: Li, Haoyang, et al.
Pubblicazione: (2024)
di: Li, Haoyang, et al.
Pubblicazione: (2024)
Efficient Heterogeneous Large Language Model Decoding with Model-Attention Disaggregation
di: Chen, Shaoyuan, et al.
Pubblicazione: (2024)
di: Chen, Shaoyuan, et al.
Pubblicazione: (2024)
Arena: Efficiently Training Large Models via Dynamic Scheduling and Adaptive Parallelism Co-Design
di: Xue, Chunyu, et al.
Pubblicazione: (2024)
di: Xue, Chunyu, et al.
Pubblicazione: (2024)
Towards Sustainable Large Language Model Serving
di: Nguyen, Sophia, et al.
Pubblicazione: (2024)
di: Nguyen, Sophia, et al.
Pubblicazione: (2024)
Stateful Large Language Model Serving with Pensieve
di: Yu, Lingfan, et al.
Pubblicazione: (2023)
di: Yu, Lingfan, et al.
Pubblicazione: (2023)
Characterization of Large Language Model Development in the Datacenter
di: Hu, Qinghao, et al.
Pubblicazione: (2024)
di: Hu, Qinghao, et al.
Pubblicazione: (2024)
Reducing Energy Bloat in Large Model Training
di: Chung, Jae-Won, et al.
Pubblicazione: (2023)
di: Chung, Jae-Won, et al.
Pubblicazione: (2023)
Efficient Interactive LLM Serving with Proxy Model-based Sequence Length Prediction
di: Qiu, Haoran, et al.
Pubblicazione: (2024)
di: Qiu, Haoran, et al.
Pubblicazione: (2024)
Fast Distributed Inference Serving for Large Language Models
di: Wu, Bingyang, et al.
Pubblicazione: (2023)
di: Wu, Bingyang, et al.
Pubblicazione: (2023)
Federated Customization of Large Models: Approaches, Experiments, and Insights
di: Ye, Yuchuan, et al.
Pubblicazione: (2026)
di: Ye, Yuchuan, et al.
Pubblicazione: (2026)
Heterogeneous Parallelism for Multimodal Large Language Model Training
di: Karnati, Yashaswi, et al.
Pubblicazione: (2026)
di: Karnati, Yashaswi, et al.
Pubblicazione: (2026)
Proactive and Reactive Autoscaling Techniques for Edge Computing
di: Gupta, Suhrid, et al.
Pubblicazione: (2025)
di: Gupta, Suhrid, et al.
Pubblicazione: (2025)
Self-adaptive, Requirements-driven Autoscaling of Microservices
di: Nunes, João Paulo Karol Santos, et al.
Pubblicazione: (2024)
di: Nunes, João Paulo Karol Santos, et al.
Pubblicazione: (2024)
Intelligent Orchestration of Distributed Large Foundation Model Inference at the Edge
di: Koch, Fernando, et al.
Pubblicazione: (2025)
di: Koch, Fernando, et al.
Pubblicazione: (2025)
Semantic-Aware Scheduling for GPU Clusters with Large Language Models
di: Wang, Zerui, et al.
Pubblicazione: (2025)
di: Wang, Zerui, et al.
Pubblicazione: (2025)
Understanding Stragglers in Large Model Training Using What-if Analysis
di: Lin, Jinkun, et al.
Pubblicazione: (2025)
di: Lin, Jinkun, et al.
Pubblicazione: (2025)
A Survey on Federated Fine-tuning of Large Language Models
di: Wu, Yebo, et al.
Pubblicazione: (2025)
di: Wu, Yebo, et al.
Pubblicazione: (2025)
Large Language Model Aided QoS Prediction for Service Recommendation
di: Liu, Huiying, et al.
Pubblicazione: (2024)
di: Liu, Huiying, et al.
Pubblicazione: (2024)
Efficient Parallelization Layouts for Large-Scale Distributed Model Training
di: Hagemann, Johannes, et al.
Pubblicazione: (2023)
di: Hagemann, Johannes, et al.
Pubblicazione: (2023)
Optimizing Large Model Training through Overlapped Activation Recomputation
di: Chen, Ping, et al.
Pubblicazione: (2024)
di: Chen, Ping, et al.
Pubblicazione: (2024)
FedRIR: Rethinking Information Representation in Federated Learning
di: Huang, Yongqiang, et al.
Pubblicazione: (2025)
di: Huang, Yongqiang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Mitigating Temporal Blindness in Kubernetes Autoscaling: An Attention-Double-LSTM Framework
di: Shaikh, Faraz, et al.
Pubblicazione: (2026) -
Autothrottle: A Practical Bi-Level Approach to Resource Management for SLO-Targeted Microservices
di: Wang, Zibo, et al.
Pubblicazione: (2022) -
GAS: Generative Activation-Aided Asynchronous Split Federated Learning
di: Yang, Jiarong, et al.
Pubblicazione: (2024) -
SAIR: Cost-Efficient Multi-Stage ML Pipeline Autoscaling via In-Context Reinforcement Learning
di: Su, Jianchang, et al.
Pubblicazione: (2026) -
MAS-H2: A Hierarchical Multi-Agent System for Holistic Cloud-Native Autoscaling
di: Hamzeh, Hamed, et al.
Pubblicazione: (2026)