DeepVM: Integrating Spot and On-Demand VMs for Cost-Efficient Deep Learning Clusters in the Cloud
Fuente:
arXiv
Salvato in:
| Autori principali: | Kim, Yoochan, Kim, Kihyun, Cho, Yonghyeon, Kim, Jinwoo, Khan, Awais, Kang, Ki-Dong, An, Baik-Song, Cha, Myung-Hoon, Kim, Hong-Yeon, Kim, Youngjae |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Cost-Efficient LLM Serving in the Cloud: VM Selection with KV Cache Offloading
di: Kim, Kihyun, et al.
Pubblicazione: (2025)
di: Kim, Kihyun, et al.
Pubblicazione: (2025)
SpotVista: Availability-Aware Recommendation System for Reliable and Cost-Efficient Multi-Node Spot Instances
di: Kim, Taeyoon, et al.
Pubblicazione: (2026)
di: Kim, Taeyoon, et al.
Pubblicazione: (2026)
Shared Disk KV Cache Management for Efficient Multi-Instance Inference in RAG-Powered LLMs
di: Lee, Hyungwoo, et al.
Pubblicazione: (2025)
di: Lee, Hyungwoo, et al.
Pubblicazione: (2025)
KubePACS: Kubernetes Cluster Using Performant, Highly Available, and Cost Efficient Spot Instances
di: Kim, Taeyoon, et al.
Pubblicazione: (2026)
di: Kim, Taeyoon, et al.
Pubblicazione: (2026)
FCDP: Fully Cached Data Parallel for Communication-Avoiding Large-Scale Training
di: Park, Gyeongseo, et al.
Pubblicazione: (2026)
di: Park, Gyeongseo, et al.
Pubblicazione: (2026)
Ding-Dong Ditch: Peeking Into Spot Instance Availability
di: Kim, Kyumin, et al.
Pubblicazione: (2026)
di: Kim, Kyumin, et al.
Pubblicazione: (2026)
AFLL: Real-time Load Stabilization for MMO Game Servers Based on Circular Causality Learning
di: Kang, Shinsuk, et al.
Pubblicazione: (2026)
di: Kang, Shinsuk, et al.
Pubblicazione: (2026)
FedCostAware: Enabling Cost-Aware Federated Learning on the Cloud
di: Sinha, Aditya, et al.
Pubblicazione: (2025)
di: Sinha, Aditya, et al.
Pubblicazione: (2025)
Iterative Thresholding and Projection Algorithms and Model-Based Deep Neural Networks for Sparse LQR Control Design
di: Cho, Myung
Pubblicazione: (2022)
di: Cho, Myung
Pubblicazione: (2022)
Proof of Cloud: Data Center Execution Assurance for Confidential VMs
di: Rezabek, Filip, et al.
Pubblicazione: (2025)
di: Rezabek, Filip, et al.
Pubblicazione: (2025)
GraNNDis: Efficient Unified Distributed Training Framework for Deep GNNs on Large Clusters
di: Song, Jaeyong, et al.
Pubblicazione: (2023)
di: Song, Jaeyong, et al.
Pubblicazione: (2023)
The SAP Cloud Infrastructure Dataset: A Reality Check of Scheduling and Placement of VMs in Cloud Computing
di: Uhlig, Arno, et al.
Pubblicazione: (2025)
di: Uhlig, Arno, et al.
Pubblicazione: (2025)
SpotKube: Cost-Optimal Microservices Deployment with Cluster Autoscaling and Spot Pricing
di: Edirisinghe, Dasith, et al.
Pubblicazione: (2024)
di: Edirisinghe, Dasith, et al.
Pubblicazione: (2024)
Convergence Analysis of Federated Learning Methods Using Backward Error Analysis
di: Lim, Jinwoo, et al.
Pubblicazione: (2025)
di: Lim, Jinwoo, et al.
Pubblicazione: (2025)
Optimizing CPU Cache Utilization in Cloud VMs with Accurate Cache Abstraction
di: Tofigh, Mani, et al.
Pubblicazione: (2025)
di: Tofigh, Mani, et al.
Pubblicazione: (2025)
TensorSocket: Shared Data Loading for Deep Learning Training
di: Robroek, Ties, et al.
Pubblicazione: (2024)
di: Robroek, Ties, et al.
Pubblicazione: (2024)
COMPASS: A Compiler Framework for Resource-Constrained Crossbar-Array Based In-Memory Deep Learning Accelerators
di: Park, Jihoon, et al.
Pubblicazione: (2025)
di: Park, Jihoon, et al.
Pubblicazione: (2025)
Learning Where It Matters: Geometric Anchoring for Robust Preference Alignment
di: Cho, Youngjae, et al.
Pubblicazione: (2026)
di: Cho, Youngjae, et al.
Pubblicazione: (2026)
HE2C: A Holistic Approach for Allocating Latency-Sensitive AI Tasks across Edge-Cloud
di: Kim, Minseo, et al.
Pubblicazione: (2024)
di: Kim, Minseo, et al.
Pubblicazione: (2024)
Dooly: Configuration-Agnostic, Redundancy-Aware Profiling for LLM Inference Simulation
di: Kim, Joon Ha, et al.
Pubblicazione: (2026)
di: Kim, Joon Ha, et al.
Pubblicazione: (2026)
A Case Study of API Design for Interoperability and Security of the Internet of Things
di: Kim, Dongha, et al.
Pubblicazione: (2024)
di: Kim, Dongha, et al.
Pubblicazione: (2024)
OMEGA: A Low-Latency GNN Serving System for Large Graphs
di: Kim, Geon-Woo, et al.
Pubblicazione: (2025)
di: Kim, Geon-Woo, et al.
Pubblicazione: (2025)
Revisiting Early-Learning Regularization When Federated Learning Meets Noisy Labels
di: Kim, Taehyeon, et al.
Pubblicazione: (2024)
di: Kim, Taehyeon, et al.
Pubblicazione: (2024)
Characterizing Compute-Communication Overlap in GPU-Accelerated Distributed Deep Learning: Performance and Power Implications
di: Lee, Seonho, et al.
Pubblicazione: (2025)
di: Lee, Seonho, et al.
Pubblicazione: (2025)
Déjà Vu: Efficient Video-Language Query Engine with Learning-based Inter-Frame Computation Reuse
di: Hwang, Jinwoo, et al.
Pubblicazione: (2025)
di: Hwang, Jinwoo, et al.
Pubblicazione: (2025)
OASIS: Object-based Analytics Storage for Intelligent SQL Query Offloading in Scientific Tabular Workloads
di: Hwang, Soon, et al.
Pubblicazione: (2025)
di: Hwang, Soon, et al.
Pubblicazione: (2025)
Eva: Cost-Efficient Cloud-Based Cluster Scheduling
di: Chang, Tzu-Tao, et al.
Pubblicazione: (2025)
di: Chang, Tzu-Tao, et al.
Pubblicazione: (2025)
Why Do AI Agents Systematically Fail at Cloud Root Cause Analysis?
di: Kim, Taeyoon, et al.
Pubblicazione: (2026)
di: Kim, Taeyoon, et al.
Pubblicazione: (2026)
DFLOP: A Data-driven Framework for Multimodal LLM Training Pipeline Optimization
di: An, Hyeonjun, et al.
Pubblicazione: (2026)
di: An, Hyeonjun, et al.
Pubblicazione: (2026)
Traversal Learning: A Lossless And Efficient Distributed Learning Framework
di: Batbaatar, Erdenebileg, et al.
Pubblicazione: (2025)
di: Batbaatar, Erdenebileg, et al.
Pubblicazione: (2025)
Toward Cost-Efficient Serving of Mixture-of-Experts with Asynchrony
di: Wang, Shaoyu, et al.
Pubblicazione: (2025)
di: Wang, Shaoyu, et al.
Pubblicazione: (2025)
TraCT: Disaggregated LLM Serving with CXL Shared Memory KV Cache at Rack-Scale
di: Yoon, Dongha, et al.
Pubblicazione: (2025)
di: Yoon, Dongha, et al.
Pubblicazione: (2025)
A Deep Reinforcement Learning Approach for Cost Optimized Workflow Scheduling in Cloud Computing Environments
di: Jayanetti, Amanda, et al.
Pubblicazione: (2024)
di: Jayanetti, Amanda, et al.
Pubblicazione: (2024)
PIM-SHERPA: Software Method for On-device LLM Inference by Resolving PIM Memory Attribute and Layout Inconsistencies
di: Lee, Sunjung, et al.
Pubblicazione: (2026)
di: Lee, Sunjung, et al.
Pubblicazione: (2026)
A Performance Analyzer for a Public Cloud's ML-Augmented VM Allocator
di: Bostandoost, Roozbeh, et al.
Pubblicazione: (2025)
di: Bostandoost, Roozbeh, et al.
Pubblicazione: (2025)
ExeGPT: Constraint-Aware Resource Scheduling for LLM Inference
di: Oh, Hyungjun, et al.
Pubblicazione: (2024)
di: Oh, Hyungjun, et al.
Pubblicazione: (2024)
AGAThA: Fast and Efficient GPU Acceleration of Guided Sequence Alignment for Long Read Mapping
di: Park, Seongyeon, et al.
Pubblicazione: (2024)
di: Park, Seongyeon, et al.
Pubblicazione: (2024)
Contextual Chain: Single-State Ledger Design for Mobile/IoT Networks with Frequent Partitions
di: Kim, Song-Ju
Pubblicazione: (2026)
di: Kim, Song-Ju
Pubblicazione: (2026)
Flex-MIG: Enabling Distributed Execution on MIG
di: Kim, Myeongsu, et al.
Pubblicazione: (2025)
di: Kim, Myeongsu, et al.
Pubblicazione: (2025)
HeteroSwitch: Characterizing and Taming System-Induced Data Heterogeneity in Federated Learning
di: Kim, Gyudong, et al.
Pubblicazione: (2024)
di: Kim, Gyudong, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Cost-Efficient LLM Serving in the Cloud: VM Selection with KV Cache Offloading
di: Kim, Kihyun, et al.
Pubblicazione: (2025) -
SpotVista: Availability-Aware Recommendation System for Reliable and Cost-Efficient Multi-Node Spot Instances
di: Kim, Taeyoon, et al.
Pubblicazione: (2026) -
Shared Disk KV Cache Management for Efficient Multi-Instance Inference in RAG-Powered LLMs
di: Lee, Hyungwoo, et al.
Pubblicazione: (2025) -
KubePACS: Kubernetes Cluster Using Performant, Highly Available, and Cost Efficient Spot Instances
di: Kim, Taeyoon, et al.
Pubblicazione: (2026) -
FCDP: Fully Cached Data Parallel for Communication-Avoiding Large-Scale Training
di: Park, Gyeongseo, et al.
Pubblicazione: (2026)