GMLake: Efficient and Transparent GPU Memory Defragmentation for Large-scale DNN Training with Virtual Memory Stitching
Fuente:
arXiv
Salvato in:
| Autori principali: | Guo, Cong, Zhang, Rui, Xu, Jiale, Leng, Jingwen, Liu, Zihan, Huang, Ziyu, Guo, Minyi, Wu, Hao, Zhao, Shouren, Zhao, Junping, Zhang, Ke |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
eLLM: Elastic Memory Management Framework for Efficient LLM Serving
di: Xu, Jiale, et al.
Pubblicazione: (2025)
di: Xu, Jiale, et al.
Pubblicazione: (2025)
vTensor: Flexible Virtual Tensor Management for Efficient LLM Serving
di: Xu, Jiale, et al.
Pubblicazione: (2024)
di: Xu, Jiale, et al.
Pubblicazione: (2024)
Towards Fast Setup and High Throughput of GPU Serverless Computing
di: Zhao, Han, et al.
Pubblicazione: (2024)
di: Zhao, Han, et al.
Pubblicazione: (2024)
FlowWalker: A Memory-efficient and High-performance GPU-based Dynamic Graph Random Walk Framework
di: Mei, Junyi, et al.
Pubblicazione: (2024)
di: Mei, Junyi, et al.
Pubblicazione: (2024)
Accelerating Sparse DNNs Based on Tiled GEMM
di: Guo, Cong, et al.
Pubblicazione: (2024)
di: Guo, Cong, et al.
Pubblicazione: (2024)
FlashFuser: Expanding the Scale of Kernel Fusion for Compute-Intensive Operators via Inter-Core Connection
di: Huang, Ziyu, et al.
Pubblicazione: (2025)
di: Huang, Ziyu, et al.
Pubblicazione: (2025)
DASH: Deterministic Attention Scheduling for High-throughput Reproducible LLM Training
di: Qiang, Xinwei, et al.
Pubblicazione: (2026)
di: Qiang, Xinwei, et al.
Pubblicazione: (2026)
Frenzy: A Memory-Aware Serverless LLM Training System for Heterogeneous GPU Clusters
di: Chang, Zihan, et al.
Pubblicazione: (2024)
di: Chang, Zihan, et al.
Pubblicazione: (2024)
Poplar: Efficient Scaling of Distributed DNN Training on Heterogeneous GPU Clusters
di: Zhang, WenZheng, et al.
Pubblicazione: (2024)
di: Zhang, WenZheng, et al.
Pubblicazione: (2024)
VQ-LLM: High-performance Code Generation for Vector Quantization Augmented LLM Inference
di: Liu, Zihan, et al.
Pubblicazione: (2025)
di: Liu, Zihan, et al.
Pubblicazione: (2025)
Understanding the Landscape of Ampere GPU Memory Errors
di: Zhu, Zhu, et al.
Pubblicazione: (2025)
di: Zhu, Zhu, et al.
Pubblicazione: (2025)
HAP: SPMD DNN Training on Heterogeneous GPU Clusters with Automated Program Synthesis
di: Zhang, Shiwei, et al.
Pubblicazione: (2024)
di: Zhang, Shiwei, et al.
Pubblicazione: (2024)
ClusterFusion: Expanding Operator Fusion Scope for LLM Inference via Cluster-Level Collective Primitive
di: Luo, Xinhao, et al.
Pubblicazione: (2025)
di: Luo, Xinhao, et al.
Pubblicazione: (2025)
FlashMem: Supporting Modern DNN Workloads on Mobile with GPU Memory Hierarchy Optimizations
di: Shu, Zhihao, et al.
Pubblicazione: (2026)
di: Shu, Zhihao, et al.
Pubblicazione: (2026)
DAK: Direct-Access-Enabled GPU Memory Offloading with Optimal Efficiency for LLM Inference
di: Lin, Shouxu, et al.
Pubblicazione: (2026)
di: Lin, Shouxu, et al.
Pubblicazione: (2026)
GPUVM: GPU-driven Unified Virtual Memory
di: Nazaraliyev, Nurlan, et al.
Pubblicazione: (2024)
di: Nazaraliyev, Nurlan, et al.
Pubblicazione: (2024)
Memory Efficient and Staleness Free Pipeline Parallel DNN Training Framework with Improved Convergence Speed
di: Dutta, Ankita, et al.
Pubblicazione: (2025)
di: Dutta, Ankita, et al.
Pubblicazione: (2025)
PilotANN: Memory-Bounded GPU Acceleration for Vector Search
di: Gui, Yuntao, et al.
Pubblicazione: (2025)
di: Gui, Yuntao, et al.
Pubblicazione: (2025)
Towards Compute-Aware In-Switch Computing for LLMs Tensor-Parallelism on Multi-GPU Systems
di: Zhang, Chen, et al.
Pubblicazione: (2026)
di: Zhang, Chen, et al.
Pubblicazione: (2026)
TiMePReSt: Time and Memory Efficient Pipeline Parallel DNN Training with Removed Staleness
di: Dutta, Ankita, et al.
Pubblicazione: (2024)
di: Dutta, Ankita, et al.
Pubblicazione: (2024)
GPU Memory and Utilization Estimation for Training-Aware Resource Management: Opportunities and Limitations
di: Yousefzadeh-Asl-Miandoab, Ehsan, et al.
Pubblicazione: (2026)
di: Yousefzadeh-Asl-Miandoab, Ehsan, et al.
Pubblicazione: (2026)
MoE-Hub: Taming Software Complexity for Seamless MoE Overlap with Hardware-Accelerated Communication on Multi-GPU Systems
di: Zhou, Zhuoshan, et al.
Pubblicazione: (2026)
di: Zhou, Zhuoshan, et al.
Pubblicazione: (2026)
DawnPiper: A Memory-scablable Pipeline Parallel Training Framework
di: Peng, Xuan, et al.
Pubblicazione: (2025)
di: Peng, Xuan, et al.
Pubblicazione: (2025)
Survey of Disaggregated Memory: Cross-layer Technique Insights for Next-Generation Datacenters
di: Wang, Jing, et al.
Pubblicazione: (2025)
di: Wang, Jing, et al.
Pubblicazione: (2025)
CUTHERMO: Understanding GPU Memory Inefficiencies with Heat Map Profiling
di: Zhao, Yanbo, et al.
Pubblicazione: (2025)
di: Zhao, Yanbo, et al.
Pubblicazione: (2025)
Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management
di: Qianli, Liu, et al.
Pubblicazione: (2025)
di: Qianli, Liu, et al.
Pubblicazione: (2025)
Breaking the Memory Wall: A Study of I/O Patterns and GPU Memory Utilization for Hybrid CPU-GPU Offloaded Optimizers
di: Maurya, Avinash, et al.
Pubblicazione: (2024)
di: Maurya, Avinash, et al.
Pubblicazione: (2024)
SWIFT: Expedited Failure Recovery for Large-scale DNN Training
di: Zhong, Yuchen, et al.
Pubblicazione: (2023)
di: Zhong, Yuchen, et al.
Pubblicazione: (2023)
InfiniLoRA: Disaggregated Multi-LoRA Serving for Large Language Models
di: Chen, Hongyu, et al.
Pubblicazione: (2026)
di: Chen, Hongyu, et al.
Pubblicazione: (2026)
Byzantine-Tolerant Consensus in GPU-Inspired Shared Memory
di: Georgiou, Chryssis, et al.
Pubblicazione: (2025)
di: Georgiou, Chryssis, et al.
Pubblicazione: (2025)
GPU Memory Prediction for Multimodal Model Training
di: Jeong, Jinwoo, et al.
Pubblicazione: (2025)
di: Jeong, Jinwoo, et al.
Pubblicazione: (2025)
ParvaGPU: Efficient Spatial GPU Sharing for Large-Scale DNN Inference in Cloud Environments
di: Lee, Munkyu, et al.
Pubblicazione: (2024)
di: Lee, Munkyu, et al.
Pubblicazione: (2024)
Enabling Large Batch Size Training for DNN Models Beyond the Memory Limit While Maintaining Performance
di: Piao, XinYu, et al.
Pubblicazione: (2021)
di: Piao, XinYu, et al.
Pubblicazione: (2021)
An Efficient, Reliable and Observable Collective Communication Library in Large-scale GPU Training Clusters
di: Zhang, Mingjun, et al.
Pubblicazione: (2025)
di: Zhang, Mingjun, et al.
Pubblicazione: (2025)
Cephalo: Harnessing Heterogeneous GPU Clusters for Training Transformer Models
di: Guo, Runsheng Benson, et al.
Pubblicazione: (2024)
di: Guo, Runsheng Benson, et al.
Pubblicazione: (2024)
Zorse: Optimizing LLM Training Efficiency on Heterogeneous GPU Clusters
di: Guo, Runsheng Benson, et al.
Pubblicazione: (2025)
di: Guo, Runsheng Benson, et al.
Pubblicazione: (2025)
DRust: Language-Guided Distributed Shared Memory with Fine Granularity, Full Transparency, and Ultra Efficiency
di: Ma, Haoran, et al.
Pubblicazione: (2024)
di: Ma, Haoran, et al.
Pubblicazione: (2024)
CRIUgpu: Transparent Checkpointing of GPU-Accelerated Workloads
di: Stoyanov, Radostin, et al.
Pubblicazione: (2025)
di: Stoyanov, Radostin, et al.
Pubblicazione: (2025)
AQUA: Network-Accelerated Memory Offloading for LLMs in Scale-Up GPU Domains
di: Kumar, Abhishek Vijaya, et al.
Pubblicazione: (2024)
di: Kumar, Abhishek Vijaya, et al.
Pubblicazione: (2024)
HARP: Orchestrating Automated Parallel Training on Heterogeneous GPU Clusters
di: Liang, Antian, et al.
Pubblicazione: (2025)
di: Liang, Antian, et al.
Pubblicazione: (2025)
Documenti analoghi
-
eLLM: Elastic Memory Management Framework for Efficient LLM Serving
di: Xu, Jiale, et al.
Pubblicazione: (2025) -
vTensor: Flexible Virtual Tensor Management for Efficient LLM Serving
di: Xu, Jiale, et al.
Pubblicazione: (2024) -
Towards Fast Setup and High Throughput of GPU Serverless Computing
di: Zhao, Han, et al.
Pubblicazione: (2024) -
FlowWalker: A Memory-efficient and High-performance GPU-based Dynamic Graph Random Walk Framework
di: Mei, Junyi, et al.
Pubblicazione: (2024) -
Accelerating Sparse DNNs Based on Tiled GEMM
di: Guo, Cong, et al.
Pubblicazione: (2024)