Armada: Memory-Efficient Distributed Training of Large-Scale Graph Neural Networks
Fuente:
arXiv
Salvato in:
| Autori principali: | Waleffe, Roger, Sarda, Devesh, Mohoney, Jason, Vlatakis-Gkaragkounis, Emmanouil-Vasileios, Rekatsinas, Theodoros, Venkataraman, Shivaram |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
GraphSnapShot: Caching Local Structure for Fast Graph Learning
di: Liu, Dong, et al.
Pubblicazione: (2024)
di: Liu, Dong, et al.
Pubblicazione: (2024)
Eva: Cost-Efficient Cloud-Based Cluster Scheduling
di: Chang, Tzu-Tao, et al.
Pubblicazione: (2025)
di: Chang, Tzu-Tao, et al.
Pubblicazione: (2025)
PGT-I: Scaling Spatiotemporal GNNs with Memory-Efficient Distributed Training
di: Ockerman, Seth, et al.
Pubblicazione: (2025)
di: Ockerman, Seth, et al.
Pubblicazione: (2025)
SYMPHONY: Improving Memory Management for LLM Inference Workloads
di: Agarwal, Saurabh, et al.
Pubblicazione: (2024)
di: Agarwal, Saurabh, et al.
Pubblicazione: (2024)
RapidGNN: Communication Efficient Large-Scale Distributed Training of Graph Neural Networks
di: Niam, Arefin, et al.
Pubblicazione: (2025)
di: Niam, Arefin, et al.
Pubblicazione: (2025)
PAL: A Variability-Aware Policy for Scheduling ML Workloads in GPU Clusters
di: Jain, Rutwik, et al.
Pubblicazione: (2024)
di: Jain, Rutwik, et al.
Pubblicazione: (2024)
Minos: Systematically Classifying Performance and Power Characteristics of GPU Workloads on HPC Clusters
di: Jain, Rutwik, et al.
Pubblicazione: (2026)
di: Jain, Rutwik, et al.
Pubblicazione: (2026)
Tesserae: Scalable Placement Policies for Deep Learning Workloads
di: Bian, Song, et al.
Pubblicazione: (2025)
di: Bian, Song, et al.
Pubblicazione: (2025)
Optimizing Distributed Training Approaches for Scaling Neural Networks
di: Baligodugula, Vishnu Vardhan, et al.
Pubblicazione: (2025)
di: Baligodugula, Vishnu Vardhan, et al.
Pubblicazione: (2025)
Heta: Distributed Training of Heterogeneous Graph Neural Networks
di: Zhong, Yuchen, et al.
Pubblicazione: (2024)
di: Zhong, Yuchen, et al.
Pubblicazione: (2024)
Exploring Distributed Vector Databases Performance on HPC Platforms: A Study with Qdrant
di: Ockerman, Seth, et al.
Pubblicazione: (2025)
di: Ockerman, Seth, et al.
Pubblicazione: (2025)
LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models
di: Chang, Tzu-Tao, et al.
Pubblicazione: (2025)
di: Chang, Tzu-Tao, et al.
Pubblicazione: (2025)
CondenseGraph: Communication-Efficient Distributed GNN Training via On-the-Fly Graph Condensation
di: Zhang, Zizhao, et al.
Pubblicazione: (2026)
di: Zhang, Zizhao, et al.
Pubblicazione: (2026)
Poplar: Efficient Scaling of Distributed DNN Training on Heterogeneous GPU Clusters
di: Zhang, WenZheng, et al.
Pubblicazione: (2024)
di: Zhang, WenZheng, et al.
Pubblicazione: (2024)
ATLAS: Efficient Out-of-Core Inference for Billion-Scale Graph Neural Networks
di: Naman, Pranjal, et al.
Pubblicazione: (2026)
di: Naman, Pranjal, et al.
Pubblicazione: (2026)
On the Performance and Memory Footprint of Distributed Training: An Empirical Study on Transformers
di: Lu, Zhengxian, et al.
Pubblicazione: (2024)
di: Lu, Zhengxian, et al.
Pubblicazione: (2024)
Efficient Distributed MLLM Training with Cornstarch
di: Jang, Insu, et al.
Pubblicazione: (2025)
di: Jang, Insu, et al.
Pubblicazione: (2025)
Justin: Hybrid CPU/Memory Elastic Scaling for Distributed Stream Processing
di: Schmitz, Donatien, et al.
Pubblicazione: (2025)
di: Schmitz, Donatien, et al.
Pubblicazione: (2025)
ACE-Sync: An Adaptive Cloud-Edge Synchronization Framework for Communication-Efficient Large-Scale Distributed Model Training
di: Yang, Yi, et al.
Pubblicazione: (2025)
di: Yang, Yi, et al.
Pubblicazione: (2025)
Efficient and Portable Support for Overdecomposition on Distributed Memory GPGPU Platforms
di: Bhosale, Aditya, et al.
Pubblicazione: (2026)
di: Bhosale, Aditya, et al.
Pubblicazione: (2026)
GMLake: Efficient and Transparent GPU Memory Defragmentation for Large-scale DNN Training with Virtual Memory Stitching
di: Guo, Cong, et al.
Pubblicazione: (2024)
di: Guo, Cong, et al.
Pubblicazione: (2024)
Disaggregated Memory with SmartNIC Offloading: a Case Study on Graph Processing
di: Wahlgren, Jacob, et al.
Pubblicazione: (2024)
di: Wahlgren, Jacob, et al.
Pubblicazione: (2024)
A New Approach for Evaluating the Performance of Distributed Latency-Sensitive Services
di: Theodoropoulos, Theodoros, et al.
Pubblicazione: (2024)
di: Theodoropoulos, Theodoros, et al.
Pubblicazione: (2024)
MegatronApp: Efficient and Comprehensive Management on Distributed LLM Training
di: Zhao, Bohan, et al.
Pubblicazione: (2025)
di: Zhao, Bohan, et al.
Pubblicazione: (2025)
Picasso: Memory-Efficient Graph Coloring Using Palettes With Applications in Quantum Computing
di: Ferdous, S M, et al.
Pubblicazione: (2024)
di: Ferdous, S M, et al.
Pubblicazione: (2024)
GriNNder: Breaking the Memory Capacity Wall in Full-Graph GNN Training with Storage Offloading
di: Song, Jaeyong, et al.
Pubblicazione: (2026)
di: Song, Jaeyong, et al.
Pubblicazione: (2026)
ReInc: Scaling Training of Dynamic Graph Neural Networks
di: Guan, Mingyu, et al.
Pubblicazione: (2025)
di: Guan, Mingyu, et al.
Pubblicazione: (2025)
HotSwap: Enabling Live Dependency Sharing in Serverless Computing
di: Li, Rui, et al.
Pubblicazione: (2024)
di: Li, Rui, et al.
Pubblicazione: (2024)
Efficient Training of Large Language Models on Distributed Infrastructures: A Survey
di: Duan, Jiangfei, et al.
Pubblicazione: (2024)
di: Duan, Jiangfei, et al.
Pubblicazione: (2024)
Efficient Parallelization Layouts for Large-Scale Distributed Model Training
di: Hagemann, Johannes, et al.
Pubblicazione: (2023)
di: Hagemann, Johannes, et al.
Pubblicazione: (2023)
SOLANET: Distributed Neighbor Graph Construction on GPU-Accelerated Systems
di: Iwabuchi, Keita, et al.
Pubblicazione: (2026)
di: Iwabuchi, Keita, et al.
Pubblicazione: (2026)
Memory Efficient and Staleness Free Pipeline Parallel DNN Training Framework with Improved Convergence Speed
di: Dutta, Ankita, et al.
Pubblicazione: (2025)
di: Dutta, Ankita, et al.
Pubblicazione: (2025)
AGoQ: Activation and Gradient Quantization for Memory-Efficient Distributed Training of LLMs
di: Lin, Wenxiang, et al.
Pubblicazione: (2026)
di: Lin, Wenxiang, et al.
Pubblicazione: (2026)
PRISM: Probabilistic Runtime Insights and Scalable Performance Modeling for Large-Scale Distributed Training
di: Golden, Alicia, et al.
Pubblicazione: (2025)
di: Golden, Alicia, et al.
Pubblicazione: (2025)
GSplit: Scaling Graph Neural Network Training on Large Graphs via Split-Parallelism
di: Polisetty, Sandeep, et al.
Pubblicazione: (2023)
di: Polisetty, Sandeep, et al.
Pubblicazione: (2023)
Efficient Graph Embedding at Scale: Optimizing CPU-GPU-SSD Integration
di: Li, Zhonggen, et al.
Pubblicazione: (2025)
di: Li, Zhonggen, et al.
Pubblicazione: (2025)
CaPGNN: Optimizing Parallel Graph Neural Network Training with Joint Caching and Resource-Aware Graph Partitioning
di: Song, Xianfeng, et al.
Pubblicazione: (2025)
di: Song, Xianfeng, et al.
Pubblicazione: (2025)
NeutronTP: Load-Balanced Distributed Full-Graph GNN Training with Tensor Parallelism
di: Ai, Xin, et al.
Pubblicazione: (2024)
di: Ai, Xin, et al.
Pubblicazione: (2024)
MTGenRec: An Efficient Distributed Training System for Generative Recommendation Models in Meituan
di: Wang, Yuxiang, et al.
Pubblicazione: (2025)
di: Wang, Yuxiang, et al.
Pubblicazione: (2025)
Analysis of Server Throughput For Managed Big Data Analytics Frameworks
di: Anagnostakis, Emmanouil, et al.
Pubblicazione: (2025)
di: Anagnostakis, Emmanouil, et al.
Pubblicazione: (2025)
Documenti analoghi
-
GraphSnapShot: Caching Local Structure for Fast Graph Learning
di: Liu, Dong, et al.
Pubblicazione: (2024) -
Eva: Cost-Efficient Cloud-Based Cluster Scheduling
di: Chang, Tzu-Tao, et al.
Pubblicazione: (2025) -
PGT-I: Scaling Spatiotemporal GNNs with Memory-Efficient Distributed Training
di: Ockerman, Seth, et al.
Pubblicazione: (2025) -
SYMPHONY: Improving Memory Management for LLM Inference Workloads
di: Agarwal, Saurabh, et al.
Pubblicazione: (2024) -
RapidGNN: Communication Efficient Large-Scale Distributed Training of Graph Neural Networks
di: Niam, Arefin, et al.
Pubblicazione: (2025)