Heta: Distributed Training of Heterogeneous Graph Neural Networks
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhong, Yuchen, Su, Junwei, Wu, Chuan, Wang, Minjie |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SWIFT: Expedited Failure Recovery for Large-scale DNN Training
por: Zhong, Yuchen, et al.
Publicado: (2023)
por: Zhong, Yuchen, et al.
Publicado: (2023)
MSPipe: Efficient Temporal GNN Training via Staleness-Aware Pipeline
por: Sheng, Guangming, et al.
Publicado: (2024)
por: Sheng, Guangming, et al.
Publicado: (2024)
RapidGNN: Communication Efficient Large-Scale Distributed Training of Graph Neural Networks
por: Niam, Arefin, et al.
Publicado: (2025)
por: Niam, Arefin, et al.
Publicado: (2025)
HAP: SPMD DNN Training on Heterogeneous GPU Clusters with Automated Program Synthesis
por: Zhang, Shiwei, et al.
Publicado: (2024)
por: Zhang, Shiwei, et al.
Publicado: (2024)
HexiSeq: Accommodating Long Context Training of LLMs over Heterogeneous Hardware
por: Liang, Yan, et al.
Publicado: (2026)
por: Liang, Yan, et al.
Publicado: (2026)
Spatiotemporal Traffic Prediction in Distributed Backend Systems via Graph Neural Networks
por: Qiu, Zhimin, et al.
Publicado: (2025)
por: Qiu, Zhimin, et al.
Publicado: (2025)
Optimizing Distributed Training Approaches for Scaling Neural Networks
por: Baligodugula, Vishnu Vardhan, et al.
Publicado: (2025)
por: Baligodugula, Vishnu Vardhan, et al.
Publicado: (2025)
Addressing Variable Heterogeneity in Distributed Multimodal Training with Entrain
por: Jang, Insu, et al.
Publicado: (2026)
por: Jang, Insu, et al.
Publicado: (2026)
Fully Distributed Online Training of Graph Neural Networks in Networked Systems
por: Olshevskyi, Rostyslav, et al.
Publicado: (2024)
por: Olshevskyi, Rostyslav, et al.
Publicado: (2024)
Poplar: Efficient Scaling of Distributed DNN Training on Heterogeneous GPU Clusters
por: Zhang, WenZheng, et al.
Publicado: (2024)
por: Zhang, WenZheng, et al.
Publicado: (2024)
CaPGNN: Optimizing Parallel Graph Neural Network Training with Joint Caching and Resource-Aware Graph Partitioning
por: Song, Xianfeng, et al.
Publicado: (2025)
por: Song, Xianfeng, et al.
Publicado: (2025)
An Experimental Comparison of Partitioning Strategies for Distributed Graph Neural Network Training
por: Merkel, Nikolai, et al.
Publicado: (2023)
por: Merkel, Nikolai, et al.
Publicado: (2023)
CondenseGraph: Communication-Efficient Distributed GNN Training via On-the-Fly Graph Condensation
por: Zhang, Zizhao, et al.
Publicado: (2026)
por: Zhang, Zizhao, et al.
Publicado: (2026)
PowerTrip: Exploiting Federated Heterogeneous Datacenter Power for Distributed ML Training
por: Mehboob, Talha, et al.
Publicado: (2025)
por: Mehboob, Talha, et al.
Publicado: (2025)
Sailor: Automating Distributed Training over Dynamic, Heterogeneous, and Geo-distributed Clusters
por: Strati, Foteini, et al.
Publicado: (2025)
por: Strati, Foteini, et al.
Publicado: (2025)
Holmes: Towards Distributed Training Across Clusters with Heterogeneous NIC Environment
por: Yang, Fei, et al.
Publicado: (2023)
por: Yang, Fei, et al.
Publicado: (2023)
SDT-GNN: Streaming-based Distributed Training Framework for Graph Neural Networks
por: Huang, Xin, et al.
Publicado: (2024)
por: Huang, Xin, et al.
Publicado: (2024)
Armada: Memory-Efficient Distributed Training of Large-Scale Graph Neural Networks
por: Waleffe, Roger, et al.
Publicado: (2025)
por: Waleffe, Roger, et al.
Publicado: (2025)
DistTrain: Addressing Model and Data Heterogeneity with Disaggregated Training for Multimodal Large Language Models
por: Zhang, Zili, et al.
Publicado: (2024)
por: Zhang, Zili, et al.
Publicado: (2024)
Multi-Resolution Model Fusion for Accelerating the Convolutional Neural Network Training
por: Wang, Kewei, et al.
Publicado: (2025)
por: Wang, Kewei, et al.
Publicado: (2025)
DiffusionPipe: Training Large Diffusion Models with Efficient Pipelines
por: Tian, Ye, et al.
Publicado: (2024)
por: Tian, Ye, et al.
Publicado: (2024)
Federated Incomplete Multi-View Clustering with Heterogeneous Graph Neural Networks
por: Yan, Xueming, et al.
Publicado: (2024)
por: Yan, Xueming, et al.
Publicado: (2024)
MalleTrain: Deep Neural Network Training on Unfillable Supercomputer Nodes
por: Ma, Xiaolong, et al.
Publicado: (2024)
por: Ma, Xiaolong, et al.
Publicado: (2024)
Distributed Matrix-Based Sampling for Graph Neural Network Training
por: Tripathy, Alok, et al.
Publicado: (2023)
por: Tripathy, Alok, et al.
Publicado: (2023)
NeutronTP: Load-Balanced Distributed Full-Graph GNN Training with Tensor Parallelism
por: Ai, Xin, et al.
Publicado: (2024)
por: Ai, Xin, et al.
Publicado: (2024)
LuWu: An End-to-End In-Network Out-of-Core Optimizer for 100B-Scale Model-in-Network Data-Parallel Training on Distributed GPUs
por: Sun, Mo, et al.
Publicado: (2024)
por: Sun, Mo, et al.
Publicado: (2024)
Reducing Data Bottlenecks in Distributed, Heterogeneous Neural Networks
por: Lin, Ruhai, et al.
Publicado: (2024)
por: Lin, Ruhai, et al.
Publicado: (2024)
HARP: Orchestrating Automated Parallel Training on Heterogeneous GPU Clusters
por: Liang, Antian, et al.
Publicado: (2025)
por: Liang, Antian, et al.
Publicado: (2025)
Coordinated Power Management on Heterogeneous Systems
por: Zheng, Zhong, et al.
Publicado: (2025)
por: Zheng, Zhong, et al.
Publicado: (2025)
Accelerating Nonlinear Time-History Analysis with Complex Constitutive Laws via Heterogeneous Memory Management: From 3D Seismic Simulation to Neural Network Training
por: Ichimura, Tsuyoshi, et al.
Publicado: (2026)
por: Ichimura, Tsuyoshi, et al.
Publicado: (2026)
Argus: Token Aware Distributed LLM Inference Optimization
por: Wu, Panlong, et al.
Publicado: (2025)
por: Wu, Panlong, et al.
Publicado: (2025)
BurstEngine: an Efficient Distributed Framework for Training Transformers on Extremely Long Sequences of over 1M Tokens
por: Sun, Ao, et al.
Publicado: (2025)
por: Sun, Ao, et al.
Publicado: (2025)
Nezha: Breaking Multi-Rail Network Barriers for Distributed DNN Training
por: Yu, Enda, et al.
Publicado: (2024)
por: Yu, Enda, et al.
Publicado: (2024)
Hexa-MoE: Efficient and Heterogeneous-aware Training for Mixture-of-Experts
por: Luo, Shuqing, et al.
Publicado: (2024)
por: Luo, Shuqing, et al.
Publicado: (2024)
MTGenRec: An Efficient Distributed Training System for Generative Recommendation Models in Meituan
por: Wang, Yuxiang, et al.
Publicado: (2025)
por: Wang, Yuxiang, et al.
Publicado: (2025)
Echo: Simulating Distributed Training At Scale
por: Feng, Yicheng, et al.
Publicado: (2024)
por: Feng, Yicheng, et al.
Publicado: (2024)
Heterogeneity-Aware Memory Efficient Federated Learning via Progressive Layer Freezing
por: Yebo, Wu, et al.
Publicado: (2024)
por: Yebo, Wu, et al.
Publicado: (2024)
Embedded Distributed Inference of Deep Neural Networks: A Systematic Review
por: Peccia, Federico Nicolás, et al.
Publicado: (2024)
por: Peccia, Federico Nicolás, et al.
Publicado: (2024)
Towards Affordable, Adaptive and Automatic GNN Training on CPU-GPU Heterogeneous Platforms
por: Qiao, Tong, et al.
Publicado: (2025)
por: Qiao, Tong, et al.
Publicado: (2025)
Stable-MoE: Lyapunov-based Token Routing for Distributed Mixture-of-Experts Training over Edge Networks
por: Shi, Long, et al.
Publicado: (2025)
por: Shi, Long, et al.
Publicado: (2025)
Ejemplares similares
-
SWIFT: Expedited Failure Recovery for Large-scale DNN Training
por: Zhong, Yuchen, et al.
Publicado: (2023) -
MSPipe: Efficient Temporal GNN Training via Staleness-Aware Pipeline
por: Sheng, Guangming, et al.
Publicado: (2024) -
RapidGNN: Communication Efficient Large-Scale Distributed Training of Graph Neural Networks
por: Niam, Arefin, et al.
Publicado: (2025) -
HAP: SPMD DNN Training on Heterogeneous GPU Clusters with Automated Program Synthesis
por: Zhang, Shiwei, et al.
Publicado: (2024) -
HexiSeq: Accommodating Long Context Training of LLMs over Heterogeneous Hardware
por: Liang, Yan, et al.
Publicado: (2026)