LIBRA: Enabling Workload-aware Multi-dimensional Network Topology Optimization for Distributed Training of Large AI Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Won, William, Rashidi, Saeed, Srinivasan, Sudarshan, Krishna, Tushar |
|---|---|
| Format: | Preprint |
| Publié: |
2021
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ASTRA-sim2.0: Modeling Hierarchical Networks and Disaggregated Systems for Large-model Training at Scale
par: Won, William, et autres
Publié: (2023)
par: Won, William, et autres
Publié: (2023)
TACOS: Topology-Aware Collective Algorithm Synthesizer for Distributed Machine Learning
par: Won, William, et autres
Publié: (2023)
par: Won, William, et autres
Publié: (2023)
COSMIC: Enabling Full-Stack Co-Design and Optimization of Distributed Machine Learning Systems
par: Raju, Aditi, et autres
Publié: (2025)
par: Raju, Aditi, et autres
Publié: (2025)
COMET: A Comprehensive Cluster Design Methodology for Distributed Deep Learning Training
par: Kadiyala, Divya Kiran, et autres
Publié: (2022)
par: Kadiyala, Divya Kiran, et autres
Publié: (2022)
Evaluating Cross-Architecture Performance Modeling of Distributed ML Workloads Using StableHLO
par: Svedas, Jonas, et autres
Publié: (2026)
par: Svedas, Jonas, et autres
Publié: (2026)
HARP: A Taxonomy for Heterogeneous and Hierarchical Processors for Mixed-reuse Workloads
par: Garg, Raveesh, et autres
Publié: (2025)
par: Garg, Raveesh, et autres
Publié: (2025)
Flint: Compiler Enabled Cluster-Free Design Space Exploration for Distributed ML
par: Yoo, Jinsun, et autres
Publié: (2026)
par: Yoo, Jinsun, et autres
Publié: (2026)
AI Surrogate Model for Distributed Computing Workloads
par: Park, David K., et autres
Publié: (2024)
par: Park, David K., et autres
Publié: (2024)
Topology-aware Preemptive Scheduling for Co-located LLM Workloads
par: Zhang, Ping, et autres
Publié: (2024)
par: Zhang, Ping, et autres
Publié: (2024)
Towards a Standardized Representation for Deep Learning Collective Algorithms
par: Yoo, Jinsun, et autres
Publié: (2024)
par: Yoo, Jinsun, et autres
Publié: (2024)
A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO
par: Svedas, Jonas, et autres
Publié: (2025)
par: Svedas, Jonas, et autres
Publié: (2025)
Agentic AI Workload Characteristics
par: Yuan, Yichao, et autres
Publié: (2026)
par: Yuan, Yichao, et autres
Publié: (2026)
Zeppelin: Balancing Variable-length Workloads in Data Parallel Large Model Training
par: Chen, Chang, et autres
Publié: (2025)
par: Chen, Chang, et autres
Publié: (2025)
Offline Energy-Optimal LLM Serving: Workload-Based Energy Models for LLM Inference on Heterogeneous Systems
par: Wilkins, Grant, et autres
Publié: (2024)
par: Wilkins, Grant, et autres
Publié: (2024)
Scheduling Data-Intensive Workloads in Large-Scale Distributed Systems: Trends and Challenges
par: Stavrinides, Georgios L., et autres
Publié: (2025)
par: Stavrinides, Georgios L., et autres
Publié: (2025)
Accelerating Compound LLM Training Workloads with Maestro
par: Yuan, Xiulong, et autres
Publié: (2026)
par: Yuan, Xiulong, et autres
Publié: (2026)
Optimizing Distributed Training Approaches for Scaling Neural Networks
par: Baligodugula, Vishnu Vardhan, et autres
Publié: (2025)
par: Baligodugula, Vishnu Vardhan, et autres
Publié: (2025)
Kub: Enabling Elastic HPC Workloads on Containerized Environments
par: Medeiros, Daniel, et autres
Publié: (2024)
par: Medeiros, Daniel, et autres
Publié: (2024)
Demystifying AI Platform Design for Distributed Inference of Next-Generation LLM models
par: Bambhaniya, Abhimanyu, et autres
Publié: (2024)
par: Bambhaniya, Abhimanyu, et autres
Publié: (2024)
Distributed Load Balancing with Workload-Dependent Service Rates
par: Zhang, Wenxin, et autres
Publié: (2024)
par: Zhang, Wenxin, et autres
Publié: (2024)
Data Management System Analysis for Distributed Computing Workloads
par: Hsu, Kuan-Chieh, et autres
Publié: (2025)
par: Hsu, Kuan-Chieh, et autres
Publié: (2025)
Optimal Workload Placement on Multi-Instance GPUs
par: Turkkan, Bekir, et autres
Publié: (2024)
par: Turkkan, Bekir, et autres
Publié: (2024)
Workload Distribution with Rateless Encoding: A Low-Latency Computation Offloading Method within Edge Networks
par: Guo, Zhongfu, et autres
Publié: (2023)
par: Guo, Zhongfu, et autres
Publié: (2023)
MegaScale-Omni: A Hyper-Scale, Workload-Resilient System for MultiModal LLM Training in Production
par: Xue, Chunyu, et autres
Publié: (2026)
par: Xue, Chunyu, et autres
Publié: (2026)
Towards Cloud Efficiency with Large-scale Workload Characterization
par: Parayil, Anjaly, et autres
Publié: (2024)
par: Parayil, Anjaly, et autres
Publié: (2024)
Nezha: Breaking Multi-Rail Network Barriers for Distributed DNN Training
par: Yu, Enda, et autres
Publié: (2024)
par: Yu, Enda, et autres
Publié: (2024)
Union: An Automatic Workload Manager for Accelerating Network Simulation
par: Wang, Xin, et autres
Publié: (2024)
par: Wang, Xin, et autres
Publié: (2024)
A Framework for Carbon-aware Real-Time Workload Management in Clouds using Renewables-driven Cores
par: Hewage, Tharindu B., et autres
Publié: (2024)
par: Hewage, Tharindu B., et autres
Publié: (2024)
Saarthi: An End-to-End Intelligent Platform for Optimising Distributed Serverless Workloads
par: Agarwal, Siddharth, et autres
Publié: (2025)
par: Agarwal, Siddharth, et autres
Publié: (2025)
Workload-Aware Hardware Accelerator Mining for Distributed Deep Learning Training
par: Adnan, Muhammad, et autres
Publié: (2024)
par: Adnan, Muhammad, et autres
Publié: (2024)
Characterizing the Efficiency of Distributed Training: A Power, Performance, and Thermal Perspective
par: Go, Seokjin, et autres
Publié: (2025)
par: Go, Seokjin, et autres
Publié: (2025)
Resource Optimization with MPI Process Malleability for Dynamic Workloads in HPC Clusters
par: Iserte, Sergio, et autres
Publié: (2025)
par: Iserte, Sergio, et autres
Publié: (2025)
RapidGNN: Communication Efficient Large-Scale Distributed Training of Graph Neural Networks
par: Niam, Arefin, et autres
Publié: (2025)
par: Niam, Arefin, et autres
Publié: (2025)
TailBench++: Flexible Multi-Client, Multi-Server Benchmarking for Latency-Critical Workloads
par: Li, Zhilin, et autres
Publié: (2025)
par: Li, Zhilin, et autres
Publié: (2025)
Hybrid Heterogeneous Clusters Can Lower the Energy Consumption of LLM Inference Workloads
par: Wilkins, Grant, et autres
Publié: (2024)
par: Wilkins, Grant, et autres
Publié: (2024)
Bandwidth-Aware Network Topology Optimization for Decentralized Learning
par: Shen, Yipeng, et autres
Publié: (2025)
par: Shen, Yipeng, et autres
Publié: (2025)
PRISM: Dynamic Primitive-Based Forecasting for Large-Scale GPU Cluster Workloads
par: Wu, Xin, et autres
Publié: (2026)
par: Wu, Xin, et autres
Publié: (2026)
ServeGen: Workload Characterization and Generation of Large Language Model Serving in Production
par: Xiang, Yuxing, et autres
Publié: (2025)
par: Xiang, Yuxing, et autres
Publié: (2025)
Galvatron: Automatic Distributed Training for Large Transformer Models
par: Gumaan, Esmail
Publié: (2025)
par: Gumaan, Esmail
Publié: (2025)
Workflow-Driven Modeling for the Compute Continuum: An Optimization Approach to Automated System and Workload Scheduling
par: Sharma, Aasish Kumar, et autres
Publié: (2025)
par: Sharma, Aasish Kumar, et autres
Publié: (2025)
Documents similaires
-
ASTRA-sim2.0: Modeling Hierarchical Networks and Disaggregated Systems for Large-model Training at Scale
par: Won, William, et autres
Publié: (2023) -
TACOS: Topology-Aware Collective Algorithm Synthesizer for Distributed Machine Learning
par: Won, William, et autres
Publié: (2023) -
COSMIC: Enabling Full-Stack Co-Design and Optimization of Distributed Machine Learning Systems
par: Raju, Aditi, et autres
Publié: (2025) -
COMET: A Comprehensive Cluster Design Methodology for Distributed Deep Learning Training
par: Kadiyala, Divya Kiran, et autres
Publié: (2022) -
Evaluating Cross-Architecture Performance Modeling of Distributed ML Workloads Using StableHLO
par: Svedas, Jonas, et autres
Publié: (2026)