A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO
Fuente:
arXiv
Guardado en:
| Autores principales: | Svedas, Jonas, Watson, Hannah, Laubeuf, Nathan, Moolchandani, Diksha, Nada, Abubakr, Singh, Arjun, Biswas, Dwaipayan, Myers, James, Bhattacharjee, Debjyoti |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Evaluating Cross-Architecture Performance Modeling of Distributed ML Workloads Using StableHLO
por: Svedas, Jonas, et al.
Publicado: (2026)
por: Svedas, Jonas, et al.
Publicado: (2026)
Saarthi: An End-to-End Intelligent Platform for Optimising Distributed Serverless Workloads
por: Agarwal, Siddharth, et al.
Publicado: (2025)
por: Agarwal, Siddharth, et al.
Publicado: (2025)
Pagoda: An Energy and Time Roofline Study for DNN Workloads on Edge Accelerators
por: K., Prashanthi S., et al.
Publicado: (2025)
por: K., Prashanthi S., et al.
Publicado: (2025)
An End-to-End DNN Inference Framework for the SpiNNaker2 Neuromorphic MPSoC
por: Jobst, Matthias, et al.
Publicado: (2025)
por: Jobst, Matthias, et al.
Publicado: (2025)
A Proposed End-To-End Principle for Data Commons
por: Grossman, Robert L.
Publicado: (2025)
por: Grossman, Robert L.
Publicado: (2025)
End-to-End and Phase-Level Performance Optimization for Hyperledger Fabric
por: Sollu, Pavan, et al.
Publicado: (2026)
por: Sollu, Pavan, et al.
Publicado: (2026)
LuWu: An End-to-End In-Network Out-of-Core Optimizer for 100B-Scale Model-in-Network Data-Parallel Training on Distributed GPUs
por: Sun, Mo, et al.
Publicado: (2024)
por: Sun, Mo, et al.
Publicado: (2024)
Beyond End-to-End: Dynamic Chain Optimization for Private LLM Adaptation on the Edge
por: Wu, Yebo, et al.
Publicado: (2026)
por: Wu, Yebo, et al.
Publicado: (2026)
Improving the End-to-End Efficiency of Offline Inference for Multi-LLM Applications Based on Sampling and Simulation
por: Fang, Jingzhi, et al.
Publicado: (2025)
por: Fang, Jingzhi, et al.
Publicado: (2025)
Accelerating Compound LLM Training Workloads with Maestro
por: Yuan, Xiulong, et al.
Publicado: (2026)
por: Yuan, Xiulong, et al.
Publicado: (2026)
Cost-Effective Edge Data Distribution with End-To-End Delay Guarantees in Edge Computing
por: Shankar, Ravi, et al.
Publicado: (2025)
por: Shankar, Ravi, et al.
Publicado: (2025)
KubeIntellect: A Modular LLM-Orchestrated Agent Framework for End-to-End Kubernetes Management
por: Ardebili, Mohsen Seyedkazemi, et al.
Publicado: (2025)
por: Ardebili, Mohsen Seyedkazemi, et al.
Publicado: (2025)
FlashMem: Supporting Modern DNN Workloads on Mobile with GPU Memory Hierarchy Optimizations
por: Shu, Zhihao, et al.
Publicado: (2026)
por: Shu, Zhihao, et al.
Publicado: (2026)
CARIn: Constraint-Aware and Responsive Inference on Heterogeneous Devices for Single- and Multi-DNN Workloads
por: Panopoulos, Ioannis, et al.
Publicado: (2024)
por: Panopoulos, Ioannis, et al.
Publicado: (2024)
Union: An Automatic Workload Manager for Accelerating Network Simulation
por: Wang, Xin, et al.
Publicado: (2024)
por: Wang, Xin, et al.
Publicado: (2024)
Odyssey: An End-to-End System for Pareto-Optimal Serverless Query Processing
por: Jesalpura, Shyam, et al.
Publicado: (2025)
por: Jesalpura, Shyam, et al.
Publicado: (2025)
Training DNN Models over Heterogeneous Clusters with Optimal Performance
por: Nie, Chengyi, et al.
Publicado: (2024)
por: Nie, Chengyi, et al.
Publicado: (2024)
Performance Characterization of Containerized DNN Training and Inference on Edge Accelerators
por: K., Prashanthi S., et al.
Publicado: (2023)
por: K., Prashanthi S., et al.
Publicado: (2023)
Fulcrum: Optimizing Concurrent DNN Training and Inferencing on Edge Accelerators
por: K., Prashanthi S., et al.
Publicado: (2025)
por: K., Prashanthi S., et al.
Publicado: (2025)
Parcae: Proactive, Liveput-Optimized DNN Training on Preemptible Instances
por: Duan, Jiangfei, et al.
Publicado: (2024)
por: Duan, Jiangfei, et al.
Publicado: (2024)
SWIFT: Expedited Failure Recovery for Large-scale DNN Training
por: Zhong, Yuchen, et al.
Publicado: (2023)
por: Zhong, Yuchen, et al.
Publicado: (2023)
Balanced and Elastic End-to-end Training of Dynamic LLMs
por: Wahib, Mohamed, et al.
Publicado: (2025)
por: Wahib, Mohamed, et al.
Publicado: (2025)
Evaluating Malleable Job Scheduling in HPC Clusters using Real-World Workloads
por: Zojer, Patrick, et al.
Publicado: (2026)
por: Zojer, Patrick, et al.
Publicado: (2026)
Nezha: Breaking Multi-Rail Network Barriers for Distributed DNN Training
por: Yu, Enda, et al.
Publicado: (2024)
por: Yu, Enda, et al.
Publicado: (2024)
A Flexible Programmable Pipeline Parallelism Framework for Efficient DNN Training
por: Jiang, Lijuan, et al.
Publicado: (2025)
por: Jiang, Lijuan, et al.
Publicado: (2025)
Poplar: Efficient Scaling of Distributed DNN Training on Heterogeneous GPU Clusters
por: Zhang, WenZheng, et al.
Publicado: (2024)
por: Zhang, WenZheng, et al.
Publicado: (2024)
Deal: Distributed End-to-End GNN Inference for All Nodes
por: Chen, Shiyang, et al.
Publicado: (2025)
por: Chen, Shiyang, et al.
Publicado: (2025)
HAP: SPMD DNN Training on Heterogeneous GPU Clusters with Automated Program Synthesis
por: Zhang, Shiwei, et al.
Publicado: (2024)
por: Zhang, Shiwei, et al.
Publicado: (2024)
Efficient Fault Localization in a Cloud Stack Using End-to-End Application Service Topology
por: Mathews, Dhanya R, et al.
Publicado: (2025)
por: Mathews, Dhanya R, et al.
Publicado: (2025)
Zeppelin: Balancing Variable-length Workloads in Data Parallel Large Model Training
por: Chen, Chang, et al.
Publicado: (2025)
por: Chen, Chang, et al.
Publicado: (2025)
A Heterogeneous Chiplet Architecture for Accelerating End-to-End Transformer Models
por: Sharma, Harsh, et al.
Publicado: (2023)
por: Sharma, Harsh, et al.
Publicado: (2023)
EaCO: Resource Sharing Dynamics and Its Impact on Energy Efficiency for DNN Training
por: Haghshenas, Kawsar, et al.
Publicado: (2024)
por: Haghshenas, Kawsar, et al.
Publicado: (2024)
nncase: An End-to-End Compiler for Efficient LLM Deployment on Heterogeneous Storage Architectures
por: Guo, Hui, et al.
Publicado: (2025)
por: Guo, Hui, et al.
Publicado: (2025)
Memory Efficient and Staleness Free Pipeline Parallel DNN Training Framework with Improved Convergence Speed
por: Dutta, Ankita, et al.
Publicado: (2025)
por: Dutta, Ankita, et al.
Publicado: (2025)
A Survey on Collaborative DNN Inference for Edge Intelligence
por: Ren, Weiqing, et al.
Publicado: (2022)
por: Ren, Weiqing, et al.
Publicado: (2022)
Rearchitecting Datacenter Lifecycle for AI: A TCO-Driven Framework
por: Stojkovic, Jovan, et al.
Publicado: (2025)
por: Stojkovic, Jovan, et al.
Publicado: (2025)
ClusterRCA: An End-to-End Approach for Network Fault Localization and Classification for HPC System
por: Sun, Yongqian, et al.
Publicado: (2025)
por: Sun, Yongqian, et al.
Publicado: (2025)
StraightLine: An End-to-End Resource-Aware Scheduler for Machine Learning Application Requests
por: Ching, Cheng-Wei, et al.
Publicado: (2024)
por: Ching, Cheng-Wei, et al.
Publicado: (2024)
PaSE: Parallelization Strategies for Efficient DNN Training
por: Elango, Venmugil
Publicado: (2024)
por: Elango, Venmugil
Publicado: (2024)
GMLake: Efficient and Transparent GPU Memory Defragmentation for Large-scale DNN Training with Virtual Memory Stitching
por: Guo, Cong, et al.
Publicado: (2024)
por: Guo, Cong, et al.
Publicado: (2024)
Ejemplares similares
-
Evaluating Cross-Architecture Performance Modeling of Distributed ML Workloads Using StableHLO
por: Svedas, Jonas, et al.
Publicado: (2026) -
Saarthi: An End-to-End Intelligent Platform for Optimising Distributed Serverless Workloads
por: Agarwal, Siddharth, et al.
Publicado: (2025) -
Pagoda: An Energy and Time Roofline Study for DNN Workloads on Edge Accelerators
por: K., Prashanthi S., et al.
Publicado: (2025) -
An End-to-End DNN Inference Framework for the SpiNNaker2 Neuromorphic MPSoC
por: Jobst, Matthias, et al.
Publicado: (2025) -
A Proposed End-To-End Principle for Data Commons
por: Grossman, Robert L.
Publicado: (2025)