PRISM: Probabilistic Runtime Insights and Scalable Performance Modeling for Large-Scale Distributed Training
Fuente:
arXiv
Salvato in:
| Autori principali: | Golden, Alicia, Kuchnik, Michael, Hsia, Samuel, DeVito, Zachary, Wei, Gu-Yeon, Brooks, David, Wu, Carole-Jean |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MAD Max Beyond Single-Node: Enabling Large Machine Learning Model Acceleration on Distributed Systems
di: Hsia, Samuel, et al.
Pubblicazione: (2023)
di: Hsia, Samuel, et al.
Pubblicazione: (2023)
Is Flash Attention Stable?
di: Golden, Alicia, et al.
Pubblicazione: (2024)
di: Golden, Alicia, et al.
Pubblicazione: (2024)
Generative AI Beyond LLMs: System Implications of Multi-Modal Generation
di: Golden, Alicia, et al.
Pubblicazione: (2023)
di: Golden, Alicia, et al.
Pubblicazione: (2023)
Revisiting Reliability in Large-Scale Machine Learning Research Clusters
di: Kokolis, Apostolos, et al.
Pubblicazione: (2024)
di: Kokolis, Apostolos, et al.
Pubblicazione: (2024)
ScaleAcross Explorer: Exploring Communication Optimization for Scale-Across AI Model Training
di: Li, Minghao, et al.
Pubblicazione: (2026)
di: Li, Minghao, et al.
Pubblicazione: (2026)
ARGO: An Auto-Tuning Runtime System for Scalable GNN Training on Multi-Core Processor
di: Lin, Yi-Chien, et al.
Pubblicazione: (2024)
di: Lin, Yi-Chien, et al.
Pubblicazione: (2024)
GreenDyGNN: Runtime-Adaptive Energy-Efficient Communication for Distributed GNN Training
di: Niam, Arefin, et al.
Pubblicazione: (2026)
di: Niam, Arefin, et al.
Pubblicazione: (2026)
Runtime-Orchestrated Second-Order Optimization for Scalable LLM Training
di: Lu, Yishun, et al.
Pubblicazione: (2026)
di: Lu, Yishun, et al.
Pubblicazione: (2026)
PRISM: Dynamic Primitive-Based Forecasting for Large-Scale GPU Cluster Workloads
di: Wu, Xin, et al.
Pubblicazione: (2026)
di: Wu, Xin, et al.
Pubblicazione: (2026)
Asynchronous Fault-Tolerant Language Decidability for Runtime Verification of Distributed Systems
di: Castañeda, Armando, et al.
Pubblicazione: (2025)
di: Castañeda, Armando, et al.
Pubblicazione: (2025)
Privacy-Preserving Sharing of Data Analytics Runtime Metrics for Performance Modeling
di: Will, Jonathan, et al.
Pubblicazione: (2024)
di: Will, Jonathan, et al.
Pubblicazione: (2024)
Optimizing Distributed Training Approaches for Scaling Neural Networks
di: Baligodugula, Vishnu Vardhan, et al.
Pubblicazione: (2025)
di: Baligodugula, Vishnu Vardhan, et al.
Pubblicazione: (2025)
Radiation Hydrodynamics at Scale: Comparing MPI and Asynchronous Many-Task Runtimes with FleCSI
di: Strack, Alexander, et al.
Pubblicazione: (2026)
di: Strack, Alexander, et al.
Pubblicazione: (2026)
Overcoming Latency-bound Limitations of Distributed Graph Algorithms using the HPX Runtime System
di: Mohammadiporshokooh, Karame, et al.
Pubblicazione: (2026)
di: Mohammadiporshokooh, Karame, et al.
Pubblicazione: (2026)
PRISM: Processing-In-Memory Sparse MTTKRP for Tensor Decomposition Acceleration
di: Pacheco, Daniel, et al.
Pubblicazione: (2026)
di: Pacheco, Daniel, et al.
Pubblicazione: (2026)
Lumos: Performance Characterization of WebAssembly as a Serverless Runtime in the Edge-Cloud Continuum
di: Marcelino, Cynthia, et al.
Pubblicazione: (2025)
di: Marcelino, Cynthia, et al.
Pubblicazione: (2025)
DistFlow: A Fully Distributed RL Framework for Scalable and Efficient LLM Post-Training
di: Wang, Zhixin, et al.
Pubblicazione: (2025)
di: Wang, Zhixin, et al.
Pubblicazione: (2025)
FlowMoE: A Scalable Pipeline Scheduling Framework for Distributed Mixture-of-Experts Training
di: Gao, Yunqi, et al.
Pubblicazione: (2025)
di: Gao, Yunqi, et al.
Pubblicazione: (2025)
RCOMPSs: A Scalable Runtime System for R Code Execution on Manycore Systems
di: Zhang, Xiran, et al.
Pubblicazione: (2025)
di: Zhang, Xiran, et al.
Pubblicazione: (2025)
On the Performance and Memory Footprint of Distributed Training: An Empirical Study on Transformers
di: Lu, Zhengxian, et al.
Pubblicazione: (2024)
di: Lu, Zhengxian, et al.
Pubblicazione: (2024)
Poplar: Efficient Scaling of Distributed DNN Training on Heterogeneous GPU Clusters
di: Zhang, WenZheng, et al.
Pubblicazione: (2024)
di: Zhang, WenZheng, et al.
Pubblicazione: (2024)
SDSL-Solver: Scalable Distributed Sparse Linear Solvers for Large-Scale Interior Point Methods
di: Yang, Shaofeng, et al.
Pubblicazione: (2026)
di: Yang, Shaofeng, et al.
Pubblicazione: (2026)
A Readiness-Driven Runtime for Pipeline-Parallel Training under Runtime Variability
di: Liu, Ruitao, et al.
Pubblicazione: (2026)
di: Liu, Ruitao, et al.
Pubblicazione: (2026)
GICC: A High-Performance Runtime for GPU-Initiated Communication and Coordination in Modern HPC Systems
di: Shan, Baodi, et al.
Pubblicazione: (2026)
di: Shan, Baodi, et al.
Pubblicazione: (2026)
A Study on the Performance of Distributed Training of Data-driven CFD Simulations
di: Iserte, Sergio, et al.
Pubblicazione: (2026)
di: Iserte, Sergio, et al.
Pubblicazione: (2026)
TD-Orch: Scalable Load-Balancing for Distributed Systems with Applications to Graph Processing
di: Zhao, Yiwei, et al.
Pubblicazione: (2025)
di: Zhao, Yiwei, et al.
Pubblicazione: (2025)
A Scalable Recipe on SuperMUC-NG Phase 2: Efficient Large-Scale Training of Language Models
di: Rajgopal, Ajay Navilarekal, et al.
Pubblicazione: (2026)
di: Rajgopal, Ajay Navilarekal, et al.
Pubblicazione: (2026)
QScale: Probabilistic Chained Consensus for Moderate-Scale Systems
di: Heydari, Hasan, et al.
Pubblicazione: (2025)
di: Heydari, Hasan, et al.
Pubblicazione: (2025)
Scalable and Performant Data Loading
di: Hira, Moto, et al.
Pubblicazione: (2025)
di: Hira, Moto, et al.
Pubblicazione: (2025)
Efficient Parallelization Layouts for Large-Scale Distributed Model Training
di: Hagemann, Johannes, et al.
Pubblicazione: (2023)
di: Hagemann, Johannes, et al.
Pubblicazione: (2023)
Pilotfish: Distributed Execution for Scalable Blockchains
di: Kniep, Quentin, et al.
Pubblicazione: (2024)
di: Kniep, Quentin, et al.
Pubblicazione: (2024)
RapidGNN: Communication Efficient Large-Scale Distributed Training of Graph Neural Networks
di: Niam, Arefin, et al.
Pubblicazione: (2025)
di: Niam, Arefin, et al.
Pubblicazione: (2025)
A New Execution Model and Executor for Adaptively Optimizing the Performance of Parallel Algorithms Using HPX Runtime System
di: Mohammadiporshokooh, Karame, et al.
Pubblicazione: (2025)
di: Mohammadiporshokooh, Karame, et al.
Pubblicazione: (2025)
Beyond Efficiency: Scaling AI Sustainably
di: Wu, Carole-Jean, et al.
Pubblicazione: (2024)
di: Wu, Carole-Jean, et al.
Pubblicazione: (2024)
Automatic Tracing in Task-Based Runtime Systems
di: Yadav, Rohan, et al.
Pubblicazione: (2024)
di: Yadav, Rohan, et al.
Pubblicazione: (2024)
An AI-Native Runtime for Multi-Wearable Environments
di: Min, Chulhong, et al.
Pubblicazione: (2024)
di: Min, Chulhong, et al.
Pubblicazione: (2024)
Junctiond: Extending FaaS Runtimes with Kernel-Bypass
di: Saurez, Enrique, et al.
Pubblicazione: (2024)
di: Saurez, Enrique, et al.
Pubblicazione: (2024)
Fused Breadth-First Probabilistic Traversals on Distributed GPU Systems
di: Neff, Reece, et al.
Pubblicazione: (2023)
di: Neff, Reece, et al.
Pubblicazione: (2023)
madupite: A High-Performance Distributed Solver for Large-Scale Markov Decision Processes
di: Gargiani, Matilde, et al.
Pubblicazione: (2025)
di: Gargiani, Matilde, et al.
Pubblicazione: (2025)
On the Runtime of Local Mutual Exclusion for Anonymous Dynamic Networks
di: Chaturvedi, Anya, et al.
Pubblicazione: (2025)
di: Chaturvedi, Anya, et al.
Pubblicazione: (2025)
Documenti analoghi
-
MAD Max Beyond Single-Node: Enabling Large Machine Learning Model Acceleration on Distributed Systems
di: Hsia, Samuel, et al.
Pubblicazione: (2023) -
Is Flash Attention Stable?
di: Golden, Alicia, et al.
Pubblicazione: (2024) -
Generative AI Beyond LLMs: System Implications of Multi-Modal Generation
di: Golden, Alicia, et al.
Pubblicazione: (2023) -
Revisiting Reliability in Large-Scale Machine Learning Research Clusters
di: Kokolis, Apostolos, et al.
Pubblicazione: (2024) -
ScaleAcross Explorer: Exploring Communication Optimization for Scale-Across AI Model Training
di: Li, Minghao, et al.
Pubblicazione: (2026)