Provenance Tracking in Large-Scale Machine Learning Systems
Fuente:
arXiv
Salvato in:
| Autori principali: | Padovani, Gabriele, Anantharaj, Valentine, Fiore, Sandro |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
yProv4ML: Effortless Provenance Tracking for Machine Learning Systems
di: Padovani, Gabriele, et al.
Pubblicazione: (2025)
di: Padovani, Gabriele, et al.
Pubblicazione: (2025)
Revisiting Reliability in Large-Scale Machine Learning Research Clusters
di: Kokolis, Apostolos, et al.
Pubblicazione: (2024)
di: Kokolis, Apostolos, et al.
Pubblicazione: (2024)
Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library
di: Wang, Weixun, et al.
Pubblicazione: (2025)
di: Wang, Weixun, et al.
Pubblicazione: (2025)
TurboGR: An Accelerated Training System for Large-Scale Generative Recommendation
di: Chai, Huichao, et al.
Pubblicazione: (2026)
di: Chai, Huichao, et al.
Pubblicazione: (2026)
Leveraging Neural Graph Compilers in Machine Learning Research for Edge-Cloud Systems
di: Furutanpey, Alireza, et al.
Pubblicazione: (2025)
di: Furutanpey, Alireza, et al.
Pubblicazione: (2025)
Two-dimensional Sparse Parallelism for Large Scale Deep Learning Recommendation Model Training
di: Zhang, Xin, et al.
Pubblicazione: (2025)
di: Zhang, Xin, et al.
Pubblicazione: (2025)
Federated Koopman-Reservoir Learning for Large-Scale Multivariate Time-Series Anomaly Detection
di: Le, Long Tan, et al.
Pubblicazione: (2025)
di: Le, Long Tan, et al.
Pubblicazione: (2025)
ASTRA-sim2.0: Modeling Hierarchical Networks and Disaggregated Systems for Large-model Training at Scale
di: Won, William, et al.
Pubblicazione: (2023)
di: Won, William, et al.
Pubblicazione: (2023)
Hardware Scaling Trends and Diminishing Returns in Large-Scale Distributed Training
di: Fernandez, Jared, et al.
Pubblicazione: (2024)
di: Fernandez, Jared, et al.
Pubblicazione: (2024)
Personalized Semi-Supervised Federated Learning for Human Activity Recognition
di: Presotto, Riccardo, et al.
Pubblicazione: (2021)
di: Presotto, Riccardo, et al.
Pubblicazione: (2021)
DYNAMIX: RL-based Adaptive Batch Size Optimization in Distributed Machine Learning Systems
di: Dai, Yuanjun, et al.
Pubblicazione: (2025)
di: Dai, Yuanjun, et al.
Pubblicazione: (2025)
ECHO-2: A Large-Scale Distributed Rollout Framework for Cost-Efficient Reinforcement Learning
di: Song, Jingwei, et al.
Pubblicazione: (2026)
di: Song, Jingwei, et al.
Pubblicazione: (2026)
Robust Decentralized Learning with Local Updates and Gradient Tracking
di: Ghiasvand, Sajjad, et al.
Pubblicazione: (2024)
di: Ghiasvand, Sajjad, et al.
Pubblicazione: (2024)
Universal Checkpointing: A Flexible and Efficient Distributed Checkpointing System for Large-Scale DNN Training with Reconfigurable Parallelis
di: Lian, Xinyu, et al.
Pubblicazione: (2024)
di: Lian, Xinyu, et al.
Pubblicazione: (2024)
Machine-Learning-Driven Runtime Optimization of BLAS Level 3 on Modern Multi-Core Systems
di: Xia, Yufan, et al.
Pubblicazione: (2024)
di: Xia, Yufan, et al.
Pubblicazione: (2024)
EARL: Efficient Agentic Reinforcement Learning Systems for Large Language Models
di: Tan, Zheyue, et al.
Pubblicazione: (2025)
di: Tan, Zheyue, et al.
Pubblicazione: (2025)
MegaScale: Scaling Large Language Model Training to More Than 10,000 GPUs
di: Jiang, Ziheng, et al.
Pubblicazione: (2024)
di: Jiang, Ziheng, et al.
Pubblicazione: (2024)
MegaScale-MoE: Large-Scale Communication-Efficient Training of Mixture-of-Experts Models in Production
di: Jin, Chao, et al.
Pubblicazione: (2025)
di: Jin, Chao, et al.
Pubblicazione: (2025)
Efficient Parallelization Layouts for Large-Scale Distributed Model Training
di: Hagemann, Johannes, et al.
Pubblicazione: (2023)
di: Hagemann, Johannes, et al.
Pubblicazione: (2023)
Minder: Faulty Machine Detection for Large-scale Distributed Model Training
di: Deng, Yangtao, et al.
Pubblicazione: (2024)
di: Deng, Yangtao, et al.
Pubblicazione: (2024)
Machine Learning for Consistency Violation Faults Analysis
di: Giri, Kamal, et al.
Pubblicazione: (2025)
di: Giri, Kamal, et al.
Pubblicazione: (2025)
SuperOffload: Unleashing the Power of Large-Scale LLM Training on Superchips
di: Lian, Xinyu, et al.
Pubblicazione: (2025)
di: Lian, Xinyu, et al.
Pubblicazione: (2025)
ShardTensor: Domain Parallelism for Scientific Machine Learning
di: Adams, Corey, et al.
Pubblicazione: (2026)
di: Adams, Corey, et al.
Pubblicazione: (2026)
Heterogeneity: An Open Challenge for Federated On-board Machine Learning
di: Hartmann, Maria, et al.
Pubblicazione: (2024)
di: Hartmann, Maria, et al.
Pubblicazione: (2024)
Training Machine Learning models at the Edge: A Survey
di: Khouas, Aymen Rayane, et al.
Pubblicazione: (2024)
di: Khouas, Aymen Rayane, et al.
Pubblicazione: (2024)
PiPar: Pipeline Parallelism for Collaborative Machine Learning
di: Zhang, Zihan, et al.
Pubblicazione: (2022)
di: Zhang, Zihan, et al.
Pubblicazione: (2022)
Algorithms for Collaborative Machine Learning under Statistical Heterogeneity
di: Hahn, Seok-Ju
Pubblicazione: (2024)
di: Hahn, Seok-Ju
Pubblicazione: (2024)
Large-Scale Graph Building in Dynamic Environments: Low Latency and High Quality
di: de Almeida, Filipe Miguel Gonçalves, et al.
Pubblicazione: (2025)
di: de Almeida, Filipe Miguel Gonçalves, et al.
Pubblicazione: (2025)
Armada: Memory-Efficient Distributed Training of Large-Scale Graph Neural Networks
di: Waleffe, Roger, et al.
Pubblicazione: (2025)
di: Waleffe, Roger, et al.
Pubblicazione: (2025)
A Semantic Partitioning Method for Large-Scale Training of Knowledge Graph Embeddings
di: Bai, Yuhe
Pubblicazione: (2025)
di: Bai, Yuhe
Pubblicazione: (2025)
AMDP: Asynchronous Multi-Directional Pipeline Parallelism for Large-Scale Models Training
di: Chen, Ling, et al.
Pubblicazione: (2026)
di: Chen, Ling, et al.
Pubblicazione: (2026)
Federated Behavioural Planes: Explaining the Evolution of Client Behaviour in Federated Learning
di: Fenoglio, Dario, et al.
Pubblicazione: (2024)
di: Fenoglio, Dario, et al.
Pubblicazione: (2024)
GSplit: Scaling Graph Neural Network Training on Large Graphs via Split-Parallelism
di: Polisetty, Sandeep, et al.
Pubblicazione: (2023)
di: Polisetty, Sandeep, et al.
Pubblicazione: (2023)
Unlearning during Learning: An Efficient Federated Machine Unlearning Method
di: Gu, Hanlin, et al.
Pubblicazione: (2024)
di: Gu, Hanlin, et al.
Pubblicazione: (2024)
Machine Learning-Based Research on the Adaptability of Adolescents to Online Education
di: Wang, Mingwei, et al.
Pubblicazione: (2024)
di: Wang, Mingwei, et al.
Pubblicazione: (2024)
A Robust Federated Learning Framework for Undependable Devices at Scale
di: Wang, Shilong, et al.
Pubblicazione: (2024)
di: Wang, Shilong, et al.
Pubblicazione: (2024)
Dependency Aware Incident Linking in Large Cloud Systems
di: Ghosh, Supriyo, et al.
Pubblicazione: (2024)
di: Ghosh, Supriyo, et al.
Pubblicazione: (2024)
NestPipe: Large-Scale Recommendation Training on 1,500+ Accelerators via Nested Pipelining
di: Jiang, Zhida, et al.
Pubblicazione: (2026)
di: Jiang, Zhida, et al.
Pubblicazione: (2026)
A Machine Learning Approach Towards Runtime Optimisation of Matrix Multiplication
di: Xia, Yufan, et al.
Pubblicazione: (2026)
di: Xia, Yufan, et al.
Pubblicazione: (2026)
TACOS: Topology-Aware Collective Algorithm Synthesizer for Distributed Machine Learning
di: Won, William, et al.
Pubblicazione: (2023)
di: Won, William, et al.
Pubblicazione: (2023)
Documenti analoghi
-
yProv4ML: Effortless Provenance Tracking for Machine Learning Systems
di: Padovani, Gabriele, et al.
Pubblicazione: (2025) -
Revisiting Reliability in Large-Scale Machine Learning Research Clusters
di: Kokolis, Apostolos, et al.
Pubblicazione: (2024) -
Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library
di: Wang, Weixun, et al.
Pubblicazione: (2025) -
TurboGR: An Accelerated Training System for Large-Scale Generative Recommendation
di: Chai, Huichao, et al.
Pubblicazione: (2026) -
Leveraging Neural Graph Compilers in Machine Learning Research for Edge-Cloud Systems
di: Furutanpey, Alireza, et al.
Pubblicazione: (2025)