Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wu, Tianyuan, Cao, Lunxi, Lu, Hanfeng, Jiang, Xiaoxiao, Yu, Yinghao, Yang, Siran, Yang, Guodong, Wang, Jiamang, Qu, Lin, Zhang, Liping, Wang, Wei |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
FALCON: Pinpointing and Mitigating Stragglers for Large-Scale Hybrid-Parallel Training
von: Wu, Tianyuan, et al.
Veröffentlicht: (2024)
von: Wu, Tianyuan, et al.
Veröffentlicht: (2024)
RollMux: Phase-Level Multiplexing for Disaggregated RL Post-Training
von: Wu, Tianyuan, et al.
Veröffentlicht: (2025)
von: Wu, Tianyuan, et al.
Veröffentlicht: (2025)
Malleus: Straggler-Resilient Hybrid Parallel Training of Large-scale Models via Malleable Data and Model Parallelization
von: Li, Haoyang, et al.
Veröffentlicht: (2024)
von: Li, Haoyang, et al.
Veröffentlicht: (2024)
RollPacker: Mitigating Long-Tail Rollouts for Fast, Synchronous RL Post-Training
von: Gao, Wei, et al.
Veröffentlicht: (2025)
von: Gao, Wei, et al.
Veröffentlicht: (2025)
ROSE: Rollout On Serving GPUs via Cooperative Elasticity for Agentic RL
von: Gao, Wei, et al.
Veröffentlicht: (2026)
von: Gao, Wei, et al.
Veröffentlicht: (2026)
Straggler Tolerant and Resilient DL Training on Homogeneous GPUs
von: Zhang, Zeyu, et al.
Veröffentlicht: (2025)
von: Zhang, Zeyu, et al.
Veröffentlicht: (2025)
RollArt: Scaling Agentic RL Training via Disaggregated Infrastructure
von: Gao, Wei, et al.
Veröffentlicht: (2025)
von: Gao, Wei, et al.
Veröffentlicht: (2025)
A Flexible Programmable Pipeline Parallelism Framework for Efficient DNN Training
von: Jiang, Lijuan, et al.
Veröffentlicht: (2025)
von: Jiang, Lijuan, et al.
Veröffentlicht: (2025)
Scaling Deep Learning Training with MPMD Pipeline Parallelism
von: Xhebraj, Anxhelo, et al.
Veröffentlicht: (2024)
von: Xhebraj, Anxhelo, et al.
Veröffentlicht: (2024)
dSTAR: Straggler Tolerant and Byzantine Resilient Distributed SGD
von: Yan, Jiahe, et al.
Veröffentlicht: (2024)
von: Yan, Jiahe, et al.
Veröffentlicht: (2024)
Enhancing Memory Efficiency in Large Language Model Training Through Chronos-aware Pipeline Parallelism
von: Lin, Xinyuan, et al.
Veröffentlicht: (2025)
von: Lin, Xinyuan, et al.
Veröffentlicht: (2025)
JanusPipe: Efficient Pipeline Parallel Training for Machine Learning Interatomic Potentials
von: Wang, Hongyu, et al.
Veröffentlicht: (2026)
von: Wang, Hongyu, et al.
Veröffentlicht: (2026)
Straggler-Resilient Decentralized Learning via Adaptive Asynchronous Updates
von: Xiong, Guojun, et al.
Veröffentlicht: (2023)
von: Xiong, Guojun, et al.
Veröffentlicht: (2023)
LegoDiffusion: Micro-Serving Text-to-Image Diffusion Workflows
von: Yang, Lingyun, et al.
Veröffentlicht: (2026)
von: Yang, Lingyun, et al.
Veröffentlicht: (2026)
Understanding Stragglers in Large Model Training Using What-if Analysis
von: Lin, Jinkun, et al.
Veröffentlicht: (2025)
von: Lin, Jinkun, et al.
Veröffentlicht: (2025)
SwiftDiffusion: Efficient Diffusion Model Serving with Add-on Modules
von: Li, Suyi, et al.
Veröffentlicht: (2024)
von: Li, Suyi, et al.
Veröffentlicht: (2024)
ReCycle: Resilient Training of Large DNNs using Pipeline Adaptation
von: Gandhi, Swapnil, et al.
Veröffentlicht: (2024)
von: Gandhi, Swapnil, et al.
Veröffentlicht: (2024)
Lightweight Federated Learning with Differential Privacy and Straggler Resilience
von: Hong, Shu, et al.
Veröffentlicht: (2024)
von: Hong, Shu, et al.
Veröffentlicht: (2024)
Balancing Pipeline Parallelism with Vocabulary Parallelism
von: Yeung, Man Tsung, et al.
Veröffentlicht: (2024)
von: Yeung, Man Tsung, et al.
Veröffentlicht: (2024)
ElasWave: An Elastic-Native System for Scalable Hybrid-Parallel Training
von: Kang, Xueze, et al.
Veröffentlicht: (2025)
von: Kang, Xueze, et al.
Veröffentlicht: (2025)
DawnPiper: A Memory-scablable Pipeline Parallel Training Framework
von: Peng, Xuan, et al.
Veröffentlicht: (2025)
von: Peng, Xuan, et al.
Veröffentlicht: (2025)
Seq1F1B: Efficient Sequence-Level Pipeline Parallelism for Large Language Model Training
von: Sun, Ao, et al.
Veröffentlicht: (2024)
von: Sun, Ao, et al.
Veröffentlicht: (2024)
ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism
von: Ma, Tenghui, et al.
Veröffentlicht: (2026)
von: Ma, Tenghui, et al.
Veröffentlicht: (2026)
Synergistic Tensor and Pipeline Parallelism
von: Qi, Mengshi, et al.
Veröffentlicht: (2025)
von: Qi, Mengshi, et al.
Veröffentlicht: (2025)
HelixPipe: Efficient Distributed Training of Long Sequence Transformers with Attention Parallel Pipeline Parallelism
von: Zhang, Geng, et al.
Veröffentlicht: (2025)
von: Zhang, Geng, et al.
Veröffentlicht: (2025)
Communication-Computation Pipeline Parallel Split Learning over Wireless Edge Networks
von: Liu, Chenyu, et al.
Veröffentlicht: (2025)
von: Liu, Chenyu, et al.
Veröffentlicht: (2025)
Bandwidth-Aware and Cost-Efficient Pipeline Parallel Scheduling in Geo-Distributed LLM Training
von: Zhang, Han, et al.
Veröffentlicht: (2026)
von: Zhang, Han, et al.
Veröffentlicht: (2026)
Exploiting Stragglers in Distributed Computing Systems with Task Grouping
von: Adikari, Tharindu, et al.
Veröffentlicht: (2024)
von: Adikari, Tharindu, et al.
Veröffentlicht: (2024)
AntDT: A Self-Adaptive Distributed Training Framework for Leader and Straggler Nodes
von: Xiao, Youshao, et al.
Veröffentlicht: (2024)
von: Xiao, Youshao, et al.
Veröffentlicht: (2024)
SPPO:Efficient Long-sequence LLM Training via Adaptive Sequence Pipeline Parallel Offloading
von: Chen, Qiaoling, et al.
Veröffentlicht: (2025)
von: Chen, Qiaoling, et al.
Veröffentlicht: (2025)
Memory Efficient and Staleness Free Pipeline Parallel DNN Training Framework with Improved Convergence Speed
von: Dutta, Ankita, et al.
Veröffentlicht: (2025)
von: Dutta, Ankita, et al.
Veröffentlicht: (2025)
SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference
von: He, Yongchao, et al.
Veröffentlicht: (2025)
von: He, Yongchao, et al.
Veröffentlicht: (2025)
Fault-Tolerant Hybrid-Parallel Training at Scale with Reliable and Efficient In-memory Checkpointing
von: Wang, Yuxin, et al.
Veröffentlicht: (2023)
von: Wang, Yuxin, et al.
Veröffentlicht: (2023)
TiMePReSt: Time and Memory Efficient Pipeline Parallel DNN Training with Removed Staleness
von: Dutta, Ankita, et al.
Veröffentlicht: (2024)
von: Dutta, Ankita, et al.
Veröffentlicht: (2024)
CaraServe: CPU-Assisted and Rank-Aware LoRA Serving for Generative LLM Inference
von: Li, Suyi, et al.
Veröffentlicht: (2024)
von: Li, Suyi, et al.
Veröffentlicht: (2024)
Towards Straggler-Resilient Split Federated Learning: An Unbalanced Update Approach
von: Liang, Dandan, et al.
Veröffentlicht: (2025)
von: Liang, Dandan, et al.
Veröffentlicht: (2025)
A Readiness-Driven Runtime for Pipeline-Parallel Training under Runtime Variability
von: Liu, Ruitao, et al.
Veröffentlicht: (2026)
von: Liu, Ruitao, et al.
Veröffentlicht: (2026)
CoCoI: Distributed Coded Inference System for Straggler Mitigation
von: Liu, Xing, et al.
Veröffentlicht: (2025)
von: Liu, Xing, et al.
Veröffentlicht: (2025)
Sparsity-Preserving Encodings for Straggler-Optimal Distributed Matrix Computations at the Edge
von: Das, Anindya Bijoy, et al.
Veröffentlicht: (2024)
von: Das, Anindya Bijoy, et al.
Veröffentlicht: (2024)
GFS: A Preemption-aware Scheduling Framework for GPU Clusters with Predictive Spot Instance Management
von: Duan, Jiaang, et al.
Veröffentlicht: (2025)
von: Duan, Jiaang, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
FALCON: Pinpointing and Mitigating Stragglers for Large-Scale Hybrid-Parallel Training
von: Wu, Tianyuan, et al.
Veröffentlicht: (2024) -
RollMux: Phase-Level Multiplexing for Disaggregated RL Post-Training
von: Wu, Tianyuan, et al.
Veröffentlicht: (2025) -
Malleus: Straggler-Resilient Hybrid Parallel Training of Large-scale Models via Malleable Data and Model Parallelization
von: Li, Haoyang, et al.
Veröffentlicht: (2024) -
RollPacker: Mitigating Long-Tail Rollouts for Fast, Synchronous RL Post-Training
von: Gao, Wei, et al.
Veröffentlicht: (2025) -
ROSE: Rollout On Serving GPUs via Cooperative Elasticity for Agentic RL
von: Gao, Wei, et al.
Veröffentlicht: (2026)