PipeOffload: Improving Scalability of Pipeline Parallelism with Memory Optimization
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wan, Xinyi, Qi, Penghui, Huang, Guangxing, Lin, Min, Li, Jialin |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Zero Bubble Pipeline Parallelism
von: Qi, Penghui, et al.
Veröffentlicht: (2023)
von: Qi, Penghui, et al.
Veröffentlicht: (2023)
Pipeline Parallelism with Controllable Memory
von: Qi, Penghui, et al.
Veröffentlicht: (2024)
von: Qi, Penghui, et al.
Veröffentlicht: (2024)
GraphPipe: Improving Performance and Scalability of DNN Training with Graph Pipeline Parallelism
von: Jeon, Byungsoo, et al.
Veröffentlicht: (2024)
von: Jeon, Byungsoo, et al.
Veröffentlicht: (2024)
Revisiting Parameter Server in LLM Post-Training
von: Wan, Xinyi, et al.
Veröffentlicht: (2026)
von: Wan, Xinyi, et al.
Veröffentlicht: (2026)
Balancing Pipeline Parallelism with Vocabulary Parallelism
von: Yeung, Man Tsung, et al.
Veröffentlicht: (2024)
von: Yeung, Man Tsung, et al.
Veröffentlicht: (2024)
BitPipe: Bidirectional Interleaved Pipeline Parallelism for Accelerating Large Models Training
von: Wu, Houming, et al.
Veröffentlicht: (2024)
von: Wu, Houming, et al.
Veröffentlicht: (2024)
TawPipe: Topology-Aware Weight Pipeline Parallelism for Accelerating Long-Context Large Models Training
von: Wu, Houming, et al.
Veröffentlicht: (2025)
von: Wu, Houming, et al.
Veröffentlicht: (2025)
PIPO: Pipelined Offloading for Efficient Inference on Consumer Devices
von: Liu, Yangyijian, et al.
Veröffentlicht: (2025)
von: Liu, Yangyijian, et al.
Veröffentlicht: (2025)
OptPipe: Memory- and Scheduling-Optimized Pipeline Parallelism for LLM Training
von: Li, Hongpei, et al.
Veröffentlicht: (2025)
von: Li, Hongpei, et al.
Veröffentlicht: (2025)
DisagMoE: Computation-Communication overlapped MoE Training via Disaggregated AF-Pipe Parallelism
von: Zeng, Zhichen, et al.
Veröffentlicht: (2026)
von: Zeng, Zhichen, et al.
Veröffentlicht: (2026)
Context Parallelism for Scalable Million-Token Inference
von: Yang, Amy, et al.
Veröffentlicht: (2024)
von: Yang, Amy, et al.
Veröffentlicht: (2024)
Scalable and Adaptive Parallel Training of Graph Transformer on Large Graphs
von: Lin, Jun-Liang, et al.
Veröffentlicht: (2026)
von: Lin, Jun-Liang, et al.
Veröffentlicht: (2026)
NEO: Saving GPU Memory Crisis with CPU Offloading for Online LLM Inference
von: Jiang, Xuanlin, et al.
Veröffentlicht: (2024)
von: Jiang, Xuanlin, et al.
Veröffentlicht: (2024)
Mitigating Staleness in Asynchronous Pipeline Parallelism via Basis Rotation
von: Jung, Hyunji, et al.
Veröffentlicht: (2026)
von: Jung, Hyunji, et al.
Veröffentlicht: (2026)
ResBM: Residual Bottleneck Models for Low-Bandwidth Pipeline Parallelism
von: Aboudib, Alan, et al.
Veröffentlicht: (2026)
von: Aboudib, Alan, et al.
Veröffentlicht: (2026)
HelixPipe: Efficient Distributed Training of Long Sequence Transformers with Attention Parallel Pipeline Parallelism
von: Zhang, Geng, et al.
Veröffentlicht: (2025)
von: Zhang, Geng, et al.
Veröffentlicht: (2025)
TAPAS: Fast and Automatic Derivation of Tensor Parallel Strategies for Large Neural Networks
von: Shi, Ziji, et al.
Veröffentlicht: (2023)
von: Shi, Ziji, et al.
Veröffentlicht: (2023)
InfiniPipe: Elastic Pipeline Parallelism for Efficient Variable-Length Long-Context LLM Training
von: Wang, Shiju, et al.
Veröffentlicht: (2025)
von: Wang, Shiju, et al.
Veröffentlicht: (2025)
Hermes: Memory-Efficient Pipeline Inference for Large Models on Edge Devices
von: Han, Xueyuan, et al.
Veröffentlicht: (2024)
von: Han, Xueyuan, et al.
Veröffentlicht: (2024)
Taming Latency-Memory Trade-Off in MoE-Based LLM Serving via Fine-Grained Expert Offloading
von: Yu, Hanfei, et al.
Veröffentlicht: (2025)
von: Yu, Hanfei, et al.
Veröffentlicht: (2025)
PipeLive: Efficient Live In-place Pipeline Parallelism Reconfiguration for Dynamic LLM Serving
von: Bai, Xu, et al.
Veröffentlicht: (2026)
von: Bai, Xu, et al.
Veröffentlicht: (2026)
Piper: Efficient Large-Scale MoE Training via Resource Modeling and Pipelined Hybrid Parallelism
von: Dash, Sajal, et al.
Veröffentlicht: (2026)
von: Dash, Sajal, et al.
Veröffentlicht: (2026)
Efficient Training on Multiple Consumer GPUs with RoundPipe
von: Luo, Yibin, et al.
Veröffentlicht: (2026)
von: Luo, Yibin, et al.
Veröffentlicht: (2026)
Inference Offloading for Cost-Sensitive Binary Classification at the Edge
von: Moothedath, Vishnu Narayanan, et al.
Veröffentlicht: (2025)
von: Moothedath, Vishnu Narayanan, et al.
Veröffentlicht: (2025)
Communication-free Sampling and 4D Hybrid Parallelism for Scalable Mini-batch GNN Training
von: Wei, Cunyang, et al.
Veröffentlicht: (2026)
von: Wei, Cunyang, et al.
Veröffentlicht: (2026)
Deep Optimizer States: Towards Scalable Training of Transformer Models Using Interleaved Offloading
von: Maurya, Avinash, et al.
Veröffentlicht: (2024)
von: Maurya, Avinash, et al.
Veröffentlicht: (2024)
Laminar: A Scalable Asynchronous RL Post-Training Framework
von: Sheng, Guangming, et al.
Veröffentlicht: (2025)
von: Sheng, Guangming, et al.
Veröffentlicht: (2025)
MQ-GNN: A Multi-Queue Pipelined Architecture for Scalable and Efficient GNN Training
von: Ullah, Irfan, et al.
Veröffentlicht: (2026)
von: Ullah, Irfan, et al.
Veröffentlicht: (2026)
Nesterov Method for Asynchronous Pipeline Parallel Optimization
von: Ajanthan, Thalaiyasingam, et al.
Veröffentlicht: (2025)
von: Ajanthan, Thalaiyasingam, et al.
Veröffentlicht: (2025)
Delayed Random Partial Gradient Averaging for Federated Learning
von: Hu, Xinyi
Veröffentlicht: (2024)
von: Hu, Xinyi
Veröffentlicht: (2024)
Application of Machine Learning Optimization in Cloud Computing Resource Scheduling and Management
von: Zhang, Yifan, et al.
Veröffentlicht: (2024)
von: Zhang, Yifan, et al.
Veröffentlicht: (2024)
AdaPtis: Reducing Pipeline Bubbles with Adaptive Pipeline Parallelism on Heterogeneous Models
von: Guo, Jihu, et al.
Veröffentlicht: (2025)
von: Guo, Jihu, et al.
Veröffentlicht: (2025)
Cost-Efficient LLM Training with Lifetime-Aware Tensor Offloading via GPUDirect Storage
von: Yuan, Ziqi, et al.
Veröffentlicht: (2025)
von: Yuan, Ziqi, et al.
Veröffentlicht: (2025)
Improving Parallel Program Performance with LLM Optimizers via Agent-System Interfaces
von: Wei, Anjiang, et al.
Veröffentlicht: (2024)
von: Wei, Anjiang, et al.
Veröffentlicht: (2024)
Parallel Split Learning with Global Sampling
von: Kohankhaki, Mohammad, et al.
Veröffentlicht: (2024)
von: Kohankhaki, Mohammad, et al.
Veröffentlicht: (2024)
AsyncMesh: Fully Asynchronous Optimization for Data and Pipeline Parallelism
von: Ajanthan, Thalaiyasingam, et al.
Veröffentlicht: (2026)
von: Ajanthan, Thalaiyasingam, et al.
Veröffentlicht: (2026)
When Foresight Pruning Meets Zeroth-Order Optimization: Efficient Federated Learning for Low-Memory Devices
von: Zhang, Pengyu, et al.
Veröffentlicht: (2024)
von: Zhang, Pengyu, et al.
Veröffentlicht: (2024)
Guard: Scalable Straggler Detection and Node Health Management for Large-Scale Training
von: Liu, Guanliang, et al.
Veröffentlicht: (2026)
von: Liu, Guanliang, et al.
Veröffentlicht: (2026)
Sampling Parallelism for Fast and Efficient Bayesian Learning
von: Özdemir, Asena Karolin, et al.
Veröffentlicht: (2026)
von: Özdemir, Asena Karolin, et al.
Veröffentlicht: (2026)
CUDA-L1: Improving CUDA Optimization via Contrastive Reinforcement Learning
von: Li, Xiaoya, et al.
Veröffentlicht: (2025)
von: Li, Xiaoya, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Zero Bubble Pipeline Parallelism
von: Qi, Penghui, et al.
Veröffentlicht: (2023) -
Pipeline Parallelism with Controllable Memory
von: Qi, Penghui, et al.
Veröffentlicht: (2024) -
GraphPipe: Improving Performance and Scalability of DNN Training with Graph Pipeline Parallelism
von: Jeon, Byungsoo, et al.
Veröffentlicht: (2024) -
Revisiting Parameter Server in LLM Post-Training
von: Wan, Xinyi, et al.
Veröffentlicht: (2026) -
Balancing Pipeline Parallelism with Vocabulary Parallelism
von: Yeung, Man Tsung, et al.
Veröffentlicht: (2024)