ResBM: Residual Bottleneck Models for Low-Bandwidth Pipeline Parallelism
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Aboudib, Alan, A., Rodrigo Lopez Portillo, Brady, Kalei, Cruz, Steffen |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Incentivised Orchestrated Training Architecture (IOTA): A Technical Primer for Release
par: Quinque, Felix, et autres
Publié: (2025)
par: Quinque, Felix, et autres
Publié: (2025)
Zero Bubble Pipeline Parallelism
par: Qi, Penghui, et autres
Publié: (2023)
par: Qi, Penghui, et autres
Publié: (2023)
AdaPtis: Reducing Pipeline Bubbles with Adaptive Pipeline Parallelism on Heterogeneous Models
par: Guo, Jihu, et autres
Publié: (2025)
par: Guo, Jihu, et autres
Publié: (2025)
BitPipe: Bidirectional Interleaved Pipeline Parallelism for Accelerating Large Models Training
par: Wu, Houming, et autres
Publié: (2024)
par: Wu, Houming, et autres
Publié: (2024)
PipeOffload: Improving Scalability of Pipeline Parallelism with Memory Optimization
par: Wan, Xinyi, et autres
Publié: (2025)
par: Wan, Xinyi, et autres
Publié: (2025)
Mitigating Staleness in Asynchronous Pipeline Parallelism via Basis Rotation
par: Jung, Hyunji, et autres
Publié: (2026)
par: Jung, Hyunji, et autres
Publié: (2026)
Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning
par: Xu, Lang, et autres
Publié: (2025)
par: Xu, Lang, et autres
Publié: (2025)
TawPipe: Topology-Aware Weight Pipeline Parallelism for Accelerating Long-Context Large Models Training
par: Wu, Houming, et autres
Publié: (2025)
par: Wu, Houming, et autres
Publié: (2025)
Piper: Efficient Large-Scale MoE Training via Resource Modeling and Pipelined Hybrid Parallelism
par: Dash, Sajal, et autres
Publié: (2026)
par: Dash, Sajal, et autres
Publié: (2026)
FreeRide: Harvesting Bubbles in Pipeline Parallelism
par: Zhang, Jiashu, et autres
Publié: (2024)
par: Zhang, Jiashu, et autres
Publié: (2024)
GraphPipe: Improving Performance and Scalability of DNN Training with Graph Pipeline Parallelism
par: Jeon, Byungsoo, et autres
Publié: (2024)
par: Jeon, Byungsoo, et autres
Publié: (2024)
TimelyFreeze: Adaptive Parameter Freezing Mechanism for Pipeline Parallelism
par: Cho, Seonghye, et autres
Publié: (2026)
par: Cho, Seonghye, et autres
Publié: (2026)
InfiniPipe: Elastic Pipeline Parallelism for Efficient Variable-Length Long-Context LLM Training
par: Wang, Shiju, et autres
Publié: (2025)
par: Wang, Shiju, et autres
Publié: (2025)
Hermes: Memory-Efficient Pipeline Inference for Large Models on Edge Devices
par: Han, Xueyuan, et autres
Publié: (2024)
par: Han, Xueyuan, et autres
Publié: (2024)
Training Ultra Long Context Language Model with Fully Pipelined Distributed Transformer
par: Yao, Jinghan, et autres
Publié: (2024)
par: Yao, Jinghan, et autres
Publié: (2024)
BootSeer: Analyzing and Mitigating Initialization Bottlenecks in Large-Scale LLM Training
par: Li, Rui, et autres
Publié: (2025)
par: Li, Rui, et autres
Publié: (2025)
SPD: Sync-Point Drop for Efficient Tensor Parallelism of Large Language Models
par: Kim, Han-Byul, et autres
Publié: (2025)
par: Kim, Han-Byul, et autres
Publié: (2025)
PIPO: Pipelined Offloading for Efficient Inference on Consumer Devices
par: Liu, Yangyijian, et autres
Publié: (2025)
par: Liu, Yangyijian, et autres
Publié: (2025)
Bandwidth-Aware and Cost-Efficient Pipeline Parallel Scheduling in Geo-Distributed LLM Training
par: Zhang, Han, et autres
Publié: (2026)
par: Zhang, Han, et autres
Publié: (2026)
Research on Model Parallelism and Data Parallelism Optimization Methods in Large Language Model-Based Recommendation Systems
par: Yang, Haowei, et autres
Publié: (2025)
par: Yang, Haowei, et autres
Publié: (2025)
Parallel Split Learning with Global Sampling
par: Kohankhaki, Mohammad, et autres
Publié: (2024)
par: Kohankhaki, Mohammad, et autres
Publié: (2024)
Semantic Parallelism: Redefining Efficient MoE Inference via Model-Data Co-Scheduling
par: Li, Yan, et autres
Publié: (2025)
par: Li, Yan, et autres
Publié: (2025)
Sampling Parallelism for Fast and Efficient Bayesian Learning
par: Özdemir, Asena Karolin, et autres
Publié: (2026)
par: Özdemir, Asena Karolin, et autres
Publié: (2026)
Context Parallelism for Scalable Million-Token Inference
par: Yang, Amy, et autres
Publié: (2024)
par: Yang, Amy, et autres
Publié: (2024)
Understand and Accelerate Memory Processing Pipeline for Large Language Model Inference
par: He, Zifan, et autres
Publié: (2026)
par: He, Zifan, et autres
Publié: (2026)
DIP: Efficient Large Multimodal Model Training with Dynamic Interleaved Pipeline
par: Xue, Zhenliang, et autres
Publié: (2025)
par: Xue, Zhenliang, et autres
Publié: (2025)
EE-LLM: Large-Scale Training and Inference of Early-Exit Large Language Models with 3D Parallelism
par: Chen, Yanxi, et autres
Publié: (2023)
par: Chen, Yanxi, et autres
Publié: (2023)
Vec-LUT: Vector Table Lookup for Parallel Ultra-Low-Bit LLM Inference on Edge Devices
par: Li, Xiangyu, et autres
Publié: (2025)
par: Li, Xiangyu, et autres
Publié: (2025)
Can Large Language Models Write Parallel Code?
par: Nichols, Daniel, et autres
Publié: (2024)
par: Nichols, Daniel, et autres
Publié: (2024)
HPC-Coder: Modeling Parallel Programs using Large Language Models
par: Nichols, Daniel, et autres
Publié: (2023)
par: Nichols, Daniel, et autres
Publié: (2023)
Scalable and Adaptive Parallel Training of Graph Transformer on Large Graphs
par: Lin, Jun-Liang, et autres
Publié: (2026)
par: Lin, Jun-Liang, et autres
Publié: (2026)
A Parallel Alternative for Energy-Efficient Neural Network Training and Inferencing
par: Seal, Sudip K., et autres
Publié: (2025)
par: Seal, Sudip K., et autres
Publié: (2025)
Tenplex: Dynamic Parallelism for Deep Learning using Parallelizable Tensor Collections
par: Wagenländer, Marcel, et autres
Publié: (2023)
par: Wagenländer, Marcel, et autres
Publié: (2023)
OptPipe: Memory- and Scheduling-Optimized Pipeline Parallelism for LLM Training
par: Li, Hongpei, et autres
Publié: (2025)
par: Li, Hongpei, et autres
Publié: (2025)
LlamaDuo: LLMOps Pipeline for Seamless Migration from Service LLMs to Small-Scale Local LLMs
par: Park, Chansung, et autres
Publié: (2024)
par: Park, Chansung, et autres
Publié: (2024)
Parallel-friendly Spatio-Temporal Graph Learning for Photovoltaic Degradation Analysis at Scale
par: Fan, Yangxin, et autres
Publié: (2024)
par: Fan, Yangxin, et autres
Publié: (2024)
TAPAS: Fast and Automatic Derivation of Tensor Parallel Strategies for Large Neural Networks
par: Shi, Ziji, et autres
Publié: (2023)
par: Shi, Ziji, et autres
Publié: (2023)
Acceleration for Deep Reinforcement Learning using Parallel and Distributed Computing: A Survey
par: Liu, Zhihong, et autres
Publié: (2024)
par: Liu, Zhihong, et autres
Publié: (2024)
FlashMLA-ETAP: Efficient Transpose Attention Pipeline for Accelerating MLA Inference on NVIDIA H20 GPUs
par: Dege, Pengcuo, et autres
Publié: (2025)
par: Dege, Pengcuo, et autres
Publié: (2025)
Automated Planning for Optimal Data Pipeline Instantiation
par: Amado, Leonardo Rosa, et autres
Publié: (2025)
par: Amado, Leonardo Rosa, et autres
Publié: (2025)
Documents similaires
-
Incentivised Orchestrated Training Architecture (IOTA): A Technical Primer for Release
par: Quinque, Felix, et autres
Publié: (2025) -
Zero Bubble Pipeline Parallelism
par: Qi, Penghui, et autres
Publié: (2023) -
AdaPtis: Reducing Pipeline Bubbles with Adaptive Pipeline Parallelism on Heterogeneous Models
par: Guo, Jihu, et autres
Publié: (2025) -
BitPipe: Bidirectional Interleaved Pipeline Parallelism for Accelerating Large Models Training
par: Wu, Houming, et autres
Publié: (2024) -
PipeOffload: Improving Scalability of Pipeline Parallelism with Memory Optimization
par: Wan, Xinyi, et autres
Publié: (2025)