Optimizing RLHF Training for Large Language Models with Stage Fusion
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhong, Yinmin, Zhang, Zili, Wu, Bingyang, Liu, Shengyu, Chen, Yukun, Wan, Changyi, Hu, Hanpeng, Xia, Lei, Ming, Ranchen, Zhu, Yibo, Jin, Xin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DistTrain: Addressing Model and Data Heterogeneity with Disaggregated Training for Multimodal Large Language Models
di: Zhang, Zili, et al.
Pubblicazione: (2024)
di: Zhang, Zili, et al.
Pubblicazione: (2024)
StreamRL: Scalable, Heterogeneous, and Elastic RL for LLMs with Disaggregated Stream Generation
di: Zhong, Yinmin, et al.
Pubblicazione: (2025)
di: Zhong, Yinmin, et al.
Pubblicazione: (2025)
TokenLake: A Unified Segment-level Prefix Cache Pool for Fine-grained Elastic Long-Context LLM Serving
di: Wu, Bingyang, et al.
Pubblicazione: (2025)
di: Wu, Bingyang, et al.
Pubblicazione: (2025)
LoongServe: Efficiently Serving Long-Context Large Language Models with Elastic Sequence Parallelism
di: Wu, Bingyang, et al.
Pubblicazione: (2024)
di: Wu, Bingyang, et al.
Pubblicazione: (2024)
Fast Distributed Inference Serving for Large Language Models
di: Wu, Bingyang, et al.
Pubblicazione: (2023)
di: Wu, Bingyang, et al.
Pubblicazione: (2023)
DistServe: Disaggregating Prefill and Decoding for Goodput-optimized Large Language Model Serving
di: Zhong, Yinmin, et al.
Pubblicazione: (2024)
di: Zhong, Yinmin, et al.
Pubblicazione: (2024)
DIP: Efficient Large Multimodal Model Training with Dynamic Interleaved Pipeline
di: Xue, Zhenliang, et al.
Pubblicazione: (2025)
di: Xue, Zhenliang, et al.
Pubblicazione: (2025)
FLUX: Fast Software-based Communication Overlap On GPUs Through Kernel Fusion
di: Chang, Li-Wen, et al.
Pubblicazione: (2024)
di: Chang, Li-Wen, et al.
Pubblicazione: (2024)
DualPath: Breaking the Storage Bandwidth Bottleneck in Agentic LLM Inference
di: Wu, Yongtong, et al.
Pubblicazione: (2026)
di: Wu, Yongtong, et al.
Pubblicazione: (2026)
Accelerating Long-Tail Generation in Synchronous RLHF Training via Adaptive Tensor Parallelism
di: Zhao, Long, et al.
Pubblicazione: (2026)
di: Zhao, Long, et al.
Pubblicazione: (2026)
Accelerating Distributed MoE Training and Inference with Lina
di: Li, Jiamin, et al.
Pubblicazione: (2022)
di: Li, Jiamin, et al.
Pubblicazione: (2022)
SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference
di: Zhao, Yihao, et al.
Pubblicazione: (2025)
di: Zhao, Yihao, et al.
Pubblicazione: (2025)
ClusterFusion++: Expanding Cluster-Level Fusion to Full Transformer-Block Decoding
di: Jin, ChiHeng, et al.
Pubblicazione: (2026)
di: Jin, ChiHeng, et al.
Pubblicazione: (2026)
Konflux: Optimized Function Fusion for Serverless Applications
di: Kowallik, Niklas, et al.
Pubblicazione: (2026)
di: Kowallik, Niklas, et al.
Pubblicazione: (2026)
Multi-Resolution Model Fusion for Accelerating the Convolutional Neural Network Training
di: Wang, Kewei, et al.
Pubblicazione: (2025)
di: Wang, Kewei, et al.
Pubblicazione: (2025)
CFP: Efficient Optimization of Intra-Operator Parallelism Plans for Large Model Training
di: Hu, Weifang, et al.
Pubblicazione: (2025)
di: Hu, Weifang, et al.
Pubblicazione: (2025)
TridentServe: A Stage-level Serving System for Diffusion Pipelines
di: Xia, Yifei, et al.
Pubblicazione: (2025)
di: Xia, Yifei, et al.
Pubblicazione: (2025)
LoongTrain: Efficient Training of Long-Sequence LLMs with Head-Context Parallelism
di: Gu, Diandian, et al.
Pubblicazione: (2024)
di: Gu, Diandian, et al.
Pubblicazione: (2024)
Heta: Distributed Training of Heterogeneous Graph Neural Networks
di: Zhong, Yuchen, et al.
Pubblicazione: (2024)
di: Zhong, Yuchen, et al.
Pubblicazione: (2024)
Optimizing Distributed Training Approaches for Scaling Neural Networks
di: Baligodugula, Vishnu Vardhan, et al.
Pubblicazione: (2025)
di: Baligodugula, Vishnu Vardhan, et al.
Pubblicazione: (2025)
RLHFless: Serverless Computing for Efficient RLHF
di: Wei, Rui, et al.
Pubblicazione: (2026)
di: Wei, Rui, et al.
Pubblicazione: (2026)
Fusionize++: Improving Serverless Application Performance Using Dynamic Task Inlining and Infrastructure Optimization
di: Schirmer, Trever, et al.
Pubblicazione: (2023)
di: Schirmer, Trever, et al.
Pubblicazione: (2023)
QSync: Quantization-Minimized Synchronous Distributed Training Across Hybrid Devices
di: Zhao, Juntao, et al.
Pubblicazione: (2024)
di: Zhao, Juntao, et al.
Pubblicazione: (2024)
MalleTrain: Deep Neural Network Training on Unfillable Supercomputer Nodes
di: Ma, Xiaolong, et al.
Pubblicazione: (2024)
di: Ma, Xiaolong, et al.
Pubblicazione: (2024)
Fulcrum: Optimizing Concurrent DNN Training and Inferencing on Edge Accelerators
di: K., Prashanthi S., et al.
Pubblicazione: (2025)
di: K., Prashanthi S., et al.
Pubblicazione: (2025)
Parcae: Proactive, Liveput-Optimized DNN Training on Preemptible Instances
di: Duan, Jiangfei, et al.
Pubblicazione: (2024)
di: Duan, Jiangfei, et al.
Pubblicazione: (2024)
Zorse: Optimizing LLM Training Efficiency on Heterogeneous GPU Clusters
di: Guo, Runsheng Benson, et al.
Pubblicazione: (2025)
di: Guo, Runsheng Benson, et al.
Pubblicazione: (2025)
SWIFT: Expedited Failure Recovery for Large-scale DNN Training
di: Zhong, Yuchen, et al.
Pubblicazione: (2023)
di: Zhong, Yuchen, et al.
Pubblicazione: (2023)
Collaborative UAVs Multi-task Video Processing Optimization Based on Enhanced Distributed Actor-Critic Networks
di: Rong, Ziqi, et al.
Pubblicazione: (2024)
di: Rong, Ziqi, et al.
Pubblicazione: (2024)
DFLOP: A Data-driven Framework for Multimodal LLM Training Pipeline Optimization
di: An, Hyeonjun, et al.
Pubblicazione: (2026)
di: An, Hyeonjun, et al.
Pubblicazione: (2026)
Optimizing Frequent Checkpointing via Low-Cost Differential for Distributed Training Systems
di: Yao, Chenxuan, et al.
Pubblicazione: (2025)
di: Yao, Chenxuan, et al.
Pubblicazione: (2025)
Towards Affordable, Adaptive and Automatic GNN Training on CPU-GPU Heterogeneous Platforms
di: Qiao, Tong, et al.
Pubblicazione: (2025)
di: Qiao, Tong, et al.
Pubblicazione: (2025)
From Patchwork to Network: A Comprehensive Framework for Demand Analysis and Fleet Optimization of Urban Air Mobility
di: Jiang, Xuan, et al.
Pubblicazione: (2025)
di: Jiang, Xuan, et al.
Pubblicazione: (2025)
Argus: Token Aware Distributed LLM Inference Optimization
di: Wu, Panlong, et al.
Pubblicazione: (2025)
di: Wu, Panlong, et al.
Pubblicazione: (2025)
MeCeFO: Enhancing LLM Training Robustness via Fault-Tolerant Optimization
di: Hu, Rizhen, et al.
Pubblicazione: (2025)
di: Hu, Rizhen, et al.
Pubblicazione: (2025)
DeepCompile: A Compiler-Driven Approach to Optimizing Distributed Deep Learning Training
di: Tanaka, Masahiro, et al.
Pubblicazione: (2025)
di: Tanaka, Masahiro, et al.
Pubblicazione: (2025)
HyperParallel: A Supernode-Affinity AI Framework
di: Zhang, Xin, et al.
Pubblicazione: (2026)
di: Zhang, Xin, et al.
Pubblicazione: (2026)
InternEvo: Efficient Long-sequence Large Language Model Training via Hybrid Parallelism and Redundant Sharding
di: Chen, Qiaoling, et al.
Pubblicazione: (2024)
di: Chen, Qiaoling, et al.
Pubblicazione: (2024)
Efficient Training of Large Language Models on Distributed Infrastructures: A Survey
di: Duan, Jiangfei, et al.
Pubblicazione: (2024)
di: Duan, Jiangfei, et al.
Pubblicazione: (2024)
RAGCache: Efficient Knowledge Caching for Retrieval-Augmented Generation
di: Jin, Chao, et al.
Pubblicazione: (2024)
di: Jin, Chao, et al.
Pubblicazione: (2024)
Documenti analoghi
-
DistTrain: Addressing Model and Data Heterogeneity with Disaggregated Training for Multimodal Large Language Models
di: Zhang, Zili, et al.
Pubblicazione: (2024) -
StreamRL: Scalable, Heterogeneous, and Elastic RL for LLMs with Disaggregated Stream Generation
di: Zhong, Yinmin, et al.
Pubblicazione: (2025) -
TokenLake: A Unified Segment-level Prefix Cache Pool for Fine-grained Elastic Long-Context LLM Serving
di: Wu, Bingyang, et al.
Pubblicazione: (2025) -
LoongServe: Efficiently Serving Long-Context Large Language Models with Elastic Sequence Parallelism
di: Wu, Bingyang, et al.
Pubblicazione: (2024) -
Fast Distributed Inference Serving for Large Language Models
di: Wu, Bingyang, et al.
Pubblicazione: (2023)