Revisiting Parameter Server in LLM Post-Training
Fuente:
arXiv
Salvato in:
| Autori principali: | Wan, Xinyi, Qi, Penghui, Huang, Guangxing, Ruan, Chaoyi, Lin, Min, Li, Jialin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
PipeOffload: Improving Scalability of Pipeline Parallelism with Memory Optimization
di: Wan, Xinyi, et al.
Pubblicazione: (2025)
di: Wan, Xinyi, et al.
Pubblicazione: (2025)
Zero Bubble Pipeline Parallelism
di: Qi, Penghui, et al.
Pubblicazione: (2023)
di: Qi, Penghui, et al.
Pubblicazione: (2023)
Cortex: Achieving Low-Latency, Cost-Efficient Remote Data Access For LLM via Semantic-Aware Knowledge Caching
di: Ruan, Chaoyi, et al.
Pubblicazione: (2025)
di: Ruan, Chaoyi, et al.
Pubblicazione: (2025)
Reaching Agreement Among Reasoning LLM Agents
di: Ruan, Chaoyi, et al.
Pubblicazione: (2025)
di: Ruan, Chaoyi, et al.
Pubblicazione: (2025)
Balancing Pipeline Parallelism with Vocabulary Parallelism
di: Yeung, Man Tsung, et al.
Pubblicazione: (2024)
di: Yeung, Man Tsung, et al.
Pubblicazione: (2024)
Accelerating Long-Tail Generation in Synchronous RLHF Training via Adaptive Tensor Parallelism
di: Zhao, Long, et al.
Pubblicazione: (2026)
di: Zhao, Long, et al.
Pubblicazione: (2026)
Why Should the Server Do It All?: A Scalable, Versatile, and Model-Agnostic Framework for Server-Light DNN Inference over Massively Distributed Clients via Training-Free Intermediate Feature Compression
di: Sung, Mingyu, et al.
Pubblicazione: (2025)
di: Sung, Mingyu, et al.
Pubblicazione: (2025)
ParaGAN: A Scalable Distributed Training Framework for Generative Adversarial Networks
di: Shi, Ziji, et al.
Pubblicazione: (2024)
di: Shi, Ziji, et al.
Pubblicazione: (2024)
DynaServe: Unified and Elastic Execution for Dynamic Disaggregated LLM Serving
di: Ruan, Chaoyi, et al.
Pubblicazione: (2025)
di: Ruan, Chaoyi, et al.
Pubblicazione: (2025)
TensorHub: Scalable and Elastic Weight Transfer for LLM RL Training
di: Ye, Chenhao, et al.
Pubblicazione: (2026)
di: Ye, Chenhao, et al.
Pubblicazione: (2026)
Hiding Communication Cost in Distributed LLM Training via Micro-batch Co-execution
di: Wang, Haiquan, et al.
Pubblicazione: (2024)
di: Wang, Haiquan, et al.
Pubblicazione: (2024)
Viability and Performance of a Private LLM Server for SMBs: A Benchmark Analysis of Qwen3-30B on Consumer-Grade Hardware
di: Khalil, Alex, et al.
Pubblicazione: (2025)
di: Khalil, Alex, et al.
Pubblicazione: (2025)
Striking the Right Balance between Compute and Copy: Improving LLM Inferencing Under Speculative Decoding
di: Ramachandran, Arun, et al.
Pubblicazione: (2025)
di: Ramachandran, Arun, et al.
Pubblicazione: (2025)
Delay-Aware Multi-Stage Edge Server Upgrade with Budget Constraint
di: Wihidayat, Endar Suprih, et al.
Pubblicazione: (2025)
di: Wihidayat, Endar Suprih, et al.
Pubblicazione: (2025)
Lagom: Unleashing the Power of Communication and Computation Overlapping for Distributed LLM Training
di: Xu, Guanbin, et al.
Pubblicazione: (2026)
di: Xu, Guanbin, et al.
Pubblicazione: (2026)
TS-EoH: An Edge Server Task Scheduling Algorithm Based on Evolution of Heuristic
di: Yatong, Wang, et al.
Pubblicazione: (2024)
di: Yatong, Wang, et al.
Pubblicazione: (2024)
Research on the Application of Spark Streaming Real-Time Data Analysis System and large language model Intelligent Agents
di: Wang, Jialin, et al.
Pubblicazione: (2024)
di: Wang, Jialin, et al.
Pubblicazione: (2024)
Pipeline Parallelism with Controllable Memory
di: Qi, Penghui, et al.
Pubblicazione: (2024)
di: Qi, Penghui, et al.
Pubblicazione: (2024)
Fast LLM Post-training via Decoupled and Fastest-of-N Speculation
di: Cheng, Rongxin, et al.
Pubblicazione: (2025)
di: Cheng, Rongxin, et al.
Pubblicazione: (2025)
OrchMLLM: Orchestrate Multimodal Data with Batch Post-Balancing to Accelerate Multimodal Large Language Model Training
di: Zheng, Yijie, et al.
Pubblicazione: (2025)
di: Zheng, Yijie, et al.
Pubblicazione: (2025)
A Few GPUs, A Whole Lotta Scale: Faithful LLM Training Emulation with PrismLLM
di: Xi, Shaoke, et al.
Pubblicazione: (2026)
di: Xi, Shaoke, et al.
Pubblicazione: (2026)
Role-Based Fault Tolerance System for LLM RL Post-Training
di: Chen, Zhenqian, et al.
Pubblicazione: (2025)
di: Chen, Zhenqian, et al.
Pubblicazione: (2025)
TACO: Efficient Communication Compression of Intermediate Tensors for Scalable Tensor-Parallel LLM Training
di: Liu, Man, et al.
Pubblicazione: (2026)
di: Liu, Man, et al.
Pubblicazione: (2026)
Laminar: A Scalable Asynchronous RL Post-Training Framework
di: Sheng, Guangming, et al.
Pubblicazione: (2025)
di: Sheng, Guangming, et al.
Pubblicazione: (2025)
MegaScale-Data: Scaling Dataloader for Multisource Large Foundation Model Training
di: Zhao, Juntao, et al.
Pubblicazione: (2025)
di: Zhao, Juntao, et al.
Pubblicazione: (2025)
KunServe: Parameter-centric Memory Management for Efficient Memory Overloading Handling in LLM Serving
di: Cheng, Rongxin, et al.
Pubblicazione: (2024)
di: Cheng, Rongxin, et al.
Pubblicazione: (2024)
Lumos: Efficient Performance Modeling and Estimation for Large-scale LLM Training
di: Liang, Mingyu, et al.
Pubblicazione: (2025)
di: Liang, Mingyu, et al.
Pubblicazione: (2025)
An Upload-Efficient Scheme for Transferring Knowledge From a Server-Side Pre-trained Generator to Clients in Heterogeneous Federated Learning
di: Zhang, Jianqing, et al.
Pubblicazione: (2024)
di: Zhang, Jianqing, et al.
Pubblicazione: (2024)
High-Throughput LLM inference on Heterogeneous Clusters
di: Xiong, Yi, et al.
Pubblicazione: (2025)
di: Xiong, Yi, et al.
Pubblicazione: (2025)
Zipage: Maintain High Request Concurrency for LLM Reasoning through Compressed PagedAttention
di: Liao, Mengqi, et al.
Pubblicazione: (2026)
di: Liao, Mengqi, et al.
Pubblicazione: (2026)
SPECTRE: Hybrid Ordinary-Parallel Speculative Serving for Resource-Efficient LLM Inference
di: Xie, Jincheng, et al.
Pubblicazione: (2026)
di: Xie, Jincheng, et al.
Pubblicazione: (2026)
Towards Carbon-Aware Container Orchestration: Predicting Workload Energy Consumption with Federated Learning
di: Saad, Zainab, et al.
Pubblicazione: (2025)
di: Saad, Zainab, et al.
Pubblicazione: (2025)
InfiniPipe: Elastic Pipeline Parallelism for Efficient Variable-Length Long-Context LLM Training
di: Wang, Shiju, et al.
Pubblicazione: (2025)
di: Wang, Shiju, et al.
Pubblicazione: (2025)
ReCoVer: Resilient LLM Pre-Training System via Fault-Tolerant Collective and Versatile Workload
di: Liu, Ziyue, et al.
Pubblicazione: (2026)
di: Liu, Ziyue, et al.
Pubblicazione: (2026)
Elastic On-Device LLM Service
di: Yin, Wangsong, et al.
Pubblicazione: (2024)
di: Yin, Wangsong, et al.
Pubblicazione: (2024)
DynaKV: Enabling Accurate and Efficient Long-Sequence LLM Decoding on Smartphones
di: Wang, Tuowei, et al.
Pubblicazione: (2025)
di: Wang, Tuowei, et al.
Pubblicazione: (2025)
MergePipe: A Budget-Aware Parameter Management System for Scalable LLM Merging
di: Wang, Yuanyi, et al.
Pubblicazione: (2026)
di: Wang, Yuanyi, et al.
Pubblicazione: (2026)
ENOVA: Autoscaling towards Cost-effective and Stable Serverless LLM Serving
di: Huang, Tao, et al.
Pubblicazione: (2024)
di: Huang, Tao, et al.
Pubblicazione: (2024)
HETHUB: A Distributed Training System with Heterogeneous Cluster for Large-Scale Models
di: Xu, Si, et al.
Pubblicazione: (2024)
di: Xu, Si, et al.
Pubblicazione: (2024)
TrainVerify: Equivalence-Based Verification for Distributed LLM Training
di: Lu, Yunchi, et al.
Pubblicazione: (2025)
di: Lu, Yunchi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
PipeOffload: Improving Scalability of Pipeline Parallelism with Memory Optimization
di: Wan, Xinyi, et al.
Pubblicazione: (2025) -
Zero Bubble Pipeline Parallelism
di: Qi, Penghui, et al.
Pubblicazione: (2023) -
Cortex: Achieving Low-Latency, Cost-Efficient Remote Data Access For LLM via Semantic-Aware Knowledge Caching
di: Ruan, Chaoyi, et al.
Pubblicazione: (2025) -
Reaching Agreement Among Reasoning LLM Agents
di: Ruan, Chaoyi, et al.
Pubblicazione: (2025) -
Balancing Pipeline Parallelism with Vocabulary Parallelism
di: Yeung, Man Tsung, et al.
Pubblicazione: (2024)