Schedule-Level Shared-Prefix Reuse for LLM RL Training
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Pengbo, Zhang, Feiyuan, Sheng, Guangming, He, Guangxin, Chai, Di, Li, Ziniu, Wu, Taiqiang, Yuan, Binhang, Chen, Kai |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Unlocking Full Efficiency of Token Filtering in Large Language Model Training
di: Chai, Di, et al.
Pubblicazione: (2025)
di: Chai, Di, et al.
Pubblicazione: (2025)
HexAGenT: Efficient Agentic LLM Serving via Workflow- and Heterogeneity-Aware Scheduling
di: Peng, You, et al.
Pubblicazione: (2026)
di: Peng, You, et al.
Pubblicazione: (2026)
Slice-Level Scheduling for High Throughput and Load Balanced LLM Serving
di: Cheng, Ke, et al.
Pubblicazione: (2024)
di: Cheng, Ke, et al.
Pubblicazione: (2024)
SWIFT: Expedited Failure Recovery for Large-scale DNN Training
di: Zhong, Yuchen, et al.
Pubblicazione: (2023)
di: Zhong, Yuchen, et al.
Pubblicazione: (2023)
Autopoiesis: A Self-Evolving System Paradigm for LLM Serving Under Runtime Dynamics
di: Jiang, Youhe, et al.
Pubblicazione: (2026)
di: Jiang, Youhe, et al.
Pubblicazione: (2026)
HexGen-2: Disaggregated Generative Inference of LLMs in Heterogeneous Environment
di: Jiang, Youhe, et al.
Pubblicazione: (2025)
di: Jiang, Youhe, et al.
Pubblicazione: (2025)
HexiSeq: Accommodating Long Context Training of LLMs over Heterogeneous Hardware
di: Liang, Yan, et al.
Pubblicazione: (2026)
di: Liang, Yan, et al.
Pubblicazione: (2026)
HexiScale: Facilitating Large Language Model Training over Heterogeneous Hardware
di: Yan, Ran, et al.
Pubblicazione: (2024)
di: Yan, Ran, et al.
Pubblicazione: (2024)
PrefixWall: Mitigating Prefix Caching Side Channels in Shared LLM Systems
di: Pennas, Panagiotis Georgios, et al.
Pubblicazione: (2026)
di: Pennas, Panagiotis Georgios, et al.
Pubblicazione: (2026)
RollMux: Phase-Level Multiplexing for Disaggregated RL Post-Training
di: Wu, Tianyuan, et al.
Pubblicazione: (2025)
di: Wu, Tianyuan, et al.
Pubblicazione: (2025)
DistFlow: A Fully Distributed RL Framework for Scalable and Efficient LLM Post-Training
di: Wang, Zhixin, et al.
Pubblicazione: (2025)
di: Wang, Zhixin, et al.
Pubblicazione: (2025)
Demystifying Cost-Efficiency in LLM Serving over Heterogeneous GPUs
di: Jiang, Youhe, et al.
Pubblicazione: (2025)
di: Jiang, Youhe, et al.
Pubblicazione: (2025)
AReaL-Hex: Accommodating Asynchronous RL Training over Heterogeneous GPUs
di: Yan, Ran, et al.
Pubblicazione: (2025)
di: Yan, Ran, et al.
Pubblicazione: (2025)
PrefillShare: A Shared Prefill Module for KV Reuse in Multi-LLM Disaggregated Serving
di: Woo, Sunghyeon, et al.
Pubblicazione: (2026)
di: Woo, Sunghyeon, et al.
Pubblicazione: (2026)
Frenzy: A Memory-Aware Serverless LLM Training System for Heterogeneous GPU Clusters
di: Chang, Zihan, et al.
Pubblicazione: (2024)
di: Chang, Zihan, et al.
Pubblicazione: (2024)
CaraServe: CPU-Assisted and Rank-Aware LoRA Serving for Generative LLM Inference
di: Li, Suyi, et al.
Pubblicazione: (2024)
di: Li, Suyi, et al.
Pubblicazione: (2024)
Raptr: Prefix Consensus for Robust High-Performance BFT
di: Tonkikh, Andrei, et al.
Pubblicazione: (2025)
di: Tonkikh, Andrei, et al.
Pubblicazione: (2025)
RcLLM: Accelerating Generative Recommendation via Beyond-Prefix KV Caching
di: Zhao, Zhan, et al.
Pubblicazione: (2026)
di: Zhao, Zhan, et al.
Pubblicazione: (2026)
Unleashing Efficient Asynchronous RL Post-Training via Staleness-Constrained Rollout Coordination
di: Li, Haoyang, et al.
Pubblicazione: (2026)
di: Li, Haoyang, et al.
Pubblicazione: (2026)
CascadeInfer: Length-Aware Scheduling of LLM Serving with Low Latency and Load Balancing
di: Yuan, Yitao, et al.
Pubblicazione: (2025)
di: Yuan, Yitao, et al.
Pubblicazione: (2025)
DreamDDP: Accelerating Data Parallel Distributed LLM Training with Layer-wise Scheduled Partial Synchronization
di: Tang, Zhenheng, et al.
Pubblicazione: (2025)
di: Tang, Zhenheng, et al.
Pubblicazione: (2025)
Parallax: Efficient LLM Inference Service over Decentralized Environment
di: Tong, Chris, et al.
Pubblicazione: (2025)
di: Tong, Chris, et al.
Pubblicazione: (2025)
Prefix Consensus For Censorship Resistant BFT
di: Xiang, Zhuolun, et al.
Pubblicazione: (2026)
di: Xiang, Zhuolun, et al.
Pubblicazione: (2026)
Efficient Pre-Training of LLMs via Topology-Aware Communication Alignment on More Than 9600 GPUs
di: He, Guoliang, et al.
Pubblicazione: (2025)
di: He, Guoliang, et al.
Pubblicazione: (2025)
BLOCKS: Blockchain-supported Cross-Silo Knowledge Sharing for Efficient LLM Services
di: Zhou, Zhaojiacheng, et al.
Pubblicazione: (2025)
di: Zhou, Zhaojiacheng, et al.
Pubblicazione: (2025)
Bandwidth-Aware and Cost-Efficient Pipeline Parallel Scheduling in Geo-Distributed LLM Training
di: Zhang, Han, et al.
Pubblicazione: (2026)
di: Zhang, Han, et al.
Pubblicazione: (2026)
Elastic Mixture of Rank-Wise Experts for Knowledge Reuse in Federated Fine-Tuning
di: Wu, Yebo, et al.
Pubblicazione: (2025)
di: Wu, Yebo, et al.
Pubblicazione: (2025)
FATE: Future-State-Aware Scheduling for Heterogeneous LLM Workflows
di: Huang, Zirui, et al.
Pubblicazione: (2026)
di: Huang, Zirui, et al.
Pubblicazione: (2026)
Energy Profiling of Data-Sharing Pipelines: Modeling, Estimation, and Reuse Strategies
di: Masoudi, Sepideh, et al.
Pubblicazione: (2025)
di: Masoudi, Sepideh, et al.
Pubblicazione: (2025)
Hestia: Hyperthread-Level Scheduling for Cloud Microservices with Interference-Aware Attention
di: Yang, Dingyu, et al.
Pubblicazione: (2026)
di: Yang, Dingyu, et al.
Pubblicazione: (2026)
INSPIRIT: Optimizing Heterogeneous Task Scheduling through Adaptive Priority in Task-based Runtime Systems
di: Wang, Yiqing, et al.
Pubblicazione: (2024)
di: Wang, Yiqing, et al.
Pubblicazione: (2024)
MeCeFO: Enhancing LLM Training Robustness via Fault-Tolerant Optimization
di: Hu, Rizhen, et al.
Pubblicazione: (2025)
di: Hu, Rizhen, et al.
Pubblicazione: (2025)
TensorHub: Scalable and Elastic Weight Transfer for LLM RL Training
di: Ye, Chenhao, et al.
Pubblicazione: (2026)
di: Ye, Chenhao, et al.
Pubblicazione: (2026)
Past-Future Scheduler for LLM Serving under SLA Guarantees
di: Gong, Ruihao, et al.
Pubblicazione: (2025)
di: Gong, Ruihao, et al.
Pubblicazione: (2025)
MemFine: Memory-Aware Fine-Grained Scheduling for MoE Training
di: Zhao, Lu, et al.
Pubblicazione: (2025)
di: Zhao, Lu, et al.
Pubblicazione: (2025)
Arrow: Adaptive Scheduling Mechanisms for Disaggregated LLM Inference Architecture
di: Wu, Yu, et al.
Pubblicazione: (2025)
di: Wu, Yu, et al.
Pubblicazione: (2025)
A Predictive and Synergistic Two-Layer Scheduling Framework for LLM Serving
di: Zhang, Yue, et al.
Pubblicazione: (2025)
di: Zhang, Yue, et al.
Pubblicazione: (2025)
AlignedServe: Orchestrating Prefix-aware Batching to Build a High-throughput and Computing-efficient LLM Serving System
di: Bai, Fengyao, et al.
Pubblicazione: (2026)
di: Bai, Fengyao, et al.
Pubblicazione: (2026)
HexGen: Generative Inference of Large Language Model over Heterogeneous Environment
di: Jiang, Youhe, et al.
Pubblicazione: (2023)
di: Jiang, Youhe, et al.
Pubblicazione: (2023)
JanusPipe: Efficient Pipeline Parallel Training for Machine Learning Interatomic Potentials
di: Wang, Hongyu, et al.
Pubblicazione: (2026)
di: Wang, Hongyu, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Unlocking Full Efficiency of Token Filtering in Large Language Model Training
di: Chai, Di, et al.
Pubblicazione: (2025) -
HexAGenT: Efficient Agentic LLM Serving via Workflow- and Heterogeneity-Aware Scheduling
di: Peng, You, et al.
Pubblicazione: (2026) -
Slice-Level Scheduling for High Throughput and Load Balanced LLM Serving
di: Cheng, Ke, et al.
Pubblicazione: (2024) -
SWIFT: Expedited Failure Recovery for Large-scale DNN Training
di: Zhong, Yuchen, et al.
Pubblicazione: (2023) -
Autopoiesis: A Self-Evolving System Paradigm for LLM Serving Under Runtime Dynamics
di: Jiang, Youhe, et al.
Pubblicazione: (2026)