ECHO-2: A Large-Scale Distributed Rollout Framework for Cost-Efficient Reinforcement Learning
Fuente:
arXiv
Guardado en:
| Autores principales: | Song, Jingwei, Chen, Meng, Xiao, Jie, Ren, Qingnan, Huang, Jiaqi, Deng, Yangshen, Tong, Chris, Chen, Wanyi, Wang, Suli, Chen, Zhisheng, Bi, Ziqian, Lu, Shuo, Duan, Yiqun, Wang, Xu, Yu, Rymon, Ai, Lynn, Yang, Eric, Shi, Tianyu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Speculative Decoding in Decentralized LLM Inference: Turning Communication Latency into Computation Throughput
por: Song, Jingwei, et al.
Publicado: (2025)
por: Song, Jingwei, et al.
Publicado: (2025)
Lattica: A Decentralized Cross-NAT Communication Framework for Scalable AI Inference and Training
por: Yang, Ween, et al.
Publicado: (2025)
por: Yang, Ween, et al.
Publicado: (2025)
NeuroTTT: Bridging Pretraining-Downstream Task Misalignment in EEG Foundation Models via Test-Time Training
por: Wang, Suli, et al.
Publicado: (2025)
por: Wang, Suli, et al.
Publicado: (2025)
Parallax: Efficient LLM Inference Service over Decentralized Environment
por: Tong, Chris, et al.
Publicado: (2025)
por: Tong, Chris, et al.
Publicado: (2025)
ROSE: Rollout On Serving GPUs via Cooperative Elasticity for Agentic RL
por: Gao, Wei, et al.
Publicado: (2026)
por: Gao, Wei, et al.
Publicado: (2026)
ECHO: Elastic Speculative Decoding with Sparse Gating for High-Concurrency Scenarios
por: Hu, Xinyi, et al.
Publicado: (2026)
por: Hu, Xinyi, et al.
Publicado: (2026)
Lotus: Optimizing Disaggregated Transactions with Disaggregated Locks
por: Hu, Zhisheng, et al.
Publicado: (2025)
por: Hu, Zhisheng, et al.
Publicado: (2025)
Revisiting the Time Cost Model of AllReduce
por: Xiong, Dian, et al.
Publicado: (2024)
por: Xiong, Dian, et al.
Publicado: (2024)
TierBase: A Workload-Driven Cost-Optimized Key-Value Store
por: Shen, Zhitao, et al.
Publicado: (2025)
por: Shen, Zhitao, et al.
Publicado: (2025)
Unleashing Efficient Asynchronous RL Post-Training via Staleness-Constrained Rollout Coordination
por: Li, Haoyang, et al.
Publicado: (2026)
por: Li, Haoyang, et al.
Publicado: (2026)
RollPacker: Mitigating Long-Tail Rollouts for Fast, Synchronous RL Post-Training
por: Gao, Wei, et al.
Publicado: (2025)
por: Gao, Wei, et al.
Publicado: (2025)
FedTeddi: Temporal Drift and Divergence Aware Scheduling for Timely Federated Edge Learning
por: Bai, Yuxuan, et al.
Publicado: (2025)
por: Bai, Yuxuan, et al.
Publicado: (2025)
A study of the spectrum resource leasing method based on ERC4907 extension
por: Liang, Zhiming, et al.
Publicado: (2025)
por: Liang, Zhiming, et al.
Publicado: (2025)
AcOrch: Accelerating Sampling-based GNN Training under CPU-NPU Heterogeneous Environments
por: Chen, Kefu, et al.
Publicado: (2026)
por: Chen, Kefu, et al.
Publicado: (2026)
CD-Raft: Reducing the Latency of Distributed Consensus in Cross-Domain Sites
por: Wang, Yangyang, et al.
Publicado: (2026)
por: Wang, Yangyang, et al.
Publicado: (2026)
RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs
por: Wu, Yongji, et al.
Publicado: (2025)
por: Wu, Yongji, et al.
Publicado: (2025)
Hiding Communication Cost in Distributed LLM Training via Micro-batch Co-execution
por: Wang, Haiquan, et al.
Publicado: (2024)
por: Wang, Haiquan, et al.
Publicado: (2024)
HeRo: Adaptive Orchestration of Agentic RAG on Heterogeneous Mobile SoC
por: Li, Maoliang, et al.
Publicado: (2026)
por: Li, Maoliang, et al.
Publicado: (2026)
Foundation Models in Federated Learning: Assessing Backdoor Vulnerabilities
por: Li, Xi, et al.
Publicado: (2024)
por: Li, Xi, et al.
Publicado: (2024)
MemAscend: System Memory Optimization for SSD-Offloaded LLM Fine-Tuning
por: Liaw, Yong-Cheng, et al.
Publicado: (2025)
por: Liaw, Yong-Cheng, et al.
Publicado: (2025)
Analysis and Optimized CXL-Attached Memory Allocation for Long-Context LLM Fine-Tuning
por: Liaw, Yong-Cheng, et al.
Publicado: (2025)
por: Liaw, Yong-Cheng, et al.
Publicado: (2025)
SwitchFS: Asynchronous Metadata Updates for Distributed Filesystems with In-Network Coordination
por: Xu, Jingwei, et al.
Publicado: (2024)
por: Xu, Jingwei, et al.
Publicado: (2024)
Joint Optimization of Offloading, Batching and DVFS for Multiuser Co-Inference
por: Xu, Yaodan, et al.
Publicado: (2025)
por: Xu, Yaodan, et al.
Publicado: (2025)
Nezha: A Key-Value Separated Distributed Store with Optimized Raft Integration
por: Wang, Yangyang, et al.
Publicado: (2026)
por: Wang, Yangyang, et al.
Publicado: (2026)
RServe: Overlapping Encoding and Prefill for Efficient LMM Inference
por: Guo, Tianyu, et al.
Publicado: (2025)
por: Guo, Tianyu, et al.
Publicado: (2025)
FlexKV: Flexible Index Offloading for Memory-Disaggregated Key-Value Store
por: Hu, Zhisheng, et al.
Publicado: (2025)
por: Hu, Zhisheng, et al.
Publicado: (2025)
Blockchain-Enabled Dynamic Spectrum Sharing for Satellite and Terrestrial Communication Networks
por: Wang, Zixin, et al.
Publicado: (2024)
por: Wang, Zixin, et al.
Publicado: (2024)
CONCUR: High-Throughput Agentic Batch Inference of LLM via Congestion-Based Concurrency Control
por: Chen, Qiaoling, et al.
Publicado: (2026)
por: Chen, Qiaoling, et al.
Publicado: (2026)
Scale: Deep Reinforcement Learning for Container Scheduling in Serverless Edge Computing
por: Chen, Chen, et al.
Publicado: (2026)
por: Chen, Chen, et al.
Publicado: (2026)
FedCGD: Collective Gradient Divergence Optimized Scheduling for Wireless Federated Learning
por: Chen, Tan, et al.
Publicado: (2025)
por: Chen, Tan, et al.
Publicado: (2025)
Distributed Online Rollout for Multivehicle Routing in Unmapped Environments
por: Weber, Jamison W., et al.
Publicado: (2023)
por: Weber, Jamison W., et al.
Publicado: (2023)
DOPD: A Dynamic PD-Disaggregation Architecture for Maximizing Goodput in LLM Inference Serving
por: Liao, Junhan, et al.
Publicado: (2025)
por: Liao, Junhan, et al.
Publicado: (2025)
LoHan: Low-Cost High-Performance Framework to Fine-Tune 100B Model on a Consumer GPU
por: Liao, Changyue, et al.
Publicado: (2024)
por: Liao, Changyue, et al.
Publicado: (2024)
ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism
por: Ma, Tenghui, et al.
Publicado: (2026)
por: Ma, Tenghui, et al.
Publicado: (2026)
BucketServe: Bucket-Based Dynamic Batching for Smart and Efficient LLM Inference Serving
por: Zheng, Wanyi, et al.
Publicado: (2025)
por: Zheng, Wanyi, et al.
Publicado: (2025)
Cortex: Achieving Low-Latency, Cost-Efficient Remote Data Access For LLM via Semantic-Aware Knowledge Caching
por: Ruan, Chaoyi, et al.
Publicado: (2025)
por: Ruan, Chaoyi, et al.
Publicado: (2025)
Mosaic: Towards Efficient Training of Multimodal Models with Spatial Resource Multiplexing
por: Wang, Yanbo, et al.
Publicado: (2026)
por: Wang, Yanbo, et al.
Publicado: (2026)
Characterization of Large Language Model Development in the Datacenter
por: Hu, Qinghao, et al.
Publicado: (2024)
por: Hu, Qinghao, et al.
Publicado: (2024)
WWW.Serve: Interconnecting Global LLM Services through Decentralization
por: Wang, Huanyu, et al.
Publicado: (2026)
por: Wang, Huanyu, et al.
Publicado: (2026)
Mobility Accelerates Learning: Convergence Analysis on Hierarchical Federated Learning in Vehicular Networks
por: Chen, Tan, et al.
Publicado: (2024)
por: Chen, Tan, et al.
Publicado: (2024)
Ejemplares similares
-
Speculative Decoding in Decentralized LLM Inference: Turning Communication Latency into Computation Throughput
por: Song, Jingwei, et al.
Publicado: (2025) -
Lattica: A Decentralized Cross-NAT Communication Framework for Scalable AI Inference and Training
por: Yang, Ween, et al.
Publicado: (2025) -
NeuroTTT: Bridging Pretraining-Downstream Task Misalignment in EEG Foundation Models via Test-Time Training
por: Wang, Suli, et al.
Publicado: (2025) -
Parallax: Efficient LLM Inference Service over Decentralized Environment
por: Tong, Chris, et al.
Publicado: (2025) -
ROSE: Rollout On Serving GPUs via Cooperative Elasticity for Agentic RL
por: Gao, Wei, et al.
Publicado: (2026)