History Rhymes: Accelerating LLM Reinforcement Learning with RhymeRL
Fuente:
arXiv
Guardado en:
| Autores principales: | He, Jingkai, Li, Tianjian, Feng, Erhu, Du, Dong, Liu, Qian, Liu, Tao, Xia, Yubin, Chen, Haibo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Topology-Aware Virtualization over Inter-Core Connected Neural Processing Units
por: Feng, Dahu, et al.
Publicado: (2025)
por: Feng, Dahu, et al.
Publicado: (2025)
Characterizing Mobile SoC for Accelerating Heterogeneous LLM Inference
por: Chen, Le, et al.
Publicado: (2025)
por: Chen, Le, et al.
Publicado: (2025)
Jiagu: Optimizing Serverless Computing Resource Utilization with Harmonized Efficiency and Practicability
por: Liu, Qingyuan, et al.
Publicado: (2024)
por: Liu, Qingyuan, et al.
Publicado: (2024)
HetRL: Efficient Reinforcement Learning for LLMs in Heterogeneous Environments
por: He, Yongjun, et al.
Publicado: (2025)
por: He, Yongjun, et al.
Publicado: (2025)
Schedule-Level Shared-Prefix Reuse for LLM RL Training
por: Li, Pengbo, et al.
Publicado: (2026)
por: Li, Pengbo, et al.
Publicado: (2026)
HiRL: Hierarchical Reinforcement Learning for Coordinated Resource Management in Heterogeneous Edge Computing
por: Zhu, Jianyong, et al.
Publicado: (2026)
por: Zhu, Jianyong, et al.
Publicado: (2026)
DistFlow: A Fully Distributed RL Framework for Scalable and Efficient LLM Post-Training
por: Wang, Zhixin, et al.
Publicado: (2025)
por: Wang, Zhixin, et al.
Publicado: (2025)
LMDeploy Accelerates Mixed-Precision LLM Inference with TurboMind
por: Zhang, Li, et al.
Publicado: (2025)
por: Zhang, Li, et al.
Publicado: (2025)
Accelerating Compound LLM Training Workloads with Maestro
por: Yuan, Xiulong, et al.
Publicado: (2026)
por: Yuan, Xiulong, et al.
Publicado: (2026)
PICO: Accelerating All k-Core Paradigms on GPU
por: Zhao, Chen, et al.
Publicado: (2024)
por: Zhao, Chen, et al.
Publicado: (2024)
PROSERVE: Unified Multi-Priority Request Scheduling for LLM Serving
por: Huang, Weizhe, et al.
Publicado: (2025)
por: Huang, Weizhe, et al.
Publicado: (2025)
FleetOpt: Analytical Fleet Provisioning for LLM Inference with Compress-and-Route as Implementation Mechanism
por: Chen, Huamin, et al.
Publicado: (2026)
por: Chen, Huamin, et al.
Publicado: (2026)
OServe: Accelerating LLM Serving via Spatial-Temporal Workload Orchestration
por: Jiang, Youhe, et al.
Publicado: (2026)
por: Jiang, Youhe, et al.
Publicado: (2026)
Polar: Agentic RL on Any Harness at Scale
por: Xu, Binfeng, et al.
Publicado: (2026)
por: Xu, Binfeng, et al.
Publicado: (2026)
inference-fleet-sim: A Queueing-Theory-Grounded Fleet Capacity Planner for LLM Inference
por: Chen, Huamin, et al.
Publicado: (2026)
por: Chen, Huamin, et al.
Publicado: (2026)
FairBatching: Fairness-Aware Batch Formation for LLM Inference
por: Lyu, Hongtao, et al.
Publicado: (2025)
por: Lyu, Hongtao, et al.
Publicado: (2025)
The 1/W Law: An Analytical Study of Context-Length Routing Topology and GPU Generation Gains for LLM Inference Energy Efficiency
por: Chen, Huamin, et al.
Publicado: (2026)
por: Chen, Huamin, et al.
Publicado: (2026)
Minions: Accelerating Large Language Model Inference with Aggregated Speculative Execution
por: Wang, Siqi, et al.
Publicado: (2024)
por: Wang, Siqi, et al.
Publicado: (2024)
Xorbits: Automating Operator Tiling for Distributed Data Science
por: Lu, Weizheng, et al.
Publicado: (2023)
por: Lu, Weizheng, et al.
Publicado: (2023)
OmniInfer: System-Wide Acceleration Techniques for Optimizing LLM Serving Throughput and Latency
por: Wang, Jun, et al.
Publicado: (2025)
por: Wang, Jun, et al.
Publicado: (2025)
A Preliminary Study on Accelerating Simulation Optimization with GPU Implementation
por: He, Jinghai, et al.
Publicado: (2024)
por: He, Jinghai, et al.
Publicado: (2024)
Fantasy: Efficient Large-scale Vector Search on GPU Clusters with GPUDirect Async
por: Liu, Yi, et al.
Publicado: (2025)
por: Liu, Yi, et al.
Publicado: (2025)
Hyperion: Hierarchical Scheduling for Parallel LLM Acceleration in Multi-tier Networks
por: Ma, Mulei, et al.
Publicado: (2025)
por: Ma, Mulei, et al.
Publicado: (2025)
Parallel Collaborative ADMM Privacy Computing and Adaptive GPU Acceleration for Distributed Edge Networks
por: Xia, Mengchun, et al.
Publicado: (2026)
por: Xia, Mengchun, et al.
Publicado: (2026)
Towards Lock Modularization for Heterogeneous Environments
por: Zhang, Hanze, et al.
Publicado: (2025)
por: Zhang, Hanze, et al.
Publicado: (2025)
HLoRA: Efficient Federated Learning System for LLM Heterogeneous Fine-Tuning
por: Liu, Qianli, et al.
Publicado: (2025)
por: Liu, Qianli, et al.
Publicado: (2025)
LLM-Enhanced Deep Reinforcement Learning for Task Offloading in Collaborative Edge Computing
por: Guo, Hao, et al.
Publicado: (2026)
por: Guo, Hao, et al.
Publicado: (2026)
WWW.Serve: Interconnecting Global LLM Services through Decentralization
por: Wang, Huanyu, et al.
Publicado: (2026)
por: Wang, Huanyu, et al.
Publicado: (2026)
Understanding the Performance and Power of LLM Inferencing on Edge Accelerators
por: Arya, Mayank, et al.
Publicado: (2025)
por: Arya, Mayank, et al.
Publicado: (2025)
LAAFD: LLM-based Agents for Accelerated FPGA Design
por: Moraru, Maxim, et al.
Publicado: (2026)
por: Moraru, Maxim, et al.
Publicado: (2026)
PlexRL: Cluster-Level Orchestration of Serviceized LLM Execution for RLVR
por: Zhang, Yiqi, et al.
Publicado: (2026)
por: Zhang, Yiqi, et al.
Publicado: (2026)
AcceLLM: Accelerating LLM Inference using Redundancy for Load Balancing and Data Locality
por: Bournias, Ilias, et al.
Publicado: (2024)
por: Bournias, Ilias, et al.
Publicado: (2024)
A Reinforcement Learning Based Backfilling Strategy for HPC Batch Jobs
por: Kolker-Hicks, Elliot, et al.
Publicado: (2024)
por: Kolker-Hicks, Elliot, et al.
Publicado: (2024)
MegatronApp: Efficient and Comprehensive Management on Distributed LLM Training
por: Zhao, Bohan, et al.
Publicado: (2025)
por: Zhao, Bohan, et al.
Publicado: (2025)
Collaborative Inference Acceleration with Non-Penetrative Tensor Partitioning
por: Liu, Zhibang, et al.
Publicado: (2025)
por: Liu, Zhibang, et al.
Publicado: (2025)
Jenga: Effective Memory Management for Serving LLM with Heterogeneity
por: Zhang, Chen, et al.
Publicado: (2025)
por: Zhang, Chen, et al.
Publicado: (2025)
exa-AMD: A Scalable Workflow for Accelerating AI-Assisted Materials Discovery and Design
por: Moraru, Maxim, et al.
Publicado: (2025)
por: Moraru, Maxim, et al.
Publicado: (2025)
GPU-Accelerated Batch-Dynamic Subgraph Matching
por: Qiu, Linshan, et al.
Publicado: (2024)
por: Qiu, Linshan, et al.
Publicado: (2024)
Achieving Dimension-Free Communication in Federated Learning via Zeroth-Order Optimization
por: Li, Zhe, et al.
Publicado: (2024)
por: Li, Zhe, et al.
Publicado: (2024)
UniPar: A Unified LLM-Based Framework for Parallel and Accelerated Code Translation in HPC
por: Bitan, Tomer, et al.
Publicado: (2025)
por: Bitan, Tomer, et al.
Publicado: (2025)
Ejemplares similares
-
Topology-Aware Virtualization over Inter-Core Connected Neural Processing Units
por: Feng, Dahu, et al.
Publicado: (2025) -
Characterizing Mobile SoC for Accelerating Heterogeneous LLM Inference
por: Chen, Le, et al.
Publicado: (2025) -
Jiagu: Optimizing Serverless Computing Resource Utilization with Harmonized Efficiency and Practicability
por: Liu, Qingyuan, et al.
Publicado: (2024) -
HetRL: Efficient Reinforcement Learning for LLMs in Heterogeneous Environments
por: He, Yongjun, et al.
Publicado: (2025) -
Schedule-Level Shared-Prefix Reuse for LLM RL Training
por: Li, Pengbo, et al.
Publicado: (2026)