DARTS: Distribution-Aware Active Rollout Trajectory Shaping for Accelerating LLM Reinforcement Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Yujie, Chen, Siwei, Luo, Longzan, Liu, Xinyi, Miao, Xupeng, Fu, Fangcheng, Cui, Bin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
PQCache: Product Quantization-based KVCache for Long Context LLM Inference
di: Zhang, Hailin, et al.
Pubblicazione: (2024)
di: Zhang, Hailin, et al.
Pubblicazione: (2024)
Galvatron: An Automatic Distributed System for Efficient Foundation Model Training
di: Liu, Xinyi, et al.
Pubblicazione: (2025)
di: Liu, Xinyi, et al.
Pubblicazione: (2025)
Accelerating Text-to-Image Editing via Cache-Enabled Sparse Diffusion Inference
di: Yu, Zihao, et al.
Pubblicazione: (2023)
di: Yu, Zihao, et al.
Pubblicazione: (2023)
SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling
di: Ji, Xiaodong, et al.
Pubblicazione: (2025)
di: Ji, Xiaodong, et al.
Pubblicazione: (2025)
Not All Rollouts are Useful: Down-Sampling Rollouts in LLM Reinforcement Learning
di: Xu, Yixuan Even, et al.
Pubblicazione: (2025)
di: Xu, Yixuan Even, et al.
Pubblicazione: (2025)
SPEC-RL: Accelerating On-Policy Reinforcement Learning with Speculative Rollouts
di: Liu, Bingshuai, et al.
Pubblicazione: (2025)
di: Liu, Bingshuai, et al.
Pubblicazione: (2025)
APRIL: Active Partial Rollouts in Reinforcement Learning to Tame Long-tail Generation
di: Zhou, Yuzhen, et al.
Pubblicazione: (2025)
di: Zhou, Yuzhen, et al.
Pubblicazione: (2025)
Spindle: Efficient Distributed Training of Multi-Task Large Models via Wavefront Scheduling
di: Wang, Yujie, et al.
Pubblicazione: (2024)
di: Wang, Yujie, et al.
Pubblicazione: (2024)
InfiniPipe: Elastic Pipeline Parallelism for Efficient Variable-Length Long-Context LLM Training
di: Wang, Shiju, et al.
Pubblicazione: (2025)
di: Wang, Shiju, et al.
Pubblicazione: (2025)
Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards
di: Lu, Xiaodong, et al.
Pubblicazione: (2026)
di: Lu, Xiaodong, et al.
Pubblicazione: (2026)
Improving Automatic Parallel Training via Balanced Memory Workload Optimization
di: Wang, Yujie, et al.
Pubblicazione: (2023)
di: Wang, Yujie, et al.
Pubblicazione: (2023)
Portfolio Reinforcement Learning with Scenario-Context Rollout
di: Bendatu, Vanya Priscillia, et al.
Pubblicazione: (2026)
di: Bendatu, Vanya Priscillia, et al.
Pubblicazione: (2026)
Sparse-RL: Breaking the Memory Wall in LLM Reinforcement Learning via Stable Sparse Rollouts
di: Luo, Sijia, et al.
Pubblicazione: (2026)
di: Luo, Sijia, et al.
Pubblicazione: (2026)
TSR: Trajectory-Search Rollouts for Multi-Turn RL of LLM Agents
di: Djuhera, Aladin, et al.
Pubblicazione: (2026)
di: Djuhera, Aladin, et al.
Pubblicazione: (2026)
Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts
di: Zheng, Haizhong, et al.
Pubblicazione: (2025)
di: Zheng, Haizhong, et al.
Pubblicazione: (2025)
EchoRL: Reinforcement Learning via Rollout Echoing
di: Bi, Jinhe, et al.
Pubblicazione: (2026)
di: Bi, Jinhe, et al.
Pubblicazione: (2026)
Demystifying Cost-Efficiency in LLM Serving over Heterogeneous GPUs
di: Jiang, Youhe, et al.
Pubblicazione: (2025)
di: Jiang, Youhe, et al.
Pubblicazione: (2025)
ASTRO: Adaptive Stitching via Dynamics-Guided Trajectory Rollouts
di: Yu, Hang, et al.
Pubblicazione: (2025)
di: Yu, Hang, et al.
Pubblicazione: (2025)
Guided Cooperation in Hierarchical Reinforcement Learning via Model-based Rollout
di: Wang, Haoran, et al.
Pubblicazione: (2023)
di: Wang, Haoran, et al.
Pubblicazione: (2023)
DiffusionRollout: Uncertainty-Aware Rollout Planning in Long-Horizon PDE Solving
di: Yoo, Seungwoo, et al.
Pubblicazione: (2026)
di: Yoo, Seungwoo, et al.
Pubblicazione: (2026)
FP4 Explore, BF16 Train: Diffusion Reinforcement Learning via Efficient Rollout Scaling
di: Li, Yitong, et al.
Pubblicazione: (2026)
di: Li, Yitong, et al.
Pubblicazione: (2026)
CAPF: Guiding Search-Agent Rollouts with Credit-Attenuated Privileged Feedback
di: Chen, Bin, et al.
Pubblicazione: (2026)
di: Chen, Bin, et al.
Pubblicazione: (2026)
ARROW: An Adaptive Rollout and Routing Method for Global Weather Forecasting
di: Tian, Jindong, et al.
Pubblicazione: (2025)
di: Tian, Jindong, et al.
Pubblicazione: (2025)
Hetu v2: A General and Scalable Deep Learning System with Hierarchical and Heterogeneous Single Program Multiple Data Annotations
di: Li, Haoyang, et al.
Pubblicazione: (2025)
di: Li, Haoyang, et al.
Pubblicazione: (2025)
Nested-ReFT: Efficient Reinforcement Learning for Large Language Model Fine-Tuning via Off-Policy Rollouts
di: Heuillet, Maxime, et al.
Pubblicazione: (2025)
di: Heuillet, Maxime, et al.
Pubblicazione: (2025)
VERIRL: Boosting the LLM-based Verilog Code Generation via Reinforcement Learning
di: Teng, Fu, et al.
Pubblicazione: (2025)
di: Teng, Fu, et al.
Pubblicazione: (2025)
Abundant Intelligence and Deficient Demand: A Macro-Financial Stress Test of Rapid AI Adoption
di: Chen, Xupeng
Pubblicazione: (2026)
di: Chen, Xupeng
Pubblicazione: (2026)
Adaptive Rollout Allocation for Online Reinforcement Learning with Verifiable Rewards
di: Nguyen, Hieu Trung, et al.
Pubblicazione: (2026)
di: Nguyen, Hieu Trung, et al.
Pubblicazione: (2026)
BubbleSpec: Turning Long-Tail Bubbles into Speculative Rollout Drafts for Synchronous Reinforcement Learning
di: Xu, Yuhang, et al.
Pubblicazione: (2026)
di: Xu, Yuhang, et al.
Pubblicazione: (2026)
Distribution-Aware Reward: Reinforcement Learning over Predictive Distributions for LLM Regression
di: Park, Jungsoo, et al.
Pubblicazione: (2026)
di: Park, Jungsoo, et al.
Pubblicazione: (2026)
LAER-MoE: Load-Adaptive Expert Re-layout for Efficient Mixture-of-Experts Training
di: Liu, Xinyi, et al.
Pubblicazione: (2026)
di: Liu, Xinyi, et al.
Pubblicazione: (2026)
Single-Trajectory Distributionally Robust Reinforcement Learning
di: Liang, Zhipeng, et al.
Pubblicazione: (2023)
di: Liang, Zhipeng, et al.
Pubblicazione: (2023)
OStr-DARTS: Differentiable Neural Architecture Search based on Operation Strength
di: Yang, Le, et al.
Pubblicazione: (2024)
di: Yang, Le, et al.
Pubblicazione: (2024)
Knowledgeable Agents by Offline Reinforcement Learning from Large Language Model Rollouts
di: Pang, Jing-Cheng, et al.
Pubblicazione: (2024)
di: Pang, Jing-Cheng, et al.
Pubblicazione: (2024)
FlexSP: Accelerating Large Language Model Training via Flexible Sequence Parallelism
di: Wang, Yujie, et al.
Pubblicazione: (2024)
di: Wang, Yujie, et al.
Pubblicazione: (2024)
Superior Computer Chess with Model Predictive Control, Reinforcement Learning, and Rollout
di: Gundawar, Atharva, et al.
Pubblicazione: (2024)
di: Gundawar, Atharva, et al.
Pubblicazione: (2024)
SARAD: LLM-Based Safety-Aware Hybrid Reinforcement Learning with Collision Prediction for Autonomous Driving
di: Wu, Kangyu, et al.
Pubblicazione: (2026)
di: Wu, Kangyu, et al.
Pubblicazione: (2026)
ByteScale: Efficient Scaling of LLM Training with a 2048K Context Length on More Than 12,000 GPUs
di: Ge, Hao, et al.
Pubblicazione: (2025)
di: Ge, Hao, et al.
Pubblicazione: (2025)
On Information Self-Locking in Reinforcement Learning for Active Reasoning of LLM agents
di: Zou, Deyu, et al.
Pubblicazione: (2026)
di: Zou, Deyu, et al.
Pubblicazione: (2026)
Thinking Short and Right Over Thinking Long: Serving LLM Reasoning Efficiently and Accurately
di: Wang, Yuhang, et al.
Pubblicazione: (2025)
di: Wang, Yuhang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
PQCache: Product Quantization-based KVCache for Long Context LLM Inference
di: Zhang, Hailin, et al.
Pubblicazione: (2024) -
Galvatron: An Automatic Distributed System for Efficient Foundation Model Training
di: Liu, Xinyi, et al.
Pubblicazione: (2025) -
Accelerating Text-to-Image Editing via Cache-Enabled Sparse Diffusion Inference
di: Yu, Zihao, et al.
Pubblicazione: (2023) -
SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling
di: Ji, Xiaodong, et al.
Pubblicazione: (2025) -
Not All Rollouts are Useful: Down-Sampling Rollouts in LLM Reinforcement Learning
di: Xu, Yixuan Even, et al.
Pubblicazione: (2025)