SPEC-RL: Accelerating On-Policy Reinforcement Learning with Speculative Rollouts
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Bingshuai, Wang, Ante, Min, Zijun, Yao, Liang, Zhang, Haibo, Liu, Yang, Han, Xu, Li, Peng, Zeng, Anxiang, Su, Jinsong |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Orchestrating Tokens and Sequences: Dynamic Hybrid Policy Optimization for RLVR
par: Min, Zijun, et autres
Publié: (2026)
par: Min, Zijun, et autres
Publié: (2026)
Retrieval-augmented Multi-modal Chain-of-Thoughts Reasoning for Large Language Models
par: Liu, Bingshuai, et autres
Publié: (2023)
par: Liu, Bingshuai, et autres
Publié: (2023)
Exploring Optimal Transport-Based Multi-Grained Alignments for Text-Molecule Retrieval
par: Min, Zijun, et autres
Publié: (2024)
par: Min, Zijun, et autres
Publié: (2024)
Accelerating RL Post-Training Rollouts via System-Integrated Speculative Decoding
par: Iso, Hayate, et autres
Publié: (2026)
par: Iso, Hayate, et autres
Publié: (2026)
Jet-RL: Enabling On-Policy FP8 Reinforcement Learning with Unified Training and Rollout Precision Flow
par: Xi, Haocheng, et autres
Publié: (2026)
par: Xi, Haocheng, et autres
Publié: (2026)
Mitigating the Negative Impact of Over-association for Conversational Query Production
par: Wang, Ante, et autres
Publié: (2024)
par: Wang, Ante, et autres
Publié: (2024)
Sparse-RL: Breaking the Memory Wall in LLM Reinforcement Learning via Stable Sparse Rollouts
par: Luo, Sijia, et autres
Publié: (2026)
par: Luo, Sijia, et autres
Publié: (2026)
Decomposing and Steering Functional Metacognition in Large Language Models
par: Li, Yanshi, et autres
Publié: (2026)
par: Li, Yanshi, et autres
Publié: (2026)
A Dual-Perspective Metaphor Detection Framework Using Large Language Models
par: Lin, Yujie, et autres
Publié: (2024)
par: Lin, Yujie, et autres
Publié: (2024)
Stable and Efficient Single-Rollout RL for Multimodal Reasoning
par: Liu, Rui, et autres
Publié: (2025)
par: Liu, Rui, et autres
Publié: (2025)
Not All Rollouts are Useful: Down-Sampling Rollouts in LLM Reinforcement Learning
par: Xu, Yixuan Even, et autres
Publié: (2025)
par: Xu, Yixuan Even, et autres
Publié: (2025)
SRT: Accelerating Reinforcement Learning via Speculative Rollout with Tree-Structured Cache
par: Chang, Chi-Chih, et autres
Publié: (2026)
par: Chang, Chi-Chih, et autres
Publié: (2026)
Compass-Embedding v4: Robust Contrastive Learning for Multilingual E-commerce Embeddings
par: Ueareeworakul, Pakorn, et autres
Publié: (2025)
par: Ueareeworakul, Pakorn, et autres
Publié: (2025)
Beyond Passive Critical Thinking: Fostering Proactive Questioning to Enhance Human-AI Collaboration
par: Wang, Ante, et autres
Publié: (2025)
par: Wang, Ante, et autres
Publié: (2025)
Investigating Inference-time Scaling for Chain of Multi-modal Thought: A Preliminary Study
par: Lin, Yujie, et autres
Publié: (2025)
par: Lin, Yujie, et autres
Publié: (2025)
HaS: Accelerating RAG through Homology-Aware Speculative Retrieval
par: Peng, Peng, et autres
Publié: (2026)
par: Peng, Peng, et autres
Publié: (2026)
Towards Better RL Training Data Utilization via Second-Order Rollout
par: Yang, Zhe, et autres
Publié: (2026)
par: Yang, Zhe, et autres
Publié: (2026)
Learning to Draft: Adaptive Speculative Decoding with Reinforcement Learning
par: Zhang, Jiebin, et autres
Publié: (2026)
par: Zhang, Jiebin, et autres
Publié: (2026)
Mid-Training of Large Language Models: A Survey
par: Mo, Kaixiang, et autres
Publié: (2025)
par: Mo, Kaixiang, et autres
Publié: (2025)
EAGLE-Pangu: Accelerator-Safe Tree Speculative Decoding on Ascend NPUs
par: Han, Chang, et autres
Publié: (2026)
par: Han, Chang, et autres
Publié: (2026)
Are Full Rollouts Necessary for On-Policy Distillation?
par: Zhang, Yaocheng, et autres
Publié: (2026)
par: Zhang, Yaocheng, et autres
Publié: (2026)
Response Enhanced Semi-supervised Dialogue Query Generation
par: Huang, Jianheng, et autres
Publié: (2023)
par: Huang, Jianheng, et autres
Publié: (2023)
Enhancing Agentic RL with Progressive Reward Shaping and Value-based Sampling Policy Optimization
par: Su, Jianghao, et autres
Publié: (2025)
par: Su, Jianghao, et autres
Publié: (2025)
Not All Languages are Equal: Insights into Multilingual Retrieval-Augmented Generation
par: Wu, Suhang, et autres
Publié: (2024)
par: Wu, Suhang, et autres
Publié: (2024)
Optimal Transport-Based Token Weighting scheme for Enhanced Preference Optimization
par: Li, Meng, et autres
Publié: (2025)
par: Li, Meng, et autres
Publié: (2025)
Length-Unbiased Sequence Policy Optimization: Revealing and Controlling Response Length Variation in RLVR
par: Liu, Fanfan, et autres
Publié: (2026)
par: Liu, Fanfan, et autres
Publié: (2026)
Towards Transparent RAG: Fostering Evidence Traceability in LLM Generation via Reinforcement Learning
par: Ren, Jingyi, et autres
Publié: (2025)
par: Ren, Jingyi, et autres
Publié: (2025)
AdaSPEC: Selective Knowledge Distillation for Efficient Speculative Decoders
par: Hu, Yuezhou, et autres
Publié: (2025)
par: Hu, Yuezhou, et autres
Publié: (2025)
RoRecomp: Enhancing Reasoning Efficiency via Rollout Response Recomposition in Reinforcement Learning
par: Li, Gang, et autres
Publié: (2025)
par: Li, Gang, et autres
Publié: (2025)
EditGRPO: Reinforcement Learning with Post-Rollout Edits for Clinically Accurate Chest X-Ray Report Generation
par: Zhang, Kai, et autres
Publié: (2025)
par: Zhang, Kai, et autres
Publié: (2025)
Each Prompt Matters: Scaling Reinforcement Learning Without Wasting Rollouts on Hundred-Billion-Scale MoE
par: Zeng, Anxiang, et autres
Publié: (2025)
par: Zeng, Anxiang, et autres
Publié: (2025)
REA-RL: Reflection-Aware Online Reinforcement Learning for Efficient Reasoning
par: Deng, Hexuan, et autres
Publié: (2025)
par: Deng, Hexuan, et autres
Publié: (2025)
Beyond Negative Rollouts: Positive-Only Policy Optimization with Implicit Negative Gradients
par: Xu, Mingwei, et autres
Publié: (2026)
par: Xu, Mingwei, et autres
Publié: (2026)
Mitigating Catastrophic Forgetting in Large Language Models with Self-Synthesized Rehearsal
par: Huang, Jianheng, et autres
Publié: (2024)
par: Huang, Jianheng, et autres
Publié: (2024)
DocTER: Evaluating Document-based Knowledge Editing
par: Wu, Suhang, et autres
Publié: (2023)
par: Wu, Suhang, et autres
Publié: (2023)
EMS-SD: Efficient Multi-sample Speculative Decoding for Accelerating Large Language Models
par: Ni, Yunsheng, et autres
Publié: (2024)
par: Ni, Yunsheng, et autres
Publié: (2024)
SpecExit: Accelerating Large Reasoning Model via Speculative Exit
par: Yang, Rubing, et autres
Publié: (2025)
par: Yang, Rubing, et autres
Publié: (2025)
Writing-RL: Advancing Long-form Writing via Adaptive Curriculum Reinforcement Learning
par: Lei, Xuanyu, et autres
Publié: (2025)
par: Lei, Xuanyu, et autres
Publié: (2025)
LogitSpec: Accelerating Retrieval-based Speculative Decoding via Next Next Token Speculation
par: Liu, Tianyu, et autres
Publié: (2025)
par: Liu, Tianyu, et autres
Publié: (2025)
Accelerate Speculative Decoding with Sparse Computation in Verification
par: Wang, Jikai, et autres
Publié: (2025)
par: Wang, Jikai, et autres
Publié: (2025)
Documents similaires
-
Orchestrating Tokens and Sequences: Dynamic Hybrid Policy Optimization for RLVR
par: Min, Zijun, et autres
Publié: (2026) -
Retrieval-augmented Multi-modal Chain-of-Thoughts Reasoning for Large Language Models
par: Liu, Bingshuai, et autres
Publié: (2023) -
Exploring Optimal Transport-Based Multi-Grained Alignments for Text-Molecule Retrieval
par: Min, Zijun, et autres
Publié: (2024) -
Accelerating RL Post-Training Rollouts via System-Integrated Speculative Decoding
par: Iso, Hayate, et autres
Publié: (2026) -
Jet-RL: Enabling On-Policy FP8 Reinforcement Learning with Unified Training and Rollout Precision Flow
par: Xi, Haocheng, et autres
Publié: (2026)