DRAFT-RL: Multi-Agent Chain-of-Draft Reasoning for Reinforcement Learning-Enhanced LLMs
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Yuanhao, Liu, Mingshan, Wang, Hongbo, Zhang, Yiding, Ma, Yifei, Tan, Wei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MASH: Cooperative-Heterogeneous Multi-Agent Reinforcement Learning for Single Humanoid Robot Locomotion
por: Liu, Qi, et al.
Publicado: (2025)
por: Liu, Qi, et al.
Publicado: (2025)
Draft-Thinking: Learning Efficient Reasoning in Long Chain-of-Thought LLMs
por: Cao, Jie, et al.
Publicado: (2026)
por: Cao, Jie, et al.
Publicado: (2026)
MarsRL: Advancing Multi-Agent Reasoning System via Reinforcement Learning with Agentic Pipeline Parallelism
por: Liu, Shulin, et al.
Publicado: (2025)
por: Liu, Shulin, et al.
Publicado: (2025)
Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning
por: Yin, Ming, et al.
Publicado: (2025)
por: Yin, Ming, et al.
Publicado: (2025)
G1: Teaching LLMs to Reason on Graphs with Reinforcement Learning
por: Guo, Xiaojun, et al.
Publicado: (2025)
por: Guo, Xiaojun, et al.
Publicado: (2025)
Multi-Agent Collaborative Reward Design for Enhancing Reasoning in Reinforcement Learning
por: Yang, Pei, et al.
Publicado: (2025)
por: Yang, Pei, et al.
Publicado: (2025)
SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning
por: Liu, Yihao, et al.
Publicado: (2025)
por: Liu, Yihao, et al.
Publicado: (2025)
Strat-Reasoner: Reinforcing Strategic Reasoning of LLMs in Multi-Agent Games
por: He, Yidong, et al.
Publicado: (2026)
por: He, Yidong, et al.
Publicado: (2026)
RADAR: Accelerating Large Language Model Inference With RL-Based Dynamic Draft Trees
por: Ma, Junjie, et al.
Publicado: (2025)
por: Ma, Junjie, et al.
Publicado: (2025)
DRAFT-ing Architectural Design Decisions using LLMs
por: Dhar, Rudra, et al.
Publicado: (2025)
por: Dhar, Rudra, et al.
Publicado: (2025)
AgentRL: Scaling Agentic Reinforcement Learning with a Multi-Turn, Multi-Task Framework
por: Zhang, Hanchen, et al.
Publicado: (2025)
por: Zhang, Hanchen, et al.
Publicado: (2025)
Reinforcement Learning-Guided Chain-of-Draft for Token-Efficient Code Generation
por: Tang, Xunzhu, et al.
Publicado: (2025)
por: Tang, Xunzhu, et al.
Publicado: (2025)
PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning
por: Zhang, Yizhen, et al.
Publicado: (2025)
por: Zhang, Yizhen, et al.
Publicado: (2025)
Direct Value Optimization: Improving Chain-of-Thought Reasoning in LLMs with Refined Values
por: Zhang, Hongbo, et al.
Publicado: (2025)
por: Zhang, Hongbo, et al.
Publicado: (2025)
MulFeRL: Enhancing Reinforcement Learning with Verbal Feedback in a Multi-turn Loop
por: Li, Xuancheng, et al.
Publicado: (2026)
por: Li, Xuancheng, et al.
Publicado: (2026)
MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use
por: Zhao, Weikang, et al.
Publicado: (2025)
por: Zhao, Weikang, et al.
Publicado: (2025)
Beyond Accuracy: Dissecting Mathematical Reasoning for LLMs Under Reinforcement Learning
por: Wang, Jiayu, et al.
Publicado: (2025)
por: Wang, Jiayu, et al.
Publicado: (2025)
Chain-of-Agents: End-to-End Agent Foundation Models via Multi-Agent Distillation and Agentic RL
por: Li, Weizhen, et al.
Publicado: (2025)
por: Li, Weizhen, et al.
Publicado: (2025)
DREAM-R: Multimodal Speculative Reasoning with RL-Based Refined Drafting, Precise Verification, and Fully Parallel Execution
por: Hu, Yunhai, et al.
Publicado: (2026)
por: Hu, Yunhai, et al.
Publicado: (2026)
Self-Compression of Chain-of-Thought via Multi-Agent Reinforcement Learning
por: Chen, Yiqun, et al.
Publicado: (2026)
por: Chen, Yiqun, et al.
Publicado: (2026)
Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL
por: He, Haoyang, et al.
Publicado: (2025)
por: He, Haoyang, et al.
Publicado: (2025)
RL of Thoughts: Navigating LLM Reasoning with Inference-time Reinforcement Learning
por: Hao, Qianyue, et al.
Publicado: (2025)
por: Hao, Qianyue, et al.
Publicado: (2025)
MobileRL: Online Agentic Reinforcement Learning for Mobile GUI Agents
por: Xu, Yifan, et al.
Publicado: (2025)
por: Xu, Yifan, et al.
Publicado: (2025)
Evolutionary Enhanced Multi-Agent Reinforcement Learning for Cooperative Air Combat
por: Li, Chengwei, et al.
Publicado: (2026)
por: Li, Chengwei, et al.
Publicado: (2026)
BoostAPR: Boosting Automated Program Repair via Execution-Grounded Reinforcement Learning with Dual Reward Models
por: Li, Yuanhao, et al.
Publicado: (2026)
por: Li, Yuanhao, et al.
Publicado: (2026)
Knowledge is Not Enough: Injecting RL Skills for Continual Adaptation
por: Tang, Pingzhi, et al.
Publicado: (2026)
por: Tang, Pingzhi, et al.
Publicado: (2026)
RefineRL: Advancing Competitive Programming with Self-Refinement Reinforcement Learning
por: Fu, Shaopeng, et al.
Publicado: (2026)
por: Fu, Shaopeng, et al.
Publicado: (2026)
OPTAGENT: Optimizing Multi-Agent LLM Interactions Through Verbal Reinforcement Learning for Enhanced Reasoning
por: Bi, Zhenyu, et al.
Publicado: (2025)
por: Bi, Zhenyu, et al.
Publicado: (2025)
Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search
por: Shen, Maohao, et al.
Publicado: (2025)
por: Shen, Maohao, et al.
Publicado: (2025)
Collaborative Multi-Agent Test-Time Reinforcement Learning for Reasoning
por: Hu, Zhiyuan, et al.
Publicado: (2026)
por: Hu, Zhiyuan, et al.
Publicado: (2026)
The Challenge of Teaching Reasoning to LLMs Without RL or Distillation
por: Du, Wei, et al.
Publicado: (2025)
por: Du, Wei, et al.
Publicado: (2025)
MAPoRL: Multi-Agent Post-Co-Training for Collaborative Large Language Models with Reinforcement Learning
por: Park, Chanwoo, et al.
Publicado: (2025)
por: Park, Chanwoo, et al.
Publicado: (2025)
Can RL Teach Long-Horizon Reasoning to LLMs? Expressiveness Is Key
por: Wang, Tianle, et al.
Publicado: (2026)
por: Wang, Tianle, et al.
Publicado: (2026)
MARSHAL: Incentivizing Multi-Agent Reasoning via Self-Play with Strategic LLMs
por: Yuan, Huining, et al.
Publicado: (2025)
por: Yuan, Huining, et al.
Publicado: (2025)
Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning
por: Ning, Yansong, et al.
Publicado: (2025)
por: Ning, Yansong, et al.
Publicado: (2025)
LaDi-RL: Latent Diffusion Reasoning Prevents Entropy Collapse in Reinforcement Learning
por: Kang, Haoqiang, et al.
Publicado: (2026)
por: Kang, Haoqiang, et al.
Publicado: (2026)
TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence
por: Hou, Guiyang, et al.
Publicado: (2025)
por: Hou, Guiyang, et al.
Publicado: (2025)
ETR: Entropy Trend Reward for Efficient Chain-of-Thought Reasoning
por: Xiong, Xuan, et al.
Publicado: (2026)
por: Xiong, Xuan, et al.
Publicado: (2026)
ProRL Agent: Rollout-as-a-Service for RL Training of Multi-Turn LLM Agents
por: Zhang, Hao, et al.
Publicado: (2026)
por: Zhang, Hao, et al.
Publicado: (2026)
SkyRL-Agent: Efficient RL Training for Multi-turn LLM Agent
por: Cao, Shiyi, et al.
Publicado: (2025)
por: Cao, Shiyi, et al.
Publicado: (2025)
Ejemplares similares
-
MASH: Cooperative-Heterogeneous Multi-Agent Reinforcement Learning for Single Humanoid Robot Locomotion
por: Liu, Qi, et al.
Publicado: (2025) -
Draft-Thinking: Learning Efficient Reasoning in Long Chain-of-Thought LLMs
por: Cao, Jie, et al.
Publicado: (2026) -
MarsRL: Advancing Multi-Agent Reasoning System via Reinforcement Learning with Agentic Pipeline Parallelism
por: Liu, Shulin, et al.
Publicado: (2025) -
Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning
por: Yin, Ming, et al.
Publicado: (2025) -
G1: Teaching LLMs to Reason on Graphs with Reinforcement Learning
por: Guo, Xiaojun, et al.
Publicado: (2025)