Agent RL Scaling Law: Agent RL with Spontaneous Code Execution for Mathematical Problem Solving
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Mai, Xinji, Xu, Haotian, Li, Zhong-Zhi, W, Xing, Wang, Weinong, Hu, Jian, Zhang, Yingying, Zhang, Wenqiang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
ProRL Agent: Rollout-as-a-Service for RL Training of Multi-Turn LLM Agents
von: Zhang, Hao, et al.
Veröffentlicht: (2026)
von: Zhang, Hao, et al.
Veröffentlicht: (2026)
ArenaRL: Scaling RL for Open-Ended Agents via Tournament-based Relative Ranking
von: Zhang, Qiang, et al.
Veröffentlicht: (2026)
von: Zhang, Qiang, et al.
Veröffentlicht: (2026)
AgentV-RL: Scaling Reward Modeling with Agentic Verifier
von: Zhang, Jiazheng, et al.
Veröffentlicht: (2026)
von: Zhang, Jiazheng, et al.
Veröffentlicht: (2026)
SkyRL-Agent: Efficient RL Training for Multi-turn LLM Agent
von: Cao, Shiyi, et al.
Veröffentlicht: (2025)
von: Cao, Shiyi, et al.
Veröffentlicht: (2025)
Agent^2 RL-Bench: Can LLM Agents Engineer Agentic RL Post-Training?
von: Chen, Wanyi, et al.
Veröffentlicht: (2026)
von: Chen, Wanyi, et al.
Veröffentlicht: (2026)
CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment
von: Jiang, Xue, et al.
Veröffentlicht: (2025)
von: Jiang, Xue, et al.
Veröffentlicht: (2025)
ComputerRL: Scaling End-to-End Online Reinforcement Learning for Computer Use Agents
von: Lai, Hanyu, et al.
Veröffentlicht: (2025)
von: Lai, Hanyu, et al.
Veröffentlicht: (2025)
Long-horizon Reasoning Agent for Olympiad-Level Mathematical Problem Solving
von: Gao, Songyang, et al.
Veröffentlicht: (2025)
von: Gao, Songyang, et al.
Veröffentlicht: (2025)
Exploring Communication Strategies for Collaborative LLM Agents in Mathematical Problem-Solving
von: Zhang, Liang, et al.
Veröffentlicht: (2025)
von: Zhang, Liang, et al.
Veröffentlicht: (2025)
Can RL Improve Generalization of LLM Agents? An Empirical Study
von: Xi, Zhiheng, et al.
Veröffentlicht: (2026)
von: Xi, Zhiheng, et al.
Veröffentlicht: (2026)
Beyond Execution: Static-Analysis Rewards and Hint-Conditioned Diffusion RL for Code Generation
von: Ouyang, Shuyin, et al.
Veröffentlicht: (2026)
von: Ouyang, Shuyin, et al.
Veröffentlicht: (2026)
AgentRL: Scaling Agentic Reinforcement Learning with a Multi-Turn, Multi-Task Framework
von: Zhang, Hanchen, et al.
Veröffentlicht: (2025)
von: Zhang, Hanchen, et al.
Veröffentlicht: (2025)
Is PRM Necessary? Problem-Solving RL Implicitly Induces PRM Capability in LLMs
von: Feng, Zhangying, et al.
Veröffentlicht: (2025)
von: Feng, Zhangying, et al.
Veröffentlicht: (2025)
MobileRL: Online Agentic Reinforcement Learning for Mobile GUI Agents
von: Xu, Yifan, et al.
Veröffentlicht: (2025)
von: Xu, Yifan, et al.
Veröffentlicht: (2025)
Teaching RL Agents to Act Better: VLM as Action Advisor for Online Reinforcement Learning
von: Wu, Xiefeng, et al.
Veröffentlicht: (2025)
von: Wu, Xiefeng, et al.
Veröffentlicht: (2025)
Proto Successor Measure: Representing the Behavior Space of an RL Agent
von: Agarwal, Siddhant, et al.
Veröffentlicht: (2024)
von: Agarwal, Siddhant, et al.
Veröffentlicht: (2024)
Towards Shutdownable Agents: Generalizing Stochastic Choice in RL Agents and LLMs
von: Cullen, Carissa, et al.
Veröffentlicht: (2026)
von: Cullen, Carissa, et al.
Veröffentlicht: (2026)
Chain-of-Agents: End-to-End Agent Foundation Models via Multi-Agent Distillation and Agentic RL
von: Li, Weizhen, et al.
Veröffentlicht: (2025)
von: Li, Weizhen, et al.
Veröffentlicht: (2025)
CUDA Agent: Large-Scale Agentic RL for High-Performance CUDA Kernel Generation
von: Dai, Weinan, et al.
Veröffentlicht: (2026)
von: Dai, Weinan, et al.
Veröffentlicht: (2026)
THOR: Tool-Integrated Hierarchical Optimization via RL for Mathematical Reasoning
von: Chang, Qikai, et al.
Veröffentlicht: (2025)
von: Chang, Qikai, et al.
Veröffentlicht: (2025)
Meta-RL Induces Exploration in Language Agents
von: Jiang, Yulun, et al.
Veröffentlicht: (2025)
von: Jiang, Yulun, et al.
Veröffentlicht: (2025)
Evolving and Executing Research Plans via Double-Loop Multi-Agent Collaboration
von: Zhang, Zhi, et al.
Veröffentlicht: (2025)
von: Zhang, Zhi, et al.
Veröffentlicht: (2025)
A Deep Dive into Scaling RL for Code Generation with Synthetic Data and Curricula
von: Sancaktar, Cansu, et al.
Veröffentlicht: (2026)
von: Sancaktar, Cansu, et al.
Veröffentlicht: (2026)
LiteResearcher: A Scalable Agentic RL Training Framework for Deep Research Agent
von: Li, Wanli, et al.
Veröffentlicht: (2026)
von: Li, Wanli, et al.
Veröffentlicht: (2026)
ProgAgent:A Continual RL Agent with Progress-Aware Rewards
von: Tan, Jinzhou, et al.
Veröffentlicht: (2026)
von: Tan, Jinzhou, et al.
Veröffentlicht: (2026)
Decomposing Elements of Problem Solving: What "Math" Does RL Teach?
von: Qin, Tian, et al.
Veröffentlicht: (2025)
von: Qin, Tian, et al.
Veröffentlicht: (2025)
When Does Multi-Agent RL Improve LLM Workflows? Workflow, Scale, and Policy-Sharing Tradeoffs
von: Zeng, Yifan, et al.
Veröffentlicht: (2026)
von: Zeng, Yifan, et al.
Veröffentlicht: (2026)
Evolving-RL: End-to-End Optimization of Experience-Driven Self-Evolving Capability within Agents
von: Fan, Zhiyuan, et al.
Veröffentlicht: (2026)
von: Fan, Zhiyuan, et al.
Veröffentlicht: (2026)
HyperAgent: Generalist Software Engineering Agents to Solve Coding Tasks at Scale
von: Phan, Huy Nhat, et al.
Veröffentlicht: (2024)
von: Phan, Huy Nhat, et al.
Veröffentlicht: (2024)
MACM: Utilizing a Multi-Agent System for Condition Mining in Solving Complex Mathematical Problems
von: Lei, Bin, et al.
Veröffentlicht: (2024)
von: Lei, Bin, et al.
Veröffentlicht: (2024)
LifelongAgentBench: Evaluating LLM Agents as Lifelong Learners
von: Zheng, Junhao, et al.
Veröffentlicht: (2025)
von: Zheng, Junhao, et al.
Veröffentlicht: (2025)
ToRA: A Tool-Integrated Reasoning Agent for Mathematical Problem Solving
von: Gou, Zhibin, et al.
Veröffentlicht: (2023)
von: Gou, Zhibin, et al.
Veröffentlicht: (2023)
ProSpec RL: Plan Ahead, then Execute
von: Liu, Liangliang, et al.
Veröffentlicht: (2024)
von: Liu, Liangliang, et al.
Veröffentlicht: (2024)
MMedAgent-RL: Optimizing Multi-Agent Collaboration for Multimodal Medical Reasoning
von: Xia, Peng, et al.
Veröffentlicht: (2025)
von: Xia, Peng, et al.
Veröffentlicht: (2025)
RedStar: Does Scaling Long-CoT Data Unlock Better Slow-Reasoning Systems?
von: Xu, Haotian, et al.
Veröffentlicht: (2025)
von: Xu, Haotian, et al.
Veröffentlicht: (2025)
Model-Based RL for Mean-Field Games is not Statistically Harder than Single-Agent RL
von: Huang, Jiawei, et al.
Veröffentlicht: (2024)
von: Huang, Jiawei, et al.
Veröffentlicht: (2024)
Harmonizing Dense and Sparse Signals in Multi-turn RL: Dual-Horizon Credit Assignment for Industrial Sales Agents
von: Yang, Haojin, et al.
Veröffentlicht: (2026)
von: Yang, Haojin, et al.
Veröffentlicht: (2026)
DRAFT-RL: Multi-Agent Chain-of-Draft Reasoning for Reinforcement Learning-Enhanced LLMs
von: Li, Yuanhao, et al.
Veröffentlicht: (2025)
von: Li, Yuanhao, et al.
Veröffentlicht: (2025)
HyperMARL: Adaptive Hypernetworks for Multi-Agent RL
von: Tessera, Kale-ab Abebe, et al.
Veröffentlicht: (2024)
von: Tessera, Kale-ab Abebe, et al.
Veröffentlicht: (2024)
GenAI-based Multi-Agent Reinforcement Learning towards Distributed Agent Intelligence: A Generative-RL Agent Perspective
von: Wang, Hang, et al.
Veröffentlicht: (2025)
von: Wang, Hang, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
ProRL Agent: Rollout-as-a-Service for RL Training of Multi-Turn LLM Agents
von: Zhang, Hao, et al.
Veröffentlicht: (2026) -
ArenaRL: Scaling RL for Open-Ended Agents via Tournament-based Relative Ranking
von: Zhang, Qiang, et al.
Veröffentlicht: (2026) -
AgentV-RL: Scaling Reward Modeling with Agentic Verifier
von: Zhang, Jiazheng, et al.
Veröffentlicht: (2026) -
SkyRL-Agent: Efficient RL Training for Multi-turn LLM Agent
von: Cao, Shiyi, et al.
Veröffentlicht: (2025) -
Agent^2 RL-Bench: Can LLM Agents Engineer Agentic RL Post-Training?
von: Chen, Wanyi, et al.
Veröffentlicht: (2026)