Scaling up Multi-Turn Off-Policy RL and Multi-Agent Tree Search for LLM Step-Provers
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xin, Ran, Zheng, Zeyu, Nie, Yanchen, Yuan, Kun, Xiao, Xia |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
BFS-Prover: Scalable Best-First Tree Search for LLM-based Automatic Theorem Proving
par: Xin, Ran, et autres
Publié: (2025)
par: Xin, Ran, et autres
Publié: (2025)
TSR: Trajectory-Search Rollouts for Multi-Turn RL of LLM Agents
par: Djuhera, Aladin, et autres
Publié: (2026)
par: Djuhera, Aladin, et autres
Publié: (2026)
OptProver: Bridging Olympiad and Optimization through Continual Training in Formal Theorem Proving
par: Li, Chenyi, et autres
Publié: (2026)
par: Li, Chenyi, et autres
Publié: (2026)
ProRL Agent: Rollout-as-a-Service for RL Training of Multi-Turn LLM Agents
par: Zhang, Hao, et autres
Publié: (2026)
par: Zhang, Hao, et autres
Publié: (2026)
AgentRL: Scaling Agentic Reinforcement Learning with a Multi-Turn, Multi-Task Framework
par: Zhang, Hanchen, et autres
Publié: (2025)
par: Zhang, Hanchen, et autres
Publié: (2025)
When Does Multi-Agent RL Improve LLM Workflows? Workflow, Scale, and Policy-Sharing Tradeoffs
par: Zeng, Yifan, et autres
Publié: (2026)
par: Zeng, Yifan, et autres
Publié: (2026)
SkyRL-Agent: Efficient RL Training for Multi-turn LLM Agent
par: Cao, Shiyi, et autres
Publié: (2025)
par: Cao, Shiyi, et autres
Publié: (2025)
Information Gain-based Policy Optimization: A Simple and Effective Approach for Multi-Turn Search Agents
par: Wang, Guoqing, et autres
Publié: (2025)
par: Wang, Guoqing, et autres
Publié: (2025)
Evaluating Multi-Turn Bargain Skills in LLM-Based Seller Agent
par: Wang, Issue Yishu, et autres
Publié: (2025)
par: Wang, Issue Yishu, et autres
Publié: (2025)
InternLM2.5-StepProver: Advancing Automated Theorem Proving via Critic-Guided Search
par: Wu, Zijian, et autres
Publié: (2024)
par: Wu, Zijian, et autres
Publié: (2024)
StepFun-Prover Preview: Let's Think and Verify Step by Step
par: Shang, Shijie, et autres
Publié: (2025)
par: Shang, Shijie, et autres
Publié: (2025)
Leanabell-Prover: Posttraining Scaling in Formal Reasoning
par: Zhang, Jingyuan, et autres
Publié: (2025)
par: Zhang, Jingyuan, et autres
Publié: (2025)
SLEA-RL: Step-Level Experience Augmented Reinforcement Learning for Multi-Turn Agentic Training
par: Wang, Prince Zizhuang, et autres
Publié: (2026)
par: Wang, Prince Zizhuang, et autres
Publié: (2026)
PAG: Multi-Turn Reinforced LLM Self-Correction with Policy as Generative Verifier
par: Jiang, Yuhua, et autres
Publié: (2025)
par: Jiang, Yuhua, et autres
Publié: (2025)
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
par: Xi, Zhiheng, et autres
Publié: (2025)
par: Xi, Zhiheng, et autres
Publié: (2025)
MPS-Prover: Advancing Stepwise Theorem Proving by Multi-Perspective Search and Data Curation
par: Liang, Zhenwen, et autres
Publié: (2025)
par: Liang, Zhenwen, et autres
Publié: (2025)
EvoEmo: Towards Evolved Emotional Policies for Adversarial LLM Agents in Multi-Turn Price Negotiation
par: Long, Yunbo, et autres
Publié: (2025)
par: Long, Yunbo, et autres
Publié: (2025)
Adaptive Layerwise Perturbation: Unifying Off-Policy Corrections for LLM RL
par: Ye, Chenlu, et autres
Publié: (2026)
par: Ye, Chenlu, et autres
Publié: (2026)
ATPO: Adaptive Tree Policy Optimization for Multi-Turn Medical Dialogue
par: Cao, Ruike, et autres
Publié: (2026)
par: Cao, Ruike, et autres
Publié: (2026)
General Modular Harness for LLM Agents in Multi-Turn Gaming Environments
par: Zhang, Yuxuan, et autres
Publié: (2025)
par: Zhang, Yuxuan, et autres
Publié: (2025)
Towards Trustworthy Multi-Turn LLM Agents via Behavioral Guidance
par: Gürsun, Gonca
Publié: (2025)
par: Gürsun, Gonca
Publié: (2025)
Soft Policy Optimization: Online Off-Policy RL for Sequence Models
par: Cohen, Taco, et autres
Publié: (2025)
par: Cohen, Taco, et autres
Publié: (2025)
Beyond the Strongest LLM: Multi-Turn Multi-Agent Orchestration vs. Single LLMs on Benchmarks
par: Tian, Aaron Xuxiang, et autres
Publié: (2025)
par: Tian, Aaron Xuxiang, et autres
Publié: (2025)
Consolidation via Policy Information Regularization in Deep RL for Multi-Agent Games
par: Malloy, Tailia, et autres
Publié: (2020)
par: Malloy, Tailia, et autres
Publié: (2020)
CM2: Reinforcement Learning with Checklist Rewards for Multi-Turn and Multi-Step Agentic Tool Use
par: Zhang, Zhen, et autres
Publié: (2026)
par: Zhang, Zhen, et autres
Publié: (2026)
Stabilizing Off-Policy Training for Long-Horizon LLM Agent via Turn-Level Importance Sampling and Clipping-Triggered Normalization
par: Li, Chenliang, et autres
Publié: (2025)
par: Li, Chenliang, et autres
Publié: (2025)
MEMO: Memory-Augmented Model Context Optimization for Robust Multi-Turn Multi-Agent LLM Games
par: Xie, Yunfei, et autres
Publié: (2026)
par: Xie, Yunfei, et autres
Publié: (2026)
Mitigating Conversational Inertia in Multi-Turn Agents
par: Wan, Yang, et autres
Publié: (2026)
par: Wan, Yang, et autres
Publié: (2026)
ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL
par: Zhou, Yifei, et autres
Publié: (2024)
par: Zhou, Yifei, et autres
Publié: (2024)
ZipRL: Adaptive Multi-Turn Context Compression with Hindsight Response Replay
par: Hu, Zhexin, et autres
Publié: (2026)
par: Hu, Zhexin, et autres
Publié: (2026)
Evaluating Memory in LLM Agents via Incremental Multi-Turn Interactions
par: Hu, Yuanzhe, et autres
Publié: (2025)
par: Hu, Yuanzhe, et autres
Publié: (2025)
Evaluating LLM-based Agents for Multi-Turn Conversations: A Survey
par: Guan, Shengyue, et autres
Publié: (2025)
par: Guan, Shengyue, et autres
Publié: (2025)
OOM-RL: Out-of-Money Reinforcement Learning Market-Driven Alignment for LLM-Based Multi-Agent Systems
par: Liu, Kun, et autres
Publié: (2026)
par: Liu, Kun, et autres
Publié: (2026)
Offline Policy Evaluation of Multi-Turn LLM Health Coaching with Real Users
par: Ozolcer, Melik, et autres
Publié: (2025)
par: Ozolcer, Melik, et autres
Publié: (2025)
Beyond Ten Turns: Unlocking Long-Horizon Agentic Search with Large-Scale Asynchronous RL
par: Gao, Jiaxuan, et autres
Publié: (2025)
par: Gao, Jiaxuan, et autres
Publié: (2025)
Proximity-Based Multi-Turn Optimization: Practical Credit Assignment for LLM Agent Training
par: Fang, Yangyi, et autres
Publié: (2026)
par: Fang, Yangyi, et autres
Publié: (2026)
Off-Policy Correction For Multi-Agent Reinforcement Learning
par: Zawalski, Michał, et autres
Publié: (2021)
par: Zawalski, Michał, et autres
Publié: (2021)
LLM Collaboration With Multi-Agent Reinforcement Learning
par: Liu, Shuo, et autres
Publié: (2025)
par: Liu, Shuo, et autres
Publié: (2025)
Incentive-Aligned Multi-Source LLM Summaries
par: Jiang, Yanchen, et autres
Publié: (2025)
par: Jiang, Yanchen, et autres
Publié: (2025)
Data-to-Dashboard: Multi-Agent LLM Framework for Insightful Visualization in Enterprise Analytics
par: Zhang, Ran, et autres
Publié: (2025)
par: Zhang, Ran, et autres
Publié: (2025)
Documents similaires
-
BFS-Prover: Scalable Best-First Tree Search for LLM-based Automatic Theorem Proving
par: Xin, Ran, et autres
Publié: (2025) -
TSR: Trajectory-Search Rollouts for Multi-Turn RL of LLM Agents
par: Djuhera, Aladin, et autres
Publié: (2026) -
OptProver: Bridging Olympiad and Optimization through Continual Training in Formal Theorem Proving
par: Li, Chenyi, et autres
Publié: (2026) -
ProRL Agent: Rollout-as-a-Service for RL Training of Multi-Turn LLM Agents
par: Zhang, Hao, et autres
Publié: (2026) -
AgentRL: Scaling Agentic Reinforcement Learning with a Multi-Turn, Multi-Task Framework
par: Zhang, Hanchen, et autres
Publié: (2025)