Reinforcing Multi-Turn Reasoning in LLM Agents via Turn-Level Reward Design
Fuente:
arXiv
Saved in:
| Main Authors: | Wei, Quan, Zeng, Siliang, Li, Chenliang, Brown, William, Frunza, Oana, Deng, Wei, Schneider, Anderson, Nevmyvaka, Yuriy, Zhao, Yang Katie, Garcia, Alfredo, Hong, Mingyi |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Chart-RVR: Reinforcement Learning with Verifiable Rewards for Explainable Chart Reasoning
by: Sinha, Sanchit, et al.
Published: (2025)
by: Sinha, Sanchit, et al.
Published: (2025)
Stabilizing Off-Policy Training for Long-Horizon LLM Agent via Turn-Level Importance Sampling and Clipping-Triggered Normalization
by: Li, Chenliang, et al.
Published: (2025)
by: Li, Chenliang, et al.
Published: (2025)
When Demonstrations Meet Generative World Models: A Maximum Likelihood Framework for Offline Inverse Reinforcement Learning
by: Zeng, Siliang, et al.
Published: (2023)
by: Zeng, Siliang, et al.
Published: (2023)
Getting More Juice Out of the SFT Data: Reward Learning from Human Demonstration Improves SFT for LLM Alignment
by: Li, Jiaxiang, et al.
Published: (2024)
by: Li, Jiaxiang, et al.
Published: (2024)
Understanding Inverse Reinforcement Learning under Overparameterization: Non-Asymptotic Analysis and Global Optimality
by: Zhang, Ruijia, et al.
Published: (2025)
by: Zhang, Ruijia, et al.
Published: (2025)
A Bayesian Approach to Robust Inverse Reinforcement Learning
by: Wei, Ran, et al.
Published: (2023)
by: Wei, Ran, et al.
Published: (2023)
Learning Reward and Policy Jointly from Demonstration and Preference Improves Alignment
by: Li, Chenliang, et al.
Published: (2024)
by: Li, Chenliang, et al.
Published: (2024)
Speculative Sampling for Parametric Temporal Point Processes
by: Biloš, Marin, et al.
Published: (2025)
by: Biloš, Marin, et al.
Published: (2025)
Structural Estimation of Markov Decision Processes in High-Dimensional State Space with Finite-Time Guarantees
by: Zeng, Siliang, et al.
Published: (2022)
by: Zeng, Siliang, et al.
Published: (2022)
Improving Reasoning for Diffusion Language Models via Group Diffusion Policy Optimization
by: Rojas, Kevin, et al.
Published: (2025)
by: Rojas, Kevin, et al.
Published: (2025)
Technical Report: Full-Stack Fine-Tuning for the Q Programming Language
by: Hogan, Brendan R., et al.
Published: (2025)
by: Hogan, Brendan R., et al.
Published: (2025)
A Mechanistic Study of Tabular Foundation Models
by: Biloš, Marin, et al.
Published: (2026)
by: Biloš, Marin, et al.
Published: (2026)
$\textbf{S}^2$IP-LLM: Semantic Space Informed Prompt Learning with LLM for Time Series Forecasting
by: Pan, Zijie, et al.
Published: (2024)
by: Pan, Zijie, et al.
Published: (2024)
Aligning Frozen LLMs by Reinforcement Learning: An Iterative Reweight-then-Optimize Approach
by: Zhang, Xinnan, et al.
Published: (2025)
by: Zhang, Xinnan, et al.
Published: (2025)
Towards Interpretable and Trustworthy Time Series Reasoning: A BlueSky Vision
by: Ning, Kanghui, et al.
Published: (2025)
by: Ning, Kanghui, et al.
Published: (2025)
RICE-PO: Turning Retrieval Interactions into Credit Signals for Reasoning Agents
by: Li, Mingchen, et al.
Published: (2026)
by: Li, Mingchen, et al.
Published: (2026)
From Demonstrations to Rewards: Alignment Without Explicit Human Preferences
by: Zeng, Siliang, et al.
Published: (2025)
by: Zeng, Siliang, et al.
Published: (2025)
Multi-Turn Reinforcement Learning for Tool-Calling Agents with Iterative Reward Calibration
by: Modecrua, Wachiravit, et al.
Published: (2026)
by: Modecrua, Wachiravit, et al.
Published: (2026)
Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning
by: Ning, Yansong, et al.
Published: (2025)
by: Ning, Yansong, et al.
Published: (2025)
Variational Schrödinger Momentum Diffusion
by: Rojas, Kevin, et al.
Published: (2025)
by: Rojas, Kevin, et al.
Published: (2025)
VAGEN: Reinforcing World Model Reasoning for Multi-Turn VLM Agents
by: Wang, Kangrui, et al.
Published: (2025)
by: Wang, Kangrui, et al.
Published: (2025)
User Simulator-Guided Multi-Turn Preference Optimization for Reasoning LLM-based Conversational Recommendation
by: Xiang, Xingyuan, et al.
Published: (2026)
by: Xiang, Xingyuan, et al.
Published: (2026)
ETHICAL ACCEPTABILITY OF USING GENERIC CONSENT FOR SECONDARY USE OF DATA AND BIOLOGICAL SAMPLES IN MEDICAL RESEARCH
by: Ana Frunza
Published: (2017)
by: Ana Frunza
Published: (2017)
Turning the Ratchet: Dynamic Screening with Multiple Agents
by: Ekmekci, Mehmet, et al.
Published: (2024)
by: Ekmekci, Mehmet, et al.
Published: (2024)
Adaptive Stopping for Multi-Turn LLM Reasoning
by: Zhou, Xiaofan, et al.
Published: (2026)
by: Zhou, Xiaofan, et al.
Published: (2026)
Privacy Amplification by Structured Subsampling for Deep Differentially Private Time Series Forecasting
by: Schuchardt, Jan, et al.
Published: (2025)
by: Schuchardt, Jan, et al.
Published: (2025)
SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks
by: Zhou, Yifei, et al.
Published: (2025)
by: Zhou, Yifei, et al.
Published: (2025)
Beyond Binary: Turning Partial Success into Dense Verifiable Rewards for Reinforcement Learning in Code Generation
by: Wang, Longwen, et al.
Published: (2026)
by: Wang, Longwen, et al.
Published: (2026)
TIPS: Turn-Level Information-Potential Reward Shaping for Search-Augmented LLMs
by: Xie, Yutao, et al.
Published: (2026)
by: Xie, Yutao, et al.
Published: (2026)
Hindsight-Anchored Policy Optimization: Turning Failure into Feedback in Sparse Reward Settings
by: Wu, Yuning, et al.
Published: (2026)
by: Wu, Yuning, et al.
Published: (2026)
Turn-PPO: Turn-Level Advantage Estimation with PPO for Improved Multi-Turn RL in Agentic LLMs
by: Li, Junbo, et al.
Published: (2025)
by: Li, Junbo, et al.
Published: (2025)
RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning
by: Wang, Zihan, et al.
Published: (2025)
by: Wang, Zihan, et al.
Published: (2025)
From Assumptions to Actions: Turning LLM Reasoning into Uncertainty-Aware Planning for Embodied Agents
by: Seo, SeungWon, et al.
Published: (2026)
by: Seo, SeungWon, et al.
Published: (2026)
AlphaLab: Autonomous Multi-Agent Research Across Optimization Domains with Frontier LLMs
by: Hogan, Brendan R., et al.
Published: (2026)
by: Hogan, Brendan R., et al.
Published: (2026)
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
by: Xi, Zhiheng, et al.
Published: (2025)
by: Xi, Zhiheng, et al.
Published: (2025)
TRACER: Turn-level Regret Matching with Inner Reinforcement Credit for Cooperative Multi-LLM Reasoning
by: Li, Chusen, et al.
Published: (2026)
by: Li, Chusen, et al.
Published: (2026)
Evaluating Performance Drift from Model Switching in Multi-Turn LLM Systems
by: Khraishi, Raad, et al.
Published: (2026)
by: Khraishi, Raad, et al.
Published: (2026)
PAIR: Prefix-Aware Internal Reward Model for Multi-Turn Agent Optimization
by: Kim, Wonjoong, et al.
Published: (2026)
by: Kim, Wonjoong, et al.
Published: (2026)
Done Is Better than Perfect: Unlocking Efficient Reasoning by Structured Multi-Turn Decomposition
by: Zeng, Zihao, et al.
Published: (2025)
by: Zeng, Zihao, et al.
Published: (2025)
Turn, Turn, Turn...but Still Finding the Answers.
by: Boardman, Edna M.
Published: (1994)
by: Boardman, Edna M.
Published: (1994)
Similar Items
-
Chart-RVR: Reinforcement Learning with Verifiable Rewards for Explainable Chart Reasoning
by: Sinha, Sanchit, et al.
Published: (2025) -
Stabilizing Off-Policy Training for Long-Horizon LLM Agent via Turn-Level Importance Sampling and Clipping-Triggered Normalization
by: Li, Chenliang, et al.
Published: (2025) -
When Demonstrations Meet Generative World Models: A Maximum Likelihood Framework for Offline Inverse Reinforcement Learning
by: Zeng, Siliang, et al.
Published: (2023) -
Getting More Juice Out of the SFT Data: Reward Learning from Human Demonstration Improves SFT for LLM Alignment
by: Li, Jiaxiang, et al.
Published: (2024) -
Understanding Inverse Reinforcement Learning under Overparameterization: Non-Asymptotic Analysis and Global Optimality
by: Zhang, Ruijia, et al.
Published: (2025)