Turn-PPO: Turn-Level Advantage Estimation with PPO for Improved Multi-Turn RL in Agentic LLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Junbo, Zhou, Peng, Meng, Rui, Vadera, Meet P., Li, Lihong, Li, Yang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Aligning LLMs Toward Multi-Turn Conversational Outcomes Using Iterative PPO
di: Jiang, Daniel R., et al.
Pubblicazione: (2025)
di: Jiang, Daniel R., et al.
Pubblicazione: (2025)
Segmental Advantage Estimation: Enhancing PPO for Long-Context LLM Training
di: Gong, Xue, et al.
Pubblicazione: (2026)
di: Gong, Xue, et al.
Pubblicazione: (2026)
Reinforcing Multi-Turn Reasoning in LLM Agents via Turn-Level Reward Design
di: Wei, Quan, et al.
Pubblicazione: (2025)
di: Wei, Quan, et al.
Pubblicazione: (2025)
SLEA-RL: Step-Level Experience Augmented Reinforcement Learning for Multi-Turn Agentic Training
di: Wang, Prince Zizhuang, et al.
Pubblicazione: (2026)
di: Wang, Prince Zizhuang, et al.
Pubblicazione: (2026)
SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks
di: Zhou, Yifei, et al.
Pubblicazione: (2025)
di: Zhou, Yifei, et al.
Pubblicazione: (2025)
VinePPO: Refining Credit Assignment in RL Training of LLMs
di: Kazemnejad, Amirhossein, et al.
Pubblicazione: (2024)
di: Kazemnejad, Amirhossein, et al.
Pubblicazione: (2024)
Turn-Based Structural Triggers: Prompt-Free Backdoors in Multi-Turn LLMs
di: Lu, Yiyang, et al.
Pubblicazione: (2026)
di: Lu, Yiyang, et al.
Pubblicazione: (2026)
Empowering Multi-Turn Tool-Integrated Agentic Reasoning with Group Turn Policy Optimization
di: Ding, Yifeng, et al.
Pubblicazione: (2025)
di: Ding, Yifeng, et al.
Pubblicazione: (2025)
Not All Turns Matter: Credit Assignment for Multi-Turn Jailbreaking
di: He, Zhida, et al.
Pubblicazione: (2026)
di: He, Zhida, et al.
Pubblicazione: (2026)
TIPS: Turn-Level Information-Potential Reward Shaping for Search-Augmented LLMs
di: Xie, Yutao, et al.
Pubblicazione: (2026)
di: Xie, Yutao, et al.
Pubblicazione: (2026)
Directional-Clamp PPO
di: Karpel, Gilad, et al.
Pubblicazione: (2025)
di: Karpel, Gilad, et al.
Pubblicazione: (2025)
Kevin: Multi-Turn RL for Generating CUDA Kernels
di: Baronio, Carlo, et al.
Pubblicazione: (2025)
di: Baronio, Carlo, et al.
Pubblicazione: (2025)
TOPPO: Rethinking PPO for Multi-Task Reinforcement Learning with Critic Balancing
di: Li, Yuanpeng, et al.
Pubblicazione: (2026)
di: Li, Yuanpeng, et al.
Pubblicazione: (2026)
Sampling Complexity of TD and PPO in RKHS
di: Zou, Lu, et al.
Pubblicazione: (2025)
di: Zou, Lu, et al.
Pubblicazione: (2025)
Multi-Turn Reasoning LLMs for Task Offloading in Mobile Edge Computing
di: Yang, Ning, et al.
Pubblicazione: (2026)
di: Yang, Ning, et al.
Pubblicazione: (2026)
Mitigating Conversational Inertia in Multi-Turn Agents
di: Wan, Yang, et al.
Pubblicazione: (2026)
di: Wan, Yang, et al.
Pubblicazione: (2026)
AM-PPO: (Advantage) Alpha-Modulation with Proximal Policy Optimization
di: Sane, Soham
Pubblicazione: (2025)
di: Sane, Soham
Pubblicazione: (2025)
ToolACE-MT: Non-Autoregressive Generation for Agentic Multi-Turn Interaction
di: Zeng, Xingshan, et al.
Pubblicazione: (2025)
di: Zeng, Xingshan, et al.
Pubblicazione: (2025)
Unsafer in Many Turns: Benchmarking and Defending Multi-Turn Safety Risks in Tool-Using Agents
di: Li, Xu, et al.
Pubblicazione: (2026)
di: Li, Xu, et al.
Pubblicazione: (2026)
Multi-Turn Jailbreaks Are Simpler Than They Seem
di: Yang, Xiaoxue, et al.
Pubblicazione: (2025)
di: Yang, Xiaoxue, et al.
Pubblicazione: (2025)
TSR: Trajectory-Search Rollouts for Multi-Turn RL of LLM Agents
di: Djuhera, Aladin, et al.
Pubblicazione: (2026)
di: Djuhera, Aladin, et al.
Pubblicazione: (2026)
Tutorly: Turning Programming Videos Into Apprenticeship Learning Environments with LLMs
di: Li, Wengxi, et al.
Pubblicazione: (2024)
di: Li, Wengxi, et al.
Pubblicazione: (2024)
Not All Turns Are Equally Hard: Adaptive Thinking Budgets For Efficient Multi-Turn Reasoning
di: Jali, Neharika, et al.
Pubblicazione: (2026)
di: Jali, Neharika, et al.
Pubblicazione: (2026)
ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL
di: Zhou, Yifei, et al.
Pubblicazione: (2024)
di: Zhou, Yifei, et al.
Pubblicazione: (2024)
TROJail: Trajectory-Level Optimization for Multi-Turn Large Language Model Jailbreaks with Process Rewards
di: Xiong, Xiqiao, et al.
Pubblicazione: (2025)
di: Xiong, Xiqiao, et al.
Pubblicazione: (2025)
Self-Rewarding PPO: Aligning Large Language Models with Demonstrations Only
di: Zhang, Qingru, et al.
Pubblicazione: (2025)
di: Zhang, Qingru, et al.
Pubblicazione: (2025)
AbideGym: Turning Static RL Worlds into Adaptive Challenges
di: Aryan, Abi, et al.
Pubblicazione: (2025)
di: Aryan, Abi, et al.
Pubblicazione: (2025)
CARE: Turning LLMs Into Causal Reasoning Expert
di: Dong, Juncheng, et al.
Pubblicazione: (2025)
di: Dong, Juncheng, et al.
Pubblicazione: (2025)
Eliciting Behaviors in Multi-Turn Conversations
di: Huang, Jing, et al.
Pubblicazione: (2025)
di: Huang, Jing, et al.
Pubblicazione: (2025)
Knowledge-Driven Multi-Turn Jailbreaking on Large Language Models
di: Li, Songze, et al.
Pubblicazione: (2026)
di: Li, Songze, et al.
Pubblicazione: (2026)
PPO in the Fisher-Rao geometry
di: Lascu, Razvan-Andrei, et al.
Pubblicazione: (2025)
di: Lascu, Razvan-Andrei, et al.
Pubblicazione: (2025)
Enhancing PPO with Trajectory-Aware Hybrid Policies
di: Liu, Qisai, et al.
Pubblicazione: (2025)
di: Liu, Qisai, et al.
Pubblicazione: (2025)
Experience-Evolving Multi-Turn Tool-Use Agent with Hybrid Episodic-Procedural Memory
di: Li, Sijia, et al.
Pubblicazione: (2025)
di: Li, Sijia, et al.
Pubblicazione: (2025)
PPO guided Agentic Pipeline for Adaptive Prompt Selection and Test Case Generation
di: Koushik, Gourisetty Venkata Sai, et al.
Pubblicazione: (2026)
di: Koushik, Gourisetty Venkata Sai, et al.
Pubblicazione: (2026)
ATPO: Adaptive Tree Policy Optimization for Multi-Turn Medical Dialogue
di: Cao, Ruike, et al.
Pubblicazione: (2026)
di: Cao, Ruike, et al.
Pubblicazione: (2026)
A Simple "Try Again" Can Elicit Multi-Turn LLM Reasoning
di: Liu, Licheng, et al.
Pubblicazione: (2025)
di: Liu, Licheng, et al.
Pubblicazione: (2025)
U-Turn Diffusion
di: Behjoo, Hamidreza, et al.
Pubblicazione: (2023)
di: Behjoo, Hamidreza, et al.
Pubblicazione: (2023)
Eval-PPO: Building an Efficient Threat Evaluator Using Proximal Policy Optimization
di: Sun, Wuzhou, et al.
Pubblicazione: (2025)
di: Sun, Wuzhou, et al.
Pubblicazione: (2025)
Colored Noise in PPO: Improved Exploration and Performance through Correlated Action Sampling
di: Hollenstein, Jakob, et al.
Pubblicazione: (2023)
di: Hollenstein, Jakob, et al.
Pubblicazione: (2023)
Bridging Online and Offline RL: Contextual Bandit Learning for Multi-Turn Code Generation
di: Chen, Ziru, et al.
Pubblicazione: (2026)
di: Chen, Ziru, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Aligning LLMs Toward Multi-Turn Conversational Outcomes Using Iterative PPO
di: Jiang, Daniel R., et al.
Pubblicazione: (2025) -
Segmental Advantage Estimation: Enhancing PPO for Long-Context LLM Training
di: Gong, Xue, et al.
Pubblicazione: (2026) -
Reinforcing Multi-Turn Reasoning in LLM Agents via Turn-Level Reward Design
di: Wei, Quan, et al.
Pubblicazione: (2025) -
SLEA-RL: Step-Level Experience Augmented Reinforcement Learning for Multi-Turn Agentic Training
di: Wang, Prince Zizhuang, et al.
Pubblicazione: (2026) -
SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks
di: Zhou, Yifei, et al.
Pubblicazione: (2025)