PAG: Multi-Turn Reinforced LLM Self-Correction with Policy as Generative Verifier
Fuente:
arXiv
Saved in:
| Main Authors: | Jiang, Yuhua, Xiong, Yuwen, Yuan, Yufeng, Xin, Chao, Xu, Wenyuan, Yue, Yu, Zhao, Qianchuan, Yan, Lin |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Risk-Sensitive RL for Alleviating Exploration Dilemmas in Large Language Models
by: Jiang, Yuhua, et al.
Published: (2025)
by: Jiang, Yuhua, et al.
Published: (2025)
A Unified Pairwise Framework for RLHF: Bridging Generative Reward Modeling and Policy Optimization
by: Xu, Wenyuan, et al.
Published: (2025)
by: Xu, Wenyuan, et al.
Published: (2025)
TUNAY NA PAG-IBIG
by: GILLO, MARIANO D.
Published: (2025)
by: GILLO, MARIANO D.
Published: (2025)
Vapor Pressure, Miscibility, Density, Dynamic Viscosity, and Sound Velocity of PAG 68 / R-290, PAG 68 / R-600a, PAG 100 / R-290, PAG 100 / R-600a, POE 68 / R-290, and POE 68 / R-600a
by: Rudzik, Tim, et al.
Published: (2026)
by: Rudzik, Tim, et al.
Published: (2026)
Taypsi: Static Enforcement of Privacy Policies for Policy-Agnostic Oblivious Computation
by: Ye, Qianchuan, et al.
Published: (2023)
by: Ye, Qianchuan, et al.
Published: (2023)
Exploring Critical Testing Scenarios for Decision-Making Policies: An LLM Approach
by: Xu, Weichao, et al.
Published: (2024)
by: Xu, Weichao, et al.
Published: (2024)
Scaling up Multi-Turn Off-Policy RL and Multi-Agent Tree Search for LLM Step-Provers
by: Xin, Ran, et al.
Published: (2025)
by: Xin, Ran, et al.
Published: (2025)
RLFactory: A Plug-and-Play Reinforcement Learning Post-Training Framework for LLM Multi-Turn Tool-Use
by: Chai, Jiajun, et al.
Published: (2025)
by: Chai, Jiajun, et al.
Published: (2025)
Reinforcing Multi-Turn Reasoning in LLM Agents via Turn-Level Reward Design
by: Wei, Quan, et al.
Published: (2025)
by: Wei, Quan, et al.
Published: (2025)
GlobeDiff: State Diffusion Process for Partial Observability in Multi-Agent Systems
by: Yang, Yiqin, et al.
Published: (2026)
by: Yang, Yiqin, et al.
Published: (2026)
Reinforcing General Reasoning without Verifiers
by: Zhou, Xiangxin, et al.
Published: (2025)
by: Zhou, Xiangxin, et al.
Published: (2025)
RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning
by: Wang, Zihan, et al.
Published: (2025)
by: Wang, Zihan, et al.
Published: (2025)
Fewer May Be Better: Enhancing Offline Reinforcement Learning with Reduced Dataset
by: Yang, Yiqin, et al.
Published: (2025)
by: Yang, Yiqin, et al.
Published: (2025)
One Model, All Roles: Multi-Turn, Multi-Agent Self-Play Reinforcement Learning for Conversational Social Intelligence
by: Jiang, Bowen, et al.
Published: (2026)
by: Jiang, Bowen, et al.
Published: (2026)
A HAT Trick: Automatically Verifying Representation Invariants Using Symbolic Finite Automata
by: Zhou, Zhe, et al.
Published: (2024)
by: Zhou, Zhe, et al.
Published: (2024)
Construction of Self-Orthogonal Quasi-Cyclic Codes and Their Application to Quantum Error-Correcting Codes
by: Gao, Mengying, et al.
Published: (2025)
by: Gao, Mengying, et al.
Published: (2025)
From Reasoning Chains to Verifiable Subproblems: Curriculum Reinforcement Learning Enables Credit Assignment for LLM Reasoning
by: Jiang, Xitai, et al.
Published: (2026)
by: Jiang, Xitai, et al.
Published: (2026)
Priority-based Energy Allocation in Buildings through Distributed Model Predictive Control
by: Li, Hongyi, et al.
Published: (2024)
by: Li, Hongyi, et al.
Published: (2024)
MM-ReCoder: Advancing Chart-to-Code Generation with Reinforcement Learning and Self-Correction
by: Tang, Zitian, et al.
Published: (2026)
by: Tang, Zitian, et al.
Published: (2026)
Evaluating LLM-based Agents for Multi-Turn Conversations: A Survey
by: Guan, Shengyue, et al.
Published: (2025)
by: Guan, Shengyue, et al.
Published: (2025)
Beyond Binary: Turning Partial Success into Dense Verifiable Rewards for Reinforcement Learning in Code Generation
by: Wang, Longwen, et al.
Published: (2026)
by: Wang, Longwen, et al.
Published: (2026)
LAMARL: LLM-Aided Multi-Agent Reinforcement Learning for Cooperative Policy Generation
by: Zhu, Guobin, et al.
Published: (2025)
by: Zhu, Guobin, et al.
Published: (2025)
Towards LLM-Powered Verilog RTL Assistant: Self-Verification and Self-Correction
by: Huang, Hanxian, et al.
Published: (2024)
by: Huang, Hanxian, et al.
Published: (2024)
Multi-Step Likelihood-Ratio Correction for Reinforcement Learning with Verifiable Rewards
by: Yoon, Deokgyu, et al.
Published: (2026)
by: Yoon, Deokgyu, et al.
Published: (2026)
UCO: A Multi-Turn Interactive Reinforcement Learning Method for Adaptive Teaching with Large Language Models
by: Wei, Shouang, et al.
Published: (2025)
by: Wei, Shouang, et al.
Published: (2025)
Benchmarking Correctness and Security in Multi-Turn Code Generation
by: Rawal, Ruchit, et al.
Published: (2025)
by: Rawal, Ruchit, et al.
Published: (2025)
Midbrain PAG Astrocytes Modulate Mouse Defensive and Panic‐Like Behaviors
by: Ellane Barcelon, et al.
Published: (2026)
by: Ellane Barcelon, et al.
Published: (2026)
Multi-Turn Interactions for Text-to-SQL with Large Language Models
by: Xiong, Guanming, et al.
Published: (2024)
by: Xiong, Guanming, et al.
Published: (2024)
Self-Induced Outcome Potential: Turn-Level Credit Assignment for Agents without Verifiers
by: Hu, Senkang, et al.
Published: (2026)
by: Hu, Senkang, et al.
Published: (2026)
MARCH: Multi-Agent Reinforced Self-Check for LLM Hallucination
by: Li, Zhuo, et al.
Published: (2026)
by: Li, Zhuo, et al.
Published: (2026)
Verify Before You Commit: Towards Faithful Reasoning in LLM Agents via Self-Auditing
by: Yuan, Wenhao, et al.
Published: (2026)
by: Yuan, Wenhao, et al.
Published: (2026)
Trust Your Memory: Verifiable Control of Smart Homes through Reinforcement Learning with Multi-dimensional Rewards
by: Guo, Kai-Yuan, et al.
Published: (2026)
by: Guo, Kai-Yuan, et al.
Published: (2026)
Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning
by: Ning, Yansong, et al.
Published: (2025)
by: Ning, Yansong, et al.
Published: (2025)
Verifiable Dropout: Turning Randomness into a Verifiable Claim
by: Lee, Kichang, et al.
Published: (2025)
by: Lee, Kichang, et al.
Published: (2025)
Evaluating Multi-Turn Bargain Skills in LLM-Based Seller Agent
by: Wang, Issue Yishu, et al.
Published: (2025)
by: Wang, Issue Yishu, et al.
Published: (2025)
An Empirical Study of Interaction Smells in Multi-Turn Human-LLM Collaborative Code Generation
by: Zhang, Binquan, et al.
Published: (2026)
by: Zhang, Binquan, et al.
Published: (2026)
Trust, But Verify: A Self-Verification Approach to Reinforcement Learning with Verifiable Rewards
by: Liu, Xiaoyuan, et al.
Published: (2025)
by: Liu, Xiaoyuan, et al.
Published: (2025)
Same Evidence, Different Answers: Canonical-Context On-Policy Distillation for Multi-Turn Language Models
by: Lin, Zizhuo, et al.
Published: (2026)
by: Lin, Zizhuo, et al.
Published: (2026)
Policy-regularized Offline Multi-objective Reinforcement Learning
by: Lin, Qian, et al.
Published: (2024)
by: Lin, Qian, et al.
Published: (2024)
Random Policy Valuation is Enough for LLM Reasoning with Verifiable Rewards
by: He, Haoran, et al.
Published: (2025)
by: He, Haoran, et al.
Published: (2025)
Similar Items
-
Risk-Sensitive RL for Alleviating Exploration Dilemmas in Large Language Models
by: Jiang, Yuhua, et al.
Published: (2025) -
A Unified Pairwise Framework for RLHF: Bridging Generative Reward Modeling and Policy Optimization
by: Xu, Wenyuan, et al.
Published: (2025) -
TUNAY NA PAG-IBIG
by: GILLO, MARIANO D.
Published: (2025) -
Vapor Pressure, Miscibility, Density, Dynamic Viscosity, and Sound Velocity of PAG 68 / R-290, PAG 68 / R-600a, PAG 100 / R-290, PAG 100 / R-600a, POE 68 / R-290, and POE 68 / R-600a
by: Rudzik, Tim, et al.
Published: (2026) -
Taypsi: Static Enforcement of Privacy Policies for Policy-Agnostic Oblivious Computation
by: Ye, Qianchuan, et al.
Published: (2023)