A$^2$TGPO: Agentic Turn-Group Policy Optimization with Adaptive Turn-level Clipping
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Chen, Dingwei, Zong, Zefang, Ma, Zhipeng, Luo, Leo, Li, Yang, Li, Chengming, Chen, Peng, Jiang, Jie |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
AT$^2$PO: Agentic Turn-based Policy Optimization via Tree Search
von: Zong, Zefang, et al.
Veröffentlicht: (2026)
von: Zong, Zefang, et al.
Veröffentlicht: (2026)
Empowering Multi-Turn Tool-Integrated Agentic Reasoning with Group Turn Policy Optimization
von: Ding, Yifeng, et al.
Veröffentlicht: (2025)
von: Ding, Yifeng, et al.
Veröffentlicht: (2025)
RC-GRPO: Reward-Conditioned Group Relative Policy Optimization for Multi-Turn Tool Calling Agents
von: Zhong, Haitian, et al.
Veröffentlicht: (2026)
von: Zhong, Haitian, et al.
Veröffentlicht: (2026)
ICPO: Illocution-Calibrated Policy Optimization for Multi-Turn Conversation
von: Wang, Zhebo, et al.
Veröffentlicht: (2026)
von: Wang, Zhebo, et al.
Veröffentlicht: (2026)
Adaptive Group Policy Optimization: Towards Stable Training and Token-Efficient Reasoning
von: Li, Chen, et al.
Veröffentlicht: (2025)
von: Li, Chen, et al.
Veröffentlicht: (2025)
Turn: A Language for Agentic Computation
von: Kizito, Muyukani
Veröffentlicht: (2026)
von: Kizito, Muyukani
Veröffentlicht: (2026)
Forgetting before Learning: Utilizing Parametric Arithmetic for Knowledge Updating in Large Language Models
von: Ni, Shiwen, et al.
Veröffentlicht: (2023)
von: Ni, Shiwen, et al.
Veröffentlicht: (2023)
Stabilizing Off-Policy Training for Long-Horizon LLM Agent via Turn-Level Importance Sampling and Clipping-Triggered Normalization
von: Li, Chenliang, et al.
Veröffentlicht: (2025)
von: Li, Chenliang, et al.
Veröffentlicht: (2025)
TL-GRPO: Turn-Level RL for Reasoning-Guided Iterative Optimization
von: Li, Peiji, et al.
Veröffentlicht: (2026)
von: Li, Peiji, et al.
Veröffentlicht: (2026)
Hindsight-Anchored Policy Optimization: Turning Failure into Feedback in Sparse Reward Settings
von: Wu, Yuning, et al.
Veröffentlicht: (2026)
von: Wu, Yuning, et al.
Veröffentlicht: (2026)
AdaMoLE: Fine-Tuning Large Language Models with Adaptive Mixture of Low-Rank Adaptation Experts
von: Liu, Zefang, et al.
Veröffentlicht: (2024)
von: Liu, Zefang, et al.
Veröffentlicht: (2024)
ToolACE-MT: Non-Autoregressive Generation for Agentic Multi-Turn Interaction
von: Zeng, Xingshan, et al.
Veröffentlicht: (2025)
von: Zeng, Xingshan, et al.
Veröffentlicht: (2025)
Many-Turn Jailbreaking
von: Yang, Xianjun, et al.
Veröffentlicht: (2025)
von: Yang, Xianjun, et al.
Veröffentlicht: (2025)
Boiling the Frog: A Multi-Turn Benchmark for Agentic Safety
von: Bisconti, Piercosma, et al.
Veröffentlicht: (2026)
von: Bisconti, Piercosma, et al.
Veröffentlicht: (2026)
BAPO: Stabilizing Off-Policy Reinforcement Learning for LLMs via Balanced Policy Optimization with Adaptive Clipping
von: Xi, Zhiheng, et al.
Veröffentlicht: (2025)
von: Xi, Zhiheng, et al.
Veröffentlicht: (2025)
LoopServe: An Adaptive Dual-phase LLM Inference Acceleration System for Multi-Turn Dialogues
von: Li, Haoyang, et al.
Veröffentlicht: (2025)
von: Li, Haoyang, et al.
Veröffentlicht: (2025)
Turn-PPO: Turn-Level Advantage Estimation with PPO for Improved Multi-Turn RL in Agentic LLMs
von: Li, Junbo, et al.
Veröffentlicht: (2025)
von: Li, Junbo, et al.
Veröffentlicht: (2025)
Expectation Confirmation Preference Optimization for Multi-Turn Conversational Recommendation Agent
von: Feng, Xueyang, et al.
Veröffentlicht: (2025)
von: Feng, Xueyang, et al.
Veröffentlicht: (2025)
DCPO: Dynamic Clipping Policy Optimization
von: Yang, Shihui, et al.
Veröffentlicht: (2025)
von: Yang, Shihui, et al.
Veröffentlicht: (2025)
Training Turn-by-Turn Verifiers for Dialogue Tutoring Agents: The Curious Case of LLMs as Your Coding Tutors
von: Wang, Jian, et al.
Veröffentlicht: (2025)
von: Wang, Jian, et al.
Veröffentlicht: (2025)
TGPO: Temporal Grounded Policy Optimization for Signal Temporal Logic Tasks
von: Meng, Yue, et al.
Veröffentlicht: (2025)
von: Meng, Yue, et al.
Veröffentlicht: (2025)
AGGC: Adaptive Group Gradient Clipping for Stabilizing Large Language Model Training
von: Li, Zhiyuan, et al.
Veröffentlicht: (2026)
von: Li, Zhiyuan, et al.
Veröffentlicht: (2026)
Adaptive Stopping for Multi-Turn LLM Reasoning
von: Zhou, Xiaofan, et al.
Veröffentlicht: (2026)
von: Zhou, Xiaofan, et al.
Veröffentlicht: (2026)
Breaking Contextual Inertia: Reinforcement Learning with Single-Turn Anchors for Stable Multi-Turn Interaction
von: Chen, Xingwu, et al.
Veröffentlicht: (2026)
von: Chen, Xingwu, et al.
Veröffentlicht: (2026)
StepPO: Step-Aligned Policy Optimization for Agentic Reinforcement Learning
von: Wang, Daoyu, et al.
Veröffentlicht: (2026)
von: Wang, Daoyu, et al.
Veröffentlicht: (2026)
One Turn Too Late: Response-Aware Defense Against Hidden Malicious Intent in Multi-Turn Dialogue
von: Shen, Xinjie, et al.
Veröffentlicht: (2026)
von: Shen, Xinjie, et al.
Veröffentlicht: (2026)
Performance-Driven Policy Optimization for Speculative Decoding with Adaptive Windowing
von: Jiang, Jie, et al.
Veröffentlicht: (2026)
von: Jiang, Jie, et al.
Veröffentlicht: (2026)
Same Evidence, Different Answers: Canonical-Context On-Policy Distillation for Multi-Turn Language Models
von: Lin, Zizhuo, et al.
Veröffentlicht: (2026)
von: Lin, Zizhuo, et al.
Veröffentlicht: (2026)
Beyond Single-Turn: A Survey on Multi-Turn Interactions with Large Language Models
von: Li, Yubo, et al.
Veröffentlicht: (2025)
von: Li, Yubo, et al.
Veröffentlicht: (2025)
Modeling Multiple Support Strategies within a Single Turn for Emotional Support Conversations
von: Zhu, Jie, et al.
Veröffentlicht: (2026)
von: Zhu, Jie, et al.
Veröffentlicht: (2026)
Personalized Turn-Level User Conversation Satisfaction Benchmark
von: Wang, Zhefan, et al.
Veröffentlicht: (2026)
von: Wang, Zhefan, et al.
Veröffentlicht: (2026)
TurnBench-MS: A Benchmark for Evaluating Multi-Turn, Multi-Step Reasoning in Large Language Models
von: Zhang, Yiran, et al.
Veröffentlicht: (2025)
von: Zhang, Yiran, et al.
Veröffentlicht: (2025)
TimeSage-MT: A Multi-Turn Benchmark for Evaluating Agentic Time Series Reasoning
von: Kong, Yaxuan, et al.
Veröffentlicht: (2026)
von: Kong, Yaxuan, et al.
Veröffentlicht: (2026)
Revisiting Early Detection of Sexual Predators via Turn-level Optimization
von: An, Jinmyeong, et al.
Veröffentlicht: (2025)
von: An, Jinmyeong, et al.
Veröffentlicht: (2025)
SEAD: Self-Evolving Agent for Multi-Turn Service Dialogue
von: Dai, Yuqin, et al.
Veröffentlicht: (2026)
von: Dai, Yuqin, et al.
Veröffentlicht: (2026)
Whom to Query for What: Adaptive Group Elicitation via Multi-Turn LLM Interactions
von: Ding, Ruomeng, et al.
Veröffentlicht: (2026)
von: Ding, Ruomeng, et al.
Veröffentlicht: (2026)
T1: A Tool-Oriented Conversational Dataset for Multi-Turn Agentic Planning
von: Chakraborty, Amartya, et al.
Veröffentlicht: (2025)
von: Chakraborty, Amartya, et al.
Veröffentlicht: (2025)
ECoh: Turn-level Coherence Evaluation for Multilingual Dialogues
von: Mendonça, John, et al.
Veröffentlicht: (2024)
von: Mendonça, John, et al.
Veröffentlicht: (2024)
NaturalTurn: A Method to Segment Speech into Psychologically Meaningful Conversational Turns
von: Cooney, Gus, et al.
Veröffentlicht: (2024)
von: Cooney, Gus, et al.
Veröffentlicht: (2024)
Test-Time Policy Adaptation for Enhanced Multi-Turn Interactions with LLMs
von: Wei, Chenxing, et al.
Veröffentlicht: (2025)
von: Wei, Chenxing, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
AT$^2$PO: Agentic Turn-based Policy Optimization via Tree Search
von: Zong, Zefang, et al.
Veröffentlicht: (2026) -
Empowering Multi-Turn Tool-Integrated Agentic Reasoning with Group Turn Policy Optimization
von: Ding, Yifeng, et al.
Veröffentlicht: (2025) -
RC-GRPO: Reward-Conditioned Group Relative Policy Optimization for Multi-Turn Tool Calling Agents
von: Zhong, Haitian, et al.
Veröffentlicht: (2026) -
ICPO: Illocution-Calibrated Policy Optimization for Multi-Turn Conversation
von: Wang, Zhebo, et al.
Veröffentlicht: (2026) -
Adaptive Group Policy Optimization: Towards Stable Training and Token-Efficient Reasoning
von: Li, Chen, et al.
Veröffentlicht: (2025)