Mitigating Lost in Multi-turn Conversation via Curriculum RL with Verifiable Accuracy and Abstention Rewards

Fuente: arXiv
Enregistré dans:
Détails bibliographiques
Auteurs principaux: Li, Ming, Chen, Pei, Zhang, Zhenhao, Yang, Tao, Zhang, Xinyang, Li, Han, Cao, Tianyu, Zeng, Ming, Wu, Zhuofeng, Jiang, Meng, Li, Huasheng, Li, Lihong, Yin, Bing
Format: Preprint
Publié: 2025
Sujets:
Accès en ligne:
Tags: Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
_version_ 1866915967942000640
author Li, Ming
Chen, Pei
Zhang, Zhenhao
Yang, Tao
Zhang, Xinyang
Li, Han
Cao, Tianyu
Zeng, Ming
Wu, Zhuofeng
Jiang, Meng
Li, Huasheng
Li, Lihong
Yin, Bing
author_facet Li, Ming
Chen, Pei
Zhang, Zhenhao
Yang, Tao
Zhang, Xinyang
Li, Han
Cao, Tianyu
Zeng, Ming
Wu, Zhuofeng
Jiang, Meng
Li, Huasheng
Li, Lihong
Yin, Bing
contents Large Language Models demonstrate strong capabilities in single-turn instruction following but suffer from Lost-in-Conversation (LiC), a degradation in performance as information is revealed progressively in multi-turn settings. Motivated by the current progress on Reinforcement Learning with Verifiable Rewards (RLVR), we propose Curriculum Reinforcement Learning with Verifiable Accuracy and Abstention Rewards (RLAAR), a framework that encourages models not only to generate correct answers, but also to judge the solvability of questions in the multi-turn conversation setting. Our approach employs a competence-gated curriculum that incrementally increases dialogue difficulty (in terms of instruction shards), stabilizing training while promoting reliability. Using multi-turn, on-policy rollouts and a mixed-reward system, RLAAR teaches models to balance problem-solving with informed abstention, reducing premature answering behaviors that cause LiC. Evaluated on LiC benchmarks, RLAAR significantly mitigates LiC performance decay (62.6% to 75.1%) and improves calibrated abstention rates (33.5% to 73.4%). Together, these results provide a practical recipe for building multi-turn reliable and trustworthy LLMs.
format Preprint
id arxiv_https___arxiv_org_abs_2510_18731
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle Mitigating Lost in Multi-turn Conversation via Curriculum RL with Verifiable Accuracy and Abstention Rewards
Li, Ming
Chen, Pei
Zhang, Zhenhao
Yang, Tao
Zhang, Xinyang
Li, Han
Cao, Tianyu
Zeng, Ming
Wu, Zhuofeng
Jiang, Meng
Li, Huasheng
Li, Lihong
Yin, Bing
Computation and Language
Artificial Intelligence
Machine Learning
Large Language Models demonstrate strong capabilities in single-turn instruction following but suffer from Lost-in-Conversation (LiC), a degradation in performance as information is revealed progressively in multi-turn settings. Motivated by the current progress on Reinforcement Learning with Verifiable Rewards (RLVR), we propose Curriculum Reinforcement Learning with Verifiable Accuracy and Abstention Rewards (RLAAR), a framework that encourages models not only to generate correct answers, but also to judge the solvability of questions in the multi-turn conversation setting. Our approach employs a competence-gated curriculum that incrementally increases dialogue difficulty (in terms of instruction shards), stabilizing training while promoting reliability. Using multi-turn, on-policy rollouts and a mixed-reward system, RLAAR teaches models to balance problem-solving with informed abstention, reducing premature answering behaviors that cause LiC. Evaluated on LiC benchmarks, RLAAR significantly mitigates LiC performance decay (62.6% to 75.1%) and improves calibrated abstention rates (33.5% to 73.4%). Together, these results provide a practical recipe for building multi-turn reliable and trustworthy LLMs.
title Mitigating Lost in Multi-turn Conversation via Curriculum RL with Verifiable Accuracy and Abstention Rewards
topic Computation and Language
Artificial Intelligence
Machine Learning
url https://arxiv.org/abs/2510.18731