Not All Turns Matter: Credit Assignment for Multi-Turn Jailbreaking

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: He, Zhida, Wen, Xiaoyu, Qi, Han, Zhou, Ziyuan, Yu, Peng, Xu, Xingcheng, Liu, Dongrui, Hu, Xia, Lu, Chaochao, Zhang, Qiaosheng
Format: Preprint
Published: 2026
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!
_version_ 1866911666865700864
author He, Zhida
Wen, Xiaoyu
Qi, Han
Zhou, Ziyuan
Yu, Peng
Xu, Xingcheng
Liu, Dongrui
Hu, Xia
Lu, Chaochao
Zhang, Qiaosheng
author_facet He, Zhida
Wen, Xiaoyu
Qi, Han
Zhou, Ziyuan
Yu, Peng
Xu, Xingcheng
Liu, Dongrui
Hu, Xia
Lu, Chaochao
Zhang, Qiaosheng
contents Deploying LLMs in multi-turn dialogues facilitates jailbreak attacks that distribute harmful intent across seemingly benign turns. Recent training-based multi-turn jailbreak methods learn long-horizon attack strategies from interaction feedback, but often rely on coarse trajectory-level outcome signals that broadcast uniformly to every turn. However, we find that turn-level contributions in multi-turn jailbreaking are non-uniform, phase-dependent, and target-specific. Such coarse outcome supervision induces a credit assignment problem, leading to over-rewarding redundant turns in successful trajectories and under-crediting useful intermediate turns in failed ones. To address this, we propose TRACE, a turn-aware credit assignment framework for reinforcement learning (RL)-based multi-turn jailbreaking. For successful trajectories, TRACE estimates turn-level contributions via leave-one-turn-out semantic masking; for failed ones, TRACE assigns penalties based on prompt harmfulness and semantic relevance, with an additional local refusal-aware penalty. Furthermore, we reuse the attack-side credit signal for multi-turn defense alignment. Extensive experiments on open-source and closed-source targets show that TRACE achieves strong overall performance in effectiveness, transferability, and efficiency, yielding about a 25% relative improvement in attack success rate over the strongest RL baseline while also improving the safety-utility balance when reused for defense alignment.
format Preprint
id arxiv_https___arxiv_org_abs_2605_08778
institution arXiv
publishDate 2026
record_format arxiv
spellingShingle Not All Turns Matter: Credit Assignment for Multi-Turn Jailbreaking
He, Zhida
Wen, Xiaoyu
Qi, Han
Zhou, Ziyuan
Yu, Peng
Xu, Xingcheng
Liu, Dongrui
Hu, Xia
Lu, Chaochao
Zhang, Qiaosheng
Artificial Intelligence
Machine Learning
Multiagent Systems
Deploying LLMs in multi-turn dialogues facilitates jailbreak attacks that distribute harmful intent across seemingly benign turns. Recent training-based multi-turn jailbreak methods learn long-horizon attack strategies from interaction feedback, but often rely on coarse trajectory-level outcome signals that broadcast uniformly to every turn. However, we find that turn-level contributions in multi-turn jailbreaking are non-uniform, phase-dependent, and target-specific. Such coarse outcome supervision induces a credit assignment problem, leading to over-rewarding redundant turns in successful trajectories and under-crediting useful intermediate turns in failed ones. To address this, we propose TRACE, a turn-aware credit assignment framework for reinforcement learning (RL)-based multi-turn jailbreaking. For successful trajectories, TRACE estimates turn-level contributions via leave-one-turn-out semantic masking; for failed ones, TRACE assigns penalties based on prompt harmfulness and semantic relevance, with an additional local refusal-aware penalty. Furthermore, we reuse the attack-side credit signal for multi-turn defense alignment. Extensive experiments on open-source and closed-source targets show that TRACE achieves strong overall performance in effectiveness, transferability, and efficiency, yielding about a 25% relative improvement in attack success rate over the strongest RL baseline while also improving the safety-utility balance when reused for defense alignment.
title Not All Turns Matter: Credit Assignment for Multi-Turn Jailbreaking
topic Artificial Intelligence
Machine Learning
Multiagent Systems
url https://arxiv.org/abs/2605.08778