Jailbreaking Large Language Models through Iterative Tool-Disguised Attacks via Reinforcement Learning

Fuente: arXiv
Enregistré dans:
Détails bibliographiques
Auteurs principaux: Wang, Zhaoqi, Zhang, Zijian, He, Daqing, Kou, Pengtao, Li, Xin, Liu, Jiamou, An, Jincheng, Liu, Yong
Format: Preprint
Publié: 2026
Sujets:
Accès en ligne:
Tags: Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!

Documents similaires