Tempest: Autonomous Multi-Turn Jailbreaking of Large Language Models with Tree Search
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhou, Andy, Arel, Ron |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Reasoning-Augmented Conversation for Multi-Turn Jailbreak Attacks on Large Language Models
por: Ying, Zonghao, et al.
Publicado: (2025)
por: Ying, Zonghao, et al.
Publicado: (2025)
Pattern Enhanced Multi-Turn Jailbreaking: Exploiting Structural Vulnerabilities in Large Language Models
por: Nihal, Ragib Amin, et al.
Publicado: (2025)
por: Nihal, Ragib Amin, et al.
Publicado: (2025)
Emerging Vulnerabilities in Frontier Models: Multi-Turn Jailbreak Attacks
por: Gibbs, Tom, et al.
Publicado: (2024)
por: Gibbs, Tom, et al.
Publicado: (2024)
Large Reasoning Models Are Autonomous Jailbreak Agents
por: Hagendorff, Thilo, et al.
Publicado: (2025)
por: Hagendorff, Thilo, et al.
Publicado: (2025)
AutoAdv: Automated Adversarial Prompting for Multi-Turn Jailbreaking of Large Language Models
por: Reddy, Aashray, et al.
Publicado: (2025)
por: Reddy, Aashray, et al.
Publicado: (2025)
CCJA: Context-Coherent Jailbreak Attack for Aligned Large Language Models
por: Zhou, Guanghao, et al.
Publicado: (2025)
por: Zhou, Guanghao, et al.
Publicado: (2025)
LLM-Virus: Evolutionary Jailbreak Attack on Large Language Models
por: Yu, Miao, et al.
Publicado: (2024)
por: Yu, Miao, et al.
Publicado: (2024)
Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models
por: Tu, Shangqing, et al.
Publicado: (2024)
por: Tu, Shangqing, et al.
Publicado: (2024)
Imperceptible Jailbreaking against Large Language Models
por: Gao, Kuofeng, et al.
Publicado: (2025)
por: Gao, Kuofeng, et al.
Publicado: (2025)
JailbreakEval: An Integrated Toolkit for Evaluating Jailbreak Attempts Against Large Language Models
por: Ran, Delong, et al.
Publicado: (2024)
por: Ran, Delong, et al.
Publicado: (2024)
Jailbreaking Large Language Models Through Content Concretization
por: Wahréus, Johan, et al.
Publicado: (2025)
por: Wahréus, Johan, et al.
Publicado: (2025)
Distract Large Language Models for Automatic Jailbreak Attack
por: Xiao, Zeguan, et al.
Publicado: (2024)
por: Xiao, Zeguan, et al.
Publicado: (2024)
Jailbreaking Multimodal Large Language Models via Shuffle Inconsistency
por: Zhao, Shiji, et al.
Publicado: (2025)
por: Zhao, Shiji, et al.
Publicado: (2025)
Is the System Message Really Important to Jailbreaks in Large Language Models?
por: Zou, Xiaotian, et al.
Publicado: (2024)
por: Zou, Xiaotian, et al.
Publicado: (2024)
ADVERSA: Measuring Multi-Turn Guardrail Degradation and Judge Reliability in Large Language Models
por: Owiredu-Ashley, Harry
Publicado: (2026)
por: Owiredu-Ashley, Harry
Publicado: (2026)
Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models
por: Liu, Yanjiang, et al.
Publicado: (2025)
por: Liu, Yanjiang, et al.
Publicado: (2025)
ForgeDAN: An Evolutionary Framework for Jailbreaking Aligned Large Language Models
por: Cheng, Siyang, et al.
Publicado: (2025)
por: Cheng, Siyang, et al.
Publicado: (2025)
Unleashing the Unseen: Harnessing Benign Datasets for Jailbreaking Large Language Models
por: Zhao, Wei, et al.
Publicado: (2024)
por: Zhao, Wei, et al.
Publicado: (2024)
CodeChameleon: Personalized Encryption Framework for Jailbreaking Large Language Models
por: Lv, Huijie, et al.
Publicado: (2024)
por: Lv, Huijie, et al.
Publicado: (2024)
"Moralized" Multi-Step Jailbreak Prompts: Black-Box Testing of Guardrails in Large Language Models for Verbal Attacks
por: Wang, Libo
Publicado: (2024)
por: Wang, Libo
Publicado: (2024)
Siren: A Learning-Based Multi-Turn Attack Framework for Simulating Real-World Human Jailbreak Behaviors
por: Zhao, Yi, et al.
Publicado: (2025)
por: Zhao, Yi, et al.
Publicado: (2025)
Continuous Embedding Attacks via Clipped Inputs in Jailbreaking Large Language Models
por: Xu, Zihao, et al.
Publicado: (2024)
por: Xu, Zihao, et al.
Publicado: (2024)
Defending against Jailbreak through Early Exit Generation of Large Language Models
por: Zhao, Chongwen, et al.
Publicado: (2024)
por: Zhao, Chongwen, et al.
Publicado: (2024)
JailBreakV: A Benchmark for Assessing the Robustness of MultiModal Large Language Models against Jailbreak Attacks
por: Luo, Weidi, et al.
Publicado: (2024)
por: Luo, Weidi, et al.
Publicado: (2024)
STShield: Single-Token Sentinel for Real-Time Jailbreak Detection in Large Language Models
por: Wang, Xunguang, et al.
Publicado: (2025)
por: Wang, Xunguang, et al.
Publicado: (2025)
FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts
por: Gong, Yichen, et al.
Publicado: (2023)
por: Gong, Yichen, et al.
Publicado: (2023)
QueryAttack: Jailbreaking Aligned Large Language Models Using Structured Non-natural Query Language
por: Zou, Qingsong, et al.
Publicado: (2025)
por: Zou, Qingsong, et al.
Publicado: (2025)
Prefix Guidance: A Steering Wheel for Large Language Models to Defend Against Jailbreak Attacks
por: Zhao, Jiawei, et al.
Publicado: (2024)
por: Zhao, Jiawei, et al.
Publicado: (2024)
RobustKV: Defending Large Language Models against Jailbreak Attacks via KV Eviction
por: Jiang, Tanqiu, et al.
Publicado: (2024)
por: Jiang, Tanqiu, et al.
Publicado: (2024)
Jailbreaking Large Language Models with Symbolic Mathematics
por: Bethany, Emet, et al.
Publicado: (2024)
por: Bethany, Emet, et al.
Publicado: (2024)
Test-Time Immunization: A Universal Defense Framework Against Jailbreaks for (Multimodal) Large Language Models
por: Yu, Yongcan, et al.
Publicado: (2025)
por: Yu, Yongcan, et al.
Publicado: (2025)
TombRaider: Entering the Vault of History to Jailbreak Large Language Models
por: Ding, Junchen, et al.
Publicado: (2025)
por: Ding, Junchen, et al.
Publicado: (2025)
EnJa: Ensemble Jailbreak on Large Language Models
por: Zhang, Jiahao, et al.
Publicado: (2024)
por: Zhang, Jiahao, et al.
Publicado: (2024)
Private Memorization Editing: Turning Memorization into a Defense to Strengthen Data Privacy in Large Language Models
por: Ruzzetti, Elena Sofia, et al.
Publicado: (2025)
por: Ruzzetti, Elena Sofia, et al.
Publicado: (2025)
from Benign import Toxic: Jailbreaking the Language Model via Adversarial Metaphors
por: Yan, Yu, et al.
Publicado: (2025)
por: Yan, Yu, et al.
Publicado: (2025)
RedAgent: Red Teaming Large Language Models with Context-aware Autonomous Language Agent
por: Xu, Huiyu, et al.
Publicado: (2024)
por: Xu, Huiyu, et al.
Publicado: (2024)
X-Teaming: Multi-Turn Jailbreaks and Defenses with Adaptive Multi-Agents
por: Rahman, Salman, et al.
Publicado: (2025)
por: Rahman, Salman, et al.
Publicado: (2025)
Beyond the Tip of Efficiency: Uncovering the Submerged Threats of Jailbreak Attacks in Small Language Models
por: Yi, Sibo, et al.
Publicado: (2025)
por: Yi, Sibo, et al.
Publicado: (2025)
An Interpretable N-gram Perplexity Threat Model for Large Language Model Jailbreaks
por: Boreiko, Valentyn, et al.
Publicado: (2024)
por: Boreiko, Valentyn, et al.
Publicado: (2024)
Jailbreak Attacks and Defenses Against Large Language Models: A Survey
por: Yi, Sibo, et al.
Publicado: (2024)
por: Yi, Sibo, et al.
Publicado: (2024)
Ejemplares similares
-
Reasoning-Augmented Conversation for Multi-Turn Jailbreak Attacks on Large Language Models
por: Ying, Zonghao, et al.
Publicado: (2025) -
Pattern Enhanced Multi-Turn Jailbreaking: Exploiting Structural Vulnerabilities in Large Language Models
por: Nihal, Ragib Amin, et al.
Publicado: (2025) -
Emerging Vulnerabilities in Frontier Models: Multi-Turn Jailbreak Attacks
por: Gibbs, Tom, et al.
Publicado: (2024) -
Large Reasoning Models Are Autonomous Jailbreak Agents
por: Hagendorff, Thilo, et al.
Publicado: (2025) -
AutoAdv: Automated Adversarial Prompting for Multi-Turn Jailbreaking of Large Language Models
por: Reddy, Aashray, et al.
Publicado: (2025)