Multi-round jailbreak attack on large language models
Fuente:
arXiv
Saved in:
| Main Authors: | Zhou, Yihua, Shi, Xiaochuan |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Multilingual jailbreaking of LLMs using low-resource languages
by: Marx, Dylan, et al.
Published: (2026)
by: Marx, Dylan, et al.
Published: (2026)
Can adversarial attacks by large language models be attributed?
by: Cebrian, Manuel, et al.
Published: (2024)
by: Cebrian, Manuel, et al.
Published: (2024)
M2S: Multi-turn to Single-turn jailbreak in Red Teaming for LLMs
by: Ha, Junwoo, et al.
Published: (2025)
by: Ha, Junwoo, et al.
Published: (2025)
Adversarial versification in portuguese as a jailbreak operator in LLMs
by: Queiroz, Joao
Published: (2025)
by: Queiroz, Joao
Published: (2025)
Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks
by: Yi, Xin, et al.
Published: (2025)
by: Yi, Xin, et al.
Published: (2025)
Dissociating language and thought in large language models
by: Mahowald, Kyle, et al.
Published: (2023)
by: Mahowald, Kyle, et al.
Published: (2023)
MindScope: Exploring cognitive biases in large language models through Multi-Agent Systems
by: Xie, Zhentao, et al.
Published: (2024)
by: Xie, Zhentao, et al.
Published: (2024)
Evaluating large language models in medical applications: a survey
by: Chen, Xiaolan, et al.
Published: (2024)
by: Chen, Xiaolan, et al.
Published: (2024)
Correcting misinformation on social media with a large language model
by: Zhou, Xinyi, et al.
Published: (2024)
by: Zhou, Xinyi, et al.
Published: (2024)
On the attribution of confidence to large language models
by: Keeling, Geoff, et al.
Published: (2024)
by: Keeling, Geoff, et al.
Published: (2024)
Sandwich attack: Multi-language Mixture Adaptive Attack on LLMs
by: Upadhayay, Bibek, et al.
Published: (2024)
by: Upadhayay, Bibek, et al.
Published: (2024)
Streamlining evidence based clinical recommendations with large language models
by: Li, Dubai, et al.
Published: (2025)
by: Li, Dubai, et al.
Published: (2025)
The 20 questions game to distinguish large language models
by: Richardeau, Gurvan, et al.
Published: (2024)
by: Richardeau, Gurvan, et al.
Published: (2024)
Quantifying non deterministic drift in large language models
by: Nicholson, Claire
Published: (2026)
by: Nicholson, Claire
Published: (2026)
Can large language models build causal graphs?
by: Long, Stephanie, et al.
Published: (2023)
by: Long, Stephanie, et al.
Published: (2023)
Response: Emergent analogical reasoning in large language models
by: Hodel, Damian, et al.
Published: (2023)
by: Hodel, Damian, et al.
Published: (2023)
Representation in large language models
by: Yetman, Cameron
Published: (2025)
by: Yetman, Cameron
Published: (2025)
StatLLaMA: Multi-Stage training for domain-optimized statistical large language models
by: Zeng, Jing-Yi, et al.
Published: (2025)
by: Zeng, Jing-Yi, et al.
Published: (2025)
Failure of contextual invariance in large language models
by: Kumar, Sagar, et al.
Published: (2026)
by: Kumar, Sagar, et al.
Published: (2026)
A survey of textual cyber abuse detection using cutting-edge language models and large language models
by: Diaz-Garcia, Jose A., et al.
Published: (2025)
by: Diaz-Garcia, Jose A., et al.
Published: (2025)
Strong and weak alignment of large language models with human values
by: Khamassi, Mehdi, et al.
Published: (2024)
by: Khamassi, Mehdi, et al.
Published: (2024)
A review on the use of large language models as virtual tutors
by: García-Méndez, Silvia, et al.
Published: (2024)
by: García-Méndez, Silvia, et al.
Published: (2024)
MathDivide: Improved mathematical reasoning by large language models
by: Srivastava, Saksham Sahai, et al.
Published: (2024)
by: Srivastava, Saksham Sahai, et al.
Published: (2024)
Re-evaluating Theory of Mind evaluation in large language models
by: Hu, Jennifer, et al.
Published: (2025)
by: Hu, Jennifer, et al.
Published: (2025)
Disentangling generalization and memorization in large language models using chess
by: Pleiss, Leonard S., et al.
Published: (2026)
by: Pleiss, Leonard S., et al.
Published: (2026)
AI-AI Bias: large language models favor communications generated by large language models
by: Laurito, Walter, et al.
Published: (2024)
by: Laurito, Walter, et al.
Published: (2024)
Alignment faking in large language models
by: Greenblatt, Ryan, et al.
Published: (2024)
by: Greenblatt, Ryan, et al.
Published: (2024)
Optimizing watermarks for large language models
by: Wouters, Bram
Published: (2023)
by: Wouters, Bram
Published: (2023)
Uncovering inequalities in new knowledge learning by large language models across different languages
by: Wang, Chenglong, et al.
Published: (2025)
by: Wang, Chenglong, et al.
Published: (2025)
Entry-level guide to the use of large language models for medical research
by: Jin, Qiao, et al.
Published: (2024)
by: Jin, Qiao, et al.
Published: (2024)
Facilitating large language model Russian adaptation with Learned Embedding Propagation
by: Tikhomirov, Mikhail, et al.
Published: (2024)
by: Tikhomirov, Mikhail, et al.
Published: (2024)
MacBehaviour: An R package for behavioural experimentation on large language models
by: Duan, Xufeng, et al.
Published: (2024)
by: Duan, Xufeng, et al.
Published: (2024)
Hyacinth6B: A large language model for Traditional Chinese
by: Song, Chih-Wei, et al.
Published: (2024)
by: Song, Chih-Wei, et al.
Published: (2024)
Can large language models understand uncommon meanings of common words?
by: Wu, Jinyang, et al.
Published: (2024)
by: Wu, Jinyang, et al.
Published: (2024)
Generating bilingual example sentences with large language models as lexicography assistants
by: Merx, Raphael, et al.
Published: (2024)
by: Merx, Raphael, et al.
Published: (2024)
Leveraging large language models for efficient representation learning for entity resolution
by: Xu, Xiaowei, et al.
Published: (2024)
by: Xu, Xiaowei, et al.
Published: (2024)
Are they human? Detecting large language models by probing human memory constraints
by: Schug, Simon, et al.
Published: (2026)
by: Schug, Simon, et al.
Published: (2026)
A blind spot for large language models: Supradiegetic linguistic information
by: Zimmerman, Julia Witte, et al.
Published: (2023)
by: Zimmerman, Julia Witte, et al.
Published: (2023)
ARC-Encoder: learning compressed text representations for large language models
by: Pilchen, Hippolyte, et al.
Published: (2025)
by: Pilchen, Hippolyte, et al.
Published: (2025)
Enhancing reasoning accuracy in large language models during inference time
by: Sharma, Vinay, et al.
Published: (2026)
by: Sharma, Vinay, et al.
Published: (2026)
Similar Items
-
Multilingual jailbreaking of LLMs using low-resource languages
by: Marx, Dylan, et al.
Published: (2026) -
Can adversarial attacks by large language models be attributed?
by: Cebrian, Manuel, et al.
Published: (2024) -
M2S: Multi-turn to Single-turn jailbreak in Red Teaming for LLMs
by: Ha, Junwoo, et al.
Published: (2025) -
Adversarial versification in portuguese as a jailbreak operator in LLMs
by: Queiroz, Joao
Published: (2025) -
Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks
by: Yi, Xin, et al.
Published: (2025)