Foot In The Door: Understanding Large Language Model Jailbreaking via Cognitive Psychology
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wang, Zhenhua, Xie, Wei, Wang, Baosheng, Wang, Enze, Gui, Zhiwen, Ma, Shuoyoucheng, Chen, Kai |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Do Large Language Models Truly Grasp Mathematics? An Empirical Exploration From Cognitive Psychology
von: Xie, Wei, et al.
Veröffentlicht: (2024)
von: Xie, Wei, et al.
Veröffentlicht: (2024)
AIPsychoBench: Understanding the Psychometric Differences between LLMs and Humans
von: Xie, Wei, et al.
Veröffentlicht: (2025)
von: Xie, Wei, et al.
Veröffentlicht: (2025)
League of LLMs: A Benchmark-Free Paradigm for Mutual Evaluation of Large Language Models
von: Guo, Qianhong, et al.
Veröffentlicht: (2025)
von: Guo, Qianhong, et al.
Veröffentlicht: (2025)
Foot-In-The-Door: A Multi-turn Jailbreak for LLMs
von: Weng, Zixuan, et al.
Veröffentlicht: (2025)
von: Weng, Zixuan, et al.
Veröffentlicht: (2025)
EasyJailbreak: A Unified Framework for Jailbreaking Large Language Models
von: Zhou, Weikang, et al.
Veröffentlicht: (2024)
von: Zhou, Weikang, et al.
Veröffentlicht: (2024)
Jailbreaking Multimodal Large Language Models via Shuffle Inconsistency
von: Zhao, Shiji, et al.
Veröffentlicht: (2025)
von: Zhao, Shiji, et al.
Veröffentlicht: (2025)
MIST: Jailbreaking Black-box Large Language Models via Iterative Semantic Tuning
von: Zheng, Muyang, et al.
Veröffentlicht: (2025)
von: Zheng, Muyang, et al.
Veröffentlicht: (2025)
Defending Large Language Models Against Jailbreak Attacks via In-Decoding Safety-Awareness Probing
von: Zhao, Yinzhi, et al.
Veröffentlicht: (2026)
von: Zhao, Yinzhi, et al.
Veröffentlicht: (2026)
Imperceptible Jailbreaking against Large Language Models
von: Gao, Kuofeng, et al.
Veröffentlicht: (2025)
von: Gao, Kuofeng, et al.
Veröffentlicht: (2025)
EnJa: Ensemble Jailbreak on Large Language Models
von: Zhang, Jiahao, et al.
Veröffentlicht: (2024)
von: Zhang, Jiahao, et al.
Veröffentlicht: (2024)
CodeChameleon: Personalized Encryption Framework for Jailbreaking Large Language Models
von: Lv, Huijie, et al.
Veröffentlicht: (2024)
von: Lv, Huijie, et al.
Veröffentlicht: (2024)
Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models
von: Tu, Shangqing, et al.
Veröffentlicht: (2024)
von: Tu, Shangqing, et al.
Veröffentlicht: (2024)
When "Competency" in Reasoning Opens the Door to Vulnerability: Jailbreaking LLMs via Novel Complex Ciphers
von: Handa, Divij, et al.
Veröffentlicht: (2024)
von: Handa, Divij, et al.
Veröffentlicht: (2024)
FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts
von: Gong, Yichen, et al.
Veröffentlicht: (2023)
von: Gong, Yichen, et al.
Veröffentlicht: (2023)
STShield: Single-Token Sentinel for Real-Time Jailbreak Detection in Large Language Models
von: Wang, Xunguang, et al.
Veröffentlicht: (2025)
von: Wang, Xunguang, et al.
Veröffentlicht: (2025)
RobustKV: Defending Large Language Models against Jailbreak Attacks via KV Eviction
von: Jiang, Tanqiu, et al.
Veröffentlicht: (2024)
von: Jiang, Tanqiu, et al.
Veröffentlicht: (2024)
Revisiting Jailbreaking for Large Language Models: A Representation Engineering Perspective
von: Li, Tianlong, et al.
Veröffentlicht: (2024)
von: Li, Tianlong, et al.
Veröffentlicht: (2024)
What are Models Thinking about? Understanding Large Language Model Hallucinations "Psychology" through Model Inner State Analysis
von: Wang, Peiran, et al.
Veröffentlicht: (2025)
von: Wang, Peiran, et al.
Veröffentlicht: (2025)
JailbreakEval: An Integrated Toolkit for Evaluating Jailbreak Attempts Against Large Language Models
von: Ran, Delong, et al.
Veröffentlicht: (2024)
von: Ran, Delong, et al.
Veröffentlicht: (2024)
Continuous Embedding Attacks via Clipped Inputs in Jailbreaking Large Language Models
von: Xu, Zihao, et al.
Veröffentlicht: (2024)
von: Xu, Zihao, et al.
Veröffentlicht: (2024)
Optimizing Psychological Counseling with Instruction-Tuned Large Language Models
von: Li, Wenjie, et al.
Veröffentlicht: (2024)
von: Li, Wenjie, et al.
Veröffentlicht: (2024)
ECCoT: A Framework for Enhancing Effective Cognition via Chain of Thought in Large Language Model
von: Duan, Zhenke, et al.
Veröffentlicht: (2025)
von: Duan, Zhenke, et al.
Veröffentlicht: (2025)
Coding Triangle: How Does Large Language Model Understand Code?
von: Zhang, Taolin, et al.
Veröffentlicht: (2025)
von: Zhang, Taolin, et al.
Veröffentlicht: (2025)
DuetSim: Building User Simulator with Dual Large Language Models for Task-Oriented Dialogues
von: Luo, Xiang, et al.
Veröffentlicht: (2024)
von: Luo, Xiang, et al.
Veröffentlicht: (2024)
The Tower of Babel Revisited: Multilingual Jailbreak Prompts on Closed-Source Large Language Models
von: Huang, Linghan, et al.
Veröffentlicht: (2025)
von: Huang, Linghan, et al.
Veröffentlicht: (2025)
Do Large Language Models Understand Logic or Just Mimick Context?
von: Yan, Junbing, et al.
Veröffentlicht: (2024)
von: Yan, Junbing, et al.
Veröffentlicht: (2024)
ForgeDAN: An Evolutionary Framework for Jailbreaking Aligned Large Language Models
von: Cheng, Siyang, et al.
Veröffentlicht: (2025)
von: Cheng, Siyang, et al.
Veröffentlicht: (2025)
Re-Initialization Token Learning for Tool-Augmented Large Language Models
von: Li, Chenghao, et al.
Veröffentlicht: (2025)
von: Li, Chenghao, et al.
Veröffentlicht: (2025)
Stealthy Jailbreak Attacks on Large Language Models via Benign Data Mirroring
von: Mu, Honglin, et al.
Veröffentlicht: (2024)
von: Mu, Honglin, et al.
Veröffentlicht: (2024)
Metacognitive Prompting Improves Understanding in Large Language Models
von: Wang, Yuqing, et al.
Veröffentlicht: (2023)
von: Wang, Yuqing, et al.
Veröffentlicht: (2023)
LLM-Virus: Evolutionary Jailbreak Attack on Large Language Models
von: Yu, Miao, et al.
Veröffentlicht: (2024)
von: Yu, Miao, et al.
Veröffentlicht: (2024)
Distract Large Language Models for Automatic Jailbreak Attack
von: Xiao, Zeguan, et al.
Veröffentlicht: (2024)
von: Xiao, Zeguan, et al.
Veröffentlicht: (2024)
THRD: A Training-Free Multi-Turn Defense Framework for Jailbreak Attacks on Large Language Models
von: Ma, Zhiqing, et al.
Veröffentlicht: (2026)
von: Ma, Zhiqing, et al.
Veröffentlicht: (2026)
CogLM: Tracking Cognitive Development of Large Language Models
von: Wang, Xinglin, et al.
Veröffentlicht: (2024)
von: Wang, Xinglin, et al.
Veröffentlicht: (2024)
Understanding Jailbreak Success: A Study of Latent Space Dynamics in Large Language Models
von: Ball, Sarah, et al.
Veröffentlicht: (2024)
von: Ball, Sarah, et al.
Veröffentlicht: (2024)
Are Large Language Models Good Prompt Optimizers?
von: Ma, Ruotian, et al.
Veröffentlicht: (2024)
von: Ma, Ruotian, et al.
Veröffentlicht: (2024)
Dissecting Failure Dynamics in Large Language Model Reasoning
von: Zhu, Wei, et al.
Veröffentlicht: (2026)
von: Zhu, Wei, et al.
Veröffentlicht: (2026)
"Moralized" Multi-Step Jailbreak Prompts: Black-Box Testing of Guardrails in Large Language Models for Verbal Attacks
von: Wang, Libo
Veröffentlicht: (2024)
von: Wang, Libo
Veröffentlicht: (2024)
AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models
von: Liu, Xiaogeng, et al.
Veröffentlicht: (2023)
von: Liu, Xiaogeng, et al.
Veröffentlicht: (2023)
Jailbreaking Frontier Foundation Models Through Intention Deception
von: Wang, Xinhe, et al.
Veröffentlicht: (2026)
von: Wang, Xinhe, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Do Large Language Models Truly Grasp Mathematics? An Empirical Exploration From Cognitive Psychology
von: Xie, Wei, et al.
Veröffentlicht: (2024) -
AIPsychoBench: Understanding the Psychometric Differences between LLMs and Humans
von: Xie, Wei, et al.
Veröffentlicht: (2025) -
League of LLMs: A Benchmark-Free Paradigm for Mutual Evaluation of Large Language Models
von: Guo, Qianhong, et al.
Veröffentlicht: (2025) -
Foot-In-The-Door: A Multi-turn Jailbreak for LLMs
von: Weng, Zixuan, et al.
Veröffentlicht: (2025) -
EasyJailbreak: A Unified Framework for Jailbreaking Large Language Models
von: Zhou, Weikang, et al.
Veröffentlicht: (2024)