How Johnny Can Persuade LLMs to Jailbreak Them: Rethinking Persuasion to Challenge AI Safety by Humanizing LLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Zeng, Yi, Lin, Hongpeng, Zhang, Jingwen, Yang, Diyi, Jia, Ruoxi, Shi, Weiyan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LLMs Can Plan Only If We Tell Them
di: Sel, Bilgehan, et al.
Pubblicazione: (2025)
di: Sel, Bilgehan, et al.
Pubblicazione: (2025)
LLM Can be a Dangerous Persuader: Empirical Study of Persuasion Safety in Large Language Models
di: Liu, Minqian, et al.
Pubblicazione: (2025)
di: Liu, Minqian, et al.
Pubblicazione: (2025)
How Do LLMs Persuade? Linear Probes Can Uncover Persuasion Dynamics in Multi-Turn Conversations
di: Jaipersaud, Brandon, et al.
Pubblicazione: (2025)
di: Jaipersaud, Brandon, et al.
Pubblicazione: (2025)
Uncovering the Persuasive Fingerprint of LLMs in Jailbreaking Attacks
di: Noughabi, Havva Alizadeh, et al.
Pubblicazione: (2025)
di: Noughabi, Havva Alizadeh, et al.
Pubblicazione: (2025)
Train Yourself as an LLM: Exploring Effects of AI Literacy on Persuasion via Role-playing LLM Training
di: Fan, Qihui, et al.
Pubblicazione: (2026)
di: Fan, Qihui, et al.
Pubblicazione: (2026)
Emergent Persuasion: Will LLMs Persuade Without Being Prompted?
di: Chang, Vincent, et al.
Pubblicazione: (2025)
di: Chang, Vincent, et al.
Pubblicazione: (2025)
The Earth is Flat because...: Investigating LLMs' Belief towards Misinformation via Persuasive Conversation
di: Xu, Rongwu, et al.
Pubblicazione: (2023)
di: Xu, Rongwu, et al.
Pubblicazione: (2023)
Paper Summary Attack: Jailbreaking LLMs through LLM Safety Papers
di: Lin, Liang, et al.
Pubblicazione: (2025)
di: Lin, Liang, et al.
Pubblicazione: (2025)
AutoPersuade: A Framework for Evaluating and Explaining Persuasive Arguments
di: Saenger, Till Raphael, et al.
Pubblicazione: (2024)
di: Saenger, Till Raphael, et al.
Pubblicazione: (2024)
Can LLMs Generate Novel Research Ideas? A Large-Scale Human Study with 100+ NLP Researchers
di: Si, Chenglei, et al.
Pubblicazione: (2024)
di: Si, Chenglei, et al.
Pubblicazione: (2024)
Hidden Persuaders: LLMs' Political Leaning and Their Influence on Voters
di: Potter, Yujin, et al.
Pubblicazione: (2024)
di: Potter, Yujin, et al.
Pubblicazione: (2024)
Efficient Safety Retrofitting Against Jailbreaking for LLMs
di: Garcia-Gasulla, Dario, et al.
Pubblicazione: (2025)
di: Garcia-Gasulla, Dario, et al.
Pubblicazione: (2025)
Social Intelligence Data Infrastructure: Structuring the Present and Navigating the Future
di: Li, Minzhi, et al.
Pubblicazione: (2024)
di: Li, Minzhi, et al.
Pubblicazione: (2024)
Relative Scaling Laws for LLMs
di: Held, William, et al.
Pubblicazione: (2025)
di: Held, William, et al.
Pubblicazione: (2025)
Persuade Me if You Can: A Framework for Evaluating Persuasion Effectiveness and Susceptibility Among Large Language Models
di: Bozdag, Nimet Beyza, et al.
Pubblicazione: (2025)
di: Bozdag, Nimet Beyza, et al.
Pubblicazione: (2025)
Overlooked Safety Vulnerability in LLMs: Malicious Intelligent Optimization Algorithm Request and its Jailbreak
di: Gu, Haoran, et al.
Pubblicazione: (2026)
di: Gu, Haoran, et al.
Pubblicazione: (2026)
LLMs Encode Harmfulness and Refusal Separately
di: Zhao, Jiachen, et al.
Pubblicazione: (2025)
di: Zhao, Jiachen, et al.
Pubblicazione: (2025)
WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs
di: Han, Seungju, et al.
Pubblicazione: (2024)
di: Han, Seungju, et al.
Pubblicazione: (2024)
FASTTRACK: Fast and Accurate Fact Tracing for LLMs
di: Chen, Si, et al.
Pubblicazione: (2024)
di: Chen, Si, et al.
Pubblicazione: (2024)
GUARD: Guideline Upholding Test through Adaptive Role-play and Jailbreak Diagnostics for LLMs
di: Jin, Haibo, et al.
Pubblicazione: (2025)
di: Jin, Haibo, et al.
Pubblicazione: (2025)
Rethinking How to Evaluate Language Model Jailbreak
di: Cai, Hongyu, et al.
Pubblicazione: (2024)
di: Cai, Hongyu, et al.
Pubblicazione: (2024)
Persuasion Dynamics in LLMs: Investigating Robustness and Adaptability in Knowledge and Safety with DuET-PD
di: Tan, Bryan Chen Zhengyu, et al.
Pubblicazione: (2025)
di: Tan, Bryan Chen Zhengyu, et al.
Pubblicazione: (2025)
PrivacyLens: Evaluating Privacy Norm Awareness of Language Models in Action
di: Shao, Yijia, et al.
Pubblicazione: (2024)
di: Shao, Yijia, et al.
Pubblicazione: (2024)
LLMs for Doctors: Leveraging Medical LLMs to Assist Doctors, Not Replace Them
di: Xie, Wenya, et al.
Pubblicazione: (2024)
di: Xie, Wenya, et al.
Pubblicazione: (2024)
Foot-In-The-Door: A Multi-turn Jailbreak for LLMs
di: Weng, Zixuan, et al.
Pubblicazione: (2025)
di: Weng, Zixuan, et al.
Pubblicazione: (2025)
Can AI-Generated Persuasion Be Detected? Persuaficial Benchmark and AI vs. Human Linguistic Differences
di: Modzelewski, Arkadiusz, et al.
Pubblicazione: (2026)
di: Modzelewski, Arkadiusz, et al.
Pubblicazione: (2026)
JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs
di: Chu, Junjie, et al.
Pubblicazione: (2024)
di: Chu, Junjie, et al.
Pubblicazione: (2024)
Defending LLMs against Jailbreaking Attacks via Backtranslation
di: Wang, Yihan, et al.
Pubblicazione: (2024)
di: Wang, Yihan, et al.
Pubblicazione: (2024)
How Far Can LLMs Improve from Experience? Measuring Test-Time Learning Ability in LLMs with Human Comparison
di: Wang, Jiayin, et al.
Pubblicazione: (2025)
di: Wang, Jiayin, et al.
Pubblicazione: (2025)
When Models Know More Than They Can Explain: Quantifying Knowledge Transfer in Human-AI Collaboration
di: Shi, Quan, et al.
Pubblicazione: (2025)
di: Shi, Quan, et al.
Pubblicazione: (2025)
How LLMs Are Persuaded: A Few Attention Heads, Rerouted
di: Sun, Xiangkun, et al.
Pubblicazione: (2026)
di: Sun, Xiangkun, et al.
Pubblicazione: (2026)
Persuasion Tokens for Editing Factual Knowledge in LLMs
di: Youssef, Paul, et al.
Pubblicazione: (2026)
di: Youssef, Paul, et al.
Pubblicazione: (2026)
The Thin Line Between Comprehension and Persuasion in LLMs
di: de Wynter, Adrian, et al.
Pubblicazione: (2025)
di: de Wynter, Adrian, et al.
Pubblicazione: (2025)
Poisoned LangChain: Jailbreak LLMs by LangChain
di: Wang, Ziqiu, et al.
Pubblicazione: (2024)
di: Wang, Ziqiu, et al.
Pubblicazione: (2024)
Can LLMs Truly Embody Human Personality? Analyzing AI and Human Behavior Alignment in Dispute Resolution
di: Kwon, Deuksin, et al.
Pubblicazione: (2026)
di: Kwon, Deuksin, et al.
Pubblicazione: (2026)
How Far Are LLMs from Believable AI? A Benchmark for Evaluating the Believability of Human Behavior Simulation
di: Xiao, Yang, et al.
Pubblicazione: (2023)
di: Xiao, Yang, et al.
Pubblicazione: (2023)
Can LLMs Capture Human Preferences?
di: Goli, Ali, et al.
Pubblicazione: (2023)
di: Goli, Ali, et al.
Pubblicazione: (2023)
Break Me If You Can: Self-Jailbreaking of Aligned LLMs via Lexical Insertion Prompting
di: Kulshreshtha, Devang, et al.
Pubblicazione: (2026)
di: Kulshreshtha, Devang, et al.
Pubblicazione: (2026)
LLMs can be Dangerous Reasoners: Analyzing-based Jailbreak Attack on Large Language Models
di: Lin, Shi, et al.
Pubblicazione: (2024)
di: Lin, Shi, et al.
Pubblicazione: (2024)
Distilling an End-to-End Voice Assistant Without Instruction Training Data
di: Held, William, et al.
Pubblicazione: (2024)
di: Held, William, et al.
Pubblicazione: (2024)
Documenti analoghi
-
LLMs Can Plan Only If We Tell Them
di: Sel, Bilgehan, et al.
Pubblicazione: (2025) -
LLM Can be a Dangerous Persuader: Empirical Study of Persuasion Safety in Large Language Models
di: Liu, Minqian, et al.
Pubblicazione: (2025) -
How Do LLMs Persuade? Linear Probes Can Uncover Persuasion Dynamics in Multi-Turn Conversations
di: Jaipersaud, Brandon, et al.
Pubblicazione: (2025) -
Uncovering the Persuasive Fingerprint of LLMs in Jailbreaking Attacks
di: Noughabi, Havva Alizadeh, et al.
Pubblicazione: (2025) -
Train Yourself as an LLM: Exploring Effects of AI Literacy on Persuasion via Role-playing LLM Training
di: Fan, Qihui, et al.
Pubblicazione: (2026)