Na'vi or Knave: Jailbreaking Language Models via Metaphorical Avatars
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yan, Yu, Sun, Sheng, Tong, Junqi, Liu, Min, Li, Qi |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
from Benign import Toxic: Jailbreaking the Language Model via Adversarial Metaphors
par: Yan, Yu, et autres
Publié: (2025)
par: Yan, Yu, et autres
Publié: (2025)
Collaborative Stance Detection via Small-Large Language Model Consistency Verification
par: Yan, Yu, et autres
Publié: (2025)
par: Yan, Yu, et autres
Publié: (2025)
Jailbreak-as-a-Service++: Unveiling Distributed AI-Driven Malicious Information Campaigns Powered by LLM Crowdsourcing
par: Yan, Yu, et autres
Publié: (2025)
par: Yan, Yu, et autres
Publié: (2025)
EasyJailbreak: A Unified Framework for Jailbreaking Large Language Models
par: Zhou, Weikang, et autres
Publié: (2024)
par: Zhou, Weikang, et autres
Publié: (2024)
Stealthy Jailbreak Attacks on Large Language Models via Benign Data Mirroring
par: Mu, Honglin, et autres
Publié: (2024)
par: Mu, Honglin, et autres
Publié: (2024)
Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models
par: Tu, Shangqing, et autres
Publié: (2024)
par: Tu, Shangqing, et autres
Publié: (2024)
MIST: Jailbreaking Black-box Large Language Models via Iterative Semantic Tuning
par: Zheng, Muyang, et autres
Publié: (2025)
par: Zheng, Muyang, et autres
Publié: (2025)
Multi-Turn Context Jailbreak Attack on Large Language Models From First Principles
par: Sun, Xiongtao, et autres
Publié: (2024)
par: Sun, Xiongtao, et autres
Publié: (2024)
Playing Language Game with LLMs Leads to Jailbreaking
par: Peng, Yu, et autres
Publié: (2024)
par: Peng, Yu, et autres
Publié: (2024)
THRD: A Training-Free Multi-Turn Defense Framework for Jailbreak Attacks on Large Language Models
par: Ma, Zhiqing, et autres
Publié: (2026)
par: Ma, Zhiqing, et autres
Publié: (2026)
Unleashing the Unseen: Harnessing Benign Datasets for Jailbreaking Large Language Models
par: Zhao, Wei, et autres
Publié: (2024)
par: Zhao, Wei, et autres
Publié: (2024)
Revisiting Jailbreaking for Large Language Models: A Representation Engineering Perspective
par: Li, Tianlong, et autres
Publié: (2024)
par: Li, Tianlong, et autres
Publié: (2024)
Foot In The Door: Understanding Large Language Model Jailbreaking via Cognitive Psychology
par: Wang, Zhenhua, et autres
Publié: (2024)
par: Wang, Zhenhua, et autres
Publié: (2024)
Continuous Embedding Attacks via Clipped Inputs in Jailbreaking Large Language Models
par: Xu, Zihao, et autres
Publié: (2024)
par: Xu, Zihao, et autres
Publié: (2024)
Jailbreak Attacks and Defenses Against Large Language Models: A Survey
par: Yi, Sibo, et autres
Publié: (2024)
par: Yi, Sibo, et autres
Publié: (2024)
Efficient LLM-Jailbreaking via Multimodal-LLM Jailbreak
par: Ji, Haoxuan, et autres
Publié: (2024)
par: Ji, Haoxuan, et autres
Publié: (2024)
Distract Large Language Models for Automatic Jailbreak Attack
par: Xiao, Zeguan, et autres
Publié: (2024)
par: Xiao, Zeguan, et autres
Publié: (2024)
An Expectation-Realization Model for Metaphor Detection
par: Uduehi, Oseremen O., et autres
Publié: (2023)
par: Uduehi, Oseremen O., et autres
Publié: (2023)
AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models
par: Liu, Xiaogeng, et autres
Publié: (2023)
par: Liu, Xiaogeng, et autres
Publié: (2023)
Jailbreaking to Jailbreak
par: Kritz, Jeremy, et autres
Publié: (2025)
par: Kritz, Jeremy, et autres
Publié: (2025)
JailbreakEval: An Integrated Toolkit for Evaluating Jailbreak Attempts Against Large Language Models
par: Ran, Delong, et autres
Publié: (2024)
par: Ran, Delong, et autres
Publié: (2024)
Beyond the Tip of Efficiency: Uncovering the Submerged Threats of Jailbreak Attacks in Small Language Models
par: Yi, Sibo, et autres
Publié: (2025)
par: Yi, Sibo, et autres
Publié: (2025)
Defending Large Language Models Against Jailbreak Attacks via In-Decoding Safety-Awareness Probing
par: Zhao, Yinzhi, et autres
Publié: (2026)
par: Zhao, Yinzhi, et autres
Publié: (2026)
Jailbreaking Multimodal Large Language Models via Shuffle Inconsistency
par: Zhao, Shiji, et autres
Publié: (2025)
par: Zhao, Shiji, et autres
Publié: (2025)
Chinese Metaphor Recognition Using a Multi-stage Prompting Large Language Model
par: Wang, Jie, et autres
Publié: (2024)
par: Wang, Jie, et autres
Publié: (2024)
The Cost of Thinking: Increased Jailbreak Risk in Large Language Models
par: Yang, Fan
Publié: (2025)
par: Yang, Fan
Publié: (2025)
Improving Attributed Text Generation of Large Language Models via Preference Learning
par: Li, Dongfang, et autres
Publié: (2024)
par: Li, Dongfang, et autres
Publié: (2024)
Imperceptible Jailbreaking against Large Language Models
par: Gao, Kuofeng, et autres
Publié: (2025)
par: Gao, Kuofeng, et autres
Publié: (2025)
Audio Jailbreaks in Large Audio-Language Models: Taxonomy, Attack-Defense Analysis, and Cost-Aware Evaluation
par: Feng, Bo-Han, et autres
Publié: (2026)
par: Feng, Bo-Han, et autres
Publié: (2026)
ForgeDAN: An Evolutionary Framework for Jailbreaking Aligned Large Language Models
par: Cheng, Siyang, et autres
Publié: (2025)
par: Cheng, Siyang, et autres
Publié: (2025)
Provable Defense Framework for LLM Jailbreaks via Noise-Augumented Alignment
par: Cheng, Zehua, et autres
Publié: (2026)
par: Cheng, Zehua, et autres
Publié: (2026)
Metaphor and Large Language Models: When Surface Features Matter More than Deep Understanding
par: Sanchez-Bayona, Elisa, et autres
Publié: (2025)
par: Sanchez-Bayona, Elisa, et autres
Publié: (2025)
Graph Counselor: Adaptive Graph Exploration via Multi-Agent Synergy to Enhance LLM Reasoning
par: Gao, Junqi, et autres
Publié: (2025)
par: Gao, Junqi, et autres
Publié: (2025)
BiasJailbreak:Analyzing Ethical Biases and Jailbreak Vulnerabilities in Large Language Models
par: Lee, Isack, et autres
Publié: (2024)
par: Lee, Isack, et autres
Publié: (2024)
FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts
par: Gong, Yichen, et autres
Publié: (2023)
par: Gong, Yichen, et autres
Publié: (2023)
QueryAttack: Jailbreaking Aligned Large Language Models Using Structured Non-natural Query Language
par: Zou, Qingsong, et autres
Publié: (2025)
par: Zou, Qingsong, et autres
Publié: (2025)
CMDAG: A Chinese Metaphor Dataset with Annotated Grounds as CoT for Boosting Metaphor Generation
par: Shao, Yujie, et autres
Publié: (2024)
par: Shao, Yujie, et autres
Publié: (2024)
GRAF: Multi-turn Jailbreaking via Global Refinement and Active Fabrication
par: Tang, Hua, et autres
Publié: (2025)
par: Tang, Hua, et autres
Publié: (2025)
Iterative Prompting with Persuasion Skills in Jailbreaking Large Language Models
par: Ke, Shih-Wen, et autres
Publié: (2025)
par: Ke, Shih-Wen, et autres
Publié: (2025)
Timo: Towards Better Temporal Reasoning for Language Models
par: Su, Zhaochen, et autres
Publié: (2024)
par: Su, Zhaochen, et autres
Publié: (2024)
Documents similaires
-
from Benign import Toxic: Jailbreaking the Language Model via Adversarial Metaphors
par: Yan, Yu, et autres
Publié: (2025) -
Collaborative Stance Detection via Small-Large Language Model Consistency Verification
par: Yan, Yu, et autres
Publié: (2025) -
Jailbreak-as-a-Service++: Unveiling Distributed AI-Driven Malicious Information Campaigns Powered by LLM Crowdsourcing
par: Yan, Yu, et autres
Publié: (2025) -
EasyJailbreak: A Unified Framework for Jailbreaking Large Language Models
par: Zhou, Weikang, et autres
Publié: (2024) -
Stealthy Jailbreak Attacks on Large Language Models via Benign Data Mirroring
par: Mu, Honglin, et autres
Publié: (2024)