Structured Semantic Cloaking for Jailbreak Attacks on Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Sun, Xiaobing, Lam, Perry, Li, Shaohua, Wang, Zizhou, Goh, Rick Siow Mong, Liu, Yong, Zhen, Liangli |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Cross-Modal Obfuscation for Jailbreak Attacks on Large Vision-Language Models
von: Jiang, Lei, et al.
Veröffentlicht: (2025)
von: Jiang, Lei, et al.
Veröffentlicht: (2025)
How Interpretable are Reasoning Explanations from Prompting Large Language Models?
von: Yeo, Wei Jie, et al.
Veröffentlicht: (2024)
von: Yeo, Wei Jie, et al.
Veröffentlicht: (2024)
MaskedCLIP: Bridging the Masked and CLIP Space for Semi-Supervised Medical Vision-Language Pre-training
von: Zhu, Lei, et al.
Veröffentlicht: (2025)
von: Zhu, Lei, et al.
Veröffentlicht: (2025)
AdvMIM: Adversarial Masked Image Modeling for Semi-Supervised Medical Image Segmentation
von: Zhu, Lei, et al.
Veröffentlicht: (2025)
von: Zhu, Lei, et al.
Veröffentlicht: (2025)
Aligning Medical Conversational AI through Online Reinforcement Learning with Information-Theoretic Rewards
von: Verma, Tanvi, et al.
Veröffentlicht: (2026)
von: Verma, Tanvi, et al.
Veröffentlicht: (2026)
Jailbreak Attacks and Defenses Against Large Language Models: A Survey
von: Yi, Sibo, et al.
Veröffentlicht: (2024)
von: Yi, Sibo, et al.
Veröffentlicht: (2024)
Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models
von: Tu, Shangqing, et al.
Veröffentlicht: (2024)
von: Tu, Shangqing, et al.
Veröffentlicht: (2024)
Jailbreaking Large Language Models with Morality Attacks
von: Su, Ying, et al.
Veröffentlicht: (2026)
von: Su, Ying, et al.
Veröffentlicht: (2026)
QueryAttack: Jailbreaking Aligned Large Language Models Using Structured Non-natural Query Language
von: Zou, Qingsong, et al.
Veröffentlicht: (2025)
von: Zou, Qingsong, et al.
Veröffentlicht: (2025)
Defending Large Language Models against Jailbreak Attacks via Semantic Smoothing
von: Ji, Jiabao, et al.
Veröffentlicht: (2024)
von: Ji, Jiabao, et al.
Veröffentlicht: (2024)
Enabling Energy-Efficient Deployment of Large Language Models on Memristor Crossbar: A Synergy of Large and Small
von: Wang, Zhehui, et al.
Veröffentlicht: (2024)
von: Wang, Zhehui, et al.
Veröffentlicht: (2024)
TAO-Attack: Toward Advanced Optimization-Based Jailbreak Attacks for Large Language Models
von: Xu, Zhi, et al.
Veröffentlicht: (2026)
von: Xu, Zhi, et al.
Veröffentlicht: (2026)
Response Attack: Exploiting Contextual Priming to Jailbreak Large Language Models
von: Miao, Ziqi, et al.
Veröffentlicht: (2025)
von: Miao, Ziqi, et al.
Veröffentlicht: (2025)
AttackEval: How to Evaluate the Effectiveness of Jailbreak Attacking on Large Language Models
von: Shu, Dong, et al.
Veröffentlicht: (2024)
von: Shu, Dong, et al.
Veröffentlicht: (2024)
StructuralSleight: Automated Jailbreak Attacks on Large Language Models Utilizing Uncommon Text-Organization Structures
von: Li, Bangxin, et al.
Veröffentlicht: (2024)
von: Li, Bangxin, et al.
Veröffentlicht: (2024)
JailbreakLens: Visual Analysis of Jailbreak Attacks Against Large Language Models
von: Feng, Yingchaojie, et al.
Veröffentlicht: (2024)
von: Feng, Yingchaojie, et al.
Veröffentlicht: (2024)
Unified Defense for Large Language Models against Jailbreak and Fine-Tuning Attacks in Education
von: Yi, Xin, et al.
Veröffentlicht: (2025)
von: Yi, Xin, et al.
Veröffentlicht: (2025)
Multi-Turn Context Jailbreak Attack on Large Language Models From First Principles
von: Sun, Xiongtao, et al.
Veröffentlicht: (2024)
von: Sun, Xiongtao, et al.
Veröffentlicht: (2024)
Continuous Embedding Attacks via Clipped Inputs in Jailbreaking Large Language Models
von: Xu, Zihao, et al.
Veröffentlicht: (2024)
von: Xu, Zihao, et al.
Veröffentlicht: (2024)
Distract Large Language Models for Automatic Jailbreak Attack
von: Xiao, Zeguan, et al.
Veröffentlicht: (2024)
von: Xiao, Zeguan, et al.
Veröffentlicht: (2024)
LLM-Virus: Evolutionary Jailbreak Attack on Large Language Models
von: Yu, Miao, et al.
Veröffentlicht: (2024)
von: Yu, Miao, et al.
Veröffentlicht: (2024)
Defending Large Language Models Against Jailbreaking Attacks Through Goal Prioritization
von: Zhang, Zhexin, et al.
Veröffentlicht: (2023)
von: Zhang, Zhexin, et al.
Veröffentlicht: (2023)
From Generalist to Specialist: Adapting Vision Language Models via Task-Specific Visual Instruction Tuning
von: Bai, Yang, et al.
Veröffentlicht: (2024)
von: Bai, Yang, et al.
Veröffentlicht: (2024)
AiRacleX: Automated Detection of Price Oracle Manipulations via LLM-Driven Knowledge Mining and Prompt Generation
von: Gao, Bo, et al.
Veröffentlicht: (2025)
von: Gao, Bo, et al.
Veröffentlicht: (2025)
An Aggregation-Free Federated Learning for Tackling Data Heterogeneity
von: Wang, Yuan, et al.
Veröffentlicht: (2024)
von: Wang, Yuan, et al.
Veröffentlicht: (2024)
Harnessing Task Overload for Scalable Jailbreak Attacks on Large Language Models
von: Dong, Yiting, et al.
Veröffentlicht: (2024)
von: Dong, Yiting, et al.
Veröffentlicht: (2024)
Stealthy Jailbreak Attacks on Large Language Models via Benign Data Mirroring
von: Mu, Honglin, et al.
Veröffentlicht: (2024)
von: Mu, Honglin, et al.
Veröffentlicht: (2024)
Weak-to-Strong Jailbreaking on Large Language Models
von: Zhao, Xuandong, et al.
Veröffentlicht: (2024)
von: Zhao, Xuandong, et al.
Veröffentlicht: (2024)
Jailbreaking Attack against Multimodal Large Language Model
von: Niu, Zhenxing, et al.
Veröffentlicht: (2024)
von: Niu, Zhenxing, et al.
Veröffentlicht: (2024)
Reasoning-Augmented Conversation for Multi-Turn Jailbreak Attacks on Large Language Models
von: Ying, Zonghao, et al.
Veröffentlicht: (2025)
von: Ying, Zonghao, et al.
Veröffentlicht: (2025)
Semantic and Structural Analysis of Implicit Biases in Large Language Models: An Interpretable Approach
von: Zhang, Renhan, et al.
Veröffentlicht: (2025)
von: Zhang, Renhan, et al.
Veröffentlicht: (2025)
RobustKV: Defending Large Language Models against Jailbreak Attacks via KV Eviction
von: Jiang, Tanqiu, et al.
Veröffentlicht: (2024)
von: Jiang, Tanqiu, et al.
Veröffentlicht: (2024)
Can Large Language Models Automatically Jailbreak GPT-4V?
von: Wu, Yuanwei, et al.
Veröffentlicht: (2024)
von: Wu, Yuanwei, et al.
Veröffentlicht: (2024)
LASH: Adaptive Semantic Hybridization for Black-Box Jailbreaking of Large Language Models
von: Nafi, Abdullah Al Nomaan, et al.
Veröffentlicht: (2026)
von: Nafi, Abdullah Al Nomaan, et al.
Veröffentlicht: (2026)
Jailbreaking Leaves a Trace: Understanding and Detecting Jailbreak Attacks from Internal Representations of Large Language Models
von: Kadali, Sri Durga Sai Sowmya, et al.
Veröffentlicht: (2026)
von: Kadali, Sri Durga Sai Sowmya, et al.
Veröffentlicht: (2026)
THRD: A Training-Free Multi-Turn Defense Framework for Jailbreak Attacks on Large Language Models
von: Ma, Zhiqing, et al.
Veröffentlicht: (2026)
von: Ma, Zhiqing, et al.
Veröffentlicht: (2026)
CCJA: Context-Coherent Jailbreak Attack for Aligned Large Language Models
von: Zhou, Guanghao, et al.
Veröffentlicht: (2025)
von: Zhou, Guanghao, et al.
Veröffentlicht: (2025)
Defending Large Language Models Against Jailbreak Attacks via In-Decoding Safety-Awareness Probing
von: Zhao, Yinzhi, et al.
Veröffentlicht: (2026)
von: Zhao, Yinzhi, et al.
Veröffentlicht: (2026)
Round Trip Translation Defence against Large Language Model Jailbreaking Attacks
von: Yung, Canaan, et al.
Veröffentlicht: (2024)
von: Yung, Canaan, et al.
Veröffentlicht: (2024)
Partially Supervised Unpaired Multi-Modal Learning for Label-Efficient Medical Image Segmentation
von: Zhu, Lei, et al.
Veröffentlicht: (2025)
von: Zhu, Lei, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Cross-Modal Obfuscation for Jailbreak Attacks on Large Vision-Language Models
von: Jiang, Lei, et al.
Veröffentlicht: (2025) -
How Interpretable are Reasoning Explanations from Prompting Large Language Models?
von: Yeo, Wei Jie, et al.
Veröffentlicht: (2024) -
MaskedCLIP: Bridging the Masked and CLIP Space for Semi-Supervised Medical Vision-Language Pre-training
von: Zhu, Lei, et al.
Veröffentlicht: (2025) -
AdvMIM: Adversarial Masked Image Modeling for Semi-Supervised Medical Image Segmentation
von: Zhu, Lei, et al.
Veröffentlicht: (2025) -
Aligning Medical Conversational AI through Online Reinforcement Learning with Information-Theoretic Rewards
von: Verma, Tanvi, et al.
Veröffentlicht: (2026)