CodeChameleon: Personalized Encryption Framework for Jailbreaking Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Lv, Huijie, Wang, Xiao, Zhang, Yuansen, Huang, Caishuang, Dou, Shihan, Ye, Junjie, Gui, Tao, Zhang, Qi, Huang, Xuanjing |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SafeAligner: Safety Alignment against Jailbreak Attacks via Response Disparity Guidance
por: Huang, Caishuang, et al.
Publicado: (2024)
por: Huang, Caishuang, et al.
Publicado: (2024)
Design and Prototype of a Unified Framework for Error-robust Compression and Encryption in IoT
por: Kuldeep, Gajraj, et al.
Publicado: (2024)
por: Kuldeep, Gajraj, et al.
Publicado: (2024)
Subspace Defense: Discarding Adversarial Perturbations by Learning a Subspace for Clean Signals
por: Zheng, Rui, et al.
Publicado: (2024)
por: Zheng, Rui, et al.
Publicado: (2024)
Reasoning Hijacking: The Fragility of Reasoning Alignment in Large Language Models
por: Liu, Yuansen, et al.
Publicado: (2026)
por: Liu, Yuansen, et al.
Publicado: (2026)
Defending against Jailbreak through Early Exit Generation of Large Language Models
por: Zhao, Chongwen, et al.
Publicado: (2024)
por: Zhao, Chongwen, et al.
Publicado: (2024)
Can LLM Infer Risk Information From MCP Server System Logs?
por: Fu, Jiayi, et al.
Publicado: (2025)
por: Fu, Jiayi, et al.
Publicado: (2025)
EquaCode: A Multi-Strategy Jailbreak Approach for Large Language Models via Equation Solving and Code Completion
por: Liang, Zhen, et al.
Publicado: (2025)
por: Liang, Zhen, et al.
Publicado: (2025)
JADES: A Universal Framework for Jailbreak Assessment via Decompositional Scoring
por: Chu, Junjie, et al.
Publicado: (2025)
por: Chu, Junjie, et al.
Publicado: (2025)
JPRO: Automated Multimodal Jailbreaking via Multi-Agent Collaboration Framework
por: Zhou, Yuxuan, et al.
Publicado: (2025)
por: Zhou, Yuxuan, et al.
Publicado: (2025)
JailbreaksOverTime: Detecting Jailbreak Attacks Under Distribution Shift
por: Piet, Julien, et al.
Publicado: (2025)
por: Piet, Julien, et al.
Publicado: (2025)
PenHeal: A Two-Stage LLM Framework for Automated Pentesting and Optimal Remediation
por: Huang, Junjie, et al.
Publicado: (2024)
por: Huang, Junjie, et al.
Publicado: (2024)
Reasoning-Oriented Programming: Chaining Semantic Gadgets to Jailbreak Large Vision Language Models
por: Zou, Quanchen, et al.
Publicado: (2026)
por: Zou, Quanchen, et al.
Publicado: (2026)
How Jailbreak Defenses Work and Ensemble? A Mechanistic Investigation
por: Long, Zhuohang, et al.
Publicado: (2025)
por: Long, Zhuohang, et al.
Publicado: (2025)
VENENA: A Deceptive Visual Encryption Framework for Wireless Semantic Secrecy
por: Han, Bin, et al.
Publicado: (2025)
por: Han, Bin, et al.
Publicado: (2025)
RAJ-PGA: Reasoning-Activated Jailbreak and Principle-Guided Alignment Framework for Large Reasoning Models
por: Chen, Jianhao, et al.
Publicado: (2025)
por: Chen, Jianhao, et al.
Publicado: (2025)
FuzzLLM: A Novel and Universal Fuzzing Framework for Proactively Discovering Jailbreak Vulnerabilities in Large Language Models
por: Yao, Dongyu, et al.
Publicado: (2023)
por: Yao, Dongyu, et al.
Publicado: (2023)
An Automated Attack Investigation Approach Leveraging Threat-Knowledge-Augmented Large Language Models
por: Dai, Rujie, et al.
Publicado: (2025)
por: Dai, Rujie, et al.
Publicado: (2025)
AJAR: Adaptive Jailbreak Architecture for Red-teaming
por: Dou, Yipu, et al.
Publicado: (2026)
por: Dou, Yipu, et al.
Publicado: (2026)
Image Encryption via Data-Identified Discrete Chaotic Maps
por: Li, Wenyuan, et al.
Publicado: (2026)
por: Li, Wenyuan, et al.
Publicado: (2026)
Sequential Comics for Jailbreaking Multimodal Large Language Models via Structured Visual Storytelling
por: Zhang, Deyue, et al.
Publicado: (2025)
por: Zhang, Deyue, et al.
Publicado: (2025)
SQL Injection Jailbreak: A Structural Disaster of Large Language Models
por: Zhao, Jiawei, et al.
Publicado: (2024)
por: Zhao, Jiawei, et al.
Publicado: (2024)
Chameleon: An Efficient FHE Scheme Switching Acceleration on GPUs
por: Wang, Zhiwei, et al.
Publicado: (2024)
por: Wang, Zhiwei, et al.
Publicado: (2024)
VulMCI : Code Splicing-based Pixel-row Oversampling for More Continuous Vulnerability Image Generation
por: Peng, Tao, et al.
Publicado: (2024)
por: Peng, Tao, et al.
Publicado: (2024)
Conditional Encryption with Applications to Secure Personalized Password Typo Correction
por: Ameri, Mohammad Hassan, et al.
Publicado: (2024)
por: Ameri, Mohammad Hassan, et al.
Publicado: (2024)
Implementation of Entropically Secure Encryption: Securing Personal Health Data
por: Temel, Mehmet Hüseyin, et al.
Publicado: (2024)
por: Temel, Mehmet Hüseyin, et al.
Publicado: (2024)
NeuroBreak: Unveil Internal Jailbreak Mechanisms in Large Language Models
por: Zhang, Chuhan, et al.
Publicado: (2025)
por: Zhang, Chuhan, et al.
Publicado: (2025)
Why does weak-OOD help? A Further Step Towards Understanding Jailbreaking VLMs
por: Zhou, Yuxuan, et al.
Publicado: (2025)
por: Zhou, Yuxuan, et al.
Publicado: (2025)
MasterKey: Automated Jailbreak Across Multiple Large Language Model Chatbots
por: Deng, Gelei, et al.
Publicado: (2023)
por: Deng, Gelei, et al.
Publicado: (2023)
EncGPT: A Multi-Agent Workflow for Dynamic Encryption Algorithms
por: Li, Donghe, et al.
Publicado: (2025)
por: Li, Donghe, et al.
Publicado: (2025)
JailbreakLens: Interpreting Jailbreak Mechanism in the Lens of Representation and Circuit
por: He, Zeqing, et al.
Publicado: (2024)
por: He, Zeqing, et al.
Publicado: (2024)
VERA: Variational Inference Framework for Jailbreaking Large Language Models
por: Lochab, Anamika, et al.
Publicado: (2025)
por: Lochab, Anamika, et al.
Publicado: (2025)
Prefix Probing: Lightweight Harmful Content Detection for Large Language Models
por: Yang, Jirui, et al.
Publicado: (2025)
por: Yang, Jirui, et al.
Publicado: (2025)
TEMPLATEFUZZ: Fine-Grained Chat Template Fuzzing for Jailbreaking and Red Teaming LLMs
por: Shen, Qingchao, et al.
Publicado: (2026)
por: Shen, Qingchao, et al.
Publicado: (2026)
A Dual-Layer Image Encryption Framework Using Chaotic AES with Dynamic S-Boxes and Steganographic QR Codes
por: Bayesh, Md Rishadul, et al.
Publicado: (2025)
por: Bayesh, Md Rishadul, et al.
Publicado: (2025)
Adjacent Words, Divergent Intents: Jailbreaking Large Language Models via Task Concurrency
por: Jiang, Yukun, et al.
Publicado: (2025)
por: Jiang, Yukun, et al.
Publicado: (2025)
A generalized motif-based Naïve Bayes model for sign prediction in complex networks
por: Ran, Yijun, et al.
Publicado: (2025)
por: Ran, Yijun, et al.
Publicado: (2025)
PII Jailbreaking in LLMs via Activation Steering Reveals Personal Information Leakage
por: Nakka, Krishna Kanth, et al.
Publicado: (2025)
por: Nakka, Krishna Kanth, et al.
Publicado: (2025)
SNNGX: Securing Spiking Neural Networks with Genetic XOR Encryption on RRAM-based Neuromorphic Accelerator
por: Wong, Kwunhang, et al.
Publicado: (2024)
por: Wong, Kwunhang, et al.
Publicado: (2024)
Multi-Input Ciphertext Multiplication for Homomorphic Encryption
por: Akherati, Sajjad, et al.
Publicado: (2026)
por: Akherati, Sajjad, et al.
Publicado: (2026)
Tit-for-Tat: Safeguarding Large Vision-Language Models Against Jailbreak Attacks via Adversarial Defense
por: Hao, Shuyang, et al.
Publicado: (2025)
por: Hao, Shuyang, et al.
Publicado: (2025)
Ejemplares similares
-
SafeAligner: Safety Alignment against Jailbreak Attacks via Response Disparity Guidance
por: Huang, Caishuang, et al.
Publicado: (2024) -
Design and Prototype of a Unified Framework for Error-robust Compression and Encryption in IoT
por: Kuldeep, Gajraj, et al.
Publicado: (2024) -
Subspace Defense: Discarding Adversarial Perturbations by Learning a Subspace for Clean Signals
por: Zheng, Rui, et al.
Publicado: (2024) -
Reasoning Hijacking: The Fragility of Reasoning Alignment in Large Language Models
por: Liu, Yuansen, et al.
Publicado: (2026) -
Defending against Jailbreak through Early Exit Generation of Large Language Models
por: Zhao, Chongwen, et al.
Publicado: (2024)