SQL Injection Jailbreak: A Structural Disaster of Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhao, Jiawei, Chen, Kejiang, Zhang, Weiming, Yu, Nenghai |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Silent Guardian: Protecting Text from Malicious Exploitation by Large Language Models
di: Zhao, Jiawei, et al.
Pubblicazione: (2023)
di: Zhao, Jiawei, et al.
Pubblicazione: (2023)
Turning Your Strength into Watermark: Watermarking Large Language Model via Knowledge Injection
di: Li, Shuai, et al.
Pubblicazione: (2023)
di: Li, Shuai, et al.
Pubblicazione: (2023)
PSRT: Accelerating LRM-based Guard Models via Prefilled Safe Reasoning Traces
di: Zhao, Jiawei, et al.
Pubblicazione: (2025)
di: Zhao, Jiawei, et al.
Pubblicazione: (2025)
Performance-lossless Black-box Model Watermarking
di: Zhao, Na, et al.
Pubblicazione: (2023)
di: Zhao, Na, et al.
Pubblicazione: (2023)
Prefix Guidance: A Steering Wheel for Large Language Models to Defend Against Jailbreak Attacks
di: Zhao, Jiawei, et al.
Pubblicazione: (2024)
di: Zhao, Jiawei, et al.
Pubblicazione: (2024)
EditMark: Watermarking Large Language Models based on Model Editing
di: Li, Shuai, et al.
Pubblicazione: (2025)
di: Li, Shuai, et al.
Pubblicazione: (2025)
A high-capacity linguistic steganography based on entropy-driven rank-token mapping
di: Jiang, Jun, et al.
Pubblicazione: (2025)
di: Jiang, Jun, et al.
Pubblicazione: (2025)
InferDPT: Privacy-Preserving Inference for Closed-box Large Language Model
di: Tong, Meng, et al.
Pubblicazione: (2023)
di: Tong, Meng, et al.
Pubblicazione: (2023)
STEAD: Robust Provably Secure Linguistic Steganography with Diffusion Language Model
di: Qi, Yuang, et al.
Pubblicazione: (2026)
di: Qi, Yuang, et al.
Pubblicazione: (2026)
Provably Secure Public-Key Steganography Based on Admissible Encoding
di: Zhang, Xin, et al.
Pubblicazione: (2025)
di: Zhang, Xin, et al.
Pubblicazione: (2025)
Provably Secure Disambiguating Neural Linguistic Steganography
di: Qi, Yuang, et al.
Pubblicazione: (2024)
di: Qi, Yuang, et al.
Pubblicazione: (2024)
Provably Secure Agent Guardrail
di: Wu, Benlong, et al.
Pubblicazione: (2026)
di: Wu, Benlong, et al.
Pubblicazione: (2026)
GIFDL: Generated Image Fluctuation Distortion Learning for Enhancing Steganographic Security
di: Wang, Xiangkun, et al.
Pubblicazione: (2025)
di: Wang, Xiangkun, et al.
Pubblicazione: (2025)
On the Vulnerability of Text Sanitization
di: Tong, Meng, et al.
Pubblicazione: (2024)
di: Tong, Meng, et al.
Pubblicazione: (2024)
Gaussian Shading: Provable Performance-Lossless Image Watermarking for Diffusion Models
di: Yang, Zijin, et al.
Pubblicazione: (2024)
di: Yang, Zijin, et al.
Pubblicazione: (2024)
Membership Inference Attacks on Tokenizers of Large Language Models
di: Tong, Meng, et al.
Pubblicazione: (2025)
di: Tong, Meng, et al.
Pubblicazione: (2025)
Natias: Neuron Attribution based Transferable Image Adversarial Steganography
di: Fan, Zexin, et al.
Pubblicazione: (2024)
di: Fan, Zexin, et al.
Pubblicazione: (2024)
LiteUpdate: A Lightweight Framework for Updating AI-Generated Image Detectors
di: Lu, Jiajie, et al.
Pubblicazione: (2025)
di: Lu, Jiajie, et al.
Pubblicazione: (2025)
De-AntiFake: Rethinking the Protective Perturbations Against Voice Cloning Attacks
di: Fan, Wei, et al.
Pubblicazione: (2025)
di: Fan, Wei, et al.
Pubblicazione: (2025)
WavInWav: Time-domain Speech Hiding via Invertible Neural Network
di: Fan, Wei, et al.
Pubblicazione: (2025)
di: Fan, Wei, et al.
Pubblicazione: (2025)
AutoPT: How Far Are We from the End2End Automated Web Penetration Testing?
di: Wu, Benlong, et al.
Pubblicazione: (2024)
di: Wu, Benlong, et al.
Pubblicazione: (2024)
SemBind: Binding Diffusion Watermarks to Semantics Against Black-Box Forgery Attacks
di: Zhang, Xin, et al.
Pubblicazione: (2026)
di: Zhang, Xin, et al.
Pubblicazione: (2026)
Gaussian Shading++: Rethinking the Realistic Deployment Challenge of Performance-Lossless Image Watermark for Diffusion Models
di: Yang, Zijin, et al.
Pubblicazione: (2025)
di: Yang, Zijin, et al.
Pubblicazione: (2025)
An Empirical Study on the Effectiveness of Large Language Models for Binary Code Understanding
di: Shang, Xiuwei, et al.
Pubblicazione: (2025)
di: Shang, Xiuwei, et al.
Pubblicazione: (2025)
How Far Have We Gone in Binary Code Understanding Using Large Language Models
di: Shang, Xiuwei, et al.
Pubblicazione: (2024)
di: Shang, Xiuwei, et al.
Pubblicazione: (2024)
AISA: Awakening Intrinsic Safety Awareness in Large Language Models against Jailbreak Attacks
di: Song, Weiming, et al.
Pubblicazione: (2026)
di: Song, Weiming, et al.
Pubblicazione: (2026)
Token Highlighter: Inspecting and Mitigating Jailbreak Prompts for Large Language Models
di: Hu, Xiaomeng, et al.
Pubblicazione: (2024)
di: Hu, Xiaomeng, et al.
Pubblicazione: (2024)
Character as a Latent Variable in Large Language Models: A Mechanistic Account of Emergent Misalignment and Conditional Safety Failures
di: Su, Yanghao, et al.
Pubblicazione: (2026)
di: Su, Yanghao, et al.
Pubblicazione: (2026)
Persona Attack: Incremental Memory Injection Jailbreak Attack against Large Language Models
di: Park, Junyoung, et al.
Pubblicazione: (2026)
di: Park, Junyoung, et al.
Pubblicazione: (2026)
Reasoning-Oriented Programming: Chaining Semantic Gadgets to Jailbreak Large Vision Language Models
di: Zou, Quanchen, et al.
Pubblicazione: (2026)
di: Zou, Quanchen, et al.
Pubblicazione: (2026)
FoC: Figure out the Cryptographic Functions in Stripped Binaries with LLMs
di: Shang, Xiuwei, et al.
Pubblicazione: (2024)
di: Shang, Xiuwei, et al.
Pubblicazione: (2024)
On Jailbreaking Quantized Language Models Through Fault Injection Attacks
di: Zahran, Noureldin, et al.
Pubblicazione: (2025)
di: Zahran, Noureldin, et al.
Pubblicazione: (2025)
State-Dependent Safety Failures in Multi-Turn Language Model Interaction
di: Li, Pengcheng, et al.
Pubblicazione: (2026)
di: Li, Pengcheng, et al.
Pubblicazione: (2026)
Are Your LLM-based Text-to-SQL Models Secure? Exploring SQL Injection via Backdoor Attacks
di: Lin, Meiyu, et al.
Pubblicazione: (2025)
di: Lin, Meiyu, et al.
Pubblicazione: (2025)
Sequential Comics for Jailbreaking Multimodal Large Language Models via Structured Visual Storytelling
di: Zhang, Deyue, et al.
Pubblicazione: (2025)
di: Zhang, Deyue, et al.
Pubblicazione: (2025)
Towards Robust Multimodal Large Language Models Against Jailbreak Attacks
di: Yin, Ziyi, et al.
Pubblicazione: (2025)
di: Yin, Ziyi, et al.
Pubblicazione: (2025)
System Prompt Poisoning: Persistent Attacks on Large Language Models Beyond User Injection
di: Li, Zongze, et al.
Pubblicazione: (2025)
di: Li, Zongze, et al.
Pubblicazione: (2025)
MasterKey: Automated Jailbreak Across Multiple Large Language Model Chatbots
di: Deng, Gelei, et al.
Pubblicazione: (2023)
di: Deng, Gelei, et al.
Pubblicazione: (2023)
Hidden You Malicious Goal Into Benign Narratives: Jailbreak Large Language Models through Logic Chain Injection
di: Wang, Zhilong, et al.
Pubblicazione: (2024)
di: Wang, Zhilong, et al.
Pubblicazione: (2024)
AquaLoRA: Toward White-box Protection for Customized Stable Diffusion Models via Watermark LoRA
di: Feng, Weitao, et al.
Pubblicazione: (2024)
di: Feng, Weitao, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Silent Guardian: Protecting Text from Malicious Exploitation by Large Language Models
di: Zhao, Jiawei, et al.
Pubblicazione: (2023) -
Turning Your Strength into Watermark: Watermarking Large Language Model via Knowledge Injection
di: Li, Shuai, et al.
Pubblicazione: (2023) -
PSRT: Accelerating LRM-based Guard Models via Prefilled Safe Reasoning Traces
di: Zhao, Jiawei, et al.
Pubblicazione: (2025) -
Performance-lossless Black-box Model Watermarking
di: Zhao, Na, et al.
Pubblicazione: (2023) -
Prefix Guidance: A Steering Wheel for Large Language Models to Defend Against Jailbreak Attacks
di: Zhao, Jiawei, et al.
Pubblicazione: (2024)