TRYLOCK: Defense-in-Depth Against LLM Jailbreaks via Layered Preference and Representation Engineering
Fuente:
arXiv
Salvato in:
| Autore principale: | Thornton, Scott |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Can Adversarial Code Comments Fool AI Security Reviewers -- Large-Scale Empirical Study of Comment-Based Attacks and Defenses Against LLM Code Analysis
di: Thornton, Scott
Pubblicazione: (2026)
di: Thornton, Scott
Pubblicazione: (2026)
Semantic Chameleon: Corpus-Dependent Poisoning Attacks and Defenses in RAG Systems
di: Thornton, Scott
Pubblicazione: (2026)
di: Thornton, Scott
Pubblicazione: (2026)
The Attacker Moves Second: Stronger Adaptive Attacks Bypass Defenses Against Llm Jailbreaks and Prompt Injections
di: Nasr, Milad, et al.
Pubblicazione: (2025)
di: Nasr, Milad, et al.
Pubblicazione: (2025)
AutoDefense: Multi-Agent LLM Defense against Jailbreak Attacks
di: Zeng, Yifan, et al.
Pubblicazione: (2024)
di: Zeng, Yifan, et al.
Pubblicazione: (2024)
Break the Breakout: Reinventing LM Defense Against Jailbreak Attacks with Self-Refinement
di: Kim, Heegyu, et al.
Pubblicazione: (2024)
di: Kim, Heegyu, et al.
Pubblicazione: (2024)
Attacks and Defenses Against LLM Fingerprinting
di: Kurian, Kevin, et al.
Pubblicazione: (2025)
di: Kurian, Kevin, et al.
Pubblicazione: (2025)
Retrieval Pivot Attacks in Hybrid RAG: Measuring and Mitigating Amplified Leakage from Vector Seeds to Graph Expansion
di: Thornton, Scott
Pubblicazione: (2026)
di: Thornton, Scott
Pubblicazione: (2026)
A Multi-Agent LLM Defense Pipeline Against Prompt Injection Attacks
di: Hossain, S M Asif, et al.
Pubblicazione: (2025)
di: Hossain, S M Asif, et al.
Pubblicazione: (2025)
T2VShield: Model-Agnostic Jailbreak Defense for Text-to-Video Models
di: Liang, Siyuan, et al.
Pubblicazione: (2025)
di: Liang, Siyuan, et al.
Pubblicazione: (2025)
Adaptive Attacks Break Defenses Against Indirect Prompt Injection Attacks on LLM Agents
di: Zhan, Qiusi, et al.
Pubblicazione: (2025)
di: Zhan, Qiusi, et al.
Pubblicazione: (2025)
Voice Jailbreak Attacks Against GPT-4o
di: Shen, Xinyue, et al.
Pubblicazione: (2024)
di: Shen, Xinyue, et al.
Pubblicazione: (2024)
A Systematic Literature Review on LLM Defenses Against Prompt Injection and Jailbreaking: Expanding NIST Taxonomy
di: Correia, Pedro H. Barcha, et al.
Pubblicazione: (2026)
di: Correia, Pedro H. Barcha, et al.
Pubblicazione: (2026)
Jailbreak Attacks and Defenses Against Large Language Models: A Survey
di: Yi, Sibo, et al.
Pubblicazione: (2024)
di: Yi, Sibo, et al.
Pubblicazione: (2024)
FL-PLAS: Federated Learning with Partial Layer Aggregation for Backdoor Defense Against High-Ratio Malicious Clients
di: Zhang, Jianyi, et al.
Pubblicazione: (2025)
di: Zhang, Jianyi, et al.
Pubblicazione: (2025)
ADAGE: Active Defenses Against GNN Extraction
di: Xu, Jing, et al.
Pubblicazione: (2025)
di: Xu, Jing, et al.
Pubblicazione: (2025)
CENSOR: Defense Against Gradient Inversion via Orthogonal Subspace Bayesian Sampling
di: Zhang, Kaiyuan, et al.
Pubblicazione: (2025)
di: Zhang, Kaiyuan, et al.
Pubblicazione: (2025)
Testing the Limits of Jailbreaking Defenses with the Purple Problem
di: Kim, Taeyoun, et al.
Pubblicazione: (2024)
di: Kim, Taeyoun, et al.
Pubblicazione: (2024)
Dashed Line Defense: Plug-And-Play Defense Against Adaptive Score-Based Query Attacks
di: Fu, Yanzhang, et al.
Pubblicazione: (2026)
di: Fu, Yanzhang, et al.
Pubblicazione: (2026)
A No-Defense Defense Against Gradient-Based Adversarial Attacks on ML-NIDS: Is Less More?
di: elShehaby, Mohamed, et al.
Pubblicazione: (2026)
di: elShehaby, Mohamed, et al.
Pubblicazione: (2026)
LLM Defenses Are Not Robust to Multi-Turn Human Jailbreaks Yet
di: Li, Nathaniel, et al.
Pubblicazione: (2024)
di: Li, Nathaniel, et al.
Pubblicazione: (2024)
PECAN: A Deterministic Certified Defense Against Backdoor Attacks
di: Zhang, Yuhao, et al.
Pubblicazione: (2023)
di: Zhang, Yuhao, et al.
Pubblicazione: (2023)
A Causal Perspective for Enhancing Jailbreak Attack and Defense
di: Pan, Licheng, et al.
Pubblicazione: (2026)
di: Pan, Licheng, et al.
Pubblicazione: (2026)
FedSurrogate: Backdoor Defense in Federated Learning via Layer Criticality and Surrogate Replacement
di: Abacha, Fatima Z., et al.
Pubblicazione: (2026)
di: Abacha, Fatima Z., et al.
Pubblicazione: (2026)
Adaptive Probe-based Steering for Robust LLM Jailbreaking
di: Chen, Junxi, et al.
Pubblicazione: (2026)
di: Chen, Junxi, et al.
Pubblicazione: (2026)
SecureCode: A Production-Grade Multi-Turn Dataset for Training Security-Aware Code Generation Models
di: Thornton, Scott
Pubblicazione: (2025)
di: Thornton, Scott
Pubblicazione: (2025)
CEE: An Inference-Time Jailbreak Defense for Embodied Intelligence via Subspace Concept Rotation
di: Yang, Jirui, et al.
Pubblicazione: (2025)
di: Yang, Jirui, et al.
Pubblicazione: (2025)
Efficient Adversarial Malware Defense via Trust-Based Raw Override and Confidence-Adaptive Bit-Depth Reduction
di: Chaudhary, Ayush, et al.
Pubblicazione: (2025)
di: Chaudhary, Ayush, et al.
Pubblicazione: (2025)
A Systematic Survey of Security Threats and Defenses in LLM-Based AI Agents: A Layered Attack Surface Framework
di: Chu, Kexin
Pubblicazione: (2026)
di: Chu, Kexin
Pubblicazione: (2026)
SecAlign: Defending Against Prompt Injection with Preference Optimization
di: Chen, Sizhe, et al.
Pubblicazione: (2024)
di: Chen, Sizhe, et al.
Pubblicazione: (2024)
TwinGate: Stateful Defense against Decompositional Jailbreaks in Untraceable Traffic via Asymmetric Contrastive Learning
di: Sun, Bowen, et al.
Pubblicazione: (2026)
di: Sun, Bowen, et al.
Pubblicazione: (2026)
KDk: A Defense Mechanism Against Label Inference Attacks in Vertical Federated Learning
di: Arazzi, Marco, et al.
Pubblicazione: (2024)
di: Arazzi, Marco, et al.
Pubblicazione: (2024)
Defending Jailbreak Prompts via In-Context Adversarial Game
di: Zhou, Yujun, et al.
Pubblicazione: (2024)
di: Zhou, Yujun, et al.
Pubblicazione: (2024)
A Zero Trust Framework for Realization and Defense Against Generative AI Attacks in Power Grid
di: Munir, Md. Shirajum, et al.
Pubblicazione: (2024)
di: Munir, Md. Shirajum, et al.
Pubblicazione: (2024)
SecureLearn -- An Attack-agnostic Defense for Multiclass Machine Learning Against Data Poisoning Attacks
di: Paracha, Anum, et al.
Pubblicazione: (2025)
di: Paracha, Anum, et al.
Pubblicazione: (2025)
Sparsification Under Siege: Dual-Level Defense Against Poisoning in Communication-Efficient Federated Learning
di: Jin, Zhiyong, et al.
Pubblicazione: (2025)
di: Jin, Zhiyong, et al.
Pubblicazione: (2025)
Efficient Jailbreaking of Large Models by Freeze Training: Lower Layers Exhibit Greater Sensitivity to Harmful Content
di: Shen, Hongyuan, et al.
Pubblicazione: (2025)
di: Shen, Hongyuan, et al.
Pubblicazione: (2025)
Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Alignment
di: Ghosal, Soumya Suvra, et al.
Pubblicazione: (2024)
di: Ghosal, Soumya Suvra, et al.
Pubblicazione: (2024)
Optimal Defenses Against Gradient Reconstruction Attacks
di: Chen, Yuxiao, et al.
Pubblicazione: (2024)
di: Chen, Yuxiao, et al.
Pubblicazione: (2024)
A Defensive Framework Against Adversarial Attacks on Machine Learning-Based Network Intrusion Detection Systems
di: Tafreshian, Benyamin, et al.
Pubblicazione: (2025)
di: Tafreshian, Benyamin, et al.
Pubblicazione: (2025)
JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models
di: Chao, Patrick, et al.
Pubblicazione: (2024)
di: Chao, Patrick, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Can Adversarial Code Comments Fool AI Security Reviewers -- Large-Scale Empirical Study of Comment-Based Attacks and Defenses Against LLM Code Analysis
di: Thornton, Scott
Pubblicazione: (2026) -
Semantic Chameleon: Corpus-Dependent Poisoning Attacks and Defenses in RAG Systems
di: Thornton, Scott
Pubblicazione: (2026) -
The Attacker Moves Second: Stronger Adaptive Attacks Bypass Defenses Against Llm Jailbreaks and Prompt Injections
di: Nasr, Milad, et al.
Pubblicazione: (2025) -
AutoDefense: Multi-Agent LLM Defense against Jailbreak Attacks
di: Zeng, Yifan, et al.
Pubblicazione: (2024) -
Break the Breakout: Reinventing LM Defense Against Jailbreak Attacks with Self-Refinement
di: Kim, Heegyu, et al.
Pubblicazione: (2024)