TrajGuard: Streaming Hidden-state Trajectory Detection for Decoding-time Jailbreak Defense
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Cheng, Liu, Xiaolei, Li, Xingyu, Xin, Bangzhou, Ding, Kangyi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LoopLLM: Transferable Energy-Latency Attacks in LLMs via Repetitive Generation
por: Li, Xingyu, et al.
Publicado: (2025)
por: Li, Xingyu, et al.
Publicado: (2025)
INK: Inheritable Natural Backdoor Attack Against Model Distillation
por: Liu, Xiaolei, et al.
Publicado: (2023)
por: Liu, Xiaolei, et al.
Publicado: (2023)
TrajAD: Trajectory Anomaly Detection for Trustworthy LLM Agents
por: Liu, Yibing, et al.
Publicado: (2026)
por: Liu, Yibing, et al.
Publicado: (2026)
A Comprehensive Study of Jailbreak Attack versus Defense for Large Language Models
por: Xu, Zihao, et al.
Publicado: (2024)
por: Xu, Zihao, et al.
Publicado: (2024)
Data to Defense: The Role of Curation in Customizing LLMs Against Jailbreaking Attacks
por: Liu, Xiaoqun, et al.
Publicado: (2024)
por: Liu, Xiaoqun, et al.
Publicado: (2024)
Bleeding Pathways: Vanishing Discriminability in LLM Hidden States Fuels Jailbreak Attacks
por: Zhang, Yingjie, et al.
Publicado: (2025)
por: Zhang, Yingjie, et al.
Publicado: (2025)
JPU: Bridging Jailbreak Defense and Unlearning via On-Policy Path Rectification
por: Wang, Xi, et al.
Publicado: (2026)
por: Wang, Xi, et al.
Publicado: (2026)
Guaranteed Jailbreaking Defense via Disrupt-and-Rectify Smoothing
por: Lin, Zheng, et al.
Publicado: (2026)
por: Lin, Zheng, et al.
Publicado: (2026)
Constitutional Classifiers++: Efficient Production-Grade Defenses against Universal Jailbreaks
por: Cunningham, Hoagy, et al.
Publicado: (2026)
por: Cunningham, Hoagy, et al.
Publicado: (2026)
A-MemGuard: A Proactive Defense Framework for LLM-Based Agent Memory
por: Wei, Qianshan, et al.
Publicado: (2025)
por: Wei, Qianshan, et al.
Publicado: (2025)
Enhancing Model Defense Against Jailbreaks with Proactive Safety Reasoning
por: Yang, Xianglin, et al.
Publicado: (2025)
por: Yang, Xianglin, et al.
Publicado: (2025)
Evolving Security in LLMs: A Study of Jailbreak Attacks and Defenses
por: Shang, Zhengchun, et al.
Publicado: (2025)
por: Shang, Zhengchun, et al.
Publicado: (2025)
KG-DF: A Black-box Defense Framework against Jailbreak Attacks Based on Knowledge Graphs
por: Liu, Shuyuan, et al.
Publicado: (2025)
por: Liu, Shuyuan, et al.
Publicado: (2025)
Hidden You Malicious Goal Into Benign Narratives: Jailbreak Large Language Models through Logic Chain Injection
por: Wang, Zhilong, et al.
Publicado: (2024)
por: Wang, Zhilong, et al.
Publicado: (2024)
CAVGAN: Unifying Jailbreak and Defense of LLMs via Generative Adversarial Attacks on their Internal Representations
por: Li, Xiaohu, et al.
Publicado: (2025)
por: Li, Xiaohu, et al.
Publicado: (2025)
A Causal Perspective for Enhancing Jailbreak Attack and Defense
por: Pan, Licheng, et al.
Publicado: (2026)
por: Pan, Licheng, et al.
Publicado: (2026)
How Jailbreak Defenses Work and Ensemble? A Mechanistic Investigation
por: Long, Zhuohang, et al.
Publicado: (2025)
por: Long, Zhuohang, et al.
Publicado: (2025)
Sentra-Guard: A Real-Time Multilingual Defense Against Adversarial LLM Prompts
por: Hasan, Md. Mehedi, et al.
Publicado: (2025)
por: Hasan, Md. Mehedi, et al.
Publicado: (2025)
DELMAN: Dynamic Defense Against Large Language Model Jailbreaking with Model Editing
por: Wang, Yi, et al.
Publicado: (2025)
por: Wang, Yi, et al.
Publicado: (2025)
MirrorShield: Towards Universal Defense Against Jailbreaks via Entropy-Guided Mirror Crafting
por: Pu, Rui, et al.
Publicado: (2025)
por: Pu, Rui, et al.
Publicado: (2025)
Decoding FL Defenses: Systemization, Pitfalls, and Remedies
por: Khan, Momin Ahmad, et al.
Publicado: (2025)
por: Khan, Momin Ahmad, et al.
Publicado: (2025)
Formalization Driven LLM Prompt Jailbreaking via Reinforcement Learning
por: Wang, Zhaoqi, et al.
Publicado: (2025)
por: Wang, Zhaoqi, et al.
Publicado: (2025)
ExplainableGuard: Interpretable Adversarial Defense for Large Language Models Using Chain-of-Thought Reasoning
por: Guan, Shaowei, et al.
Publicado: (2025)
por: Guan, Shaowei, et al.
Publicado: (2025)
CCFC: Core & Core-Full-Core Dual-Track Defense for LLM Jailbreak Protection
por: Hu, Jiaming, et al.
Publicado: (2025)
por: Hu, Jiaming, et al.
Publicado: (2025)
Bidirectional Intention Inference Enhances LLMs' Defense Against Multi-Turn Jailbreak Attacks
por: Tong, Haibo, et al.
Publicado: (2025)
por: Tong, Haibo, et al.
Publicado: (2025)
MCP-Guard: A Multi-Stage Defense-in-Depth Framework for Securing Model Context Protocol in Agentic AI
por: Xing, Wenpeng, et al.
Publicado: (2025)
por: Xing, Wenpeng, et al.
Publicado: (2025)
Red-teaming the Multimodal Reasoning: Jailbreaking Vision-Language Models via Cross-modal Entanglement Attacks
por: Yan, Yu, et al.
Publicado: (2026)
por: Yan, Yu, et al.
Publicado: (2026)
GUARD-SLM: Token Activation-Based Defense Against Jailbreak Attacks for Small Language Models
por: Mia, Md Jueal, et al.
Publicado: (2026)
por: Mia, Md Jueal, et al.
Publicado: (2026)
ShellForge: Adversarial Co-Evolution of Webshell Generation and Multi-View Detection for Robust Webshell Defense
por: Ding, Yizhong
Publicado: (2026)
por: Ding, Yizhong
Publicado: (2026)
Jailbreaking Large Language Models through Iterative Tool-Disguised Attacks via Reinforcement Learning
por: Wang, Zhaoqi, et al.
Publicado: (2026)
por: Wang, Zhaoqi, et al.
Publicado: (2026)
SafeMobile: Chain-level Jailbreak Detection and Automated Evaluation for Multimodal Mobile Agents
por: Liang, Siyuan, et al.
Publicado: (2025)
por: Liang, Siyuan, et al.
Publicado: (2025)
TinyGuard:A lightweight Byzantine Defense for Resource-Constrained Federated Learning via Statistical Update Fingerprints
por: Mahdavi, Ali, et al.
Publicado: (2026)
por: Mahdavi, Ali, et al.
Publicado: (2026)
DistillGuard: Evaluating Defenses Against LLM Knowledge Distillation
por: Jiang, Bo
Publicado: (2026)
por: Jiang, Bo
Publicado: (2026)
ShallowJail: Steering Jailbreaks against Large Language Models
por: Liu, Shang, et al.
Publicado: (2026)
por: Liu, Shang, et al.
Publicado: (2026)
GuardReasoner-VL: Safeguarding VLMs via Reinforced Reasoning
por: Liu, Yue, et al.
Publicado: (2025)
por: Liu, Yue, et al.
Publicado: (2025)
A Cross-Language Investigation into Jailbreak Attacks in Large Language Models
por: Li, Jie, et al.
Publicado: (2024)
por: Li, Jie, et al.
Publicado: (2024)
NegBLEURT Forest: Leveraging Inconsistencies for Detecting Jailbreak Attacks
por: Sleem, Lama, et al.
Publicado: (2025)
por: Sleem, Lama, et al.
Publicado: (2025)
JailDAM: Jailbreak Detection with Adaptive Memory for Vision-Language Model
por: Nian, Yi, et al.
Publicado: (2025)
por: Nian, Yi, et al.
Publicado: (2025)
X-Guard: Multilingual Guard Agent for Content Moderation
por: Upadhayay, Bibek, et al.
Publicado: (2025)
por: Upadhayay, Bibek, et al.
Publicado: (2025)
MoJE: Mixture of Jailbreak Experts, Naive Tabular Classifiers as Guard for Prompt Attacks
por: Cornacchia, Giandomenico, et al.
Publicado: (2024)
por: Cornacchia, Giandomenico, et al.
Publicado: (2024)
Ejemplares similares
-
LoopLLM: Transferable Energy-Latency Attacks in LLMs via Repetitive Generation
por: Li, Xingyu, et al.
Publicado: (2025) -
INK: Inheritable Natural Backdoor Attack Against Model Distillation
por: Liu, Xiaolei, et al.
Publicado: (2023) -
TrajAD: Trajectory Anomaly Detection for Trustworthy LLM Agents
por: Liu, Yibing, et al.
Publicado: (2026) -
A Comprehensive Study of Jailbreak Attack versus Defense for Large Language Models
por: Xu, Zihao, et al.
Publicado: (2024) -
Data to Defense: The Role of Curation in Customizing LLMs Against Jailbreaking Attacks
por: Liu, Xiaoqun, et al.
Publicado: (2024)