GuardNet: Graph-Attention Filtering for Jailbreak Defense in Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Forough, Javad, Maheri, Mohammad, Haddadi, Hamed |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Dynamic Probabilistic Noise Injection for Membership Inference Defense
di: Forough, Javad, et al.
Pubblicazione: (2025)
di: Forough, Javad, et al.
Pubblicazione: (2025)
Verifiable Unlearning on Edge
di: Maheri, Mohammad M, et al.
Pubblicazione: (2025)
di: Maheri, Mohammad M, et al.
Pubblicazione: (2025)
Client Clustering Meets Knowledge Sharing: Enhancing Privacy and Robustness in Personalized Peer-to-Peer Learning
di: Maheri, Mohammad Mahdi, et al.
Pubblicazione: (2025)
di: Maheri, Mohammad Mahdi, et al.
Pubblicazione: (2025)
TeleSparse: Practical Privacy-Preserving Verification of Deep Neural Networks
di: Maheri, Mohammad M, et al.
Pubblicazione: (2025)
di: Maheri, Mohammad M, et al.
Pubblicazione: (2025)
ZK-APEX: Zero-Knowledge Approximate Personalized Unlearning with Executable Proofs
di: Maheri, Mohammad M, et al.
Pubblicazione: (2025)
di: Maheri, Mohammad M, et al.
Pubblicazione: (2025)
WARP: Weight Teleportation for Attack-Resilient Unlearning Protocols
di: Maheri, Mohammad M, et al.
Pubblicazione: (2025)
di: Maheri, Mohammad M, et al.
Pubblicazione: (2025)
P4: Towards private, personalized, and Peer-to-Peer learning
di: Maheri, Mohammad Mahdi, et al.
Pubblicazione: (2024)
di: Maheri, Mohammad Mahdi, et al.
Pubblicazione: (2024)
When Agents Handle Secrets: A Survey of Confidential Computing for Agentic AI
di: Forough, Javad, et al.
Pubblicazione: (2026)
di: Forough, Javad, et al.
Pubblicazione: (2026)
JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models
di: Chao, Patrick, et al.
Pubblicazione: (2024)
di: Chao, Patrick, et al.
Pubblicazione: (2024)
SmoothLLM: Defending Large Language Models Against Jailbreaking Attacks
di: Robey, Alexander, et al.
Pubblicazione: (2023)
di: Robey, Alexander, et al.
Pubblicazione: (2023)
Jailbreaking Black Box Large Language Models in Twenty Queries
di: Chao, Patrick, et al.
Pubblicazione: (2023)
di: Chao, Patrick, et al.
Pubblicazione: (2023)
UniGuard: Towards Universal Safety Guardrails for Jailbreak Attacks on Multimodal Large Language Models
di: Oh, Sejoon, et al.
Pubblicazione: (2024)
di: Oh, Sejoon, et al.
Pubblicazione: (2024)
Jailbreak Attacks and Defenses Against Large Language Models: A Survey
di: Yi, Sibo, et al.
Pubblicazione: (2024)
di: Yi, Sibo, et al.
Pubblicazione: (2024)
MELTing point: Mobile Evaluation of Language Transformers
di: Laskaridis, Stefanos, et al.
Pubblicazione: (2024)
di: Laskaridis, Stefanos, et al.
Pubblicazione: (2024)
Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations
di: Wei, Zeming, et al.
Pubblicazione: (2023)
di: Wei, Zeming, et al.
Pubblicazione: (2023)
AgenTEE: Confidential LLM Agent Execution on Edge Devices
di: Abdollahi, Sina, et al.
Pubblicazione: (2026)
di: Abdollahi, Sina, et al.
Pubblicazione: (2026)
Robust Hallucination Detection in LLMs via Adaptive Token Selection
di: Niu, Mengjia, et al.
Pubblicazione: (2025)
di: Niu, Mengjia, et al.
Pubblicazione: (2025)
GuardVal: Dynamic Large Language Model Jailbreak Evaluation for Comprehensive Safety Testing
di: Zhang, Peiyan, et al.
Pubblicazione: (2025)
di: Zhang, Peiyan, et al.
Pubblicazione: (2025)
Context-Aware Membership Inference Attacks against Pre-trained Large Language Models
di: Chang, Hongyan, et al.
Pubblicazione: (2024)
di: Chang, Hongyan, et al.
Pubblicazione: (2024)
Mitigating Hallucinations in Large Language Models via Self-Refinement-Enhanced Knowledge Retrieval
di: Niu, Mengjia, et al.
Pubblicazione: (2024)
di: Niu, Mengjia, et al.
Pubblicazione: (2024)
Attention-Aware GNN-based Input Defense against Multi-Turn LLM Jailbreak
di: Huang, Zixuan, et al.
Pubblicazione: (2025)
di: Huang, Zixuan, et al.
Pubblicazione: (2025)
Towards Real-Time ECG and EMG Modeling on $μ$NPUs
di: Millar, Josh, et al.
Pubblicazione: (2026)
di: Millar, Josh, et al.
Pubblicazione: (2026)
Energy-Aware Deep Learning on Resource-Constrained Hardware
di: Millar, Josh, et al.
Pubblicazione: (2025)
di: Millar, Josh, et al.
Pubblicazione: (2025)
Machine Learning with Confidential Computing: A Systematization of Knowledge
di: Mo, Fan, et al.
Pubblicazione: (2022)
di: Mo, Fan, et al.
Pubblicazione: (2022)
T2VShield: Model-Agnostic Jailbreak Defense for Text-to-Video Models
di: Liang, Siyuan, et al.
Pubblicazione: (2025)
di: Liang, Siyuan, et al.
Pubblicazione: (2025)
An Early Experience with Confidential Computing Architecture for On-Device Model Protection
di: Abdollahi, Sina, et al.
Pubblicazione: (2025)
di: Abdollahi, Sina, et al.
Pubblicazione: (2025)
Terracorder: Sense Long and Prosper
di: Millar, Josh, et al.
Pubblicazione: (2024)
di: Millar, Josh, et al.
Pubblicazione: (2024)
Privacy Challenges in Meta-Learning: An Investigation on Model-Agnostic Meta-Learning
di: Rafiei, Mina, et al.
Pubblicazione: (2024)
di: Rafiei, Mina, et al.
Pubblicazione: (2024)
AlignTree: Efficient Defense Against LLM Jailbreak Attacks
di: Goren, Gil, et al.
Pubblicazione: (2025)
di: Goren, Gil, et al.
Pubblicazione: (2025)
Improved Few-Shot Jailbreaking Can Circumvent Aligned Language Models and Their Defenses
di: Zheng, Xiaosen, et al.
Pubblicazione: (2024)
di: Zheng, Xiaosen, et al.
Pubblicazione: (2024)
Jailbreaking Large Language Models in Infinitely Many Ways
di: Goldstein, Oliver, et al.
Pubblicazione: (2025)
di: Goldstein, Oliver, et al.
Pubblicazione: (2025)
JULI: Jailbreak Large Language Models by Self-Introspection
di: Wang, Jesson, et al.
Pubblicazione: (2025)
di: Wang, Jesson, et al.
Pubblicazione: (2025)
DeepInception: Hypnotize Large Language Model to Be Jailbreaker
di: Li, Xuan, et al.
Pubblicazione: (2023)
di: Li, Xuan, et al.
Pubblicazione: (2023)
Attention-Enhanced Graph Filtering for False Data Injection Attack Detection and Localization
di: Abdulin, Ruslan, et al.
Pubblicazione: (2026)
di: Abdulin, Ruslan, et al.
Pubblicazione: (2026)
BiasJailbreak:Analyzing Ethical Biases and Jailbreak Vulnerabilities in Large Language Models
di: Lee, Isack, et al.
Pubblicazione: (2024)
di: Lee, Isack, et al.
Pubblicazione: (2024)
Graph Defense Diffusion Model
di: He, Xin, et al.
Pubblicazione: (2025)
di: He, Xin, et al.
Pubblicazione: (2025)
Jailbreaking and Mitigation of Vulnerabilities in Large Language Models
di: Peng, Benji, et al.
Pubblicazione: (2024)
di: Peng, Benji, et al.
Pubblicazione: (2024)
AutoDefense: Multi-Agent LLM Defense against Jailbreak Attacks
di: Zeng, Yifan, et al.
Pubblicazione: (2024)
di: Zeng, Yifan, et al.
Pubblicazione: (2024)
Deep Unlearn: Benchmarking Machine Unlearning for Image Classification
di: Cadet, Xavier F., et al.
Pubblicazione: (2024)
di: Cadet, Xavier F., et al.
Pubblicazione: (2024)
Testing the Limits of Jailbreaking Defenses with the Purple Problem
di: Kim, Taeyoun, et al.
Pubblicazione: (2024)
di: Kim, Taeyoun, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Dynamic Probabilistic Noise Injection for Membership Inference Defense
di: Forough, Javad, et al.
Pubblicazione: (2025) -
Verifiable Unlearning on Edge
di: Maheri, Mohammad M, et al.
Pubblicazione: (2025) -
Client Clustering Meets Knowledge Sharing: Enhancing Privacy and Robustness in Personalized Peer-to-Peer Learning
di: Maheri, Mohammad Mahdi, et al.
Pubblicazione: (2025) -
TeleSparse: Practical Privacy-Preserving Verification of Deep Neural Networks
di: Maheri, Mohammad M, et al.
Pubblicazione: (2025) -
ZK-APEX: Zero-Knowledge Approximate Personalized Unlearning with Executable Proofs
di: Maheri, Mohammad M, et al.
Pubblicazione: (2025)