Disentangling Adversarial Prompts: A Semantic-Graph Defense for Robust LLM Security
Fuente:
arXiv
Guardado en:
| Autores principales: | Fang, Xiang, Fang, Wanlong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Beyond Vulnerabilities: A Survey of Adversarial Attacks as Both Threats and Defenses in Computer Vision Systems
por: Guo, Zhongliang, et al.
Publicado: (2025)
por: Guo, Zhongliang, et al.
Publicado: (2025)
Adversarial Attacks and Defenses on Text-to-Image Diffusion Models: A Survey
por: Zhang, Chenyu, et al.
Publicado: (2024)
por: Zhang, Chenyu, et al.
Publicado: (2024)
Autoencoder-based Denoising Defense against Adversarial Attacks on Object Detection
por: Song, Min Geun, et al.
Publicado: (2025)
por: Song, Min Geun, et al.
Publicado: (2025)
T2I-RiskyPrompt: A Benchmark for Safety Evaluation, Attack, and Defense on Text-to-Image Model
por: Zhang, Chenyu, et al.
Publicado: (2025)
por: Zhang, Chenyu, et al.
Publicado: (2025)
Proactive Adversarial Defense: Harnessing Prompt Tuning in Vision-Language Models to Detect Unseen Backdoored Images
por: Stein, Kyle, et al.
Publicado: (2024)
por: Stein, Kyle, et al.
Publicado: (2024)
Adversarial Robustness of Vision in Open Foundation Models
por: Fox, Jonathon, et al.
Publicado: (2025)
por: Fox, Jonathon, et al.
Publicado: (2025)
CP-Guard+: A New Paradigm for Malicious Agent Detection and Defense in Collaborative Perception
por: Hu, Senkang, et al.
Publicado: (2025)
por: Hu, Senkang, et al.
Publicado: (2025)
Fooling the Watchers: Breaking AIGC Detectors via Semantic Prompt Attacks
por: Hao, Run, et al.
Publicado: (2025)
por: Hao, Run, et al.
Publicado: (2025)
ROBIN: Robust and Invisible Watermarks for Diffusion Models with Adversarial Optimization
por: Huang, Huayang, et al.
Publicado: (2024)
por: Huang, Huayang, et al.
Publicado: (2024)
Semantic Router: On the Feasibility of Hijacking MLLMs via a Single Adversarial Perturbation
por: Li, Changyue, et al.
Publicado: (2025)
por: Li, Changyue, et al.
Publicado: (2025)
Image-based Prompt Injection: Hijacking Multimodal LLMs through Visually Embedded Adversarial Instructions
por: Nagaraja, Neha, et al.
Publicado: (2026)
por: Nagaraja, Neha, et al.
Publicado: (2026)
SAGE: Exploring the Boundaries of Unsafe Concept Domain with Semantic-Augment Erasing
por: Zhu, Hongguang, et al.
Publicado: (2025)
por: Zhu, Hongguang, et al.
Publicado: (2025)
Robustness Analysis against Adversarial Patch Attacks in Fully Unmanned Stores
por: Na, Hyunsik, et al.
Publicado: (2025)
por: Na, Hyunsik, et al.
Publicado: (2025)
PuriDefense: Randomized Local Implicit Adversarial Purification for Defending Black-box Query-based Attacks
por: Guo, Ping, et al.
Publicado: (2024)
por: Guo, Ping, et al.
Publicado: (2024)
Watertox: The Art of Simplicity in Universal Attacks A Cross-Model Framework for Robust Adversarial Generation
por: Gao, Zhenghao, et al.
Publicado: (2024)
por: Gao, Zhenghao, et al.
Publicado: (2024)
On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression
por: Zhang, Xinwei, et al.
Publicado: (2026)
por: Zhang, Xinwei, et al.
Publicado: (2026)
DIFFender: Diffusion-Based Adversarial Defense against Patch Attacks
por: Kang, Caixin, et al.
Publicado: (2023)
por: Kang, Caixin, et al.
Publicado: (2023)
Evaluating the Efficacy of Prompt-Engineered Large Multimodal Models Versus Fine-Tuned Vision Transformers in Image-Based Security Applications
por: Trad, Fouad, et al.
Publicado: (2024)
por: Trad, Fouad, et al.
Publicado: (2024)
Defensive Adversarial CAPTCHA: A Semantics-Driven Framework for Natural Adversarial Example Generation
por: Du, Xia, et al.
Publicado: (2025)
por: Du, Xia, et al.
Publicado: (2025)
AttackVLA: Benchmarking Adversarial and Backdoor Attacks on Vision-Language-Action Models
por: Li, Jiayu, et al.
Publicado: (2025)
por: Li, Jiayu, et al.
Publicado: (2025)
Real-world Adversarial Defense against Patch Attacks based on Diffusion Model
por: Wei, Xingxing, et al.
Publicado: (2024)
por: Wei, Xingxing, et al.
Publicado: (2024)
Disrupting Vision-Language Model-Driven Navigation Services via Adversarial Object Fusion
por: Xie, Chunlong, et al.
Publicado: (2025)
por: Xie, Chunlong, et al.
Publicado: (2025)
Backdoor Defense in Diffusion Models via Spatial Attention Unlearning
por: Jha, Abha, et al.
Publicado: (2025)
por: Jha, Abha, et al.
Publicado: (2025)
DeMark: A Query-Free Black-Box Attack on Deepfake Watermarking Defenses
por: Song, Wei, et al.
Publicado: (2026)
por: Song, Wei, et al.
Publicado: (2026)
PAD-FT: A Lightweight Defense for Backdoor Attacks via Data Purification and Fine-Tuning
por: Xu, Yukai, et al.
Publicado: (2024)
por: Xu, Yukai, et al.
Publicado: (2024)
Exploring the Adversarial Frontier: Quantifying Robustness via Adversarial Hypervolume
por: Guo, Ping, et al.
Publicado: (2024)
por: Guo, Ping, et al.
Publicado: (2024)
AR-GAN: Generative Adversarial Network-Based Defense Method Against Adversarial Attacks on the Traffic Sign Classification System of Autonomous Vehicles
por: Salek, M Sabbir, et al.
Publicado: (2023)
por: Salek, M Sabbir, et al.
Publicado: (2023)
Attacking the Spike: On the Transferability and Security of Spiking Neural Networks to Adversarial Examples
por: Xu, Nuo, et al.
Publicado: (2022)
por: Xu, Nuo, et al.
Publicado: (2022)
PatchCURE: Improving Certifiable Robustness, Model Utility, and Computation Efficiency of Adversarial Patch Defenses
por: Xiang, Chong, et al.
Publicado: (2023)
por: Xiang, Chong, et al.
Publicado: (2023)
From Attack to Defense: Insights into Deep Learning Security Measures in Black-Box Settings
por: Juraev, Firuz, et al.
Publicado: (2024)
por: Juraev, Firuz, et al.
Publicado: (2024)
AdvSecureNet: A Python Toolkit for Adversarial Machine Learning
por: Catal, Melih, et al.
Publicado: (2024)
por: Catal, Melih, et al.
Publicado: (2024)
Safety in Embodied AI: A Survey of Risks, Attacks, and Defenses
por: Li, Xiao, et al.
Publicado: (2026)
por: Li, Xiao, et al.
Publicado: (2026)
SKeDA: A Generative Watermarking Framework for Text-to-video Diffusion Models
por: Yang, Yang, et al.
Publicado: (2026)
por: Yang, Yang, et al.
Publicado: (2026)
PromptGuard: Soft Prompt-Guided Unsafe Content Moderation for Text-to-Image Models
por: Yuan, Lingzhi, et al.
Publicado: (2025)
por: Yuan, Lingzhi, et al.
Publicado: (2025)
A White-Box False Positive Adversarial Attack Method on Contrastive Loss Based Offline Handwritten Signature Verification Models
por: Guo, Zhongliang, et al.
Publicado: (2023)
por: Guo, Zhongliang, et al.
Publicado: (2023)
On the Importance of Backbone to the Adversarial Robustness of Object Detectors
por: Li, Xiao, et al.
Publicado: (2023)
por: Li, Xiao, et al.
Publicado: (2023)
Evaluating the Evaluators: Trust in Adversarial Robustness Tests
por: Cinà, Antonio Emanuele, et al.
Publicado: (2025)
por: Cinà, Antonio Emanuele, et al.
Publicado: (2025)
The Impact of Scaling Training Data on Adversarial Robustness
por: Zimmerli, Marco, et al.
Publicado: (2025)
por: Zimmerli, Marco, et al.
Publicado: (2025)
The Adversarial AI-Art: Understanding, Generation, Detection, and Benchmarking
por: Li, Yuying, et al.
Publicado: (2024)
por: Li, Yuying, et al.
Publicado: (2024)
Edge-Only Universal Adversarial Attacks in Distributed Learning
por: Rossolini, Giulio, et al.
Publicado: (2024)
por: Rossolini, Giulio, et al.
Publicado: (2024)
Ejemplares similares
-
Beyond Vulnerabilities: A Survey of Adversarial Attacks as Both Threats and Defenses in Computer Vision Systems
por: Guo, Zhongliang, et al.
Publicado: (2025) -
Adversarial Attacks and Defenses on Text-to-Image Diffusion Models: A Survey
por: Zhang, Chenyu, et al.
Publicado: (2024) -
Autoencoder-based Denoising Defense against Adversarial Attacks on Object Detection
por: Song, Min Geun, et al.
Publicado: (2025) -
T2I-RiskyPrompt: A Benchmark for Safety Evaluation, Attack, and Defense on Text-to-Image Model
por: Zhang, Chenyu, et al.
Publicado: (2025) -
Proactive Adversarial Defense: Harnessing Prompt Tuning in Vision-Language Models to Detect Unseen Backdoored Images
por: Stein, Kyle, et al.
Publicado: (2024)