Attention Is Where You Attack
Fuente:
arXiv
Salvato in:
| Autori principali: | Srivastava, Aviral, Panda, Sourav |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Formal Framework for Assessing and Mitigating Emergent Security Risks in Generative AI Models: Bridging Theory and Dynamic Risk Mitigation
di: Srivastava, Aviral, et al.
Pubblicazione: (2024)
di: Srivastava, Aviral, et al.
Pubblicazione: (2024)
When and Where do Data Poisons Attack Textual Inversion?
di: Styborski, Jeremy, et al.
Pubblicazione: (2025)
di: Styborski, Jeremy, et al.
Pubblicazione: (2025)
A Survey on Offensive AI Within Cybersecurity
di: Girhepuje, Sahil, et al.
Pubblicazione: (2024)
di: Girhepuje, Sahil, et al.
Pubblicazione: (2024)
Breaking ReAct Agents: Foot-in-the-Door Attack Will Get You In
di: Nakash, Itay, et al.
Pubblicazione: (2024)
di: Nakash, Itay, et al.
Pubblicazione: (2024)
Attention Masks Help Adversarial Attacks to Bypass Safety Detectors
di: Shi, Yunfan
Pubblicazione: (2024)
di: Shi, Yunfan
Pubblicazione: (2024)
Not What You Asked For: Typographic Attacks in Household Robot Manipulation
di: Iranmanesh, Ali, et al.
Pubblicazione: (2026)
di: Iranmanesh, Ali, et al.
Pubblicazione: (2026)
Uncovering and Aligning Anomalous Attention Heads to Defend Against NLP Backdoor Attacks
di: Jin, Haotian, et al.
Pubblicazione: (2025)
di: Jin, Haotian, et al.
Pubblicazione: (2025)
Temporal-Spatial Attention Network (TSAN) for DoS Attack Detection in Network Traffic
di: Kayode, Bisola Faith, et al.
Pubblicazione: (2025)
di: Kayode, Bisola Faith, et al.
Pubblicazione: (2025)
Confidence Is All You Need for MI Attacks
di: Sinha, Abhishek, et al.
Pubblicazione: (2023)
di: Sinha, Abhishek, et al.
Pubblicazione: (2023)
Buffer is All You Need: Defending Federated Learning against Backdoor Attacks under Non-iids via Buffering
di: Lyu, Xingyu, et al.
Pubblicazione: (2025)
di: Lyu, Xingyu, et al.
Pubblicazione: (2025)
Attention Tracker: Detecting Prompt Injection Attacks in LLMs
di: Hung, Kuo-Han, et al.
Pubblicazione: (2024)
di: Hung, Kuo-Han, et al.
Pubblicazione: (2024)
The Surface You Test Is Not the Surface That Breaks
di: Arman, Shifat E, et al.
Pubblicazione: (2026)
di: Arman, Shifat E, et al.
Pubblicazione: (2026)
CL-Attack: Textual Backdoor Attacks via Cross-Lingual Triggers
di: Zheng, Jingyi, et al.
Pubblicazione: (2024)
di: Zheng, Jingyi, et al.
Pubblicazione: (2024)
Injection, Attack and Erasure: Revocable Backdoor Attacks via Machine Unlearning
di: Song, Baogang, et al.
Pubblicazione: (2025)
di: Song, Baogang, et al.
Pubblicazione: (2025)
AttackSeqBench: Benchmarking the Capabilities of LLMs for Attack Sequences Understanding
di: Ma, Haokai, et al.
Pubblicazione: (2025)
di: Ma, Haokai, et al.
Pubblicazione: (2025)
DiffAttack: Evasion Attacks Against Diffusion-Based Adversarial Purification
di: Kang, Mintong, et al.
Pubblicazione: (2023)
di: Kang, Mintong, et al.
Pubblicazione: (2023)
Attacking Slicing Network via Side-channel Reinforcement Learning Attack
di: Shao, Wei, et al.
Pubblicazione: (2024)
di: Shao, Wei, et al.
Pubblicazione: (2024)
Feint and Attack: Attention-Based Strategies for Jailbreaking and Protecting LLMs
di: Pu, Rui, et al.
Pubblicazione: (2024)
di: Pu, Rui, et al.
Pubblicazione: (2024)
You Can Backdoor Personalized Federated Learning
di: Ye, Tiandi, et al.
Pubblicazione: (2023)
di: Ye, Tiandi, et al.
Pubblicazione: (2023)
Jailbreaking is (Mostly) Simpler Than You Think
di: Russinovich, Mark, et al.
Pubblicazione: (2025)
di: Russinovich, Mark, et al.
Pubblicazione: (2025)
Dynamic Target Attack
di: Xiu, Kedong, et al.
Pubblicazione: (2025)
di: Xiu, Kedong, et al.
Pubblicazione: (2025)
Untargeted Jailbreak Attack
di: Huang, Xinzhe, et al.
Pubblicazione: (2025)
di: Huang, Xinzhe, et al.
Pubblicazione: (2025)
CAHS-Attack: CLIP-Aware Heuristic Search Attack Method for Stable Diffusion
di: Xia, Shuhan, et al.
Pubblicazione: (2025)
di: Xia, Shuhan, et al.
Pubblicazione: (2025)
Jailbreaking Prompt Attack: A Controllable Adversarial Attack against Diffusion Models
di: Ma, Jiachen, et al.
Pubblicazione: (2024)
di: Ma, Jiachen, et al.
Pubblicazione: (2024)
I Don't Know You, But I Can Catch You: Real-Time Defense against Diverse Adversarial Patches for Object Detectors
di: Lin, Zijin, et al.
Pubblicazione: (2024)
di: Lin, Zijin, et al.
Pubblicazione: (2024)
Persona Attack: Incremental Memory Injection Jailbreak Attack against Large Language Models
di: Park, Junyoung, et al.
Pubblicazione: (2026)
di: Park, Junyoung, et al.
Pubblicazione: (2026)
A Systematic Review of Algorithmic Red Teaming Methodologies for Assurance and Security of AI Applications
di: Srivastava, Shruti, et al.
Pubblicazione: (2026)
di: Srivastava, Shruti, et al.
Pubblicazione: (2026)
AttackPilot: Autonomous Inference Attacks Against ML Services With LLM-Based Agents
di: Wu, Yixin, et al.
Pubblicazione: (2025)
di: Wu, Yixin, et al.
Pubblicazione: (2025)
Now You Hear Me: Audio Narrative Attacks Against Large Audio-Language Models
di: Yu, Ye, et al.
Pubblicazione: (2026)
di: Yu, Ye, et al.
Pubblicazione: (2026)
Attention Slipping: A Mechanistic Understanding of Jailbreak Attacks and Defenses in LLMs
di: Hu, Xiaomeng, et al.
Pubblicazione: (2025)
di: Hu, Xiaomeng, et al.
Pubblicazione: (2025)
PIDP-Attack: Combining Prompt Injection with Database Poisoning Attacks on Retrieval-Augmented Generation Systems
di: Wang, Haozhen, et al.
Pubblicazione: (2026)
di: Wang, Haozhen, et al.
Pubblicazione: (2026)
PBI-Attack: Prior-Guided Bimodal Interactive Black-Box Jailbreak Attack for Toxicity Maximization
di: Cheng, Ruoxi, et al.
Pubblicazione: (2024)
di: Cheng, Ruoxi, et al.
Pubblicazione: (2024)
AttackER: Towards Enhancing Cyber-Attack Attribution with a Named Entity Recognition Dataset
di: Deka, Pritam, et al.
Pubblicazione: (2024)
di: Deka, Pritam, et al.
Pubblicazione: (2024)
CompressionAttack: Exploiting Prompt Compression as a New Attack Surface in LLM-Powered Agents
di: Liu, Zesen, et al.
Pubblicazione: (2025)
di: Liu, Zesen, et al.
Pubblicazione: (2025)
Where Do LLM-based Systems Break? A System-Level Security Framework for Risk Assessment and Treatment
di: Nagaraja, Neha, et al.
Pubblicazione: (2026)
di: Nagaraja, Neha, et al.
Pubblicazione: (2026)
Single-Configuration Attack Success Rate Is Not Enough: Jailbreak Evaluations Should Report Distributional Attack Success
di: Maple, Carsten, et al.
Pubblicazione: (2026)
di: Maple, Carsten, et al.
Pubblicazione: (2026)
Delayed Backdoor Attacks: Exploring the Temporal Dimension as a New Attack Surface in Pre-Trained Models
di: Ding, Zikang, et al.
Pubblicazione: (2026)
di: Ding, Zikang, et al.
Pubblicazione: (2026)
Involuntary Jailbreak: On Self-Prompting Attacks
di: Guo, Yangyang, et al.
Pubblicazione: (2025)
di: Guo, Yangyang, et al.
Pubblicazione: (2025)
Security of Internet of Agents: Attacks and Countermeasures
di: Wang, Yuntao, et al.
Pubblicazione: (2025)
di: Wang, Yuntao, et al.
Pubblicazione: (2025)
Attacks on the neural network and defense methods
di: Korenev, A., et al.
Pubblicazione: (2024)
di: Korenev, A., et al.
Pubblicazione: (2024)
Documenti analoghi
-
A Formal Framework for Assessing and Mitigating Emergent Security Risks in Generative AI Models: Bridging Theory and Dynamic Risk Mitigation
di: Srivastava, Aviral, et al.
Pubblicazione: (2024) -
When and Where do Data Poisons Attack Textual Inversion?
di: Styborski, Jeremy, et al.
Pubblicazione: (2025) -
A Survey on Offensive AI Within Cybersecurity
di: Girhepuje, Sahil, et al.
Pubblicazione: (2024) -
Breaking ReAct Agents: Foot-in-the-Door Attack Will Get You In
di: Nakash, Itay, et al.
Pubblicazione: (2024) -
Attention Masks Help Adversarial Attacks to Bypass Safety Detectors
di: Shi, Yunfan
Pubblicazione: (2024)