Attacking LLMs and AI Agents: Advertisement Embedding Attacks Against Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Guo, Qiming, Tang, Jinwen, Huang, Xingran |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Shadowcast: Stealthy Data Poisoning Attacks Against Vision-Language Models
di: Xu, Yuancheng, et al.
Pubblicazione: (2024)
di: Xu, Yuancheng, et al.
Pubblicazione: (2024)
Improved Membership Inference Attacks Against Language Classification Models
di: Shachor, Shlomit, et al.
Pubblicazione: (2023)
di: Shachor, Shlomit, et al.
Pubblicazione: (2023)
Can Differentially Private Fine-tuning LLMs Protect Against Privacy Attacks?
di: Du, Hao, et al.
Pubblicazione: (2025)
di: Du, Hao, et al.
Pubblicazione: (2025)
Jailbreak Attacks and Defenses Against Large Language Models: A Survey
di: Yi, Sibo, et al.
Pubblicazione: (2024)
di: Yi, Sibo, et al.
Pubblicazione: (2024)
Prompt Injection Attacks on Large Language Models in Oncology
di: Clusmann, Jan, et al.
Pubblicazione: (2024)
di: Clusmann, Jan, et al.
Pubblicazione: (2024)
Attacks and Defenses Against LLM Fingerprinting
di: Kurian, Kevin, et al.
Pubblicazione: (2025)
di: Kurian, Kevin, et al.
Pubblicazione: (2025)
Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey
di: Huang, Tiansheng, et al.
Pubblicazione: (2024)
di: Huang, Tiansheng, et al.
Pubblicazione: (2024)
LeakSealer: A Semisupervised Defense for LLMs Against Prompt Injection and Leakage Attacks
di: Panebianco, Francesco, et al.
Pubblicazione: (2025)
di: Panebianco, Francesco, et al.
Pubblicazione: (2025)
A Survey on Model Extraction Attacks and Defenses for Large Language Models
di: Zhao, Kaixiang, et al.
Pubblicazione: (2025)
di: Zhao, Kaixiang, et al.
Pubblicazione: (2025)
Optimal Defenses Against Gradient Reconstruction Attacks
di: Chen, Yuxiao, et al.
Pubblicazione: (2024)
di: Chen, Yuxiao, et al.
Pubblicazione: (2024)
ExploitGym: Can AI Agents Turn Security Vulnerabilities into Real Attacks?
di: Wang, Zhun, et al.
Pubblicazione: (2026)
di: Wang, Zhun, et al.
Pubblicazione: (2026)
PLeak: Prompt Leaking Attacks against Large Language Model Applications
di: Hui, Bo, et al.
Pubblicazione: (2024)
di: Hui, Bo, et al.
Pubblicazione: (2024)
Untargeted Adversarial Attack on Knowledge Graph Embeddings
di: Zhao, Tianzhe, et al.
Pubblicazione: (2024)
di: Zhao, Tianzhe, et al.
Pubblicazione: (2024)
JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs
di: Chu, Junjie, et al.
Pubblicazione: (2024)
di: Chu, Junjie, et al.
Pubblicazione: (2024)
Compromising Embodied Agents with Contextual Backdoor Attacks
di: Liu, Aishan, et al.
Pubblicazione: (2024)
di: Liu, Aishan, et al.
Pubblicazione: (2024)
DCMI: A Differential Calibration Membership Inference Attack Against Retrieval-Augmented Generation
di: Gao, Xinyu, et al.
Pubblicazione: (2025)
di: Gao, Xinyu, et al.
Pubblicazione: (2025)
Model Inversion Attacks on Llama 3: Extracting PII from Large Language Models
di: Sivashanmugam, Sathesh P.
Pubblicazione: (2025)
di: Sivashanmugam, Sathesh P.
Pubblicazione: (2025)
Large Language Models for Link Stealing Attacks Against Graph Neural Networks
di: Guan, Faqian, et al.
Pubblicazione: (2024)
di: Guan, Faqian, et al.
Pubblicazione: (2024)
Center-Based Relaxed Learning Against Membership Inference Attacks
di: Fang, Xingli, et al.
Pubblicazione: (2024)
di: Fang, Xingli, et al.
Pubblicazione: (2024)
LLMs can be Dangerous Reasoners: Analyzing-based Jailbreak Attack on Large Language Models
di: Lin, Shi, et al.
Pubblicazione: (2024)
di: Lin, Shi, et al.
Pubblicazione: (2024)
A White-Box Adversarial Attack Against a Digital Twin
di: Patterson, Wilson, et al.
Pubblicazione: (2022)
di: Patterson, Wilson, et al.
Pubblicazione: (2022)
Enhancing IoT Security Against DDoS Attacks through Federated Learning
di: Shirvani, Ghazaleh, et al.
Pubblicazione: (2024)
di: Shirvani, Ghazaleh, et al.
Pubblicazione: (2024)
Attention Tracker: Detecting Prompt Injection Attacks in LLMs
di: Hung, Kuo-Han, et al.
Pubblicazione: (2024)
di: Hung, Kuo-Han, et al.
Pubblicazione: (2024)
TrojFM: Resource-efficient Backdoor Attacks against Very Large Foundation Models
di: Nie, Yuzhou., et al.
Pubblicazione: (2024)
di: Nie, Yuzhou., et al.
Pubblicazione: (2024)
Can Adversarial Code Comments Fool AI Security Reviewers -- Large-Scale Empirical Study of Comment-Based Attacks and Defenses Against LLM Code Analysis
di: Thornton, Scott
Pubblicazione: (2026)
di: Thornton, Scott
Pubblicazione: (2026)
Semantic Intent Fragmentation: A Single-Shot Compositional Attack on Multi-Agent AI Pipelines
di: Ahad, Tanzim, et al.
Pubblicazione: (2026)
di: Ahad, Tanzim, et al.
Pubblicazione: (2026)
Guiding not Forcing: Enhancing the Transferability of Jailbreaking Attacks on LLMs via Removing Superfluous Constraints
di: Yang, Junxiao, et al.
Pubblicazione: (2025)
di: Yang, Junxiao, et al.
Pubblicazione: (2025)
The Resurgence of GCG Adversarial Attacks on Large Language Models
di: Tan, Yuting, et al.
Pubblicazione: (2025)
di: Tan, Yuting, et al.
Pubblicazione: (2025)
Jailbreaking Leading Safety-Aligned LLMs with Simple Adaptive Attacks
di: Andriushchenko, Maksym, et al.
Pubblicazione: (2024)
di: Andriushchenko, Maksym, et al.
Pubblicazione: (2024)
Jailbreaking LLMs Without Gradients or Priors: Effective and Transferable Attacks
di: Nurlanov, Zhakshylyk, et al.
Pubblicazione: (2026)
di: Nurlanov, Zhakshylyk, et al.
Pubblicazione: (2026)
Claudini: Autoresearch Discovers State-of-the-Art Adversarial Attack Algorithms for LLMs
di: Panfilov, Alexander, et al.
Pubblicazione: (2026)
di: Panfilov, Alexander, et al.
Pubblicazione: (2026)
Trusted Weights, Treacherous Optimizations? Optimization-Triggered Backdoor Attacks on LLMs
di: Wang, Yifei, et al.
Pubblicazione: (2026)
di: Wang, Yifei, et al.
Pubblicazione: (2026)
GenBFA: An Evolutionary Optimization Approach to Bit-Flip Attacks on LLMs
di: Das, Sanjay, et al.
Pubblicazione: (2024)
di: Das, Sanjay, et al.
Pubblicazione: (2024)
Your Agent Can Defend Itself against Backdoor Attacks
di: Changjiang, Li, et al.
Pubblicazione: (2025)
di: Changjiang, Li, et al.
Pubblicazione: (2025)
Be Kind, Rewrite: Benign Projections via Rewriting Defend Against LLM Data Poisoning Attacks
di: Halloran, John T., et al.
Pubblicazione: (2026)
di: Halloran, John T., et al.
Pubblicazione: (2026)
SurvAttack: Black-Box Attack On Survival Models through Ontology-Informed EHR Perturbation
di: Kerdabadi, Mohsen Nayebi, et al.
Pubblicazione: (2024)
di: Kerdabadi, Mohsen Nayebi, et al.
Pubblicazione: (2024)
Virus: Harmful Fine-tuning Attack for Large Language Models Bypassing Guardrail Moderation
di: Huang, Tiansheng, et al.
Pubblicazione: (2025)
di: Huang, Tiansheng, et al.
Pubblicazione: (2025)
GenAI-FDIA: Physics-Informed Generative Models for False Data Injection Attacks
di: Razzaque, Mohammad A., et al.
Pubblicazione: (2026)
di: Razzaque, Mohammad A., et al.
Pubblicazione: (2026)
Adaptive Attacks on Trusted Monitors Subvert AI Control Protocols
di: Terekhov, Mikhail, et al.
Pubblicazione: (2025)
di: Terekhov, Mikhail, et al.
Pubblicazione: (2025)
Crypto Miner Attack: GPU Remote Code Execution Attacks
di: Szabo, Ariel, et al.
Pubblicazione: (2025)
di: Szabo, Ariel, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Shadowcast: Stealthy Data Poisoning Attacks Against Vision-Language Models
di: Xu, Yuancheng, et al.
Pubblicazione: (2024) -
Improved Membership Inference Attacks Against Language Classification Models
di: Shachor, Shlomit, et al.
Pubblicazione: (2023) -
Can Differentially Private Fine-tuning LLMs Protect Against Privacy Attacks?
di: Du, Hao, et al.
Pubblicazione: (2025) -
Jailbreak Attacks and Defenses Against Large Language Models: A Survey
di: Yi, Sibo, et al.
Pubblicazione: (2024) -
Prompt Injection Attacks on Large Language Models in Oncology
di: Clusmann, Jan, et al.
Pubblicazione: (2024)