Persistent Pre-Training Poisoning of LLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Yiming, Rando, Javier, Evtimov, Ivan, Chi, Jianfeng, Smith, Eric Michael, Carlini, Nicholas, Tramèr, Florian, Ippolito, Daphne |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Gradient-based Jailbreak Images for Multimodal Fusion Models
di: Rando, Javier, et al.
Pubblicazione: (2024)
di: Rando, Javier, et al.
Pubblicazione: (2024)
Universal Jailbreak Backdoors from Poisoned Human Feedback
di: Rando, Javier, et al.
Pubblicazione: (2023)
di: Rando, Javier, et al.
Pubblicazione: (2023)
LLMs unlock new paths to monetizing exploits
di: Carlini, Nicholas, et al.
Pubblicazione: (2025)
di: Carlini, Nicholas, et al.
Pubblicazione: (2025)
AutoAdvExBench: Benchmarking autonomous exploitation of adversarial example defenses
di: Carlini, Nicholas, et al.
Pubblicazione: (2025)
di: Carlini, Nicholas, et al.
Pubblicazione: (2025)
Adversarial Perturbations Cannot Reliably Protect Artists From Generative AI
di: Hönig, Robert, et al.
Pubblicazione: (2024)
di: Hönig, Robert, et al.
Pubblicazione: (2024)
Large-scale online deanonymization with LLMs
di: Lermen, Simon, et al.
Pubblicazione: (2026)
di: Lermen, Simon, et al.
Pubblicazione: (2026)
Adversarial ML Problems Are Getting Harder to Solve and to Evaluate
di: Rando, Javier, et al.
Pubblicazione: (2025)
di: Rando, Javier, et al.
Pubblicazione: (2025)
Competition Report: Finding Universal Jailbreak Backdoors in Aligned LLMs
di: Rando, Javier, et al.
Pubblicazione: (2024)
di: Rando, Javier, et al.
Pubblicazione: (2024)
Query-Based Adversarial Prompt Generation
di: Hayase, Jonathan, et al.
Pubblicazione: (2024)
di: Hayase, Jonathan, et al.
Pubblicazione: (2024)
Are aligned neural networks adversarially aligned?
di: Carlini, Nicholas, et al.
Pubblicazione: (2023)
di: Carlini, Nicholas, et al.
Pubblicazione: (2023)
An Adversarial Perspective on Machine Unlearning for AI Safety
di: Łucki, Jakub, et al.
Pubblicazione: (2024)
di: Łucki, Jakub, et al.
Pubblicazione: (2024)
Defeating Prompt Injections by Design
di: Debenedetti, Edoardo, et al.
Pubblicazione: (2025)
di: Debenedetti, Edoardo, et al.
Pubblicazione: (2025)
WASP: Benchmarking Web Agent Security Against Prompt Injection Attacks
di: Evtimov, Ivan, et al.
Pubblicazione: (2025)
di: Evtimov, Ivan, et al.
Pubblicazione: (2025)
Evading Black-box Classifiers Without Breaking Eggs
di: Debenedetti, Edoardo, et al.
Pubblicazione: (2023)
di: Debenedetti, Edoardo, et al.
Pubblicazione: (2023)
Position: Considerations for Differentially Private Learning with Large-Scale Public Pretraining
di: Tramèr, Florian, et al.
Pubblicazione: (2022)
di: Tramèr, Florian, et al.
Pubblicazione: (2022)
Poisoning Web-Scale Training Datasets is Practical
di: Carlini, Nicholas, et al.
Pubblicazione: (2023)
di: Carlini, Nicholas, et al.
Pubblicazione: (2023)
On The Dangers of Poisoned LLMs In Security Automation
di: Karlsen, Patrick, et al.
Pubblicazione: (2025)
di: Karlsen, Patrick, et al.
Pubblicazione: (2025)
Can Reasoning Models Obfuscate Reasoning? Stress-Testing Chain-of-Thought Monitorability
di: Zolkowski, Artur, et al.
Pubblicazione: (2025)
di: Zolkowski, Artur, et al.
Pubblicazione: (2025)
Detecting Adversarial Fine-tuning with Auditing Agents
di: Egler, Sarah, et al.
Pubblicazione: (2025)
di: Egler, Sarah, et al.
Pubblicazione: (2025)
System Prompt Poisoning: Persistent Attacks on Large Language Models Beyond User Injection
di: Li, Zongze, et al.
Pubblicazione: (2025)
di: Li, Zongze, et al.
Pubblicazione: (2025)
From Poisoned to Aware: Fostering Backdoor Self-Awareness in LLMs
di: Shen, Guangyu, et al.
Pubblicazione: (2025)
di: Shen, Guangyu, et al.
Pubblicazione: (2025)
The Jailbreak Tax: How Useful are Your Jailbreak Outputs?
di: Nikolić, Kristina, et al.
Pubblicazione: (2025)
di: Nikolić, Kristina, et al.
Pubblicazione: (2025)
Trojan Hippo: Weaponizing Agent Memory for Data Exfiltration
di: Das, Debeshee, et al.
Pubblicazione: (2026)
di: Das, Debeshee, et al.
Pubblicazione: (2026)
Swallowing the Poison Pills: Insights from Vulnerability Disparity Among LLMs
di: Yifeng, Peng, et al.
Pubblicazione: (2025)
di: Yifeng, Peng, et al.
Pubblicazione: (2025)
On Evaluating the Durability of Safeguards for Open-Weight LLMs
di: Qi, Xiangyu, et al.
Pubblicazione: (2024)
di: Qi, Xiangyu, et al.
Pubblicazione: (2024)
Poisoned Acoustics
di: Dahme, Harrison
Pubblicazione: (2026)
di: Dahme, Harrison
Pubblicazione: (2026)
Scaling Trends for Data Poisoning in LLMs
di: Bowen, Dillon, et al.
Pubblicazione: (2024)
di: Bowen, Dillon, et al.
Pubblicazione: (2024)
P2P: A Poison-to-Poison Remedy for Reliable Backdoor Defense in LLMs
di: Zhao, Shuai, et al.
Pubblicazione: (2025)
di: Zhao, Shuai, et al.
Pubblicazione: (2025)
Persistent Backdoor Attacks under Continual Fine-Tuning of LLMs
di: Cui, Jing, et al.
Pubblicazione: (2025)
di: Cui, Jing, et al.
Pubblicazione: (2025)
Data Poisoning Vulnerabilities Across Healthcare AI Architectures: A Security Threat Analysis
di: Abtahi, Farhad, et al.
Pubblicazione: (2025)
di: Abtahi, Farhad, et al.
Pubblicazione: (2025)
MemoryGraft: Persistent Compromise of LLM Agents via Poisoned Experience Retrieval
di: Srivastava, Saksham Sahai, et al.
Pubblicazione: (2025)
di: Srivastava, Saksham Sahai, et al.
Pubblicazione: (2025)
Poison Once, Exploit Forever: Environment-Injected Memory Poisoning Attacks on Web Agents
di: Zou, Wei, et al.
Pubblicazione: (2026)
di: Zou, Wei, et al.
Pubblicazione: (2026)
Polynomial Time Cryptanalytic Extraction of Deep Neural Networks in the Hard-Label Setting
di: Carlini, Nicholas, et al.
Pubblicazione: (2024)
di: Carlini, Nicholas, et al.
Pubblicazione: (2024)
PARASITE: Conditional System Prompt Poisoning to Hijack LLMs
di: Pham, Viet, et al.
Pubblicazione: (2025)
di: Pham, Viet, et al.
Pubblicazione: (2025)
SoK: Watermarking for AI-Generated Content
di: Zhao, Xuandong, et al.
Pubblicazione: (2024)
di: Zhao, Xuandong, et al.
Pubblicazione: (2024)
AdvPrefix: An Objective for Nuanced LLM Jailbreaks
di: Zhu, Sicheng, et al.
Pubblicazione: (2024)
di: Zhu, Sicheng, et al.
Pubblicazione: (2024)
Dataset and Lessons Learned from the 2024 SaTML LLM Capture-the-Flag Competition
di: Debenedetti, Edoardo, et al.
Pubblicazione: (2024)
di: Debenedetti, Edoardo, et al.
Pubblicazione: (2024)
Exploring and Developing a Pre-Model Safeguard with Draft Models
di: Cai, Hongyu, et al.
Pubblicazione: (2026)
di: Cai, Hongyu, et al.
Pubblicazione: (2026)
CSC: Turning the Adversary's Poison against Itself
di: Shi, Yuchen, et al.
Pubblicazione: (2026)
di: Shi, Yuchen, et al.
Pubblicazione: (2026)
Data Poisoning in Deep Learning: A Survey
di: Zhao, Pinlong, et al.
Pubblicazione: (2025)
di: Zhao, Pinlong, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Gradient-based Jailbreak Images for Multimodal Fusion Models
di: Rando, Javier, et al.
Pubblicazione: (2024) -
Universal Jailbreak Backdoors from Poisoned Human Feedback
di: Rando, Javier, et al.
Pubblicazione: (2023) -
LLMs unlock new paths to monetizing exploits
di: Carlini, Nicholas, et al.
Pubblicazione: (2025) -
AutoAdvExBench: Benchmarking autonomous exploitation of adversarial example defenses
di: Carlini, Nicholas, et al.
Pubblicazione: (2025) -
Adversarial Perturbations Cannot Reliably Protect Artists From Generative AI
di: Hönig, Robert, et al.
Pubblicazione: (2024)