Learning to Poison Large Language Models for Downstream Manipulation
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhou, Xiangyu, Qiang, Yao, Zade, Saleh Zare, Roshani, Mohammad Amin, Khanduri, Prashant, Zytko, Douglas, Zhu, Dongxiao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Hijacking Large Language Models via Adversarial In-Context Learning
di: Zhou, Xiangyu, et al.
Pubblicazione: (2023)
di: Zhou, Xiangyu, et al.
Pubblicazione: (2023)
Not All Tokens Are Meant to Be Forgotten
di: Zhou, Xiangyu, et al.
Pubblicazione: (2025)
di: Zhou, Xiangyu, et al.
Pubblicazione: (2025)
Automatic Calibration for Membership Inference Attack on Large Language Models
di: Zade, Saleh Zare, et al.
Pubblicazione: (2025)
di: Zade, Saleh Zare, et al.
Pubblicazione: (2025)
Denial-of-Service Poisoning Attacks against Large Language Models
di: Gao, Kuofeng, et al.
Pubblicazione: (2024)
di: Gao, Kuofeng, et al.
Pubblicazione: (2024)
PoisonBench: Assessing Large Language Model Vulnerability to Data Poisoning
di: Fu, Tingchen, et al.
Pubblicazione: (2024)
di: Fu, Tingchen, et al.
Pubblicazione: (2024)
Fight Poison with Poison: Enhancing Robustness in Few-shot Machine-Generated Text Detection with Adversarial Training
di: Duan, Wenjing, et al.
Pubblicazione: (2026)
di: Duan, Wenjing, et al.
Pubblicazione: (2026)
Retrieval-Augmented Review Generation for Poisoning Recommender Systems
di: Yang, Shiyi, et al.
Pubblicazione: (2025)
di: Yang, Shiyi, et al.
Pubblicazione: (2025)
Attention Smoothing Is All You Need For Unlearning
di: Zade, Saleh Zare, et al.
Pubblicazione: (2026)
di: Zade, Saleh Zare, et al.
Pubblicazione: (2026)
From Theory to Practice: Evaluating Data Poisoning Attacks and Defenses in In-Context Learning on Social Media Health Discourse
di: Jhuma, Rabeya Amin, et al.
Pubblicazione: (2025)
di: Jhuma, Rabeya Amin, et al.
Pubblicazione: (2025)
Sugar-Coated Poison: Benign Generation Unlocks LLM Jailbreaking
di: Wu, Yu-Hang, et al.
Pubblicazione: (2025)
di: Wu, Yu-Hang, et al.
Pubblicazione: (2025)
SCOUT: A Defense Against Data Poisoning Attacks in Fine-Tuned Language Models
di: Afane, Mohamed, et al.
Pubblicazione: (2025)
di: Afane, Mohamed, et al.
Pubblicazione: (2025)
RAG Safety: Exploring Knowledge Poisoning Attacks to Retrieval-Augmented Generation
di: Zhao, Tianzhe, et al.
Pubblicazione: (2025)
di: Zhao, Tianzhe, et al.
Pubblicazione: (2025)
Bias Amplification in RAG: Poisoning Knowledge Retrieval to Steer LLMs
di: Wang, Linlin, et al.
Pubblicazione: (2025)
di: Wang, Linlin, et al.
Pubblicazione: (2025)
Fact2Fiction: Targeted Poisoning Attack to Agentic Fact-checking System
di: He, Haorui, et al.
Pubblicazione: (2025)
di: He, Haorui, et al.
Pubblicazione: (2025)
EPT Benchmark: Evaluation of Persian Trustworthiness in Large Language Models
di: Mirbagheri, Mohammad Reza, et al.
Pubblicazione: (2025)
di: Mirbagheri, Mohammad Reza, et al.
Pubblicazione: (2025)
How Susceptible are Large Language Models to Ideological Manipulation?
di: Chen, Kai, et al.
Pubblicazione: (2024)
di: Chen, Kai, et al.
Pubblicazione: (2024)
Lateral Phishing With Large Language Models: A Large Organization Comparative Study
di: Bethany, Mazal, et al.
Pubblicazione: (2024)
di: Bethany, Mazal, et al.
Pubblicazione: (2024)
RLHFPoison: Reward Poisoning Attack for Reinforcement Learning with Human Feedback in Large Language Models
di: Wang, Jiongxiao, et al.
Pubblicazione: (2023)
di: Wang, Jiongxiao, et al.
Pubblicazione: (2023)
Disabling Self-Correction in Retrieval-Augmented Generation via Stealthy Retriever Poisoning
di: Dai, Yanbo, et al.
Pubblicazione: (2025)
di: Dai, Yanbo, et al.
Pubblicazione: (2025)
Can Reinforcement Learning Unlock the Hidden Dangers in Aligned Large Language Models?
di: Karkevandi, Mohammad Bahrami, et al.
Pubblicazione: (2024)
di: Karkevandi, Mohammad Bahrami, et al.
Pubblicazione: (2024)
VERA: Variational Inference Framework for Jailbreaking Large Language Models
di: Lochab, Anamika, et al.
Pubblicazione: (2025)
di: Lochab, Anamika, et al.
Pubblicazione: (2025)
SEEP: Training Dynamics Grounds Latent Representation Search for Mitigating Backdoor Poisoning Attacks
di: He, Xuanli, et al.
Pubblicazione: (2024)
di: He, Xuanli, et al.
Pubblicazione: (2024)
Temporal Context Awareness: A Defense Framework Against Multi-turn Manipulation Attacks on Large Language Models
di: Kulkarni, Prashant, et al.
Pubblicazione: (2025)
di: Kulkarni, Prashant, et al.
Pubblicazione: (2025)
Federated Domain-Specific Knowledge Transfer on Large Language Models Using Synthetic Data
di: Li, Haoran, et al.
Pubblicazione: (2024)
di: Li, Haoran, et al.
Pubblicazione: (2024)
Safely Learning with Private Data: A Federated Learning Framework for Large Language Model
di: Zheng, JiaYing, et al.
Pubblicazione: (2024)
di: Zheng, JiaYing, et al.
Pubblicazione: (2024)
P2P: A Poison-to-Poison Remedy for Reliable Backdoor Defense in LLMs
di: Zhao, Shuai, et al.
Pubblicazione: (2025)
di: Zhao, Shuai, et al.
Pubblicazione: (2025)
Graph-Aware Stealthy Poison-Text Backdoors for Text-Attributed Graphs
di: Luo, Qi, et al.
Pubblicazione: (2026)
di: Luo, Qi, et al.
Pubblicazione: (2026)
LLMAtKGE: Large Language Models as Explainable Attackers against Knowledge Graph Embeddings
di: Li, Ting, et al.
Pubblicazione: (2025)
di: Li, Ting, et al.
Pubblicazione: (2025)
Eyes-on-Me: Scalable RAG Poisoning through Transferable Attention-Steering Attractors
di: Chen, Yen-Shan, et al.
Pubblicazione: (2025)
di: Chen, Yen-Shan, et al.
Pubblicazione: (2025)
ContextLeak: Auditing Leakage in Private In-Context Learning Methods
di: Choi, Jacob, et al.
Pubblicazione: (2025)
di: Choi, Jacob, et al.
Pubblicazione: (2025)
The Dark Side of Human Feedback: Poisoning Large Language Models via User Inputs
di: Chen, Bocheng, et al.
Pubblicazione: (2024)
di: Chen, Bocheng, et al.
Pubblicazione: (2024)
Acquiring Clean Language Models from Backdoor Poisoned Datasets by Downscaling Frequency Space
di: Wu, Zongru, et al.
Pubblicazione: (2024)
di: Wu, Zongru, et al.
Pubblicazione: (2024)
Understanding and Mitigating Over-refusal for Large Language Models via Safety Representation
di: Zhang, Junbo, et al.
Pubblicazione: (2025)
di: Zhang, Junbo, et al.
Pubblicazione: (2025)
Black-Box Opinion Manipulation Attacks to Retrieval-Augmented Generation of Large Language Models
di: Chen, Zhuo, et al.
Pubblicazione: (2024)
di: Chen, Zhuo, et al.
Pubblicazione: (2024)
Pattern Enhanced Multi-Turn Jailbreaking: Exploiting Structural Vulnerabilities in Large Language Models
di: Nihal, Ragib Amin, et al.
Pubblicazione: (2025)
di: Nihal, Ragib Amin, et al.
Pubblicazione: (2025)
Bileve: Securing Text Provenance in Large Language Models Against Spoofing with Bi-level Signature
di: Zhou, Tong, et al.
Pubblicazione: (2024)
di: Zhou, Tong, et al.
Pubblicazione: (2024)
Resource Consumption Red-Teaming for Large Vision-Language Models
di: Gao, Haoran, et al.
Pubblicazione: (2025)
di: Gao, Haoran, et al.
Pubblicazione: (2025)
Learning-Based Automated Adversarial Red-Teaming for Robustness Evaluation of Large Language Models
di: Wei, Zhang, et al.
Pubblicazione: (2025)
di: Wei, Zhang, et al.
Pubblicazione: (2025)
Malware Classification from Memory Dumps Using Machine Learning, Transformers, and Large Language Models
di: Dweib, Areej, et al.
Pubblicazione: (2025)
di: Dweib, Areej, et al.
Pubblicazione: (2025)
Copyright Traps for Large Language Models
di: Meeus, Matthieu, et al.
Pubblicazione: (2024)
di: Meeus, Matthieu, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Hijacking Large Language Models via Adversarial In-Context Learning
di: Zhou, Xiangyu, et al.
Pubblicazione: (2023) -
Not All Tokens Are Meant to Be Forgotten
di: Zhou, Xiangyu, et al.
Pubblicazione: (2025) -
Automatic Calibration for Membership Inference Attack on Large Language Models
di: Zade, Saleh Zare, et al.
Pubblicazione: (2025) -
Denial-of-Service Poisoning Attacks against Large Language Models
di: Gao, Kuofeng, et al.
Pubblicazione: (2024) -
PoisonBench: Assessing Large Language Model Vulnerability to Data Poisoning
di: Fu, Tingchen, et al.
Pubblicazione: (2024)