Acquiring Clean Language Models from Backdoor Poisoned Datasets by Downscaling Frequency Space
Fuente:
arXiv
Salvato in:
| Autori principali: | Wu, Zongru, Zhang, Zhuosheng, Cheng, Pengzhou, Liu, Gongshen |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Gracefully Filtering Backdoor Samples for Generative Large Language Models without Retraining
di: Wu, Zongru, et al.
Pubblicazione: (2024)
di: Wu, Zongru, et al.
Pubblicazione: (2024)
SynGhost: Invisible and Universal Task-agnostic Backdoor Attack via Syntactic Transfer
di: Cheng, Pengzhou, et al.
Pubblicazione: (2024)
di: Cheng, Pengzhou, et al.
Pubblicazione: (2024)
TrojanRAG: Retrieval-Augmented Generation Can Be Backdoor Driver in Large Language Models
di: Cheng, Pengzhou, et al.
Pubblicazione: (2024)
di: Cheng, Pengzhou, et al.
Pubblicazione: (2024)
MKF-ADS: Multi-Knowledge Fusion Based Self-supervised Anomaly Detection System for Control Area Network
di: Cheng, Pengzhou, et al.
Pubblicazione: (2024)
di: Cheng, Pengzhou, et al.
Pubblicazione: (2024)
Transferring Backdoors between Large Language Models by Knowledge Distillation
di: Cheng, Pengzhou, et al.
Pubblicazione: (2024)
di: Cheng, Pengzhou, et al.
Pubblicazione: (2024)
UOR: Universal Backdoor Attacks on Pre-trained Language Models
di: Du, Wei, et al.
Pubblicazione: (2023)
di: Du, Wei, et al.
Pubblicazione: (2023)
NSmark: Null Space Based Black-box Watermarking Defense Framework for Language Models
di: Zhao, Haodong, et al.
Pubblicazione: (2024)
di: Zhao, Haodong, et al.
Pubblicazione: (2024)
Backdoor Attacks and Countermeasures in Natural Language Processing Models: A Comprehensive Security Review
di: Cheng, Pengzhou, et al.
Pubblicazione: (2023)
di: Cheng, Pengzhou, et al.
Pubblicazione: (2023)
P2P: A Poison-to-Poison Remedy for Reliable Backdoor Defense in LLMs
di: Zhao, Shuai, et al.
Pubblicazione: (2025)
di: Zhao, Shuai, et al.
Pubblicazione: (2025)
ProtegoFed: Backdoor-Free Federated Instruction Tuning with Interspersed Poisoned Data
di: Zhao, Haodong, et al.
Pubblicazione: (2026)
di: Zhao, Haodong, et al.
Pubblicazione: (2026)
Defending Against Weight-Poisoning Backdoor Attacks for Parameter-Efficient Fine-Tuning
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
PoisonBench: Assessing Large Language Model Vulnerability to Data Poisoning
di: Fu, Tingchen, et al.
Pubblicazione: (2024)
di: Fu, Tingchen, et al.
Pubblicazione: (2024)
Backdoor Token Unlearning: Exposing and Defending Backdoors in Pretrained Language Models
di: Jiang, Peihai, et al.
Pubblicazione: (2025)
di: Jiang, Peihai, et al.
Pubblicazione: (2025)
Universal Jailbreak Backdoors from Poisoned Human Feedback
di: Rando, Javier, et al.
Pubblicazione: (2023)
di: Rando, Javier, et al.
Pubblicazione: (2023)
LaSM: Layer-wise Scaling Mechanism for Defending Pop-up Attack on GUI Agents
di: Yan, Zihe, et al.
Pubblicazione: (2025)
di: Yan, Zihe, et al.
Pubblicazione: (2025)
A Survey of Recent Backdoor Attacks and Defenses in Large Language Models
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
Smoothing Grounding and Reasoning for MLLM-Powered GUI Agents with Query-Oriented Pivot Tasks
di: Wu, Zongru, et al.
Pubblicazione: (2025)
di: Wu, Zongru, et al.
Pubblicazione: (2025)
DUP: Detection-guided Unlearning for Backdoor Purification in Language Models
di: Hu, Man, et al.
Pubblicazione: (2025)
di: Hu, Man, et al.
Pubblicazione: (2025)
Universal Vulnerabilities in Large Language Models: Backdoor Attacks for In-context Learning
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
Stealthy and Persistent Unalignment on Large Language Models via Backdoor Injections
di: Cao, Yuanpu, et al.
Pubblicazione: (2023)
di: Cao, Yuanpu, et al.
Pubblicazione: (2023)
Poison Once, Control Anywhere: Clean-Text Visual Backdoors in VLM-based Mobile Agents
di: Wang, Xuan, et al.
Pubblicazione: (2025)
di: Wang, Xuan, et al.
Pubblicazione: (2025)
bi-GRPO: Bidirectional Optimization for Jailbreak Backdoor Injection on LLMs
di: Ji, Wence, et al.
Pubblicazione: (2025)
di: Ji, Wence, et al.
Pubblicazione: (2025)
Exploring Backdoor Vulnerabilities of Chat Models
di: Hao, Yunzhuo, et al.
Pubblicazione: (2024)
di: Hao, Yunzhuo, et al.
Pubblicazione: (2024)
Instructions as Backdoors: Backdoor Vulnerabilities of Instruction Tuning for Large Language Models
di: Xu, Jiashu, et al.
Pubblicazione: (2023)
di: Xu, Jiashu, et al.
Pubblicazione: (2023)
SSCL-BW: Sample-Specific Clean-Label Backdoor Watermarking for Dataset Ownership Verification
di: Wang, Yingjia, et al.
Pubblicazione: (2025)
di: Wang, Yingjia, et al.
Pubblicazione: (2025)
ADMIT: Few-shot Knowledge Poisoning Attacks on RAG-based Fact Checking
di: Wu, Yutao, et al.
Pubblicazione: (2025)
di: Wu, Yutao, et al.
Pubblicazione: (2025)
Supply-Chain Poisoning Attacks Against LLM Coding Agent Skill Ecosystems
di: Qu, Yubin, et al.
Pubblicazione: (2026)
di: Qu, Yubin, et al.
Pubblicazione: (2026)
Stealthy Backdoor Attacks against LLMs Based on Natural Style Triggers
di: Wei, Jiali, et al.
Pubblicazione: (2026)
di: Wei, Jiali, et al.
Pubblicazione: (2026)
Unlearning Backdoor Attacks for LLMs with Weak-to-Strong Knowledge Distillation
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
A Set of Generalized Components to Achieve Effective Poison-only Clean-label Backdoor Attacks with Collaborative Sample Selection and Triggers
di: Wu, Zhixiao, et al.
Pubblicazione: (2025)
di: Wu, Zhixiao, et al.
Pubblicazione: (2025)
RLHFPoison: Reward Poisoning Attack for Reinforcement Learning with Human Feedback in Large Language Models
di: Wang, Jiongxiao, et al.
Pubblicazione: (2023)
di: Wang, Jiongxiao, et al.
Pubblicazione: (2023)
Securing Multi-turn Conversational Language Models From Distributed Backdoor Triggers
di: Tong, Terry, et al.
Pubblicazione: (2024)
di: Tong, Terry, et al.
Pubblicazione: (2024)
ForgeDAN: An Evolutionary Framework for Jailbreaking Aligned Large Language Models
di: Cheng, Siyang, et al.
Pubblicazione: (2025)
di: Cheng, Siyang, et al.
Pubblicazione: (2025)
PARASITE: Conditional System Prompt Poisoning to Hijack LLMs
di: Pham, Viet, et al.
Pubblicazione: (2025)
di: Pham, Viet, et al.
Pubblicazione: (2025)
Virus Infection Attack on LLMs: Your Poisoning Can Spread "VIA" Synthetic Data
di: Liang, Zi, et al.
Pubblicazione: (2025)
di: Liang, Zi, et al.
Pubblicazione: (2025)
From Poisoned to Aware: Fostering Backdoor Self-Awareness in LLMs
di: Shen, Guangyu, et al.
Pubblicazione: (2025)
di: Shen, Guangyu, et al.
Pubblicazione: (2025)
Black-Box Opinion Manipulation Attacks to Retrieval-Augmented Generation of Large Language Models
di: Chen, Zhuo, et al.
Pubblicazione: (2024)
di: Chen, Zhuo, et al.
Pubblicazione: (2024)
A Study of Backdoors in Instruction Fine-tuned Language Models
di: Raghuram, Jayaram, et al.
Pubblicazione: (2024)
di: Raghuram, Jayaram, et al.
Pubblicazione: (2024)
ForensicsData: A Digital Forensics Dataset for Large Language Models
di: Chakir, Youssef, et al.
Pubblicazione: (2025)
di: Chakir, Youssef, et al.
Pubblicazione: (2025)
Unleashing the Unseen: Harnessing Benign Datasets for Jailbreaking Large Language Models
di: Zhao, Wei, et al.
Pubblicazione: (2024)
di: Zhao, Wei, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Gracefully Filtering Backdoor Samples for Generative Large Language Models without Retraining
di: Wu, Zongru, et al.
Pubblicazione: (2024) -
SynGhost: Invisible and Universal Task-agnostic Backdoor Attack via Syntactic Transfer
di: Cheng, Pengzhou, et al.
Pubblicazione: (2024) -
TrojanRAG: Retrieval-Augmented Generation Can Be Backdoor Driver in Large Language Models
di: Cheng, Pengzhou, et al.
Pubblicazione: (2024) -
MKF-ADS: Multi-Knowledge Fusion Based Self-supervised Anomaly Detection System for Control Area Network
di: Cheng, Pengzhou, et al.
Pubblicazione: (2024) -
Transferring Backdoors between Large Language Models by Knowledge Distillation
di: Cheng, Pengzhou, et al.
Pubblicazione: (2024)