UOR: Universal Backdoor Attacks on Pre-trained Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Du, Wei, Li, Peixuan, Li, Boqun, Zhao, Haodong, Liu, Gongshen |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
NSmark: Null Space Based Black-box Watermarking Defense Framework for Language Models
di: Zhao, Haodong, et al.
Pubblicazione: (2024)
di: Zhao, Haodong, et al.
Pubblicazione: (2024)
SynGhost: Invisible and Universal Task-agnostic Backdoor Attack via Syntactic Transfer
di: Cheng, Pengzhou, et al.
Pubblicazione: (2024)
di: Cheng, Pengzhou, et al.
Pubblicazione: (2024)
Acquiring Clean Language Models from Backdoor Poisoned Datasets by Downscaling Frequency Space
di: Wu, Zongru, et al.
Pubblicazione: (2024)
di: Wu, Zongru, et al.
Pubblicazione: (2024)
Gracefully Filtering Backdoor Samples for Generative Large Language Models without Retraining
di: Wu, Zongru, et al.
Pubblicazione: (2024)
di: Wu, Zongru, et al.
Pubblicazione: (2024)
Patronus: Identifying and Mitigating Transferable Backdoors in Pre-trained Language Models
di: Zhao, Tianhang, et al.
Pubblicazione: (2025)
di: Zhao, Tianhang, et al.
Pubblicazione: (2025)
Universal Vulnerabilities in Large Language Models: Backdoor Attacks for In-context Learning
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
A Survey of Recent Backdoor Attacks and Defenses in Large Language Models
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
Backdoor Token Unlearning: Exposing and Defending Backdoors in Pretrained Language Models
di: Jiang, Peihai, et al.
Pubblicazione: (2025)
di: Jiang, Peihai, et al.
Pubblicazione: (2025)
Stealthy Backdoor Attacks against LLMs Based on Natural Style Triggers
di: Wei, Jiali, et al.
Pubblicazione: (2026)
di: Wei, Jiali, et al.
Pubblicazione: (2026)
Backdoor Attacks and Countermeasures in Natural Language Processing Models: A Comprehensive Security Review
di: Cheng, Pengzhou, et al.
Pubblicazione: (2023)
di: Cheng, Pengzhou, et al.
Pubblicazione: (2023)
Unlearning Backdoor Attacks for LLMs with Weak-to-Strong Knowledge Distillation
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
Machine Unlearning of Pre-trained Large Language Models
di: Yao, Jin, et al.
Pubblicazione: (2024)
di: Yao, Jin, et al.
Pubblicazione: (2024)
DUP: Detection-guided Unlearning for Backdoor Purification in Language Models
di: Hu, Man, et al.
Pubblicazione: (2025)
di: Hu, Man, et al.
Pubblicazione: (2025)
Context-Aware Membership Inference Attacks against Pre-trained Large Language Models
di: Chang, Hongyan, et al.
Pubblicazione: (2024)
di: Chang, Hongyan, et al.
Pubblicazione: (2024)
Your Inference Request Will Become a Black Box: Confidential Inference for Cloud-based Large Language Models
di: Huang, Chung-ju, et al.
Pubblicazione: (2026)
di: Huang, Chung-ju, et al.
Pubblicazione: (2026)
Imposter.AI: Adversarial Attacks with Hidden Intentions towards Aligned Large Language Models
di: Liu, Xiao, et al.
Pubblicazione: (2024)
di: Liu, Xiao, et al.
Pubblicazione: (2024)
Claim-Guided Textual Backdoor Attack for Practical Applications
di: Song, Minkyoo, et al.
Pubblicazione: (2024)
di: Song, Minkyoo, et al.
Pubblicazione: (2024)
A Universal Identity Backdoor Attack against Speaker Verification based on Siamese Network
di: Zhao, Haodong, et al.
Pubblicazione: (2023)
di: Zhao, Haodong, et al.
Pubblicazione: (2023)
Defending Against Weight-Poisoning Backdoor Attacks for Parameter-Efficient Fine-Tuning
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
Breaking PEFT Limitations: Leveraging Weak-to-Strong Knowledge Transfer for Backdoor Attacks in LLMs
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
Window-based Membership Inference Attacks Against Fine-tuned Large Language Models
di: Chen, Yuetian, et al.
Pubblicazione: (2026)
di: Chen, Yuetian, et al.
Pubblicazione: (2026)
TrojanRAG: Retrieval-Augmented Generation Can Be Backdoor Driver in Large Language Models
di: Cheng, Pengzhou, et al.
Pubblicazione: (2024)
di: Cheng, Pengzhou, et al.
Pubblicazione: (2024)
Stealthy and Persistent Unalignment on Large Language Models via Backdoor Injections
di: Cao, Yuanpu, et al.
Pubblicazione: (2023)
di: Cao, Yuanpu, et al.
Pubblicazione: (2023)
Black-Box Opinion Manipulation Attacks to Retrieval-Augmented Generation of Large Language Models
di: Chen, Zhuo, et al.
Pubblicazione: (2024)
di: Chen, Zhuo, et al.
Pubblicazione: (2024)
Continuous Embedding Attacks via Clipped Inputs in Jailbreaking Large Language Models
di: Xu, Zihao, et al.
Pubblicazione: (2024)
di: Xu, Zihao, et al.
Pubblicazione: (2024)
QueryAttack: Jailbreaking Aligned Large Language Models Using Structured Non-natural Query Language
di: Zou, Qingsong, et al.
Pubblicazione: (2025)
di: Zou, Qingsong, et al.
Pubblicazione: (2025)
Unleashing the Unseen: Harnessing Benign Datasets for Jailbreaking Large Language Models
di: Zhao, Wei, et al.
Pubblicazione: (2024)
di: Zhao, Wei, et al.
Pubblicazione: (2024)
Backdoor Samples Detection Based on Perturbation Discrepancy Consistency in Pre-trained Language Models
di: Peng, Zuquan, et al.
Pubblicazione: (2025)
di: Peng, Zuquan, et al.
Pubblicazione: (2025)
Exploring Backdoor Vulnerabilities of Chat Models
di: Hao, Yunzhuo, et al.
Pubblicazione: (2024)
di: Hao, Yunzhuo, et al.
Pubblicazione: (2024)
Instructions as Backdoors: Backdoor Vulnerabilities of Instruction Tuning for Large Language Models
di: Xu, Jiashu, et al.
Pubblicazione: (2023)
di: Xu, Jiashu, et al.
Pubblicazione: (2023)
Towards Label-Only Membership Inference Attack against Pre-trained Large Language Models
di: He, Yu, et al.
Pubblicazione: (2025)
di: He, Yu, et al.
Pubblicazione: (2025)
Beyond the Tip of Efficiency: Uncovering the Submerged Threats of Jailbreak Attacks in Small Language Models
di: Yi, Sibo, et al.
Pubblicazione: (2025)
di: Yi, Sibo, et al.
Pubblicazione: (2025)
HauntAttack: When Attack Follows Reasoning as a Shadow
di: Ma, Jingyuan, et al.
Pubblicazione: (2025)
di: Ma, Jingyuan, et al.
Pubblicazione: (2025)
Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models
di: Tu, Shangqing, et al.
Pubblicazione: (2024)
di: Tu, Shangqing, et al.
Pubblicazione: (2024)
BadJudge: Backdoor Vulnerabilities of LLM-as-a-Judge
di: Tong, Terry, et al.
Pubblicazione: (2025)
di: Tong, Terry, et al.
Pubblicazione: (2025)
Goal-guided Generative Prompt Injection Attack on Large Language Models
di: Zhang, Chong, et al.
Pubblicazione: (2024)
di: Zhang, Chong, et al.
Pubblicazione: (2024)
Delayed Backdoor Attacks: Exploring the Temporal Dimension as a New Attack Surface in Pre-Trained Models
di: Ding, Zikang, et al.
Pubblicazione: (2026)
di: Ding, Zikang, et al.
Pubblicazione: (2026)
AdaPPA: Adaptive Position Pre-Fill Jailbreak Attack Approach Targeting LLMs
di: Lv, Lijia, et al.
Pubblicazione: (2024)
di: Lv, Lijia, et al.
Pubblicazione: (2024)
Prefix Guidance: A Steering Wheel for Large Language Models to Defend Against Jailbreak Attacks
di: Zhao, Jiawei, et al.
Pubblicazione: (2024)
di: Zhao, Jiawei, et al.
Pubblicazione: (2024)
RobustKV: Defending Large Language Models against Jailbreak Attacks via KV Eviction
di: Jiang, Tanqiu, et al.
Pubblicazione: (2024)
di: Jiang, Tanqiu, et al.
Pubblicazione: (2024)
Documenti analoghi
-
NSmark: Null Space Based Black-box Watermarking Defense Framework for Language Models
di: Zhao, Haodong, et al.
Pubblicazione: (2024) -
SynGhost: Invisible and Universal Task-agnostic Backdoor Attack via Syntactic Transfer
di: Cheng, Pengzhou, et al.
Pubblicazione: (2024) -
Acquiring Clean Language Models from Backdoor Poisoned Datasets by Downscaling Frequency Space
di: Wu, Zongru, et al.
Pubblicazione: (2024) -
Gracefully Filtering Backdoor Samples for Generative Large Language Models without Retraining
di: Wu, Zongru, et al.
Pubblicazione: (2024) -
Patronus: Identifying and Mitigating Transferable Backdoors in Pre-trained Language Models
di: Zhao, Tianhang, et al.
Pubblicazione: (2025)