BadLingual: A Novel Lingual-Backdoor Attack against Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Zihan, Li, Hongwei, Zhang, Rui, Jiang, Wenbo, Chen, Kangjie, Zhang, Tianwei, Zhao, Qingchuan, Xu, Guowen |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ConfGuard: A Simple and Effective Backdoor Detection for Large Language Models
di: Wang, Zihan, et al.
Pubblicazione: (2025)
di: Wang, Zihan, et al.
Pubblicazione: (2025)
BadTemplate: A Training-Free Backdoor Attack via Chat Template Against Large Language Models
di: Wang, Zihan, et al.
Pubblicazione: (2026)
di: Wang, Zihan, et al.
Pubblicazione: (2026)
MPMA: Preference Manipulation Attack Against Model Context Protocol
di: Wang, Zihan, et al.
Pubblicazione: (2025)
di: Wang, Zihan, et al.
Pubblicazione: (2025)
Combinational Backdoor Attack against Customized Text-to-Image Models
di: Jiang, Wenbo, et al.
Pubblicazione: (2024)
di: Jiang, Wenbo, et al.
Pubblicazione: (2024)
Backdoor Attacks against Image-to-Image Networks
di: Jiang, Wenbo, et al.
Pubblicazione: (2024)
di: Jiang, Wenbo, et al.
Pubblicazione: (2024)
Watch Out for Your Guidance on Generation! Exploring Conditional Backdoor Attacks against Large Language Models
di: He, Jiaming, et al.
Pubblicazione: (2024)
di: He, Jiaming, et al.
Pubblicazione: (2024)
TuBA: Cross-Lingual Transferability of Backdoor Attacks in LLMs with Instruction Tuning
di: He, Xuanli, et al.
Pubblicazione: (2024)
di: He, Xuanli, et al.
Pubblicazione: (2024)
Black-Box Skill Stealing Attack from Proprietary LLM Agents: An Empirical Study
di: Wang, Zihan, et al.
Pubblicazione: (2026)
di: Wang, Zihan, et al.
Pubblicazione: (2026)
The Ripple Effect: On Unforeseen Complications of Backdoor Attacks
di: Zhang, Rui, et al.
Pubblicazione: (2025)
di: Zhang, Rui, et al.
Pubblicazione: (2025)
Hidden Tail: Adversarial Image Causing Stealthy Resource Consumption in Vision-Language Models
di: Zhang, Rui, et al.
Pubblicazione: (2025)
di: Zhang, Rui, et al.
Pubblicazione: (2025)
BadApex: Backdoor Attack Based on Adaptive Optimization Mechanism of Black-box Large Language Models
di: Wu, Zhengxian, et al.
Pubblicazione: (2025)
di: Wu, Zhengxian, et al.
Pubblicazione: (2025)
Stealthy Targeted Backdoor Attacks against Image Captioning
di: Fan, Wenshu, et al.
Pubblicazione: (2024)
di: Fan, Wenshu, et al.
Pubblicazione: (2024)
BadEdit: Backdooring large language models by model editing
di: Li, Yanzhou, et al.
Pubblicazione: (2024)
di: Li, Yanzhou, et al.
Pubblicazione: (2024)
Cross-Lingual Summarization as a Black-Box Watermark Removal Attack
di: Ganesan, Gokul
Pubblicazione: (2025)
di: Ganesan, Gokul
Pubblicazione: (2025)
Composite Backdoor Attacks Against Large Language Models
di: Huang, Hai, et al.
Pubblicazione: (2023)
di: Huang, Hai, et al.
Pubblicazione: (2023)
Backdoor Attacks against Hybrid Classical-Quantum Neural Networks
di: Guo, Ji, et al.
Pubblicazione: (2024)
di: Guo, Ji, et al.
Pubblicazione: (2024)
CL-Attack: Textual Backdoor Attacks via Cross-Lingual Triggers
di: Zheng, Jingyi, et al.
Pubblicazione: (2024)
di: Zheng, Jingyi, et al.
Pubblicazione: (2024)
The Art of (Mis)alignment: How Fine-Tuning Methods Effectively Misalign and Realign LLMs in Post-Training
di: Zhang, Rui, et al.
Pubblicazione: (2026)
di: Zhang, Rui, et al.
Pubblicazione: (2026)
Instruction Backdoor Attacks Against Customized LLMs
di: Zhang, Rui, et al.
Pubblicazione: (2024)
di: Zhang, Rui, et al.
Pubblicazione: (2024)
A Survey on Backdoor Threats in Large Language Models (LLMs): Attacks, Defenses, and Evaluations
di: Zhou, Yihe, et al.
Pubblicazione: (2025)
di: Zhou, Yihe, et al.
Pubblicazione: (2025)
BadAgent: Inserting and Activating Backdoor Attacks in LLM Agents
di: Wang, Yifei, et al.
Pubblicazione: (2024)
di: Wang, Yifei, et al.
Pubblicazione: (2024)
BadActs: A Universal Backdoor Defense in the Activation Space
di: Yi, Biao, et al.
Pubblicazione: (2024)
di: Yi, Biao, et al.
Pubblicazione: (2024)
SteganoBackdoor: Stealthy and Data-Efficient Backdoor Attacks on Language Models
di: Xue, Eric, et al.
Pubblicazione: (2025)
di: Xue, Eric, et al.
Pubblicazione: (2025)
A Survey of Recent Backdoor Attacks and Defenses in Large Language Models
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
BadToken: Token-level Backdoor Attacks to Multi-modal Large Language Models
di: Yuan, Zenghui, et al.
Pubblicazione: (2025)
di: Yuan, Zenghui, et al.
Pubblicazione: (2025)
Large Language Models are Good Attackers: Efficient and Stealthy Textual Backdoor Attacks
di: Li, Ziqiang, et al.
Pubblicazione: (2024)
di: Li, Ziqiang, et al.
Pubblicazione: (2024)
Universal Vulnerabilities in Large Language Models: Backdoor Attacks for In-context Learning
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
Towards Effective Prompt Stealing Attack against Text-to-Image Diffusion Models
di: Zhao, Shiqian, et al.
Pubblicazione: (2025)
di: Zhao, Shiqian, et al.
Pubblicazione: (2025)
BadMerging: Backdoor Attacks Against Model Merging
di: Zhang, Jinghuai, et al.
Pubblicazione: (2024)
di: Zhang, Jinghuai, et al.
Pubblicazione: (2024)
Denial-of-Service Poisoning Attacks against Large Language Models
di: Gao, Kuofeng, et al.
Pubblicazione: (2024)
di: Gao, Kuofeng, et al.
Pubblicazione: (2024)
MetaBackdoor: Exploiting Positional Encoding as a Backdoor Attack Surface in LLMs
di: Wen, Rui, et al.
Pubblicazione: (2026)
di: Wen, Rui, et al.
Pubblicazione: (2026)
BadTime: An Effective Backdoor Attack on Multivariate Long-Term Time Series Forecasting
di: Xiang, Kunlan, et al.
Pubblicazione: (2025)
di: Xiang, Kunlan, et al.
Pubblicazione: (2025)
BadJudge: Backdoor Vulnerabilities of LLM-as-a-Judge
di: Tong, Terry, et al.
Pubblicazione: (2025)
di: Tong, Terry, et al.
Pubblicazione: (2025)
BadRSSD: Backdoor Attacks on Regularized Self-Supervised Diffusion Models
di: Wang, Jiayao, et al.
Pubblicazione: (2026)
di: Wang, Jiayao, et al.
Pubblicazione: (2026)
BadFair: Backdoored Fairness Attacks with Group-conditioned Triggers
di: Xue, Jiaqi, et al.
Pubblicazione: (2024)
di: Xue, Jiaqi, et al.
Pubblicazione: (2024)
Semantic-level Backdoor Attack against Text-to-Image Diffusion Models
di: Chen, Tianxin, et al.
Pubblicazione: (2026)
di: Chen, Tianxin, et al.
Pubblicazione: (2026)
Towards Action Hijacking of Large Language Model-based Agent
di: Zhang, Yuyang, et al.
Pubblicazione: (2024)
di: Zhang, Yuyang, et al.
Pubblicazione: (2024)
Stealthy Backdoor Attacks against LLMs Based on Natural Style Triggers
di: Wei, Jiali, et al.
Pubblicazione: (2026)
di: Wei, Jiali, et al.
Pubblicazione: (2026)
Character as a Latent Variable in Large Language Models: A Mechanistic Account of Emergent Misalignment and Conditional Safety Failures
di: Su, Yanghao, et al.
Pubblicazione: (2026)
di: Su, Yanghao, et al.
Pubblicazione: (2026)
BadViM: Backdoor Attack against Vision Mamba
di: Wu, Yinghao, et al.
Pubblicazione: (2025)
di: Wu, Yinghao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
ConfGuard: A Simple and Effective Backdoor Detection for Large Language Models
di: Wang, Zihan, et al.
Pubblicazione: (2025) -
BadTemplate: A Training-Free Backdoor Attack via Chat Template Against Large Language Models
di: Wang, Zihan, et al.
Pubblicazione: (2026) -
MPMA: Preference Manipulation Attack Against Model Context Protocol
di: Wang, Zihan, et al.
Pubblicazione: (2025) -
Combinational Backdoor Attack against Customized Text-to-Image Models
di: Jiang, Wenbo, et al.
Pubblicazione: (2024) -
Backdoor Attacks against Image-to-Image Networks
di: Jiang, Wenbo, et al.
Pubblicazione: (2024)