BadTemplate: A Training-Free Backdoor Attack via Chat Template Against Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Zihan, Li, Hongwei, Zhang, Rui, Jiang, Wenbo, Xu, Guowen |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
BadLingual: A Novel Lingual-Backdoor Attack against Large Language Models
par: Wang, Zihan, et autres
Publié: (2025)
par: Wang, Zihan, et autres
Publié: (2025)
ConfGuard: A Simple and Effective Backdoor Detection for Large Language Models
par: Wang, Zihan, et autres
Publié: (2025)
par: Wang, Zihan, et autres
Publié: (2025)
MPMA: Preference Manipulation Attack Against Model Context Protocol
par: Wang, Zihan, et autres
Publié: (2025)
par: Wang, Zihan, et autres
Publié: (2025)
Combinational Backdoor Attack against Customized Text-to-Image Models
par: Jiang, Wenbo, et autres
Publié: (2024)
par: Jiang, Wenbo, et autres
Publié: (2024)
The Ripple Effect: On Unforeseen Complications of Backdoor Attacks
par: Zhang, Rui, et autres
Publié: (2025)
par: Zhang, Rui, et autres
Publié: (2025)
Instruction Backdoor Attacks Against Customized LLMs
par: Zhang, Rui, et autres
Publié: (2024)
par: Zhang, Rui, et autres
Publié: (2024)
Backdoor Attacks against Image-to-Image Networks
par: Jiang, Wenbo, et autres
Publié: (2024)
par: Jiang, Wenbo, et autres
Publié: (2024)
BadMerging: Backdoor Attacks Against Model Merging
par: Zhang, Jinghuai, et autres
Publié: (2024)
par: Zhang, Jinghuai, et autres
Publié: (2024)
TrojanEdit: Multimodal Backdoor Attack Against Image Editing Model
par: Guo, Ji, et autres
Publié: (2024)
par: Guo, Ji, et autres
Publié: (2024)
Watch Out for Your Guidance on Generation! Exploring Conditional Backdoor Attacks against Large Language Models
par: He, Jiaming, et autres
Publié: (2024)
par: He, Jiaming, et autres
Publié: (2024)
Black-Box Skill Stealing Attack from Proprietary LLM Agents: An Empirical Study
par: Wang, Zihan, et autres
Publié: (2026)
par: Wang, Zihan, et autres
Publié: (2026)
Backdoor Attack Against Vision Transformers via Attention Gradient-Based Image Erosion
par: Guo, Ji, et autres
Publié: (2024)
par: Guo, Ji, et autres
Publié: (2024)
Stealthy Targeted Backdoor Attacks against Image Captioning
par: Fan, Wenshu, et autres
Publié: (2024)
par: Fan, Wenshu, et autres
Publié: (2024)
BadToken: Token-level Backdoor Attacks to Multi-modal Large Language Models
par: Yuan, Zenghui, et autres
Publié: (2025)
par: Yuan, Zenghui, et autres
Publié: (2025)
BadBone: Backdoor Attacks Against Backbone Models in Visual Prompt Learning
par: Yang, Ziqing, et autres
Publié: (2026)
par: Yang, Ziqing, et autres
Publié: (2026)
BadTime: An Effective Backdoor Attack on Multivariate Long-Term Time Series Forecasting
par: Xiang, Kunlan, et autres
Publié: (2025)
par: Xiang, Kunlan, et autres
Publié: (2025)
Hidden Tail: Adversarial Image Causing Stealthy Resource Consumption in Vision-Language Models
par: Zhang, Rui, et autres
Publié: (2025)
par: Zhang, Rui, et autres
Publié: (2025)
Inference-Time Backdoors via Chat Templates: From LLM Supply Chains to Agentic System Compromise
par: Fogel, Ariel, et autres
Publié: (2026)
par: Fogel, Ariel, et autres
Publié: (2026)
BadVLA: Towards Backdoor Attacks on Vision-Language-Action Models via Objective-Decoupled Optimization
par: Zhou, Xueyang, et autres
Publié: (2025)
par: Zhou, Xueyang, et autres
Publié: (2025)
Backdoor Attacks against Hybrid Classical-Quantum Neural Networks
par: Guo, Ji, et autres
Publié: (2024)
par: Guo, Ji, et autres
Publié: (2024)
BadChain: Backdoor Chain-of-Thought Prompting for Large Language Models
par: Xiang, Zhen, et autres
Publié: (2024)
par: Xiang, Zhen, et autres
Publié: (2024)
Composite Backdoor Attacks Against Large Language Models
par: Huang, Hai, et autres
Publié: (2023)
par: Huang, Hai, et autres
Publié: (2023)
BadApex: Backdoor Attack Based on Adaptive Optimization Mechanism of Black-box Large Language Models
par: Wu, Zhengxian, et autres
Publié: (2025)
par: Wu, Zhengxian, et autres
Publié: (2025)
ChatBug: A Common Vulnerability of Aligned LLMs Induced by Chat Templates
par: Jiang, Fengqing, et autres
Publié: (2024)
par: Jiang, Fengqing, et autres
Publié: (2024)
BadRSSD: Backdoor Attacks on Regularized Self-Supervised Diffusion Models
par: Wang, Jiayao, et autres
Publié: (2026)
par: Wang, Jiayao, et autres
Publié: (2026)
Invisibility Cloak: Disappearance under Human Pose Estimation via Backdoor Attacks
par: Zhang, Minxing, et autres
Publié: (2024)
par: Zhang, Minxing, et autres
Publié: (2024)
Physical Backdoor Attack can Jeopardize Driving with Vision-Large-Language Models
par: Ni, Zhenyang, et autres
Publié: (2024)
par: Ni, Zhenyang, et autres
Publié: (2024)
BadDLM: Backdooring Diffusion Language Models with Diverse Targets
par: Zhai, Shengfang, et autres
Publié: (2026)
par: Zhai, Shengfang, et autres
Publié: (2026)
BadCM: Invisible Backdoor Attack Against Cross-Modal Learning
par: Zhang, Zheng, et autres
Publié: (2024)
par: Zhang, Zheng, et autres
Publié: (2024)
Using Large Language Models for Template Detection from Security Event Logs
par: Vaarandi, Risto, et autres
Publié: (2024)
par: Vaarandi, Risto, et autres
Publié: (2024)
The Art of (Mis)alignment: How Fine-Tuning Methods Effectively Misalign and Realign LLMs in Post-Training
par: Zhang, Rui, et autres
Publié: (2026)
par: Zhang, Rui, et autres
Publié: (2026)
Merge Hijacking: Backdoor Attacks to Model Merging of Large Language Models
par: Yuan, Zenghui, et autres
Publié: (2025)
par: Yuan, Zenghui, et autres
Publié: (2025)
BadSkill: Backdoor Attacks on Agent Skills via Model-in-Skill Poisoning
par: Tie, Guiyao, et autres
Publié: (2026)
par: Tie, Guiyao, et autres
Publié: (2026)
State Backdoor: Towards Stealthy Real-world Poisoning Attack on Vision-Language-Action Model in State Space
par: Guo, Ji, et autres
Publié: (2026)
par: Guo, Ji, et autres
Publié: (2026)
BadPatches: Routing-aware Backdoor Attacks on Vision Mixture of Experts
par: Chan, Cedric, et autres
Publié: (2025)
par: Chan, Cedric, et autres
Publié: (2025)
Real is not True: Backdoor Attacks Against Deepfake Detection
par: Sun, Hong, et autres
Publié: (2024)
par: Sun, Hong, et autres
Publié: (2024)
Delayed Backdoor Attacks: Exploring the Temporal Dimension as a New Attack Surface in Pre-Trained Models
par: Ding, Zikang, et autres
Publié: (2026)
par: Ding, Zikang, et autres
Publié: (2026)
Chain-of-Scrutiny: Detecting Backdoor Attacks for Large Language Models
par: Li, Xi, et autres
Publié: (2024)
par: Li, Xi, et autres
Publié: (2024)
One Prompt to Verify Your Models: Black-Box Text-to-Image Models Verification via Non-Transferable Adversarial Attacks
par: Guo, Ji, et autres
Publié: (2024)
par: Guo, Ji, et autres
Publié: (2024)
CleanGen: Mitigating Backdoor Attacks for Generation Tasks in Large Language Models
par: Li, Yuetai, et autres
Publié: (2024)
par: Li, Yuetai, et autres
Publié: (2024)
Documents similaires
-
BadLingual: A Novel Lingual-Backdoor Attack against Large Language Models
par: Wang, Zihan, et autres
Publié: (2025) -
ConfGuard: A Simple and Effective Backdoor Detection for Large Language Models
par: Wang, Zihan, et autres
Publié: (2025) -
MPMA: Preference Manipulation Attack Against Model Context Protocol
par: Wang, Zihan, et autres
Publié: (2025) -
Combinational Backdoor Attack against Customized Text-to-Image Models
par: Jiang, Wenbo, et autres
Publié: (2024) -
The Ripple Effect: On Unforeseen Complications of Backdoor Attacks
par: Zhang, Rui, et autres
Publié: (2025)