BadChain: Backdoor Chain-of-Thought Prompting for Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xiang, Zhen, Jiang, Fengqing, Xiong, Zidi, Ramasubramanian, Bhaskar, Poovendran, Radha, Li, Bo |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CleanGen: Mitigating Backdoor Attacks for Generation Tasks in Large Language Models
par: Li, Yuetai, et autres
Publié: (2024)
par: Li, Yuetai, et autres
Publié: (2024)
CBD: A Certified Backdoor Detector Based on Local Dominant Probability
par: Xiang, Zhen, et autres
Publié: (2023)
par: Xiang, Zhen, et autres
Publié: (2023)
Game of Trojans: Adaptive Adversaries Against Output-based Trojaned-Model Detectors
par: Sahabandu, Dinuka, et autres
Publié: (2024)
par: Sahabandu, Dinuka, et autres
Publié: (2024)
SoSBench: Benchmarking Safety Alignment on Six Scientific Domains
par: Jiang, Fengqing, et autres
Publié: (2025)
par: Jiang, Fengqing, et autres
Publié: (2025)
ACE: A Model Poisoning Attack on Contribution Evaluation Methods in Federated Learning
par: Xu, Zhangchen, et autres
Publié: (2024)
par: Xu, Zhangchen, et autres
Publié: (2024)
Double-Dip: Thwarting Label-Only Membership Inference Attacks with Transfer Learning and Randomization
par: Rajabi, Arezoo, et autres
Publié: (2024)
par: Rajabi, Arezoo, et autres
Publié: (2024)
DarkMind: Latent Chain-of-Thought Backdoor in Customized LLMs
par: Guo, Zhen, et autres
Publié: (2025)
par: Guo, Zhen, et autres
Publié: (2025)
ChatBug: A Common Vulnerability of Aligned LLMs Induced by Chat Templates
par: Jiang, Fengqing, et autres
Publié: (2024)
par: Jiang, Fengqing, et autres
Publié: (2024)
Brave: Byzantine-Resilient and Privacy-Preserving Peer-to-Peer Federated Learning
par: Xu, Zhangchen, et autres
Publié: (2024)
par: Xu, Zhangchen, et autres
Publié: (2024)
BadMerging: Backdoor Attacks Against Model Merging
par: Zhang, Jinghuai, et autres
Publié: (2024)
par: Zhang, Jinghuai, et autres
Publié: (2024)
CANTXSec: A Deterministic Intrusion Detection and Prevention System for CAN Bus Monitoring ECU Activations
par: Donadel, Denis, et autres
Publié: (2025)
par: Donadel, Denis, et autres
Publié: (2025)
BadScientist: Can a Research Agent Write Convincing but Unsound Papers that Fool LLM Reviewers?
par: Jiang, Fengqing, et autres
Publié: (2025)
par: Jiang, Fengqing, et autres
Publié: (2025)
Thought-Transfer: Indirect Targeted Poisoning Attacks on Chain-of-Thought Reasoning Models
par: Chaudhari, Harsh, et autres
Publié: (2026)
par: Chaudhari, Harsh, et autres
Publié: (2026)
Backdooring Instruction-Tuned Large Language Models with Virtual Prompt Injection
par: Yan, Jun, et autres
Publié: (2023)
par: Yan, Jun, et autres
Publié: (2023)
BadRSSD: Backdoor Attacks on Regularized Self-Supervised Diffusion Models
par: Wang, Jiayao, et autres
Publié: (2026)
par: Wang, Jiayao, et autres
Publié: (2026)
Backdoored Retrievers for Prompt Injection Attacks on Retrieval Augmented Generation of Large Language Models
par: Clop, Cody, et autres
Publié: (2024)
par: Clop, Cody, et autres
Publié: (2024)
Under-confidence Backdoors Are Resilient and Stealthy Backdoors
par: Peng, Minlong, et autres
Publié: (2022)
par: Peng, Minlong, et autres
Publié: (2022)
Echoes within the Reasoning: Stealthy and Effective Watermarking via Chain of Thought
par: Lu, Jiacheng, et autres
Publié: (2026)
par: Lu, Jiacheng, et autres
Publié: (2026)
Fusing Pruned and Backdoored Models: Optimal Transport-based Data-free Backdoor Mitigation
par: Lin, Weilin, et autres
Publié: (2024)
par: Lin, Weilin, et autres
Publié: (2024)
DiffusionHijack: Supply-Chain PRNG Backdoor Attack on Diffusion Models and Quantum Random Number Defense
par: You, Ziyang, et autres
Publié: (2026)
par: You, Ziyang, et autres
Publié: (2026)
BadFU: Backdoor Federated Learning through Adversarial Machine Unlearning
par: Lu, Bingguang, et autres
Publié: (2025)
par: Lu, Bingguang, et autres
Publié: (2025)
BadThink: Triggered Overthinking Attacks on Chain-of-Thought Reasoning in Large Language Models
par: Liu, Shuaitong, et autres
Publié: (2025)
par: Liu, Shuaitong, et autres
Publié: (2025)
RigorLLM: Resilient Guardrails for Large Language Models against Undesired Content
par: Yuan, Zhuowen, et autres
Publié: (2024)
par: Yuan, Zhuowen, et autres
Publié: (2024)
TooBadRL: Trigger Optimization to Boost Effectiveness of Backdoor Attacks on Deep Reinforcement Learning
par: Zhang, Mingxuan, et autres
Publié: (2025)
par: Zhang, Mingxuan, et autres
Publié: (2025)
Data-Chain Backdoor: Do You Trust Diffusion Models as Generative Data Supplier?
par: Lu, Junchi, et autres
Publié: (2025)
par: Lu, Junchi, et autres
Publié: (2025)
Output Supervision Can Obfuscate the Chain of Thought
par: Drori, Jacob, et autres
Publié: (2025)
par: Drori, Jacob, et autres
Publié: (2025)
Inference-Time Backdoors via Chat Templates: From LLM Supply Chains to Agentic System Compromise
par: Fogel, Ariel, et autres
Publié: (2026)
par: Fogel, Ariel, et autres
Publié: (2026)
Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor
par: Chang, Wenhan, et autres
Publié: (2026)
par: Chang, Wenhan, et autres
Publié: (2026)
Model Supply Chain Poisoning: Backdooring Pre-trained Models via Embedding Indistinguishability
par: Wang, Hao, et autres
Publié: (2024)
par: Wang, Hao, et autres
Publié: (2024)
Chain-of-Thought Prompting of Large Language Models for Discovering and Fixing Software Vulnerabilities
par: Nong, Yu, et autres
Publié: (2024)
par: Nong, Yu, et autres
Publié: (2024)
SequentialBreak: Large Language Models Can be Fooled by Embedding Jailbreak Prompts into Sequential Prompt Chains
par: Saiem, Bijoy Ahmed, et autres
Publié: (2024)
par: Saiem, Bijoy Ahmed, et autres
Publié: (2024)
Authority Backdoor: A Certifiable Backdoor Mechanism for Authoring DNNs
par: Yang, Han, et autres
Publié: (2025)
par: Yang, Han, et autres
Publié: (2025)
Prompt Obfuscation for Large Language Models
par: Pape, David, et autres
Publié: (2024)
par: Pape, David, et autres
Publié: (2024)
Backdooring Masked Diffusion Language Models
par: Cao, Daniel Yiming, et autres
Publié: (2026)
par: Cao, Daniel Yiming, et autres
Publié: (2026)
Self-Purification Mitigates Backdoors in Multimodal Diffusion Language Models
par: Wan, Guangnian, et autres
Publié: (2026)
par: Wan, Guangnian, et autres
Publié: (2026)
BadImplant: Injection-based Multi-Targeted Graph Backdoor Attack
par: Khan, Md Nabi Newaz, et autres
Publié: (2026)
par: Khan, Md Nabi Newaz, et autres
Publié: (2026)
Persistent Backdoor Attacks in Continual Learning
par: Guo, Zhen, et autres
Publié: (2024)
par: Guo, Zhen, et autres
Publié: (2024)
The 'Sure' Trap: Multi-Scale Poisoning Analysis of Stealthy Compliance-Only Backdoors in Fine-Tuned Large Language Models
par: Tan, Yuting, et autres
Publié: (2025)
par: Tan, Yuting, et autres
Publié: (2025)
Conscious Data Contribution via Community-Driven Chain-of-Thought Distillation
par: Libon, Lena, et autres
Publié: (2025)
par: Libon, Lena, et autres
Publié: (2025)
Krait: A Backdoor Attack Against Graph Prompt Tuning
par: Song, Ying, et autres
Publié: (2024)
par: Song, Ying, et autres
Publié: (2024)
Documents similaires
-
CleanGen: Mitigating Backdoor Attacks for Generation Tasks in Large Language Models
par: Li, Yuetai, et autres
Publié: (2024) -
CBD: A Certified Backdoor Detector Based on Local Dominant Probability
par: Xiang, Zhen, et autres
Publié: (2023) -
Game of Trojans: Adaptive Adversaries Against Output-based Trojaned-Model Detectors
par: Sahabandu, Dinuka, et autres
Publié: (2024) -
SoSBench: Benchmarking Safety Alignment on Six Scientific Domains
par: Jiang, Fengqing, et autres
Publié: (2025) -
ACE: A Model Poisoning Attack on Contribution Evaluation Methods in Federated Learning
par: Xu, Zhangchen, et autres
Publié: (2024)