Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor
Fuente:
arXiv
Saved in:
| Main Authors: | Chang, Wenhan, Zhu, Tianqing, Xiong, Ping, Guan, Faqian, Zhou, Wanlei |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Zero-shot Class Unlearning via Layer-wise Relevance Analysis and Neuronal Path Perturbation
by: Chang, Wenhan, et al.
Published: (2024)
by: Chang, Wenhan, et al.
Published: (2024)
Large Language Models Merging for Enhancing the Link Stealing Attack on Graph Neural Networks
by: Guan, Faqian, et al.
Published: (2024)
by: Guan, Faqian, et al.
Published: (2024)
Chain-of-Lure: A Universal Jailbreak Attack Framework using Unconstrained Synthetic Narratives
by: Chang, Wenhan, et al.
Published: (2025)
by: Chang, Wenhan, et al.
Published: (2025)
Large Language Models for Link Stealing Attacks Against Graph Neural Networks
by: Guan, Faqian, et al.
Published: (2024)
by: Guan, Faqian, et al.
Published: (2024)
Evaluating of Machine Unlearning: Robustness Verification Without Prior Modifications
by: Xu, Heng, et al.
Published: (2024)
by: Xu, Heng, et al.
Published: (2024)
Defending Against Neural Network Model Inversion Attacks via Data Poisoning
by: Zhou, Shuai, et al.
Published: (2024)
by: Zhou, Shuai, et al.
Published: (2024)
Osmosis Distillation: Model Hijacking with the Fewest Samples
by: Shi, Yuchen, et al.
Published: (2026)
by: Shi, Yuchen, et al.
Published: (2026)
Poisoning the Pixels: Revisiting Backdoor Attacks on Semantic Segmentation
by: Zhang, Guangsheng, et al.
Published: (2026)
by: Zhang, Guangsheng, et al.
Published: (2026)
Really Unlearned? Verifying Machine Unlearning via Influential Sample Pairs
by: Xu, Heng, et al.
Published: (2024)
by: Xu, Heng, et al.
Published: (2024)
Don't Forget Too Much: Towards Machine Unlearning on Feature Level
by: Xu, Heng, et al.
Published: (2024)
by: Xu, Heng, et al.
Published: (2024)
Federated TrustChain: Blockchain-Enhanced LLM Training and Unlearning
by: Zuo, Xuhan, et al.
Published: (2024)
by: Zuo, Xuhan, et al.
Published: (2024)
Large Language Model Federated Learning with Blockchain and Unlearning for Cross-Organizational Collaboration
by: Zuo, Xuhan, et al.
Published: (2024)
by: Zuo, Xuhan, et al.
Published: (2024)
When Machine Unlearning Meets Retrieval-Augmented Generation (RAG): Keep Secret or Forget Knowledge?
by: Wang, Shang, et al.
Published: (2024)
by: Wang, Shang, et al.
Published: (2024)
BadChain: Backdoor Chain-of-Thought Prompting for Large Language Models
by: Xiang, Zhen, et al.
Published: (2024)
by: Xiang, Zhen, et al.
Published: (2024)
When LLMs Team Up: A Coordinated Attack Framework for Automated Cyber Intrusions
by: Qi, Minfeng, et al.
Published: (2026)
by: Qi, Minfeng, et al.
Published: (2026)
Merge Hijacking: Backdoor Attacks to Model Merging of Large Language Models
by: Yuan, Zenghui, et al.
Published: (2025)
by: Yuan, Zenghui, et al.
Published: (2025)
Privacy Intelligence: A Survey on Image Privacy in Online Social Networks
by: Liu, Chi, et al.
Published: (2020)
by: Liu, Chi, et al.
Published: (2020)
MARS: A Malignity-Aware Backdoor Defense in Federated Learning
by: Wan, Wei, et al.
Published: (2025)
by: Wan, Wei, et al.
Published: (2025)
From Thinking to Output: Chain-of-Thought and Text Generation Characteristics in Reasoning Language Models
by: Liu, Junhao, et al.
Published: (2025)
by: Liu, Junhao, et al.
Published: (2025)
Safety Context Injection: Inference-Time Safety Alignment via Static Filtering and Agentic Analysis
by: Xu, Zhenhao, et al.
Published: (2026)
by: Xu, Zhenhao, et al.
Published: (2026)
The Emerged Security and Privacy of LLM Agent: A Survey with Case Studies
by: He, Feng, et al.
Published: (2024)
by: He, Feng, et al.
Published: (2024)
Frequency Bias Matters: Diving into Robust and Generalized Deep Image Forgery Detection
by: Liu, Chi, et al.
Published: (2025)
by: Liu, Chi, et al.
Published: (2025)
Towards Robust GAN-generated Image Detection: a Multi-view Completion Representation
by: Liu, Chi, et al.
Published: (2023)
by: Liu, Chi, et al.
Published: (2023)
Towards Transparent and Incentive-Compatible Collaboration in Decentralized LLM Multi-Agent Systems: A Blockchain-Driven Approach
by: Qi, Minfeng, et al.
Published: (2025)
by: Qi, Minfeng, et al.
Published: (2025)
Towards Efficient Target-Level Machine Unlearning Based on Essential Graph
by: Xu, Heng, et al.
Published: (2024)
by: Xu, Heng, et al.
Published: (2024)
A Survey on Machine Unlearning: Techniques and New Emerged Privacy Risks
by: Liu, Hengzhu, et al.
Published: (2024)
by: Liu, Hengzhu, et al.
Published: (2024)
Unique Security and Privacy Threats of Large Language Models: A Comprehensive Survey
by: Wang, Shang, et al.
Published: (2024)
by: Wang, Shang, et al.
Published: (2024)
DiffusionHijack: Supply-Chain PRNG Backdoor Attack on Diffusion Models and Quantum Random Number Defense
by: You, Ziyang, et al.
Published: (2026)
by: You, Ziyang, et al.
Published: (2026)
WebTrap: Stealthy Mid-Task Hijacking of Browser Agents During Navigation
by: Liu, Zhichao, et al.
Published: (2026)
by: Liu, Zhichao, et al.
Published: (2026)
Linkage on Security, Privacy and Fairness in Federated Learning: New Balances and New Perspectives
by: Wang, Linlin, et al.
Published: (2024)
by: Wang, Linlin, et al.
Published: (2024)
Forgetting Similar Samples: Can Machine Unlearning Do it Better?
by: Xu, Heng, et al.
Published: (2026)
by: Xu, Heng, et al.
Published: (2026)
CSC: Turning the Adversary's Poison against Itself
by: Shi, Yuchen, et al.
Published: (2026)
by: Shi, Yuchen, et al.
Published: (2026)
DarkMind: Latent Chain-of-Thought Backdoor in Customized LLMs
by: Guo, Zhen, et al.
Published: (2025)
by: Guo, Zhen, et al.
Published: (2025)
Bias Amplification in RAG: Poisoning Knowledge Retrieval to Steer LLMs
by: Wang, Linlin, et al.
Published: (2025)
by: Wang, Linlin, et al.
Published: (2025)
ShadowCoT: Cognitive Hijacking for Stealthy Reasoning Backdoors in LLMs
by: Zhao, Gejian, et al.
Published: (2025)
by: Zhao, Gejian, et al.
Published: (2025)
When Fairness Meets Privacy: Exploring Privacy Threats in Fair Binary Classifiers via Membership Inference Attacks
by: Tian, Huan, et al.
Published: (2023)
by: Tian, Huan, et al.
Published: (2023)
TRAP: Hijacking VLA CoT-Reasoning via Adversarial Patches
by: Huang, Zhengxian, et al.
Published: (2026)
by: Huang, Zhengxian, et al.
Published: (2026)
QUEEN: Query Unlearning against Model Extraction
by: Chen, Huajie, et al.
Published: (2024)
by: Chen, Huajie, et al.
Published: (2024)
Update Selective Parameters: Federated Machine Unlearning Based on Model Explanation
by: Xu, Heng, et al.
Published: (2024)
by: Xu, Heng, et al.
Published: (2024)
How Does a Deep Learning Model Architecture Impact Its Privacy? A Comprehensive Study of Privacy Attacks on CNNs and Transformers
by: Zhang, Guangsheng, et al.
Published: (2022)
by: Zhang, Guangsheng, et al.
Published: (2022)
Similar Items
-
Zero-shot Class Unlearning via Layer-wise Relevance Analysis and Neuronal Path Perturbation
by: Chang, Wenhan, et al.
Published: (2024) -
Large Language Models Merging for Enhancing the Link Stealing Attack on Graph Neural Networks
by: Guan, Faqian, et al.
Published: (2024) -
Chain-of-Lure: A Universal Jailbreak Attack Framework using Unconstrained Synthetic Narratives
by: Chang, Wenhan, et al.
Published: (2025) -
Large Language Models for Link Stealing Attacks Against Graph Neural Networks
by: Guan, Faqian, et al.
Published: (2024) -
Evaluating of Machine Unlearning: Robustness Verification Without Prior Modifications
by: Xu, Heng, et al.
Published: (2024)