Merge Hijacking: Backdoor Attacks to Model Merging of Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yuan, Zenghui, Xu, Yangming, Shi, Jiawen, Zhou, Pan, Sun, Lichao |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
BadToken: Token-level Backdoor Attacks to Multi-modal Large Language Models
par: Yuan, Zenghui, et autres
Publié: (2025)
par: Yuan, Zenghui, et autres
Publié: (2025)
BadSkill: Backdoor Attacks on Agent Skills via Model-in-Skill Poisoning
par: Tie, Guiyao, et autres
Publié: (2026)
par: Tie, Guiyao, et autres
Publié: (2026)
BadMerging: Backdoor Attacks Against Model Merging
par: Zhang, Jinghuai, et autres
Publié: (2024)
par: Zhang, Jinghuai, et autres
Publié: (2024)
Prompt Injection Attack to Tool Selection in LLM Agents
par: Shi, Jiawen, et autres
Publié: (2025)
par: Shi, Jiawen, et autres
Publié: (2025)
Optimization-based Prompt Injection Attack to LLM-as-a-Judge
par: Shi, Jiawen, et autres
Publié: (2024)
par: Shi, Jiawen, et autres
Publié: (2024)
Poisoned-MRAG: Knowledge Poisoning Attacks to Multimodal Retrieval Augmented Generation
par: Liu, Yinuo, et autres
Publié: (2025)
par: Liu, Yinuo, et autres
Publié: (2025)
LoBAM: LoRA-Based Backdoor Attack on Model Merging
par: Yin, Ming, et autres
Publié: (2024)
par: Yin, Ming, et autres
Publié: (2024)
Large Language Models Merging for Enhancing the Link Stealing Attack on Graph Neural Networks
par: Guan, Faqian, et autres
Publié: (2024)
par: Guan, Faqian, et autres
Publié: (2024)
Backdoor Attacks on Discrete Graph Diffusion Models
par: Wang, Jiawen, et autres
Publié: (2025)
par: Wang, Jiawen, et autres
Publié: (2025)
AutoJailbreak: Exploring Jailbreak Attacks and Defenses through a Dependency Lens
par: Lu, Lin, et autres
Publié: (2024)
par: Lu, Lin, et autres
Publié: (2024)
Inhibitory Attacks on Backdoor-based Fingerprinting for Large Language Models
par: Fu, Hang, et autres
Publié: (2026)
par: Fu, Hang, et autres
Publié: (2026)
HijackRAG: Hijacking Attacks against Retrieval-Augmented Large Language Models
par: Zhang, Yucheng, et autres
Publié: (2024)
par: Zhang, Yucheng, et autres
Publié: (2024)
Practical, Generalizable and Robust Backdoor Attacks on Text-to-Image Diffusion Models
par: Dai, Haoran, et autres
Publié: (2025)
par: Dai, Haoran, et autres
Publié: (2025)
CAMH: Advancing Model Hijacking Attack in Machine Learning
par: He, Xing, et autres
Publié: (2024)
par: He, Xing, et autres
Publié: (2024)
MergePrint: Merge-Resistant Fingerprints for Robust Black-box Ownership Verification of Large Language Models
par: Yamabe, Shojiro, et autres
Publié: (2024)
par: Yamabe, Shojiro, et autres
Publié: (2024)
Do Not Merge My Model! Safeguarding Open-Source LLMs Against Unauthorized Model Merging
par: Li, Qinfeng, et autres
Publié: (2025)
par: Li, Qinfeng, et autres
Publié: (2025)
Merger-as-a-Stealer: Stealing Targeted PII from Aligned LLMs with Model Merging
par: Lu, Lin, et autres
Publié: (2025)
par: Lu, Lin, et autres
Publié: (2025)
Shifting-Merging: Secure, High-Capacity and Efficient Steganography via Large Language Models
par: Bai, Minhao, et autres
Publié: (2025)
par: Bai, Minhao, et autres
Publié: (2025)
Hallucinating AI Hijacking Attack: Large Language Models and Malicious Code Recommenders
par: Noever, David, et autres
Publié: (2024)
par: Noever, David, et autres
Publié: (2024)
Mitigating the Backdoor Effect for Multi-Task Model Merging via Safety-Aware Subspace
par: Yang, Jinluan, et autres
Publié: (2024)
par: Yang, Jinluan, et autres
Publié: (2024)
Virtual Context: Enhancing Jailbreak Attacks with Special Token Injection
par: Zhou, Yuqi, et autres
Publié: (2024)
par: Zhou, Yuqi, et autres
Publié: (2024)
DiffusionHijack: Supply-Chain PRNG Backdoor Attack on Diffusion Models and Quantum Random Number Defense
par: You, Ziyang, et autres
Publié: (2026)
par: You, Ziyang, et autres
Publié: (2026)
Reasoning Hijacking: The Fragility of Reasoning Alignment in Large Language Models
par: Liu, Yuansen, et autres
Publié: (2026)
par: Liu, Yuansen, et autres
Publié: (2026)
Towards Action Hijacking of Large Language Model-based Agent
par: Zhang, Yuyang, et autres
Publié: (2024)
par: Zhang, Yuyang, et autres
Publié: (2024)
Have You Merged My Model? On The Robustness of Large Language Model IP Protection Methods Against Model Merging
par: Cong, Tianshuo, et autres
Publié: (2024)
par: Cong, Tianshuo, et autres
Publié: (2024)
Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor
par: Chang, Wenhan, et autres
Publié: (2026)
par: Chang, Wenhan, et autres
Publié: (2026)
Model Hijacking Attack in Federated Learning
par: Li, Zheng, et autres
Publié: (2024)
par: Li, Zheng, et autres
Publié: (2024)
Physical Backdoor Attack can Jeopardize Driving with Vision-Large-Language Models
par: Ni, Zhenyang, et autres
Publié: (2024)
par: Ni, Zhenyang, et autres
Publié: (2024)
Vocabulary Attack to Hijack Large Language Model Applications
par: Levi, Patrick, et autres
Publié: (2024)
par: Levi, Patrick, et autres
Publié: (2024)
MergeGuard: Efficient Thwarting of Trojan Attacks in Machine Learning Models
par: Shabgahi, Soheil Zibakhsh, et autres
Publié: (2025)
par: Shabgahi, Soheil Zibakhsh, et autres
Publié: (2025)
BadVLA: Towards Backdoor Attacks on Vision-Language-Action Models via Objective-Decoupled Optimization
par: Zhou, Xueyang, et autres
Publié: (2025)
par: Zhou, Xueyang, et autres
Publié: (2025)
Double Backdoored: Converting Code Large Language Model Backdoors to Traditional Malware via Adversarial Instruction Tuning Attacks
par: Hossen, Md Imran, et autres
Publié: (2024)
par: Hossen, Md Imran, et autres
Publié: (2024)
Chain-of-Scrutiny: Detecting Backdoor Attacks for Large Language Models
par: Li, Xi, et autres
Publié: (2024)
par: Li, Xi, et autres
Publié: (2024)
A Survey of Recent Backdoor Attacks and Defenses in Large Language Models
par: Zhao, Shuai, et autres
Publié: (2024)
par: Zhao, Shuai, et autres
Publié: (2024)
BadTemplate: A Training-Free Backdoor Attack via Chat Template Against Large Language Models
par: Wang, Zihan, et autres
Publié: (2026)
par: Wang, Zihan, et autres
Publié: (2026)
CleanGen: Mitigating Backdoor Attacks for Generation Tasks in Large Language Models
par: Li, Yuetai, et autres
Publié: (2024)
par: Li, Yuetai, et autres
Publié: (2024)
Concept-Guided Backdoor Attack on Vision Language Models
par: Shen, Haoyu, et autres
Publié: (2025)
par: Shen, Haoyu, et autres
Publié: (2025)
Universal Vulnerabilities in Large Language Models: Backdoor Attacks for In-context Learning
par: Zhao, Shuai, et autres
Publié: (2024)
par: Zhao, Shuai, et autres
Publié: (2024)
Osmosis Distillation: Model Hijacking with the Fewest Samples
par: Shi, Yuchen, et autres
Publié: (2026)
par: Shi, Yuchen, et autres
Publié: (2026)
A Survey on Backdoor Threats in Large Language Models (LLMs): Attacks, Defenses, and Evaluations
par: Zhou, Yihe, et autres
Publié: (2025)
par: Zhou, Yihe, et autres
Publié: (2025)
Documents similaires
-
BadToken: Token-level Backdoor Attacks to Multi-modal Large Language Models
par: Yuan, Zenghui, et autres
Publié: (2025) -
BadSkill: Backdoor Attacks on Agent Skills via Model-in-Skill Poisoning
par: Tie, Guiyao, et autres
Publié: (2026) -
BadMerging: Backdoor Attacks Against Model Merging
par: Zhang, Jinghuai, et autres
Publié: (2024) -
Prompt Injection Attack to Tool Selection in LLM Agents
par: Shi, Jiawen, et autres
Publié: (2025) -
Optimization-based Prompt Injection Attack to LLM-as-a-Judge
par: Shi, Jiawen, et autres
Publié: (2024)