Defending MoE LLMs against Harmful Fine-Tuning via Safety Routing Alignment
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kim, Jaehan, Song, Minkyoo, Shin, Seungwon, Son, Sooel |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Subgraph Reconstruction Attacks on Graph RAG Deployments with Practical Defenses
par: Song, Minkyoo, et autres
Publié: (2026)
par: Song, Minkyoo, et autres
Publié: (2026)
Obliviate: Neutralizing Task-agnostic Backdoors within the Parameter-efficient Fine-tuning Paradigm
par: Kim, Jaehan, et autres
Publié: (2024)
par: Kim, Jaehan, et autres
Publié: (2024)
Claim-Guided Textual Backdoor Attack for Practical Applications
par: Song, Minkyoo, et autres
Publié: (2024)
par: Song, Minkyoo, et autres
Publié: (2024)
PassREfinder-FL: Privacy-Preserving Credential Stuffing Risk Prediction via Graph-Based Federated Learning for Representing Password Reuse between Websites
par: Kim, Jaehan, et autres
Publié: (2025)
par: Kim, Jaehan, et autres
Publié: (2025)
When LLMs Go Online: The Emerging Threat of Web-Enabled LLMs
par: Kim, Hanna, et autres
Publié: (2024)
par: Kim, Hanna, et autres
Publié: (2024)
Safety-Oriented Routing Analysis of Mixtral MoE Under Benign and Harmful Prompts
par: Siddiky, Md Nurul Absar
Publié: (2026)
par: Siddiky, Md Nurul Absar
Publié: (2026)
SPARD: Defending Harmful Fine-Tuning Attack via Safety Projection with Relevance-Diversity Data Selection
par: Chen, Shuhao, et autres
Publié: (2026)
par: Chen, Shuhao, et autres
Publié: (2026)
Safety Anchor: Defending Harmful Fine-tuning via Geometric Bottlenecks
par: Lu, Guoxin, et autres
Publié: (2026)
par: Lu, Guoxin, et autres
Publié: (2026)
Antidote: Post-fine-tuning Safety Alignment for Large Language Models against Harmful Fine-tuning
par: Huang, Tiansheng, et autres
Publié: (2024)
par: Huang, Tiansheng, et autres
Publié: (2024)
Pharmacist: Safety Alignment Data Curation for Large Language Models against Harmful Fine-tuning
par: Liu, Guozhi, et autres
Publié: (2025)
par: Liu, Guozhi, et autres
Publié: (2025)
SAFEx: Analyzing Vulnerabilities of MoE-Based LLMs via Stable Safety-critical Expert Identification
par: Lai, Zhenglin, et autres
Publié: (2025)
par: Lai, Zhenglin, et autres
Publié: (2025)
SelfDefend: LLMs Can Defend Themselves against Jailbreaking in a Practical Manner
par: Wang, Xunguang, et autres
Publié: (2024)
par: Wang, Xunguang, et autres
Publié: (2024)
SecMoE: Communication-Efficient Secure MoE Inference via Select-Then-Compute
par: Shen, Bowen, et autres
Publié: (2026)
par: Shen, Bowen, et autres
Publié: (2026)
Defensive Refusal Bias: How Safety Alignment Fails Cyber Defenders
par: Campbell, David, et autres
Publié: (2026)
par: Campbell, David, et autres
Publié: (2026)
SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding
par: Xu, Zhangchen, et autres
Publié: (2024)
par: Xu, Zhangchen, et autres
Publié: (2024)
Analysing Safety Risks in LLMs Fine-Tuned with Pseudo-Malicious Cyber Security Data
par: ElZemity, Adel, et autres
Publié: (2025)
par: ElZemity, Adel, et autres
Publié: (2025)
A Systematic Evaluation of Parameter-Efficient Fine-Tuning Methods for the Security of Code LLMs
par: Lee, Kiho, et autres
Publié: (2025)
par: Lee, Kiho, et autres
Publié: (2025)
BadMoE: Backdooring Mixture-of-Experts LLMs via Optimizing Routing Triggers and Infecting Dormant Experts
par: Wang, Qingyue, et autres
Publié: (2025)
par: Wang, Qingyue, et autres
Publié: (2025)
Adversarial Tuning: Defending Against Jailbreak Attacks for LLMs
par: Liu, Fan, et autres
Publié: (2024)
par: Liu, Fan, et autres
Publié: (2024)
Defending against Indirect Prompt Injection by Instruction Detection
par: Wen, Tongyu, et autres
Publié: (2025)
par: Wen, Tongyu, et autres
Publié: (2025)
Cordon-MAS: Defending RAG against Knowledge Poisoning via Information-Flow Control
par: Yu, Zhe, et autres
Publié: (2026)
par: Yu, Zhe, et autres
Publié: (2026)
Targeting Alignment: Extracting Safety Classifiers of Aligned LLMs
par: Ferrand, Jean-Charles Noirot, et autres
Publié: (2025)
par: Ferrand, Jean-Charles Noirot, et autres
Publié: (2025)
Defending against Stegomalware in Deep Neural Networks with Permutation Symmetry
par: Torpmann-Hagen, Birk, et autres
Publié: (2025)
par: Torpmann-Hagen, Birk, et autres
Publié: (2025)
MISLEADER: Defending against Model Extraction with Ensembles of Distilled Models
par: Cheng, Xueqi, et autres
Publié: (2025)
par: Cheng, Xueqi, et autres
Publié: (2025)
Fine-Tuning, Quantization, and LLMs: Navigating Unintended Outcomes
par: Kumar, Divyanshu, et autres
Publié: (2024)
par: Kumar, Divyanshu, et autres
Publié: (2024)
Defending Against Weight-Poisoning Backdoor Attacks for Parameter-Efficient Fine-Tuning
par: Zhao, Shuai, et autres
Publié: (2024)
par: Zhao, Shuai, et autres
Publié: (2024)
$PC^2$: Politically Controversial Content Generation via Jailbreaking Attacks on GPT-based Text-to-Image Models
par: Choi, Wonwoo, et autres
Publié: (2026)
par: Choi, Wonwoo, et autres
Publié: (2026)
Quantifying and Defending against Privacy Threats on Federated Knowledge Graph Embedding
par: Hu, Yuke, et autres
Publié: (2023)
par: Hu, Yuke, et autres
Publié: (2023)
Persistent Backdoor Attacks under Continual Fine-Tuning of LLMs
par: Cui, Jing, et autres
Publié: (2025)
par: Cui, Jing, et autres
Publié: (2025)
Scam Shield: Multi-Model Voting and Fine-Tuned LLMs Against Adversarial Attacks
par: Chang, Chen-Wei, et autres
Publié: (2025)
par: Chang, Chen-Wei, et autres
Publié: (2025)
Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets
par: Lu, Ning, et autres
Publié: (2025)
par: Lu, Ning, et autres
Publié: (2025)
Differentiation-Based Extraction of Proprietary Data from Fine-Tuned LLMs
par: Li, Zongjie, et autres
Publié: (2025)
par: Li, Zongjie, et autres
Publié: (2025)
Agent Safety Alignment via Reinforcement Learning
par: Sha, Zeyang, et autres
Publié: (2025)
par: Sha, Zeyang, et autres
Publié: (2025)
Buffer is All You Need: Defending Federated Learning against Backdoor Attacks under Non-iids via Buffering
par: Lyu, Xingyu, et autres
Publié: (2025)
par: Lyu, Xingyu, et autres
Publié: (2025)
TamperBench: Systematically Stress-Testing LLM Safety Under Fine-Tuning and Tampering
par: Hossain, Saad, et autres
Publié: (2026)
par: Hossain, Saad, et autres
Publié: (2026)
BugWhisperer: Fine-Tuning LLMs for SoC Hardware Vulnerability Detection
par: Tarek, Shams, et autres
Publié: (2025)
par: Tarek, Shams, et autres
Publié: (2025)
RASA: Routing-Aware Safety Alignment for Mixture-of-Experts Models
par: Liang, Jiacheng, et autres
Publié: (2026)
par: Liang, Jiacheng, et autres
Publié: (2026)
Self-Mined Hardness for Safety Fine-Tuning
par: Gupta, Prakhar, et autres
Publié: (2026)
par: Gupta, Prakhar, et autres
Publié: (2026)
MTSA: Multi-turn Safety Alignment for LLMs through Multi-round Red-teaming
par: Guo, Weiyang, et autres
Publié: (2025)
par: Guo, Weiyang, et autres
Publié: (2025)
DRIP: Defending Prompt Injection via Token-wise Representation Editing and Residual Instruction Fusion
par: Liu, Ruofan, et autres
Publié: (2025)
par: Liu, Ruofan, et autres
Publié: (2025)
Documents similaires
-
Subgraph Reconstruction Attacks on Graph RAG Deployments with Practical Defenses
par: Song, Minkyoo, et autres
Publié: (2026) -
Obliviate: Neutralizing Task-agnostic Backdoors within the Parameter-efficient Fine-tuning Paradigm
par: Kim, Jaehan, et autres
Publié: (2024) -
Claim-Guided Textual Backdoor Attack for Practical Applications
par: Song, Minkyoo, et autres
Publié: (2024) -
PassREfinder-FL: Privacy-Preserving Credential Stuffing Risk Prediction via Graph-Based Federated Learning for Representing Password Reuse between Websites
par: Kim, Jaehan, et autres
Publié: (2025) -
When LLMs Go Online: The Emerging Threat of Web-Enabled LLMs
par: Kim, Hanna, et autres
Publié: (2024)