SDD: Self-Degraded Defense against Malicious Fine-tuning
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Zixuan, Lu, Weikai, Lin, Xin, Zeng, Ziqian |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
CrossGuard: Safeguarding MLLMs against Joint-Modal Implicit Malicious Attacks
por: Zhang, Xu, et al.
Publicado: (2025)
por: Zhang, Xu, et al.
Publicado: (2025)
Antidote: Post-fine-tuning Safety Alignment for Large Language Models against Harmful Fine-tuning
por: Huang, Tiansheng, et al.
Publicado: (2024)
por: Huang, Tiansheng, et al.
Publicado: (2024)
SOFT: Selective Data Obfuscation for Protecting LLM Fine-tuning against Membership Inference Attacks
por: Zhang, Kaiyuan, et al.
Publicado: (2025)
por: Zhang, Kaiyuan, et al.
Publicado: (2025)
Real-time ML-based Defense Against Malicious Payload in Reconfigurable Embedded Systems
por: Stahle-Smith, Rye, et al.
Publicado: (2025)
por: Stahle-Smith, Rye, et al.
Publicado: (2025)
Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey
por: Huang, Tiansheng, et al.
Publicado: (2024)
por: Huang, Tiansheng, et al.
Publicado: (2024)
The dark deep side of DeepSeek: Fine-tuning attacks against the safety alignment of CoT-enabled models
por: Xu, Zhiyuan, et al.
Publicado: (2025)
por: Xu, Zhiyuan, et al.
Publicado: (2025)
Ensemble Privacy Defense for Knowledge-Intensive LLMs against Membership Inference Attacks
por: Fu, Haowei, et al.
Publicado: (2025)
por: Fu, Haowei, et al.
Publicado: (2025)
Analysing Safety Risks in LLMs Fine-Tuned with Pseudo-Malicious Cyber Security Data
por: ElZemity, Adel, et al.
Publicado: (2025)
por: ElZemity, Adel, et al.
Publicado: (2025)
VFEFL: Privacy-Preserving Federated Learning against Malicious Clients via Verifiable Functional Encryption
por: Cai, Nina, et al.
Publicado: (2025)
por: Cai, Nina, et al.
Publicado: (2025)
Pharmacist: Safety Alignment Data Curation for Large Language Models against Harmful Fine-tuning
por: Liu, Guozhi, et al.
Publicado: (2025)
por: Liu, Guozhi, et al.
Publicado: (2025)
RewardDS: Privacy-Preserving Fine-Tuning for Large Language Models via Reward Driven Data Synthesis
por: Wang, Jianwei, et al.
Publicado: (2025)
por: Wang, Jianwei, et al.
Publicado: (2025)
Constitutional Classifiers++: Efficient Production-Grade Defenses against Universal Jailbreaks
por: Cunningham, Hoagy, et al.
Publicado: (2026)
por: Cunningham, Hoagy, et al.
Publicado: (2026)
Detecting Adversarial Fine-tuning with Auditing Agents
por: Egler, Sarah, et al.
Publicado: (2025)
por: Egler, Sarah, et al.
Publicado: (2025)
I Don't Know You, But I Can Catch You: Real-Time Defense against Diverse Adversarial Patches for Object Detectors
por: Lin, Zijin, et al.
Publicado: (2024)
por: Lin, Zijin, et al.
Publicado: (2024)
A Critical Evaluation of Defenses against Prompt Injection Attacks
por: Jia, Yuqi, et al.
Publicado: (2025)
por: Jia, Yuqi, et al.
Publicado: (2025)
Benchmarking Safety Risks of Knowledge-Intensive Reasoning under Malicious Knowledge Editing
por: Mao, Qinghua, et al.
Publicado: (2026)
por: Mao, Qinghua, et al.
Publicado: (2026)
COGNITION: From Evaluation to Defense against Multimodal LLM CAPTCHA Solvers
por: Wang, Junyu, et al.
Publicado: (2025)
por: Wang, Junyu, et al.
Publicado: (2025)
SafeDream: Safety World Model for Proactive Early Jailbreak Detection
por: Yan, Bo, et al.
Publicado: (2026)
por: Yan, Bo, et al.
Publicado: (2026)
A general approach to enhance the survivability of backdoor attacks by decision path coupling
por: Zhao, Yufei, et al.
Publicado: (2024)
por: Zhao, Yufei, et al.
Publicado: (2024)
PrivacyRestore: Privacy-Preserving Inference in Large Language Models via Privacy Removal and Restoration
por: Zeng, Ziqian, et al.
Publicado: (2024)
por: Zeng, Ziqian, et al.
Publicado: (2024)
KG-DF: A Black-box Defense Framework against Jailbreak Attacks Based on Knowledge Graphs
por: Liu, Shuyuan, et al.
Publicado: (2025)
por: Liu, Shuyuan, et al.
Publicado: (2025)
One Step to the Side: Why Defenses Against Malicious Finetuning Fail Under Adaptive Adversaries
por: Zloczower, Itay, et al.
Publicado: (2026)
por: Zloczower, Itay, et al.
Publicado: (2026)
Malla: Demystifying Real-world Large Language Model Integrated Malicious Services
por: Lin, Zilong, et al.
Publicado: (2024)
por: Lin, Zilong, et al.
Publicado: (2024)
One Turn Too Late: Response-Aware Defense Against Hidden Malicious Intent in Multi-Turn Dialogue
por: Shen, Xinjie, et al.
Publicado: (2026)
por: Shen, Xinjie, et al.
Publicado: (2026)
A2AS: Agentic AI Runtime Security and Self-Defense
por: Neelou, Eugene, et al.
Publicado: (2025)
por: Neelou, Eugene, et al.
Publicado: (2025)
Bidirectional Intention Inference Enhances LLMs' Defense Against Multi-Turn Jailbreak Attacks
por: Tong, Haibo, et al.
Publicado: (2025)
por: Tong, Haibo, et al.
Publicado: (2025)
Token-level Data Selection for Safe LLM Fine-tuning
por: Li, Yanping, et al.
Publicado: (2026)
por: Li, Yanping, et al.
Publicado: (2026)
UNSEEN: A Cross-Stack LLM Unlearning Defense against AR-LLM Social Engineering Attacks
por: Yu, Tianlong, et al.
Publicado: (2026)
por: Yu, Tianlong, et al.
Publicado: (2026)
Invisible Prompts, Visible Threats: Malicious Font Injection in External Resources for Large Language Models
por: Xiong, Junjie, et al.
Publicado: (2025)
por: Xiong, Junjie, et al.
Publicado: (2025)
Reflect-Guard: Enhancing LLM Safeguards against Adversarial Prompts via Logical Self-Reflection
por: Lin, Lixing, et al.
Publicado: (2026)
por: Lin, Lixing, et al.
Publicado: (2026)
Critical-CoT: A Robust Defense Framework against Reasoning-Level Backdoor Attacks in Large Language Models
por: Truong, Vu Tuan, et al.
Publicado: (2026)
por: Truong, Vu Tuan, et al.
Publicado: (2026)
A Novel Approach to Malicious Code Detection Using CNN-BiLSTM and Feature Fusion
por: Zhang, Lixia, et al.
Publicado: (2024)
por: Zhang, Lixia, et al.
Publicado: (2024)
A Graph-Attentive LSTM Model for Malicious URL Detection
por: Hossain, Md. Ifthekhar, et al.
Publicado: (2025)
por: Hossain, Md. Ifthekhar, et al.
Publicado: (2025)
A Sentence Relation-Based Approach to Sanitizing Malicious Instructions
por: Datta, Soumil, et al.
Publicado: (2026)
por: Datta, Soumil, et al.
Publicado: (2026)
Leveraging Large Language Models to Detect npm Malicious Packages
por: Zahan, Nusrat, et al.
Publicado: (2024)
por: Zahan, Nusrat, et al.
Publicado: (2024)
Safety Anchor: Defending Harmful Fine-tuning via Geometric Bottlenecks
por: Lu, Guoxin, et al.
Publicado: (2026)
por: Lu, Guoxin, et al.
Publicado: (2026)
Case Study: Fine-tuning Small Language Models for Accurate and Private CWE Detection in Python Code
por: Bappy, Md. Azizul Hakim, et al.
Publicado: (2025)
por: Bappy, Md. Azizul Hakim, et al.
Publicado: (2025)
I can't see it but I can Fine-tune it: On Encrypted Fine-tuning of Transformers using Fully Homomorphic Encryption
por: Panzade, Prajwal, et al.
Publicado: (2024)
por: Panzade, Prajwal, et al.
Publicado: (2024)
WeiDetect: Weibull Distribution-Based Defense against Poisoning Attacks in Federated Learning for Network Intrusion Detection Systems
por: M., Sameera K., et al.
Publicado: (2025)
por: M., Sameera K., et al.
Publicado: (2025)
Towards a Practical Defense against Adversarial Attacks on Deep Learning-based Malware Detectors via Randomized Smoothing
por: Gibert, Daniel, et al.
Publicado: (2023)
por: Gibert, Daniel, et al.
Publicado: (2023)
Ejemplares similares
-
CrossGuard: Safeguarding MLLMs against Joint-Modal Implicit Malicious Attacks
por: Zhang, Xu, et al.
Publicado: (2025) -
Antidote: Post-fine-tuning Safety Alignment for Large Language Models against Harmful Fine-tuning
por: Huang, Tiansheng, et al.
Publicado: (2024) -
SOFT: Selective Data Obfuscation for Protecting LLM Fine-tuning against Membership Inference Attacks
por: Zhang, Kaiyuan, et al.
Publicado: (2025) -
Real-time ML-based Defense Against Malicious Payload in Reconfigurable Embedded Systems
por: Stahle-Smith, Rye, et al.
Publicado: (2025) -
Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey
por: Huang, Tiansheng, et al.
Publicado: (2024)