Virus: Harmful Fine-tuning Attack for Large Language Models Bypassing Guardrail Moderation
Fuente:
arXiv
Salvato in:
| Autori principali: | Huang, Tiansheng, Hu, Sihao, Ilhan, Fatih, Tekin, Selim Furkan, Liu, Ling |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey
di: Huang, Tiansheng, et al.
Pubblicazione: (2024)
di: Huang, Tiansheng, et al.
Pubblicazione: (2024)
Booster: Tackling Harmful Fine-tuning for Large Language Models via Attenuating Harmful Perturbation
di: Huang, Tiansheng, et al.
Pubblicazione: (2024)
di: Huang, Tiansheng, et al.
Pubblicazione: (2024)
Lisa: Lazy Safety Alignment for Large Language Models against Harmful Fine-tuning Attack
di: Huang, Tiansheng, et al.
Pubblicazione: (2024)
di: Huang, Tiansheng, et al.
Pubblicazione: (2024)
Safety Tax: Safety Alignment Makes Your Large Reasoning Models Less Reasonable
di: Huang, Tiansheng, et al.
Pubblicazione: (2025)
di: Huang, Tiansheng, et al.
Pubblicazione: (2025)
Antidote: Post-fine-tuning Safety Alignment for Large Language Models against Harmful Fine-tuning
di: Huang, Tiansheng, et al.
Pubblicazione: (2024)
di: Huang, Tiansheng, et al.
Pubblicazione: (2024)
MELT: A Behavioral Trace Dataset for High-Risk Memecoin Launch Detection
di: Hu, Sihao, et al.
Pubblicazione: (2026)
di: Hu, Sihao, et al.
Pubblicazione: (2026)
CTRAP: Embedding Collapse Trap to Safeguard Large Language Models from Harmful Fine-Tuning
di: Yi, Biao, et al.
Pubblicazione: (2025)
di: Yi, Biao, et al.
Pubblicazione: (2025)
LLM-TOPLA: Efficient LLM Ensemble by Maximising Diversity
di: Tekin, Selim Furkan, et al.
Pubblicazione: (2024)
di: Tekin, Selim Furkan, et al.
Pubblicazione: (2024)
Vaccine: Perturbation-aware Alignment for Large Language Models against Harmful Fine-tuning Attack
di: Huang, Tiansheng, et al.
Pubblicazione: (2024)
di: Huang, Tiansheng, et al.
Pubblicazione: (2024)
Pharmacist: Safety Alignment Data Curation for Large Language Models against Harmful Fine-tuning
di: Liu, Guozhi, et al.
Pubblicazione: (2025)
di: Liu, Guozhi, et al.
Pubblicazione: (2025)
OpenGuardrails: A Configurable, Unified, and Scalable Guardrails Platform for Large Language Models
di: Wang, Thomas, et al.
Pubblicazione: (2025)
di: Wang, Thomas, et al.
Pubblicazione: (2025)
EnchTable: Unified Safety Alignment Transfer in Fine-tuned Large Language Models
di: Wu, Jialin, et al.
Pubblicazione: (2025)
di: Wu, Jialin, et al.
Pubblicazione: (2025)
Window-based Membership Inference Attacks Against Fine-tuned Large Language Models
di: Chen, Yuetian, et al.
Pubblicazione: (2026)
di: Chen, Yuetian, et al.
Pubblicazione: (2026)
Why LLM Safety Guardrails Collapse After Fine-tuning: A Similarity Analysis Between Alignment and Fine-tuning Datasets
di: Hsiung, Lei, et al.
Pubblicazione: (2025)
di: Hsiung, Lei, et al.
Pubblicazione: (2025)
H3Fusion: Helpful, Harmless, Honest Fusion of Aligned LLMs
di: Tekin, Selim Furkan, et al.
Pubblicazione: (2024)
di: Tekin, Selim Furkan, et al.
Pubblicazione: (2024)
Black-Box Guardrail Reverse-engineering Attack
di: Yao, Hongwei, et al.
Pubblicazione: (2025)
di: Yao, Hongwei, et al.
Pubblicazione: (2025)
Practical Membership Inference Attacks against Fine-tuned Large Language Models via Self-prompt Calibration
di: Fu, Wenjie, et al.
Pubblicazione: (2023)
di: Fu, Wenjie, et al.
Pubblicazione: (2023)
Mitigating Fine-tuning based Jailbreak Attack with Backdoor Enhanced Safety Alignment
di: Wang, Jiongxiao, et al.
Pubblicazione: (2024)
di: Wang, Jiongxiao, et al.
Pubblicazione: (2024)
Probe before You Talk: Towards Black-box Defense against Backdoor Unalignment for Large Language Models
di: Yi, Biao, et al.
Pubblicazione: (2025)
di: Yi, Biao, et al.
Pubblicazione: (2025)
Safety Anchor: Defending Harmful Fine-tuning via Geometric Bottlenecks
di: Lu, Guoxin, et al.
Pubblicazione: (2026)
di: Lu, Guoxin, et al.
Pubblicazione: (2026)
LLM-Virus: Evolutionary Jailbreak Attack on Large Language Models
di: Yu, Miao, et al.
Pubblicazione: (2024)
di: Yu, Miao, et al.
Pubblicazione: (2024)
No Two Devils Alike: Unveiling Distinct Mechanisms of Fine-tuning Attacks
di: Leong, Chak Tou, et al.
Pubblicazione: (2024)
di: Leong, Chak Tou, et al.
Pubblicazione: (2024)
"Moralized" Multi-Step Jailbreak Prompts: Black-Box Testing of Guardrails in Large Language Models for Verbal Attacks
di: Wang, Libo
Pubblicazione: (2024)
di: Wang, Libo
Pubblicazione: (2024)
Jailbreaking Large Language Models Against Moderation Guardrails via Cipher Characters
di: Jin, Haibo, et al.
Pubblicazione: (2024)
di: Jin, Haibo, et al.
Pubblicazione: (2024)
ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models
di: Zhao, Yunhan, et al.
Pubblicazione: (2026)
di: Zhao, Yunhan, et al.
Pubblicazione: (2026)
SGuard-v1: Safety Guardrail for Large Language Models
di: Lee, JoonHo, et al.
Pubblicazione: (2025)
di: Lee, JoonHo, et al.
Pubblicazione: (2025)
Private Fine-tuning of Large Language Models with Zeroth-order Optimization
di: Tang, Xinyu, et al.
Pubblicazione: (2024)
di: Tang, Xinyu, et al.
Pubblicazione: (2024)
Auto-Tuning Safety Guardrails for Black-Box Large Language Models
di: Abdulkadir, Perry
Pubblicazione: (2025)
di: Abdulkadir, Perry
Pubblicazione: (2025)
Privately Learning from Graphs with Applications in Fine-tuning Large Language Models
di: Yin, Haoteng, et al.
Pubblicazione: (2024)
di: Yin, Haoteng, et al.
Pubblicazione: (2024)
LoRA-Leak: Membership Inference Attacks Against LoRA Fine-tuned Language Models
di: Ran, Delong, et al.
Pubblicazione: (2025)
di: Ran, Delong, et al.
Pubblicazione: (2025)
BitBypass: A New Direction in Jailbreaking Aligned Large Language Models with Bitstream Camouflage
di: Nakka, Kalyan, et al.
Pubblicazione: (2025)
di: Nakka, Kalyan, et al.
Pubblicazione: (2025)
Privacy in Large Language Models: Attacks, Defenses and Future Directions
di: Li, Haoran, et al.
Pubblicazione: (2023)
di: Li, Haoran, et al.
Pubblicazione: (2023)
ADVERSA: Measuring Multi-Turn Guardrail Degradation and Judge Reliability in Large Language Models
di: Owiredu-Ashley, Harry
Pubblicazione: (2026)
di: Owiredu-Ashley, Harry
Pubblicazione: (2026)
Triaging Threats to Specialized Guardrails
di: Mo, Wenjie Jacky, et al.
Pubblicazione: (2026)
di: Mo, Wenjie Jacky, et al.
Pubblicazione: (2026)
In AI Sweet Harmony: Sociopragmatic Guardrail Bypasses and Evaluation-Awareness in OpenAI gpt-oss-20b
di: Durner, Nils
Pubblicazione: (2025)
di: Durner, Nils
Pubblicazione: (2025)
Fun-tuning: Characterizing the Vulnerability of Proprietary LLMs to Optimization-based Prompt Injection Attacks via the Fine-Tuning Interface
di: Labunets, Andrey, et al.
Pubblicazione: (2025)
di: Labunets, Andrey, et al.
Pubblicazione: (2025)
Prompt Stealing Attacks Against Large Language Models
di: Sha, Zeyang, et al.
Pubblicazione: (2024)
di: Sha, Zeyang, et al.
Pubblicazione: (2024)
SCOUT: A Defense Against Data Poisoning Attacks in Fine-Tuned Language Models
di: Afane, Mohamed, et al.
Pubblicazione: (2025)
di: Afane, Mohamed, et al.
Pubblicazione: (2025)
Privacy-Preserving Parameter-Efficient Fine-Tuning for Large Language Model Services
di: Li, Yansong, et al.
Pubblicazione: (2023)
di: Li, Yansong, et al.
Pubblicazione: (2023)
Large Language Models are Good Attackers: Efficient and Stealthy Textual Backdoor Attacks
di: Li, Ziqiang, et al.
Pubblicazione: (2024)
di: Li, Ziqiang, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey
di: Huang, Tiansheng, et al.
Pubblicazione: (2024) -
Booster: Tackling Harmful Fine-tuning for Large Language Models via Attenuating Harmful Perturbation
di: Huang, Tiansheng, et al.
Pubblicazione: (2024) -
Lisa: Lazy Safety Alignment for Large Language Models against Harmful Fine-tuning Attack
di: Huang, Tiansheng, et al.
Pubblicazione: (2024) -
Safety Tax: Safety Alignment Makes Your Large Reasoning Models Less Reasonable
di: Huang, Tiansheng, et al.
Pubblicazione: (2025) -
Antidote: Post-fine-tuning Safety Alignment for Large Language Models against Harmful Fine-tuning
di: Huang, Tiansheng, et al.
Pubblicazione: (2024)