Booster: Tackling Harmful Fine-tuning for Large Language Models via Attenuating Harmful Perturbation
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Huang, Tiansheng, Hu, Sihao, Ilhan, Fatih, Tekin, Selim Furkan, Liu, Ling |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Virus: Harmful Fine-tuning Attack for Large Language Models Bypassing Guardrail Moderation
von: Huang, Tiansheng, et al.
Veröffentlicht: (2025)
von: Huang, Tiansheng, et al.
Veröffentlicht: (2025)
Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey
von: Huang, Tiansheng, et al.
Veröffentlicht: (2024)
von: Huang, Tiansheng, et al.
Veröffentlicht: (2024)
Lisa: Lazy Safety Alignment for Large Language Models against Harmful Fine-tuning Attack
von: Huang, Tiansheng, et al.
Veröffentlicht: (2024)
von: Huang, Tiansheng, et al.
Veröffentlicht: (2024)
Vaccine: Perturbation-aware Alignment for Large Language Models against Harmful Fine-tuning Attack
von: Huang, Tiansheng, et al.
Veröffentlicht: (2024)
von: Huang, Tiansheng, et al.
Veröffentlicht: (2024)
H3Fusion: Helpful, Harmless, Honest Fusion of Aligned LLMs
von: Tekin, Selim Furkan, et al.
Veröffentlicht: (2024)
von: Tekin, Selim Furkan, et al.
Veröffentlicht: (2024)
Panacea: Mitigating Harmful Fine-tuning for Large Language Models via Post-fine-tuning Perturbation
von: Wang, Yibo, et al.
Veröffentlicht: (2025)
von: Wang, Yibo, et al.
Veröffentlicht: (2025)
LLM-TOPLA: Efficient LLM Ensemble by Maximising Diversity
von: Tekin, Selim Furkan, et al.
Veröffentlicht: (2024)
von: Tekin, Selim Furkan, et al.
Veröffentlicht: (2024)
Safety Tax: Safety Alignment Makes Your Large Reasoning Models Less Reasonable
von: Huang, Tiansheng, et al.
Veröffentlicht: (2025)
von: Huang, Tiansheng, et al.
Veröffentlicht: (2025)
A Survey on Large Language Model-Based Game Agents
von: Hu, Sihao, et al.
Veröffentlicht: (2024)
von: Hu, Sihao, et al.
Veröffentlicht: (2024)
PokeLLMon: A Human-Parity Agent for Pokemon Battles with Large Language Models
von: Hu, Sihao, et al.
Veröffentlicht: (2024)
von: Hu, Sihao, et al.
Veröffentlicht: (2024)
Antidote: Post-fine-tuning Safety Alignment for Large Language Models against Harmful Fine-tuning
von: Huang, Tiansheng, et al.
Veröffentlicht: (2024)
von: Huang, Tiansheng, et al.
Veröffentlicht: (2024)
Adversarial Attention Perturbations for Large Object Detection Transformers
von: Yahn, Zachary, et al.
Veröffentlicht: (2025)
von: Yahn, Zachary, et al.
Veröffentlicht: (2025)
Pharmacist: Safety Alignment Data Curation for Large Language Models against Harmful Fine-tuning
von: Liu, Guozhi, et al.
Veröffentlicht: (2025)
von: Liu, Guozhi, et al.
Veröffentlicht: (2025)
Surgery: Mitigating Harmful Fine-Tuning for Large Language Models via Attention Sink
von: Liu, Guozhi, et al.
Veröffentlicht: (2026)
von: Liu, Guozhi, et al.
Veröffentlicht: (2026)
Self-HarmLLM: Can Large Language Model Harm Itself?
von: Kim, Heehwan, et al.
Veröffentlicht: (2025)
von: Kim, Heehwan, et al.
Veröffentlicht: (2025)
Safety Anchor: Defending Harmful Fine-tuning via Geometric Bottlenecks
von: Lu, Guoxin, et al.
Veröffentlicht: (2026)
von: Lu, Guoxin, et al.
Veröffentlicht: (2026)
VaccineRAG: Boosting Multimodal Large Language Models' Immunity to Harmful RAG Samples
von: Sun, Qixin, et al.
Veröffentlicht: (2025)
von: Sun, Qixin, et al.
Veröffentlicht: (2025)
Dynamic Optimizations of LLM Ensembles with Two-Stage Reinforcement Learning Agents
von: Tekin, Selim Furkan, et al.
Veröffentlicht: (2025)
von: Tekin, Selim Furkan, et al.
Veröffentlicht: (2025)
AdamMeme: Adaptively Probe the Reasoning Capacity of Multimodal Large Language Models on Harmfulness
von: Chen, Zixin, et al.
Veröffentlicht: (2025)
von: Chen, Zixin, et al.
Veröffentlicht: (2025)
HarmTransform: Transforming Explicit Harmful Queries into Stealthy via Multi-Agent Debate
von: Zhu, Shenzhe
Veröffentlicht: (2025)
von: Zhu, Shenzhe
Veröffentlicht: (2025)
Large Language Models are Vulnerable to Bait-and-Switch Attacks for Generating Harmful Content
von: Bianchi, Federico, et al.
Veröffentlicht: (2024)
von: Bianchi, Federico, et al.
Veröffentlicht: (2024)
FairBelief -- Assessing Harmful Beliefs in Language Models
von: Setzu, Mattia, et al.
Veröffentlicht: (2024)
von: Setzu, Mattia, et al.
Veröffentlicht: (2024)
Robust Few-Shot Ensemble Learning with Focal Diversity-Based Pruning
von: Tekin, Selim Furkan, et al.
Veröffentlicht: (2024)
von: Tekin, Selim Furkan, et al.
Veröffentlicht: (2024)
HarmMetric Eval: Benchmarking Metrics and Judges for LLM Harmfulness Assessment
von: Yang, Langqi, et al.
Veröffentlicht: (2025)
von: Yang, Langqi, et al.
Veröffentlicht: (2025)
Moderating Harm: Benchmarking Large Language Models for Cyberbullying Detection in YouTube Comments
von: Muminovic, Amel
Veröffentlicht: (2025)
von: Muminovic, Amel
Veröffentlicht: (2025)
Harm or Humor: A Multimodal, Multilingual Benchmark for Overt and Covert Harmful Humor
von: Sharshar, Ahmed, et al.
Veröffentlicht: (2026)
von: Sharshar, Ahmed, et al.
Veröffentlicht: (2026)
Towards Explainable Harmful Meme Detection through Multimodal Debate between Large Language Models
von: Lin, Hongzhan, et al.
Veröffentlicht: (2024)
von: Lin, Hongzhan, et al.
Veröffentlicht: (2024)
Helpful or Harmful? Exploring the Efficacy of Large Language Models for Online Grooming Prevention
von: Prosser, Ellie, et al.
Veröffentlicht: (2024)
von: Prosser, Ellie, et al.
Veröffentlicht: (2024)
AgentHarm: A Benchmark for Measuring Harmfulness of LLM Agents
von: Andriushchenko, Maksym, et al.
Veröffentlicht: (2024)
von: Andriushchenko, Maksym, et al.
Veröffentlicht: (2024)
MemeArena: Automating Context-Aware Unbiased Evaluation of Harmfulness Understanding for Multimodal Large Language Models
von: Chen, Zixin, et al.
Veröffentlicht: (2025)
von: Chen, Zixin, et al.
Veröffentlicht: (2025)
Advancing Harmful Content Detection in Organizational Research: Integrating Large Language Models with Elo Rating System
von: Akben, Mustafa, et al.
Veröffentlicht: (2025)
von: Akben, Mustafa, et al.
Veröffentlicht: (2025)
Semi-supervised Fine-tuning for Large Language Models
von: Luo, Junyu, et al.
Veröffentlicht: (2024)
von: Luo, Junyu, et al.
Veröffentlicht: (2024)
OSPC: Detecting Harmful Memes with Large Language Model as a Catalyst
von: Cao, Jingtao, et al.
Veröffentlicht: (2024)
von: Cao, Jingtao, et al.
Veröffentlicht: (2024)
PluriHarms: Benchmarking the Full Spectrum of Human Judgments on AI Harm
von: Li, Jing-Jing, et al.
Veröffentlicht: (2026)
von: Li, Jing-Jing, et al.
Veröffentlicht: (2026)
SocialHarmBench: Revealing LLM Vulnerabilities to Socially Harmful Requests
von: Pandey, Punya Syon, et al.
Veröffentlicht: (2025)
von: Pandey, Punya Syon, et al.
Veröffentlicht: (2025)
Attention-aware Inference Optimizations for Large Vision-Language Models with Memory-efficient Decoding
von: Ilhan, Fatih, et al.
Veröffentlicht: (2026)
von: Ilhan, Fatih, et al.
Veröffentlicht: (2026)
`For Argument's Sake, Show Me How to Harm Myself!': Jailbreaking LLMs in Suicide and Self-Harm Contexts
von: Schoene, Annika M, et al.
Veröffentlicht: (2025)
von: Schoene, Annika M, et al.
Veröffentlicht: (2025)
CTRAP: Embedding Collapse Trap to Safeguard Large Language Models from Harmful Fine-Tuning
von: Yi, Biao, et al.
Veröffentlicht: (2025)
von: Yi, Biao, et al.
Veröffentlicht: (2025)
Selecting Large Language Model to Fine-tune via Rectified Scaling Law
von: Lin, Haowei, et al.
Veröffentlicht: (2024)
von: Lin, Haowei, et al.
Veröffentlicht: (2024)
First, Do No Harm (With LLMs): Mitigating Racial Bias via Agentic Workflows
von: Xing, Sihao, et al.
Veröffentlicht: (2026)
von: Xing, Sihao, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Virus: Harmful Fine-tuning Attack for Large Language Models Bypassing Guardrail Moderation
von: Huang, Tiansheng, et al.
Veröffentlicht: (2025) -
Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey
von: Huang, Tiansheng, et al.
Veröffentlicht: (2024) -
Lisa: Lazy Safety Alignment for Large Language Models against Harmful Fine-tuning Attack
von: Huang, Tiansheng, et al.
Veröffentlicht: (2024) -
Vaccine: Perturbation-aware Alignment for Large Language Models against Harmful Fine-tuning Attack
von: Huang, Tiansheng, et al.
Veröffentlicht: (2024) -
H3Fusion: Helpful, Harmless, Honest Fusion of Aligned LLMs
von: Tekin, Selim Furkan, et al.
Veröffentlicht: (2024)