Badllama 3: removing safety finetuning from Llama 3 in minutes
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Volkov, Dmitrii |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
BadGPT-4o: stripping safety finetuning from GPT models
par: Krupkina, Ekaterina, et autres
Publié: (2024)
par: Krupkina, Ekaterina, et autres
Publié: (2024)
Emergent Misalignment: Narrow finetuning can produce broadly misaligned LLMs
par: Betley, Jan, et autres
Publié: (2025)
par: Betley, Jan, et autres
Publié: (2025)
Forbidden Facts: An Investigation of Competing Objectives in Llama-2
par: Wang, Tony T., et autres
Publié: (2023)
par: Wang, Tony T., et autres
Publié: (2023)
Model Inversion Attacks on Llama 3: Extracting PII from Large Language Models
par: Sivashanmugam, Sathesh P.
Publié: (2025)
par: Sivashanmugam, Sathesh P.
Publié: (2025)
Llama-3.1-FoundationAI-SecurityLLM-Reasoning-8B Technical Report
par: Yang, Zhuoran, et autres
Publié: (2026)
par: Yang, Zhuoran, et autres
Publié: (2026)
LLM Agent Honeypot: Monitoring AI Hacking Agents in the Wild
par: Reworr, et autres
Publié: (2024)
par: Reworr, et autres
Publié: (2024)
Stealing User Prompts from Mixture of Experts
par: Yona, Itay, et autres
Publié: (2024)
par: Yona, Itay, et autres
Publié: (2024)
Universal Jailbreak Backdoors from Poisoned Human Feedback
par: Rando, Javier, et autres
Publié: (2023)
par: Rando, Javier, et autres
Publié: (2023)
Teach LLMs to Phish: Stealing Private Information from Language Models
par: Panda, Ashwinee, et autres
Publié: (2024)
par: Panda, Ashwinee, et autres
Publié: (2024)
Extracting Training Data from Diffusion Language Models via Infilling
par: Wang, Yihan, et autres
Publié: (2026)
par: Wang, Yihan, et autres
Publié: (2026)
There Are No Silly Questions: Evaluation of Offline LLM Capabilities from a Turkish Perspective
par: Yilmaz, Edibe, et autres
Publié: (2026)
par: Yilmaz, Edibe, et autres
Publié: (2026)
Follow My Instruction and Spill the Beans: Scalable Data Extraction from Retrieval-Augmented Generation Systems
par: Qi, Zhenting, et autres
Publié: (2024)
par: Qi, Zhenting, et autres
Publié: (2024)
Memories Retrieved from Many Paths: A Multi-Prefix Framework for Robust Detection of Training Data Leakage in Large Language Models
par: Dang, Trung Cuong, et autres
Publié: (2025)
par: Dang, Trung Cuong, et autres
Publié: (2025)
AdvPrefix: An Objective for Nuanced LLM Jailbreaks
par: Zhu, Sicheng, et autres
Publié: (2024)
par: Zhu, Sicheng, et autres
Publié: (2024)
Best-of-Venom: Attacking RLHF by Injecting Poisoned Preference Data
par: Baumgärtner, Tim, et autres
Publié: (2024)
par: Baumgärtner, Tim, et autres
Publié: (2024)
Covert Malicious Finetuning: Challenges in Safeguarding LLM Adaptation
par: Halawi, Danny, et autres
Publié: (2024)
par: Halawi, Danny, et autres
Publié: (2024)
TRAP: Targeted Random Adversarial Prompt Honeypot for Black-Box Identification
par: Gubri, Martin, et autres
Publié: (2024)
par: Gubri, Martin, et autres
Publié: (2024)
Fight Back Against Jailbreaking via Prompt Adversarial Tuning
par: Mo, Yichuan, et autres
Publié: (2024)
par: Mo, Yichuan, et autres
Publié: (2024)
Gradient Cuff: Detecting Jailbreak Attacks on Large Language Models by Exploring Refusal Loss Landscapes
par: Hu, Xiaomeng, et autres
Publié: (2024)
par: Hu, Xiaomeng, et autres
Publié: (2024)
Detecting Training Data of Large Language Models via Expectation Maximization
par: Kim, Gyuwan, et autres
Publié: (2024)
par: Kim, Gyuwan, et autres
Publié: (2024)
Machine Unlearning of Pre-trained Large Language Models
par: Yao, Jin, et autres
Publié: (2024)
par: Yao, Jin, et autres
Publié: (2024)
Preserving Privacy in Large Language Models: A Survey on Current Threats and Solutions
par: Miranda, Michele, et autres
Publié: (2024)
par: Miranda, Michele, et autres
Publié: (2024)
DP-MemArc: Differential Privacy Transfer Learning for Memory Efficient Language Models
par: Liu, Yanming, et autres
Publié: (2024)
par: Liu, Yanming, et autres
Publié: (2024)
Towards Understanding the Fragility of Multilingual LLMs against Fine-Tuning Attacks
par: Poppi, Samuele, et autres
Publié: (2024)
par: Poppi, Samuele, et autres
Publié: (2024)
Systematically Analyzing Prompt Injection Vulnerabilities in Diverse LLM Architectures
par: Benjamin, Victoria, et autres
Publié: (2024)
par: Benjamin, Victoria, et autres
Publié: (2024)
Rethinking How to Evaluate Language Model Jailbreak
par: Cai, Hongyu, et autres
Publié: (2024)
par: Cai, Hongyu, et autres
Publié: (2024)
JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs
par: Chu, Junjie, et autres
Publié: (2024)
par: Chu, Junjie, et autres
Publié: (2024)
Textual Unlearning Gives a False Sense of Unlearning
par: Du, Jiacheng, et autres
Publié: (2024)
par: Du, Jiacheng, et autres
Publié: (2024)
Instructional Segment Embedding: Improving LLM Safety with Instruction Hierarchy
par: Wu, Tong, et autres
Publié: (2024)
par: Wu, Tong, et autres
Publié: (2024)
SequentialBreak: Large Language Models Can be Fooled by Embedding Jailbreak Prompts into Sequential Prompt Chains
par: Saiem, Bijoy Ahmed, et autres
Publié: (2024)
par: Saiem, Bijoy Ahmed, et autres
Publié: (2024)
LLMs can be Dangerous Reasoners: Analyzing-based Jailbreak Attack on Large Language Models
par: Lin, Shi, et autres
Publié: (2024)
par: Lin, Shi, et autres
Publié: (2024)
Enhancing Prompt Injection Attacks to LLMs via Poisoning Alignment
par: Shao, Zedian, et autres
Publié: (2024)
par: Shao, Zedian, et autres
Publié: (2024)
SVIP: Towards Verifiable Inference of Open-source Large Language Models
par: Sun, Yifan, et autres
Publié: (2024)
par: Sun, Yifan, et autres
Publié: (2024)
Large Language Models in Cybersecurity: State-of-the-Art
par: Motlagh, Farzad Nourmohammadzadeh, et autres
Publié: (2024)
par: Motlagh, Farzad Nourmohammadzadeh, et autres
Publié: (2024)
Towards Building a Robust Toxicity Predictor
par: Bespalov, Dmitriy, et autres
Publié: (2024)
par: Bespalov, Dmitriy, et autres
Publié: (2024)
Exploiting Class Probabilities for Black-box Sentence-level Attacks
par: Moraffah, Raha, et autres
Publié: (2024)
par: Moraffah, Raha, et autres
Publié: (2024)
PostMark: A Robust Blackbox Watermark for Large Language Models
par: Chang, Yapei, et autres
Publié: (2024)
par: Chang, Yapei, et autres
Publié: (2024)
The Task Shield: Enforcing Task Alignment to Defend Against Indirect Prompt Injection in LLM Agents
par: Jia, Feiran, et autres
Publié: (2024)
par: Jia, Feiran, et autres
Publié: (2024)
BadAgent: Inserting and Activating Backdoor Attacks in LLM Agents
par: Wang, Yifei, et autres
Publié: (2024)
par: Wang, Yifei, et autres
Publié: (2024)
HSF: Defending against Jailbreak Attacks with Hidden State Filtering
par: Qian, Cheng, et autres
Publié: (2024)
par: Qian, Cheng, et autres
Publié: (2024)
Documents similaires
-
BadGPT-4o: stripping safety finetuning from GPT models
par: Krupkina, Ekaterina, et autres
Publié: (2024) -
Emergent Misalignment: Narrow finetuning can produce broadly misaligned LLMs
par: Betley, Jan, et autres
Publié: (2025) -
Forbidden Facts: An Investigation of Competing Objectives in Llama-2
par: Wang, Tony T., et autres
Publié: (2023) -
Model Inversion Attacks on Llama 3: Extracting PII from Large Language Models
par: Sivashanmugam, Sathesh P.
Publié: (2025) -
Llama-3.1-FoundationAI-SecurityLLM-Reasoning-8B Technical Report
par: Yang, Zhuoran, et autres
Publié: (2026)