Exploring Backdoor Vulnerabilities of Chat Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Hao, Yunzhuo, Yang, Wenkai, Lin, Yankai |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Watch Out for Your Agents! Investigating Backdoor Threats to LLM-Based Agents
di: Yang, Wenkai, et al.
Pubblicazione: (2024)
di: Yang, Wenkai, et al.
Pubblicazione: (2024)
Universal Vulnerabilities in Large Language Models: Backdoor Attacks for In-context Learning
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
Exploring ChatGPT's Capabilities on Vulnerability Management
di: Liu, Peiyu, et al.
Pubblicazione: (2023)
di: Liu, Peiyu, et al.
Pubblicazione: (2023)
BadJudge: Backdoor Vulnerabilities of LLM-as-a-Judge
di: Tong, Terry, et al.
Pubblicazione: (2025)
di: Tong, Terry, et al.
Pubblicazione: (2025)
Instructions as Backdoors: Backdoor Vulnerabilities of Instruction Tuning for Large Language Models
di: Xu, Jiashu, et al.
Pubblicazione: (2023)
di: Xu, Jiashu, et al.
Pubblicazione: (2023)
Backdoor Token Unlearning: Exposing and Defending Backdoors in Pretrained Language Models
di: Jiang, Peihai, et al.
Pubblicazione: (2025)
di: Jiang, Peihai, et al.
Pubblicazione: (2025)
ReasAlign: Reasoning Enhanced Safety Alignment against Prompt Injection Attack
di: Li, Hao, et al.
Pubblicazione: (2026)
di: Li, Hao, et al.
Pubblicazione: (2026)
DUP: Detection-guided Unlearning for Backdoor Purification in Language Models
di: Hu, Man, et al.
Pubblicazione: (2025)
di: Hu, Man, et al.
Pubblicazione: (2025)
UOR: Universal Backdoor Attacks on Pre-trained Language Models
di: Du, Wei, et al.
Pubblicazione: (2023)
di: Du, Wei, et al.
Pubblicazione: (2023)
A Survey of Recent Backdoor Attacks and Defenses in Large Language Models
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
Stealthy and Persistent Unalignment on Large Language Models via Backdoor Injections
di: Cao, Yuanpu, et al.
Pubblicazione: (2023)
di: Cao, Yuanpu, et al.
Pubblicazione: (2023)
Gracefully Filtering Backdoor Samples for Generative Large Language Models without Retraining
di: Wu, Zongru, et al.
Pubblicazione: (2024)
di: Wu, Zongru, et al.
Pubblicazione: (2024)
Secure Code Generation via Online Reinforcement Learning with Vulnerability Reward Model
di: Wu, Tianyi, et al.
Pubblicazione: (2026)
di: Wu, Tianyi, et al.
Pubblicazione: (2026)
Acquiring Clean Language Models from Backdoor Poisoned Datasets by Downscaling Frequency Space
di: Wu, Zongru, et al.
Pubblicazione: (2024)
di: Wu, Zongru, et al.
Pubblicazione: (2024)
Claim-Guided Textual Backdoor Attack for Practical Applications
di: Song, Minkyoo, et al.
Pubblicazione: (2024)
di: Song, Minkyoo, et al.
Pubblicazione: (2024)
Emerging Vulnerabilities in Frontier Models: Multi-Turn Jailbreak Attacks
di: Gibbs, Tom, et al.
Pubblicazione: (2024)
di: Gibbs, Tom, et al.
Pubblicazione: (2024)
Unlearning Backdoor Attacks for LLMs with Weak-to-Strong Knowledge Distillation
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
bi-GRPO: Bidirectional Optimization for Jailbreak Backdoor Injection on LLMs
di: Ji, Wence, et al.
Pubblicazione: (2025)
di: Ji, Wence, et al.
Pubblicazione: (2025)
PoisonBench: Assessing Large Language Model Vulnerability to Data Poisoning
di: Fu, Tingchen, et al.
Pubblicazione: (2024)
di: Fu, Tingchen, et al.
Pubblicazione: (2024)
Code Vulnerability Detection Across Different Programming Languages with AI Models
di: Humran, Hael Abdulhakim Ali, et al.
Pubblicazione: (2025)
di: Humran, Hael Abdulhakim Ali, et al.
Pubblicazione: (2025)
Stealthy Backdoor Attacks against LLMs Based on Natural Style Triggers
di: Wei, Jiali, et al.
Pubblicazione: (2026)
di: Wei, Jiali, et al.
Pubblicazione: (2026)
Medical MLLM is Vulnerable: Cross-Modality Jailbreak and Mismatched Attacks on Medical Multimodal Large Language Models
di: Huang, Xijie, et al.
Pubblicazione: (2024)
di: Huang, Xijie, et al.
Pubblicazione: (2024)
LoRATK: LoRA Once, Backdoor Everywhere in the Share-and-Play Ecosystem
di: Liu, Hongyi, et al.
Pubblicazione: (2024)
di: Liu, Hongyi, et al.
Pubblicazione: (2024)
Defending Against Weight-Poisoning Backdoor Attacks for Parameter-Efficient Fine-Tuning
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
Pattern Enhanced Multi-Turn Jailbreaking: Exploiting Structural Vulnerabilities in Large Language Models
di: Nihal, Ragib Amin, et al.
Pubblicazione: (2025)
di: Nihal, Ragib Amin, et al.
Pubblicazione: (2025)
Omni-Safety under Cross-Modality Conflict: Vulnerabilities, Dynamics Mechanisms and Efficient Alignment
di: Wang, Kun, et al.
Pubblicazione: (2026)
di: Wang, Kun, et al.
Pubblicazione: (2026)
Intrusion Detection at Scale with the Assistance of a Command-line Language Model
di: Lin, Jiongliang, et al.
Pubblicazione: (2024)
di: Lin, Jiongliang, et al.
Pubblicazione: (2024)
SynGhost: Invisible and Universal Task-agnostic Backdoor Attack via Syntactic Transfer
di: Cheng, Pengzhou, et al.
Pubblicazione: (2024)
di: Cheng, Pengzhou, et al.
Pubblicazione: (2024)
Breaking PEFT Limitations: Leveraging Weak-to-Strong Knowledge Transfer for Backdoor Attacks in LLMs
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
P2P: A Poison-to-Poison Remedy for Reliable Backdoor Defense in LLMs
di: Zhao, Shuai, et al.
Pubblicazione: (2025)
di: Zhao, Shuai, et al.
Pubblicazione: (2025)
Say Something Else: Rethinking Contextual Privacy as Information Sufficiency
di: Xiao, Yunze, et al.
Pubblicazione: (2026)
di: Xiao, Yunze, et al.
Pubblicazione: (2026)
Are My Optimized Prompts Compromised? Exploring Vulnerabilities of LLM-based Optimizers
di: Zhao, Andrew, et al.
Pubblicazione: (2025)
di: Zhao, Andrew, et al.
Pubblicazione: (2025)
From Vulnerabilities to Remediation: A Systematic Literature Review of LLMs in Code Security
di: Basic, Enna, et al.
Pubblicazione: (2024)
di: Basic, Enna, et al.
Pubblicazione: (2024)
GradingAttack: Exposing Security Vulnerabilities in LLM Based Educational Grading Agents
di: Li, Xueyi, et al.
Pubblicazione: (2026)
di: Li, Xueyi, et al.
Pubblicazione: (2026)
Improving LLM Reasoning for Vulnerability Detection via Group Relative Policy Optimization
di: Simoni, Marco, et al.
Pubblicazione: (2025)
di: Simoni, Marco, et al.
Pubblicazione: (2025)
A Study of Backdoors in Instruction Fine-tuned Language Models
di: Raghuram, Jayaram, et al.
Pubblicazione: (2024)
di: Raghuram, Jayaram, et al.
Pubblicazione: (2024)
Generalization-Enhanced Code Vulnerability Detection via Multi-Task Instruction Fine-Tuning
di: Du, Xiaohu, et al.
Pubblicazione: (2024)
di: Du, Xiaohu, et al.
Pubblicazione: (2024)
Relevance as a Vulnerability: How Web Retrieval Degrades Safety Alignment in LLM Agents
di: Nawal, Aditya, et al.
Pubblicazione: (2026)
di: Nawal, Aditya, et al.
Pubblicazione: (2026)
Helpful or Harmful? Exploring the Efficacy of Large Language Models for Online Grooming Prevention
di: Prosser, Ellie, et al.
Pubblicazione: (2024)
di: Prosser, Ellie, et al.
Pubblicazione: (2024)
When Reject Turns into Accept: Quantifying the Vulnerability of LLM-Based Scientific Reviewers to Indirect Prompt Injection
di: Sahoo, Devanshu, et al.
Pubblicazione: (2025)
di: Sahoo, Devanshu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Watch Out for Your Agents! Investigating Backdoor Threats to LLM-Based Agents
di: Yang, Wenkai, et al.
Pubblicazione: (2024) -
Universal Vulnerabilities in Large Language Models: Backdoor Attacks for In-context Learning
di: Zhao, Shuai, et al.
Pubblicazione: (2024) -
Exploring ChatGPT's Capabilities on Vulnerability Management
di: Liu, Peiyu, et al.
Pubblicazione: (2023) -
BadJudge: Backdoor Vulnerabilities of LLM-as-a-Judge
di: Tong, Terry, et al.
Pubblicazione: (2025) -
Instructions as Backdoors: Backdoor Vulnerabilities of Instruction Tuning for Large Language Models
di: Xu, Jiashu, et al.
Pubblicazione: (2023)