Test-time Backdoor Mitigation for Black-Box Large Language Models with Defensive Demonstrations
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Mo, Wenjie, Xu, Jiashu, Liu, Qin, Wang, Jiongxiao, Yan, Jun, Askari, Hadi, Xiao, Chaowei, Chen, Muhao |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Mitigating Backdoor Threats to Large Language Models: Advancement and Challenges
par: Liu, Qin, et autres
Publié: (2024)
par: Liu, Qin, et autres
Publié: (2024)
Instructions as Backdoors: Backdoor Vulnerabilities of Instruction Tuning for Large Language Models
par: Xu, Jiashu, et autres
Publié: (2023)
par: Xu, Jiashu, et autres
Publié: (2023)
From Shortcuts to Triggers: Backdoor Defense with Denoised PoE
par: Liu, Qin, et autres
Publié: (2023)
par: Liu, Qin, et autres
Publié: (2023)
RLHFPoison: Reward Poisoning Attack for Reinforcement Learning with Human Feedback in Large Language Models
par: Wang, Jiongxiao, et autres
Publié: (2023)
par: Wang, Jiongxiao, et autres
Publié: (2023)
FATH: Authentication-based Test-time Defense against Indirect Prompt Injection Attacks
par: Wang, Jiongxiao, et autres
Publié: (2024)
par: Wang, Jiongxiao, et autres
Publié: (2024)
Securing Multi-turn Conversational Language Models From Distributed Backdoor Triggers
par: Tong, Terry, et autres
Publié: (2024)
par: Tong, Terry, et autres
Publié: (2024)
Mitigating Fine-tuning based Jailbreak Attack with Backdoor Enhanced Safety Alignment
par: Wang, Jiongxiao, et autres
Publié: (2024)
par: Wang, Jiongxiao, et autres
Publié: (2024)
Less Diverse, Less Safe: The Indirect But Pervasive Risk of Test-Time Scaling in Large Language Models
par: Nahin, Shahriar Kabir, et autres
Publié: (2025)
par: Nahin, Shahriar Kabir, et autres
Publié: (2025)
Instructional Fingerprinting of Large Language Models
par: Xu, Jiashu, et autres
Publié: (2024)
par: Xu, Jiashu, et autres
Publié: (2024)
AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models
par: Liu, Xiaogeng, et autres
Publié: (2023)
par: Liu, Xiaogeng, et autres
Publié: (2023)
LayerIF: Estimating Layer Quality for Large Language Models using Influence Functions
par: Askari, Hadi, et autres
Publié: (2025)
par: Askari, Hadi, et autres
Publié: (2025)
Two Heads are Better than One: Nested PoE for Robust Defense Against Multi-Backdoors
par: Graf, Victoria, et autres
Publié: (2024)
par: Graf, Victoria, et autres
Publié: (2024)
Rethinking Backdoor Detection Evaluation for Language Models
par: Yan, Jun, et autres
Publié: (2024)
par: Yan, Jun, et autres
Publié: (2024)
Assessing LLMs for Zero-shot Abstractive Summarization Through the Lens of Relevance Paraphrasing
par: Askari, Hadi, et autres
Publié: (2024)
par: Askari, Hadi, et autres
Publié: (2024)
Cognitive Overload: Jailbreaking Large Language Models with Overloaded Logical Thinking
par: Xu, Nan, et autres
Publié: (2023)
par: Xu, Nan, et autres
Publié: (2023)
EvoDefense: Co-Evolving Black-Box Defense with Large Language Models
par: Li, Yu, et autres
Publié: (2026)
par: Li, Yu, et autres
Publié: (2026)
SudoLM: Learning Access Control of Parametric Knowledge with Authorization Alignment
par: Liu, Qin, et autres
Publié: (2024)
par: Liu, Qin, et autres
Publié: (2024)
SafeLens: Deliberate and Efficient Video Guardrails with Fast-and-Slow Screening
par: Nahin, Shahriar Kabir, et autres
Publié: (2026)
par: Nahin, Shahriar Kabir, et autres
Publié: (2026)
DR.GAP: Mitigating Bias in Large Language Models using Gender-Aware Prompting with Demonstration and Reasoning
par: Qiu, Hongye, et autres
Publié: (2025)
par: Qiu, Hongye, et autres
Publié: (2025)
Revisiting Zero-Shot Abstractive Summarization in the Era of Large Language Models from the Perspective of Position Bias
par: Chhabra, Anshuman, et autres
Publié: (2024)
par: Chhabra, Anshuman, et autres
Publié: (2024)
Preference Poisoning Attacks on Reward Model Learning
par: Wu, Junlin, et autres
Publié: (2024)
par: Wu, Junlin, et autres
Publié: (2024)
Knowledge Distillation of Black-Box Large Language Models
par: Chen, Hongzhan, et autres
Publié: (2024)
par: Chen, Hongzhan, et autres
Publié: (2024)
A Survey of Recent Backdoor Attacks and Defenses in Large Language Models
par: Zhao, Shuai, et autres
Publié: (2024)
par: Zhao, Shuai, et autres
Publié: (2024)
Probe before You Talk: Towards Black-box Defense against Backdoor Unalignment for Large Language Models
par: Yi, Biao, et autres
Publié: (2025)
par: Yi, Biao, et autres
Publié: (2025)
How Trustworthy are Open-Source LLMs? An Assessment under Malicious Demonstrations Shows their Vulnerabilities
par: Mo, Lingbo, et autres
Publié: (2023)
par: Mo, Lingbo, et autres
Publié: (2023)
Multilingual Collaborative Defense for Large Language Models
par: Li, Hongliang, et autres
Publié: (2025)
par: Li, Hongliang, et autres
Publié: (2025)
ROM: Real-time Overthinking Mitigation via Streaming Detection and Intervention
par: Wang, Xinyan, et autres
Publié: (2026)
par: Wang, Xinyan, et autres
Publié: (2026)
Bias Testing and Mitigation in Black Box LLMs using Metamorphic Relations
par: Salimian, Sina, et autres
Publié: (2025)
par: Salimian, Sina, et autres
Publié: (2025)
Monotonic Paraphrasing Improves Generalization of Language Model Prompting
par: Liu, Qin, et autres
Publié: (2024)
par: Liu, Qin, et autres
Publié: (2024)
Black-Box Prompt Optimization: Aligning Large Language Models without Model Training
par: Cheng, Jiale, et autres
Publié: (2023)
par: Cheng, Jiale, et autres
Publié: (2023)
DebugLM: Learning Traceable Training Data Provenance for LLMs
par: Mo, Wenjie Jacky, et autres
Publié: (2026)
par: Mo, Wenjie Jacky, et autres
Publié: (2026)
AJF: Adaptive Jailbreak Framework Based on the Comprehension Ability of Black-Box Large Language Models
par: Yu, Mingyu, et autres
Publié: (2025)
par: Yu, Mingyu, et autres
Publié: (2025)
Black-Box On-Policy Distillation of Large Language Models
par: Ye, Tianzhu, et autres
Publié: (2025)
par: Ye, Tianzhu, et autres
Publié: (2025)
Black-Box Visual Prompt Engineering for Mitigating Object Hallucination in Large Vision Language Models
par: Woo, Sangmin, et autres
Publié: (2025)
par: Woo, Sangmin, et autres
Publié: (2025)
Beyond the Black Box: A Survey on the Theory and Mechanism of Large Language Models
par: Gan, Zeyu, et autres
Publié: (2026)
par: Gan, Zeyu, et autres
Publié: (2026)
VLM-Guard: Safeguarding Vision-Language Models via Fulfilling Safety Alignment Gap
par: Liu, Qin, et autres
Publié: (2025)
par: Liu, Qin, et autres
Publié: (2025)
RPM: Reasoning-Level Personalization for Black-Box Large Language Models
par: Kim, Jieyong, et autres
Publié: (2025)
par: Kim, Jieyong, et autres
Publié: (2025)
Unraveling Cross-Modality Knowledge Conflicts in Large Vision-Language Models
par: Zhu, Tinghui, et autres
Publié: (2024)
par: Zhu, Tinghui, et autres
Publié: (2024)
Cross-modality Information Check for Detecting Jailbreaking in Multimodal Large Language Models
par: Xu, Yue, et autres
Publié: (2024)
par: Xu, Yue, et autres
Publié: (2024)
ThinkGuard: Deliberative Slow Thinking Leads to Cautious Guardrails
par: Wen, Xiaofei, et autres
Publié: (2025)
par: Wen, Xiaofei, et autres
Publié: (2025)
Documents similaires
-
Mitigating Backdoor Threats to Large Language Models: Advancement and Challenges
par: Liu, Qin, et autres
Publié: (2024) -
Instructions as Backdoors: Backdoor Vulnerabilities of Instruction Tuning for Large Language Models
par: Xu, Jiashu, et autres
Publié: (2023) -
From Shortcuts to Triggers: Backdoor Defense with Denoised PoE
par: Liu, Qin, et autres
Publié: (2023) -
RLHFPoison: Reward Poisoning Attack for Reinforcement Learning with Human Feedback in Large Language Models
par: Wang, Jiongxiao, et autres
Publié: (2023) -
FATH: Authentication-based Test-time Defense against Indirect Prompt Injection Attacks
par: Wang, Jiongxiao, et autres
Publié: (2024)