Defending Large Language Models against Jailbreak Attacks via Semantic Smoothing
Fuente:
arXiv
Salvato in:
| Autori principali: | Ji, Jiabao, Hou, Bairu, Robey, Alexander, Pappas, George J., Hassani, Hamed, Zhang, Yang, Wong, Eric, Chang, Shiyu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SmoothLLM: Defending Large Language Models Against Jailbreaking Attacks
di: Robey, Alexander, et al.
Pubblicazione: (2023)
di: Robey, Alexander, et al.
Pubblicazione: (2023)
Jailbreaking Black Box Large Language Models in Twenty Queries
di: Chao, Patrick, et al.
Pubblicazione: (2023)
di: Chao, Patrick, et al.
Pubblicazione: (2023)
Advancing the Robustness of Large Language Models through Self-Denoised Smoothing
di: Ji, Jiabao, et al.
Pubblicazione: (2024)
di: Ji, Jiabao, et al.
Pubblicazione: (2024)
Jailbreaking LLM-Controlled Robots
di: Robey, Alexander, et al.
Pubblicazione: (2024)
di: Robey, Alexander, et al.
Pubblicazione: (2024)
KVLink: Accelerating Large Language Models via Efficient KV Cache Reuse
di: Yang, Jingbo, et al.
Pubblicazione: (2025)
di: Yang, Jingbo, et al.
Pubblicazione: (2025)
Steering Dialogue Dynamics for Robustness against Multi-turn Jailbreaking Attacks
di: Hu, Hanjiang, et al.
Pubblicazione: (2025)
di: Hu, Hanjiang, et al.
Pubblicazione: (2025)
ThinkPrune: Pruning Long Chain-of-Thought of LLMs via Reinforcement Learning
di: Hou, Bairu, et al.
Pubblicazione: (2025)
di: Hou, Bairu, et al.
Pubblicazione: (2025)
A Probabilistic Framework for LLM Hallucination Detection via Belief Tree Propagation
di: Hou, Bairu, et al.
Pubblicazione: (2024)
di: Hou, Bairu, et al.
Pubblicazione: (2024)
Defending LLMs against Jailbreaking Attacks via Backtranslation
di: Wang, Yihan, et al.
Pubblicazione: (2024)
di: Wang, Yihan, et al.
Pubblicazione: (2024)
JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models
di: Chao, Patrick, et al.
Pubblicazione: (2024)
di: Chao, Patrick, et al.
Pubblicazione: (2024)
Watermark Smoothing Attacks against Language Models
di: Chang, Hongyan, et al.
Pubblicazione: (2024)
di: Chang, Hongyan, et al.
Pubblicazione: (2024)
RobustKV: Defending Large Language Models against Jailbreak Attacks via KV Eviction
di: Jiang, Tanqiu, et al.
Pubblicazione: (2024)
di: Jiang, Tanqiu, et al.
Pubblicazione: (2024)
Decomposing Uncertainty for Large Language Models through Input Clarification Ensembling
di: Hou, Bairu, et al.
Pubblicazione: (2023)
di: Hou, Bairu, et al.
Pubblicazione: (2023)
Defending Large Language Models Against Jailbreaking Attacks Through Goal Prioritization
di: Zhang, Zhexin, et al.
Pubblicazione: (2023)
di: Zhang, Zhexin, et al.
Pubblicazione: (2023)
Defending Large Language Models Against Jailbreak Attacks via In-Decoding Safety-Awareness Probing
di: Zhao, Yinzhi, et al.
Pubblicazione: (2026)
di: Zhao, Yinzhi, et al.
Pubblicazione: (2026)
SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding
di: Xu, Zhangchen, et al.
Pubblicazione: (2024)
di: Xu, Zhangchen, et al.
Pubblicazione: (2024)
HSF: Defending against Jailbreak Attacks with Hidden State Filtering
di: Qian, Cheng, et al.
Pubblicazione: (2024)
di: Qian, Cheng, et al.
Pubblicazione: (2024)
Explicitly Encoding Structural Symmetry is Key to Length Generalization in Arithmetic Tasks
di: Sabbaghi, Mahdi, et al.
Pubblicazione: (2024)
di: Sabbaghi, Mahdi, et al.
Pubblicazione: (2024)
Defending against Jailbreak through Early Exit Generation of Large Language Models
di: Zhao, Chongwen, et al.
Pubblicazione: (2024)
di: Zhao, Chongwen, et al.
Pubblicazione: (2024)
Benchmarking Misuse Mitigation Against Covert Adversaries
di: Brown, Davis, et al.
Pubblicazione: (2025)
di: Brown, Davis, et al.
Pubblicazione: (2025)
Safety Guardrails for LLM-Enabled Robots
di: Ravichandran, Zachary, et al.
Pubblicazione: (2025)
di: Ravichandran, Zachary, et al.
Pubblicazione: (2025)
Adversarial Training Should Be Cast as a Non-Zero-Sum Game
di: Robey, Alexander, et al.
Pubblicazione: (2023)
di: Robey, Alexander, et al.
Pubblicazione: (2023)
Instruction-Following Pruning for Large Language Models
di: Hou, Bairu, et al.
Pubblicazione: (2025)
di: Hou, Bairu, et al.
Pubblicazione: (2025)
Structured Semantic Cloaking for Jailbreak Attacks on Large Language Models
di: Sun, Xiaobing, et al.
Pubblicazione: (2026)
di: Sun, Xiaobing, et al.
Pubblicazione: (2026)
DETAM: Defending LLMs Against Jailbreak Attacks via Targeted Attention Modification
di: Li, Yu, et al.
Pubblicazione: (2025)
di: Li, Yu, et al.
Pubblicazione: (2025)
Reasoning-to-Defend: Safety-Aware Reasoning Can Defend Large Language Models from Jailbreaking
di: Zhu, Junda, et al.
Pubblicazione: (2025)
di: Zhu, Junda, et al.
Pubblicazione: (2025)
Adversarial Attacks on Robotic Vision Language Action Models
di: Jones, Eliot Krzysztof, et al.
Pubblicazione: (2025)
di: Jones, Eliot Krzysztof, et al.
Pubblicazione: (2025)
Prefix Guidance: A Steering Wheel for Large Language Models to Defend Against Jailbreak Attacks
di: Zhao, Jiawei, et al.
Pubblicazione: (2024)
di: Zhao, Jiawei, et al.
Pubblicazione: (2024)
Evaluating the Performance of Large Language Models via Debates
di: Moniri, Behrad, et al.
Pubblicazione: (2024)
di: Moniri, Behrad, et al.
Pubblicazione: (2024)
Defending LLM Watermarking Against Spoofing Attacks with Contrastive Representation Learning
di: An, Li, et al.
Pubblicazione: (2025)
di: An, Li, et al.
Pubblicazione: (2025)
Jailbreaking Attack against Multimodal Large Language Model
di: Niu, Zhenxing, et al.
Pubblicazione: (2024)
di: Niu, Zhenxing, et al.
Pubblicazione: (2024)
PARDEN, Can You Repeat That? Defending against Jailbreaks via Repetition
di: Zhang, Ziyang, et al.
Pubblicazione: (2024)
di: Zhang, Ziyang, et al.
Pubblicazione: (2024)
Adversarial Tuning: Defending Against Jailbreak Attacks for LLMs
di: Liu, Fan, et al.
Pubblicazione: (2024)
di: Liu, Fan, et al.
Pubblicazione: (2024)
Robust Prompt Optimization for Defending Language Models Against Jailbreaking Attacks
di: Zhou, Andy, et al.
Pubblicazione: (2024)
di: Zhou, Andy, et al.
Pubblicazione: (2024)
Round Trip Translation Defence against Large Language Model Jailbreaking Attacks
di: Yung, Canaan, et al.
Pubblicazione: (2024)
di: Yung, Canaan, et al.
Pubblicazione: (2024)
Shaping the Safety Boundaries: Understanding and Defending Against Jailbreaks in Large Language Models
di: Gao, Lang, et al.
Pubblicazione: (2024)
di: Gao, Lang, et al.
Pubblicazione: (2024)
Chordal Sparsity for Lipschitz Constant Estimation of Deep Neural Networks
di: Xue, Anton, et al.
Pubblicazione: (2022)
di: Xue, Anton, et al.
Pubblicazione: (2022)
Contextual Safety Reasoning and Grounding for Open-World Robots
di: Ravichandran, Zachary, et al.
Pubblicazione: (2026)
di: Ravichandran, Zachary, et al.
Pubblicazione: (2026)
Unified Defense for Large Language Models against Jailbreak and Fine-Tuning Attacks in Education
di: Yi, Xin, et al.
Pubblicazione: (2025)
di: Yi, Xin, et al.
Pubblicazione: (2025)
HiddenDetect: Detecting Jailbreak Attacks against Large Vision-Language Models via Monitoring Hidden States
di: Jiang, Yilei, et al.
Pubblicazione: (2025)
di: Jiang, Yilei, et al.
Pubblicazione: (2025)
Documenti analoghi
-
SmoothLLM: Defending Large Language Models Against Jailbreaking Attacks
di: Robey, Alexander, et al.
Pubblicazione: (2023) -
Jailbreaking Black Box Large Language Models in Twenty Queries
di: Chao, Patrick, et al.
Pubblicazione: (2023) -
Advancing the Robustness of Large Language Models through Self-Denoised Smoothing
di: Ji, Jiabao, et al.
Pubblicazione: (2024) -
Jailbreaking LLM-Controlled Robots
di: Robey, Alexander, et al.
Pubblicazione: (2024) -
KVLink: Accelerating Large Language Models via Efficient KV Cache Reuse
di: Yang, Jingbo, et al.
Pubblicazione: (2025)