JailbreakEval: An Integrated Toolkit for Evaluating Jailbreak Attempts Against Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Ran, Delong, Liu, Jinyuan, Gong, Yichen, Zheng, Jingyi, He, Xinlei, Cong, Tianshuo, Wang, Anyu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts
di: Gong, Yichen, et al.
Pubblicazione: (2023)
di: Gong, Yichen, et al.
Pubblicazione: (2023)
Have You Merged My Model? On The Robustness of Large Language Model IP Protection Methods Against Model Merging
di: Cong, Tianshuo, et al.
Pubblicazione: (2024)
di: Cong, Tianshuo, et al.
Pubblicazione: (2024)
LoRA-Leak: Membership Inference Attacks Against LoRA Fine-tuned Language Models
di: Ran, Delong, et al.
Pubblicazione: (2025)
di: Ran, Delong, et al.
Pubblicazione: (2025)
Jailbreak Attacks and Defenses Against Large Language Models: A Survey
di: Yi, Sibo, et al.
Pubblicazione: (2024)
di: Yi, Sibo, et al.
Pubblicazione: (2024)
Beyond the Tip of Efficiency: Uncovering the Submerged Threats of Jailbreak Attacks in Small Language Models
di: Yi, Sibo, et al.
Pubblicazione: (2025)
di: Yi, Sibo, et al.
Pubblicazione: (2025)
Cryptanalysis of Pseudorandom Error-Correcting Codes
di: Wang, Tianrui, et al.
Pubblicazione: (2025)
di: Wang, Tianrui, et al.
Pubblicazione: (2025)
Test-Time Immunization: A Universal Defense Framework Against Jailbreaks for (Multimodal) Large Language Models
di: Yu, Yongcan, et al.
Pubblicazione: (2025)
di: Yu, Yongcan, et al.
Pubblicazione: (2025)
JailbreakLens: Visual Analysis of Jailbreak Attacks Against Large Language Models
di: Feng, Yingchaojie, et al.
Pubblicazione: (2024)
di: Feng, Yingchaojie, et al.
Pubblicazione: (2024)
Subtoxic Questions: Dive Into Attitude Change of LLM's Response in Jailbreak Attempts
di: Zhang, Tianyu, et al.
Pubblicazione: (2024)
di: Zhang, Tianyu, et al.
Pubblicazione: (2024)
CL-Attack: Textual Backdoor Attacks via Cross-Lingual Triggers
di: Zheng, Jingyi, et al.
Pubblicazione: (2024)
di: Zheng, Jingyi, et al.
Pubblicazione: (2024)
How Real is Your Jailbreak? Fine-grained Jailbreak Evaluation with Anchored Reference
di: Liu, Songyang, et al.
Pubblicazione: (2026)
di: Liu, Songyang, et al.
Pubblicazione: (2026)
Harnessing Task Overload for Scalable Jailbreak Attacks on Large Language Models
di: Dong, Yiting, et al.
Pubblicazione: (2024)
di: Dong, Yiting, et al.
Pubblicazione: (2024)
Jailbreaking Leaves a Trace: Understanding and Detecting Jailbreak Attacks from Internal Representations of Large Language Models
di: Kadali, Sri Durga Sai Sowmya, et al.
Pubblicazione: (2026)
di: Kadali, Sri Durga Sai Sowmya, et al.
Pubblicazione: (2026)
Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models
di: Tu, Shangqing, et al.
Pubblicazione: (2024)
di: Tu, Shangqing, et al.
Pubblicazione: (2024)
On Evaluating The Performance of Watermarked Machine-Generated Texts Under Adversarial Attacks
di: Liu, Zesen, et al.
Pubblicazione: (2024)
di: Liu, Zesen, et al.
Pubblicazione: (2024)
InfoFlood: Jailbreaking Large Language Models with Information Overload
di: Yadav, Advait, et al.
Pubblicazione: (2025)
di: Yadav, Advait, et al.
Pubblicazione: (2025)
JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs
di: Chu, Junjie, et al.
Pubblicazione: (2024)
di: Chu, Junjie, et al.
Pubblicazione: (2024)
StructuralSleight: Automated Jailbreak Attacks on Large Language Models Utilizing Uncommon Text-Organization Structures
di: Li, Bangxin, et al.
Pubblicazione: (2024)
di: Li, Bangxin, et al.
Pubblicazione: (2024)
PandaGuard: Systematic Evaluation of LLM Safety against Jailbreaking Attacks
di: Shen, Guobin, et al.
Pubblicazione: (2025)
di: Shen, Guobin, et al.
Pubblicazione: (2025)
Imperceptible Jailbreaking against Large Language Models
di: Gao, Kuofeng, et al.
Pubblicazione: (2025)
di: Gao, Kuofeng, et al.
Pubblicazione: (2025)
Prefix Guidance: A Steering Wheel for Large Language Models to Defend Against Jailbreak Attacks
di: Zhao, Jiawei, et al.
Pubblicazione: (2024)
di: Zhao, Jiawei, et al.
Pubblicazione: (2024)
Jailbreak Antidote: Runtime Safety-Utility Balance via Sparse Representation Adjustment in Large Language Models
di: Shen, Guobin, et al.
Pubblicazione: (2024)
di: Shen, Guobin, et al.
Pubblicazione: (2024)
Retrieval-Augmented Defense: Adaptive and Controllable Jailbreak Prevention for Large Language Models
di: Yang, Guangyu, et al.
Pubblicazione: (2025)
di: Yang, Guangyu, et al.
Pubblicazione: (2025)
Don't Listen To Me: Understanding and Exploring Jailbreak Prompts of Large Language Models
di: Yu, Zhiyuan, et al.
Pubblicazione: (2024)
di: Yu, Zhiyuan, et al.
Pubblicazione: (2024)
Adversarial Tuning: Defending Against Jailbreak Attacks for LLMs
di: Liu, Fan, et al.
Pubblicazione: (2024)
di: Liu, Fan, et al.
Pubblicazione: (2024)
Jailbreaking Large Language Models Through Content Concretization
di: Wahréus, Johan, et al.
Pubblicazione: (2025)
di: Wahréus, Johan, et al.
Pubblicazione: (2025)
Distract Large Language Models for Automatic Jailbreak Attack
di: Xiao, Zeguan, et al.
Pubblicazione: (2024)
di: Xiao, Zeguan, et al.
Pubblicazione: (2024)
S-Eval: Towards Automated and Comprehensive Safety Evaluation for Large Language Models
di: Yuan, Xiaohan, et al.
Pubblicazione: (2024)
di: Yuan, Xiaohan, et al.
Pubblicazione: (2024)
Towards Robust Multimodal Large Language Models Against Jailbreak Attacks
di: Yin, Ziyi, et al.
Pubblicazione: (2025)
di: Yin, Ziyi, et al.
Pubblicazione: (2025)
Jailbreaking Multimodal Large Language Models via Shuffle Inconsistency
di: Zhao, Shiji, et al.
Pubblicazione: (2025)
di: Zhao, Shiji, et al.
Pubblicazione: (2025)
Improved Techniques for Optimization-Based Jailbreaking on Large Language Models
di: Jia, Xiaojun, et al.
Pubblicazione: (2024)
di: Jia, Xiaojun, et al.
Pubblicazione: (2024)
Is the System Message Really Important to Jailbreaks in Large Language Models?
di: Zou, Xiaotian, et al.
Pubblicazione: (2024)
di: Zou, Xiaotian, et al.
Pubblicazione: (2024)
LLM-Virus: Evolutionary Jailbreak Attack on Large Language Models
di: Yu, Miao, et al.
Pubblicazione: (2024)
di: Yu, Miao, et al.
Pubblicazione: (2024)
VERA: Variational Inference Framework for Jailbreaking Large Language Models
di: Lochab, Anamika, et al.
Pubblicazione: (2025)
di: Lochab, Anamika, et al.
Pubblicazione: (2025)
Towards Safe AI Clinicians: A Comprehensive Study on Large Language Model Jailbreaking in Healthcare
di: Zhang, Hang, et al.
Pubblicazione: (2025)
di: Zhang, Hang, et al.
Pubblicazione: (2025)
BitBypass: A New Direction in Jailbreaking Aligned Large Language Models with Bitstream Camouflage
di: Nakka, Kalyan, et al.
Pubblicazione: (2025)
di: Nakka, Kalyan, et al.
Pubblicazione: (2025)
SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding
di: Xu, Zhangchen, et al.
Pubblicazione: (2024)
di: Xu, Zhangchen, et al.
Pubblicazione: (2024)
Proactive defense against LLM Jailbreak
di: Zhao, Weiliang, et al.
Pubblicazione: (2025)
di: Zhao, Weiliang, et al.
Pubblicazione: (2025)
Mitigating Jailbreaks with Intent-Aware LLMs
di: Yeo, Wei Jie, et al.
Pubblicazione: (2025)
di: Yeo, Wei Jie, et al.
Pubblicazione: (2025)
Rethinking How to Evaluate Language Model Jailbreak
di: Cai, Hongyu, et al.
Pubblicazione: (2024)
di: Cai, Hongyu, et al.
Pubblicazione: (2024)
Documenti analoghi
-
FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts
di: Gong, Yichen, et al.
Pubblicazione: (2023) -
Have You Merged My Model? On The Robustness of Large Language Model IP Protection Methods Against Model Merging
di: Cong, Tianshuo, et al.
Pubblicazione: (2024) -
LoRA-Leak: Membership Inference Attacks Against LoRA Fine-tuned Language Models
di: Ran, Delong, et al.
Pubblicazione: (2025) -
Jailbreak Attacks and Defenses Against Large Language Models: A Survey
di: Yi, Sibo, et al.
Pubblicazione: (2024) -
Beyond the Tip of Efficiency: Uncovering the Submerged Threats of Jailbreak Attacks in Small Language Models
di: Yi, Sibo, et al.
Pubblicazione: (2025)