Salvato in:
| Autori principali: | Zhang, Hang, Lou, Qian, Wang, Yanshan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2501.18632 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
InfoFlood: Jailbreaking Large Language Models with Information Overload
di: Yadav, Advait, et al.
Pubblicazione: (2025)
di: Yadav, Advait, et al.
Pubblicazione: (2025)
Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models
di: Tu, Shangqing, et al.
Pubblicazione: (2024)
di: Tu, Shangqing, et al.
Pubblicazione: (2024)
S-Eval: Towards Automated and Comprehensive Safety Evaluation for Large Language Models
di: Yuan, Xiaohan, et al.
Pubblicazione: (2024)
di: Yuan, Xiaohan, et al.
Pubblicazione: (2024)
JailbreakLens: Visual Analysis of Jailbreak Attacks Against Large Language Models
di: Feng, Yingchaojie, et al.
Pubblicazione: (2024)
di: Feng, Yingchaojie, et al.
Pubblicazione: (2024)
StructuralSleight: Automated Jailbreak Attacks on Large Language Models Utilizing Uncommon Text-Organization Structures
di: Li, Bangxin, et al.
Pubblicazione: (2024)
di: Li, Bangxin, et al.
Pubblicazione: (2024)
Don't Listen To Me: Understanding and Exploring Jailbreak Prompts of Large Language Models
di: Yu, Zhiyuan, et al.
Pubblicazione: (2024)
di: Yu, Zhiyuan, et al.
Pubblicazione: (2024)
Jailbreaking Leaves a Trace: Understanding and Detecting Jailbreak Attacks from Internal Representations of Large Language Models
di: Kadali, Sri Durga Sai Sowmya, et al.
Pubblicazione: (2026)
di: Kadali, Sri Durga Sai Sowmya, et al.
Pubblicazione: (2026)
Imperceptible Jailbreaking against Large Language Models
di: Gao, Kuofeng, et al.
Pubblicazione: (2025)
di: Gao, Kuofeng, et al.
Pubblicazione: (2025)
Harnessing Task Overload for Scalable Jailbreak Attacks on Large Language Models
di: Dong, Yiting, et al.
Pubblicazione: (2024)
di: Dong, Yiting, et al.
Pubblicazione: (2024)
JailbreakEval: An Integrated Toolkit for Evaluating Jailbreak Attempts Against Large Language Models
di: Ran, Delong, et al.
Pubblicazione: (2024)
di: Ran, Delong, et al.
Pubblicazione: (2024)
Safely Learning with Private Data: A Federated Learning Framework for Large Language Model
di: Zheng, JiaYing, et al.
Pubblicazione: (2024)
di: Zheng, JiaYing, et al.
Pubblicazione: (2024)
VERA: Variational Inference Framework for Jailbreaking Large Language Models
di: Lochab, Anamika, et al.
Pubblicazione: (2025)
di: Lochab, Anamika, et al.
Pubblicazione: (2025)
Retrieval-Augmented Defense: Adaptive and Controllable Jailbreak Prevention for Large Language Models
di: Yang, Guangyu, et al.
Pubblicazione: (2025)
di: Yang, Guangyu, et al.
Pubblicazione: (2025)
SciSafeEval: A Comprehensive Benchmark for Safety Alignment of Large Language Models in Scientific Tasks
di: Li, Tianhao, et al.
Pubblicazione: (2024)
di: Li, Tianhao, et al.
Pubblicazione: (2024)
CodeChameleon: Personalized Encryption Framework for Jailbreaking Large Language Models
di: Lv, Huijie, et al.
Pubblicazione: (2024)
di: Lv, Huijie, et al.
Pubblicazione: (2024)
SafeAligner: Safety Alignment against Jailbreak Attacks via Response Disparity Guidance
di: Huang, Caishuang, et al.
Pubblicazione: (2024)
di: Huang, Caishuang, et al.
Pubblicazione: (2024)
BitBypass: A New Direction in Jailbreaking Aligned Large Language Models with Bitstream Camouflage
di: Nakka, Kalyan, et al.
Pubblicazione: (2025)
di: Nakka, Kalyan, et al.
Pubblicazione: (2025)
LLM-Virus: Evolutionary Jailbreak Attack on Large Language Models
di: Yu, Miao, et al.
Pubblicazione: (2024)
di: Yu, Miao, et al.
Pubblicazione: (2024)
ForgeDAN: An Evolutionary Framework for Jailbreaking Aligned Large Language Models
di: Cheng, Siyang, et al.
Pubblicazione: (2025)
di: Cheng, Siyang, et al.
Pubblicazione: (2025)
EnJa: Ensemble Jailbreak on Large Language Models
di: Zhang, Jiahao, et al.
Pubblicazione: (2024)
di: Zhang, Jiahao, et al.
Pubblicazione: (2024)
Sugar-Coated Poison: Benign Generation Unlocks LLM Jailbreaking
di: Wu, Yu-Hang, et al.
Pubblicazione: (2025)
di: Wu, Yu-Hang, et al.
Pubblicazione: (2025)
Jailbreaking Multimodal Large Language Models via Shuffle Inconsistency
di: Zhao, Shiji, et al.
Pubblicazione: (2025)
di: Zhao, Shiji, et al.
Pubblicazione: (2025)
Jailbreaking Large Language Models Through Content Concretization
di: Wahréus, Johan, et al.
Pubblicazione: (2025)
di: Wahréus, Johan, et al.
Pubblicazione: (2025)
Distract Large Language Models for Automatic Jailbreak Attack
di: Xiao, Zeguan, et al.
Pubblicazione: (2024)
di: Xiao, Zeguan, et al.
Pubblicazione: (2024)
JailbreakZoo: Survey, Landscapes, and Horizons in Jailbreaking Large Language and Vision-Language Models
di: Jin, Haibo, et al.
Pubblicazione: (2024)
di: Jin, Haibo, et al.
Pubblicazione: (2024)
CCJA: Context-Coherent Jailbreak Attack for Aligned Large Language Models
di: Zhou, Guanghao, et al.
Pubblicazione: (2025)
di: Zhou, Guanghao, et al.
Pubblicazione: (2025)
GradSafe: Detecting Jailbreak Prompts for LLMs via Safety-Critical Gradient Analysis
di: Xie, Yueqi, et al.
Pubblicazione: (2024)
di: Xie, Yueqi, et al.
Pubblicazione: (2024)
Reasoning-Augmented Conversation for Multi-Turn Jailbreak Attacks on Large Language Models
di: Ying, Zonghao, et al.
Pubblicazione: (2025)
di: Ying, Zonghao, et al.
Pubblicazione: (2025)
Improved Techniques for Optimization-Based Jailbreaking on Large Language Models
di: Jia, Xiaojun, et al.
Pubblicazione: (2024)
di: Jia, Xiaojun, et al.
Pubblicazione: (2024)
Is the System Message Really Important to Jailbreaks in Large Language Models?
di: Zou, Xiaotian, et al.
Pubblicazione: (2024)
di: Zou, Xiaotian, et al.
Pubblicazione: (2024)
Jailbreak Antidote: Runtime Safety-Utility Balance via Sparse Representation Adjustment in Large Language Models
di: Shen, Guobin, et al.
Pubblicazione: (2024)
di: Shen, Guobin, et al.
Pubblicazione: (2024)
STShield: Single-Token Sentinel for Real-Time Jailbreak Detection in Large Language Models
di: Wang, Xunguang, et al.
Pubblicazione: (2025)
di: Wang, Xunguang, et al.
Pubblicazione: (2025)
Jailbreak-Zero: A Path to Pareto Optimal Red Teaming for Large Language Models
di: Hu, Kai, et al.
Pubblicazione: (2025)
di: Hu, Kai, et al.
Pubblicazione: (2025)
FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts
di: Gong, Yichen, et al.
Pubblicazione: (2023)
di: Gong, Yichen, et al.
Pubblicazione: (2023)
How Real is Your Jailbreak? Fine-grained Jailbreak Evaluation with Anchored Reference
di: Liu, Songyang, et al.
Pubblicazione: (2026)
di: Liu, Songyang, et al.
Pubblicazione: (2026)
Prefix Guidance: A Steering Wheel for Large Language Models to Defend Against Jailbreak Attacks
di: Zhao, Jiawei, et al.
Pubblicazione: (2024)
di: Zhao, Jiawei, et al.
Pubblicazione: (2024)
Continuous Embedding Attacks via Clipped Inputs in Jailbreaking Large Language Models
di: Xu, Zihao, et al.
Pubblicazione: (2024)
di: Xu, Zihao, et al.
Pubblicazione: (2024)
CR-UTP: Certified Robustness against Universal Text Perturbations on Large Language Models
di: Lou, Qian, et al.
Pubblicazione: (2024)
di: Lou, Qian, et al.
Pubblicazione: (2024)
RobustKV: Defending Large Language Models against Jailbreak Attacks via KV Eviction
di: Jiang, Tanqiu, et al.
Pubblicazione: (2024)
di: Jiang, Tanqiu, et al.
Pubblicazione: (2024)
Unleashing the Unseen: Harnessing Benign Datasets for Jailbreaking Large Language Models
di: Zhao, Wei, et al.
Pubblicazione: (2024)
di: Zhao, Wei, et al.
Pubblicazione: (2024)
Documenti analoghi
-
InfoFlood: Jailbreaking Large Language Models with Information Overload
di: Yadav, Advait, et al.
Pubblicazione: (2025) -
Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models
di: Tu, Shangqing, et al.
Pubblicazione: (2024) -
S-Eval: Towards Automated and Comprehensive Safety Evaluation for Large Language Models
di: Yuan, Xiaohan, et al.
Pubblicazione: (2024) -
JailbreakLens: Visual Analysis of Jailbreak Attacks Against Large Language Models
di: Feng, Yingchaojie, et al.
Pubblicazione: (2024) -
StructuralSleight: Automated Jailbreak Attacks on Large Language Models Utilizing Uncommon Text-Organization Structures
di: Li, Bangxin, et al.
Pubblicazione: (2024)