AJF: Adaptive Jailbreak Framework Based on the Comprehension Ability of Black-Box Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yu, Mingyu, Wang, Wei, Wei, Yanjie, Qin, Sujuan, Gao, Fei, Li, Wenmin |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LASH: Adaptive Semantic Hybridization for Black-Box Jailbreaking of Large Language Models
par: Nafi, Abdullah Al Nomaan, et autres
Publié: (2026)
par: Nafi, Abdullah Al Nomaan, et autres
Publié: (2026)
Beyond Visual Safety: Jailbreaking Multimodal Large Language Models for Harmful Image Generation via Semantic-Agnostic Inputs
par: Yu, Mingyu, et autres
Publié: (2026)
par: Yu, Mingyu, et autres
Publié: (2026)
Open Sesame! Universal Black Box Jailbreaking of Large Language Models
par: Lapid, Raz, et autres
Publié: (2023)
par: Lapid, Raz, et autres
Publié: (2023)
Black-Box On-Policy Distillation of Large Language Models
par: Ye, Tianzhu, et autres
Publié: (2025)
par: Ye, Tianzhu, et autres
Publié: (2025)
EvoDefense: Co-Evolving Black-Box Defense with Large Language Models
par: Li, Yu, et autres
Publié: (2026)
par: Li, Yu, et autres
Publié: (2026)
The GaoYao Benchmark: A Comprehensive Framework for Evaluating Multilingual and Multicultural Abilities of Large Language Models
par: Liu, Yilun, et autres
Publié: (2026)
par: Liu, Yilun, et autres
Publié: (2026)
EasyJailbreak: A Unified Framework for Jailbreaking Large Language Models
par: Zhou, Weikang, et autres
Publié: (2024)
par: Zhou, Weikang, et autres
Publié: (2024)
BlackDAN: A Black-Box Multi-Objective Approach for Effective and Contextual Jailbreaking of Large Language Models
par: Wang, Xinyuan, et autres
Publié: (2024)
par: Wang, Xinyuan, et autres
Publié: (2024)
Persona Jailbreaking in Large Language Models
par: Sandhan, Jivnesh, et autres
Publié: (2026)
par: Sandhan, Jivnesh, et autres
Publié: (2026)
"Moralized" Multi-Step Jailbreak Prompts: Black-Box Testing of Guardrails in Large Language Models for Verbal Attacks
par: Wang, Libo
Publié: (2024)
par: Wang, Libo
Publié: (2024)
TimeBench: A Comprehensive Evaluation of Temporal Reasoning Abilities in Large Language Models
par: Chu, Zheng, et autres
Publié: (2023)
par: Chu, Zheng, et autres
Publié: (2023)
Disentangling Memory and Reasoning Ability in Large Language Models
par: Jin, Mingyu, et autres
Publié: (2024)
par: Jin, Mingyu, et autres
Publié: (2024)
BBox-Adapter: Lightweight Adapting for Black-Box Large Language Models
par: Sun, Haotian, et autres
Publié: (2024)
par: Sun, Haotian, et autres
Publié: (2024)
Exploiting the Index Gradients for Optimization-Based Jailbreaking on Large Language Models
par: Li, Jiahui, et autres
Publié: (2024)
par: Li, Jiahui, et autres
Publié: (2024)
JailbreakLens: Visual Analysis of Jailbreak Attacks Against Large Language Models
par: Feng, Yingchaojie, et autres
Publié: (2024)
par: Feng, Yingchaojie, et autres
Publié: (2024)
AttackEval: How to Evaluate the Effectiveness of Jailbreak Attacking on Large Language Models
par: Shu, Dong, et autres
Publié: (2024)
par: Shu, Dong, et autres
Publié: (2024)
Diversity Helps Jailbreak Large Language Models
par: Zhao, Weiliang, et autres
Publié: (2024)
par: Zhao, Weiliang, et autres
Publié: (2024)
Knowledge Distillation of Black-Box Large Language Models
par: Chen, Hongzhan, et autres
Publié: (2024)
par: Chen, Hongzhan, et autres
Publié: (2024)
Weak-to-Strong Jailbreaking on Large Language Models
par: Zhao, Xuandong, et autres
Publié: (2024)
par: Zhao, Xuandong, et autres
Publié: (2024)
FedDTPT: Federated Discrete and Transferable Prompt Tuning for Black-Box Large Language Models
par: Wu, Jiaqi, et autres
Publié: (2024)
par: Wu, Jiaqi, et autres
Publié: (2024)
ForgeDAN: An Evolutionary Framework for Jailbreaking Aligned Large Language Models
par: Cheng, Siyang, et autres
Publié: (2025)
par: Cheng, Siyang, et autres
Publié: (2025)
Test-time Backdoor Mitigation for Black-Box Large Language Models with Defensive Demonstrations
par: Mo, Wenjie, et autres
Publié: (2023)
par: Mo, Wenjie, et autres
Publié: (2023)
Cognitive Overload: Jailbreaking Large Language Models with Overloaded Logical Thinking
par: Xu, Nan, et autres
Publié: (2023)
par: Xu, Nan, et autres
Publié: (2023)
Beyond the Black Box: A Survey on the Theory and Mechanism of Large Language Models
par: Gan, Zeyu, et autres
Publié: (2026)
par: Gan, Zeyu, et autres
Publié: (2026)
Cross-modality Information Check for Detecting Jailbreaking in Multimodal Large Language Models
par: Xu, Yue, et autres
Publié: (2024)
par: Xu, Yue, et autres
Publié: (2024)
TAO-Attack: Toward Advanced Optimization-Based Jailbreak Attacks for Large Language Models
par: Xu, Zhi, et autres
Publié: (2026)
par: Xu, Zhi, et autres
Publié: (2026)
InFoBench: Evaluating Instruction Following Ability in Large Language Models
par: Qin, Yiwei, et autres
Publié: (2024)
par: Qin, Yiwei, et autres
Publié: (2024)
AutoLogi: Automated Generation of Logic Puzzles for Evaluating Reasoning Abilities of Large Language Models
par: Zhu, Qin, et autres
Publié: (2025)
par: Zhu, Qin, et autres
Publié: (2025)
Jailbreaking Commercial Black-Box LLMs with Explicitly Harmful Prompts
par: Zhang, Chiyu, et autres
Publié: (2025)
par: Zhang, Chiyu, et autres
Publié: (2025)
Unleashing the Unseen: Harnessing Benign Datasets for Jailbreaking Large Language Models
par: Zhao, Wei, et autres
Publié: (2024)
par: Zhao, Wei, et autres
Publié: (2024)
Defending Large Language Models Against Jailbreaking Attacks Through Goal Prioritization
par: Zhang, Zhexin, et autres
Publié: (2023)
par: Zhang, Zhexin, et autres
Publié: (2023)
Imperceptible Jailbreaking against Large Language Models
par: Gao, Kuofeng, et autres
Publié: (2025)
par: Gao, Kuofeng, et autres
Publié: (2025)
Jailbreaking Large Language Models with Morality Attacks
par: Su, Ying, et autres
Publié: (2026)
par: Su, Ying, et autres
Publié: (2026)
Entropy-Based Adaptive Weighting for Self-Training
par: Wang, Xiaoxuan, et autres
Publié: (2025)
par: Wang, Xiaoxuan, et autres
Publié: (2025)
Reflective Personalization Optimization: A Post-hoc Rewriting Framework for Black-Box Large Language Models
par: Hao, Teqi, et autres
Publié: (2025)
par: Hao, Teqi, et autres
Publié: (2025)
Distilling Reasoning Ability from Large Language Models with Adaptive Thinking
par: Chen, Xiaoshu, et autres
Publié: (2024)
par: Chen, Xiaoshu, et autres
Publié: (2024)
Black-Box Prompt Optimization: Aligning Large Language Models without Model Training
par: Cheng, Jiale, et autres
Publié: (2023)
par: Cheng, Jiale, et autres
Publié: (2023)
RPM: Reasoning-Level Personalization for Black-Box Large Language Models
par: Kim, Jieyong, et autres
Publié: (2025)
par: Kim, Jieyong, et autres
Publié: (2025)
Model Editing Harms General Abilities of Large Language Models: Regularization to the Rescue
par: Gu, Jia-Chen, et autres
Publié: (2024)
par: Gu, Jia-Chen, et autres
Publié: (2024)
SODA: Semi On-Policy Black-Box Distillation for Large Language Models
par: Chen, Xiwen, et autres
Publié: (2026)
par: Chen, Xiwen, et autres
Publié: (2026)
Documents similaires
-
LASH: Adaptive Semantic Hybridization for Black-Box Jailbreaking of Large Language Models
par: Nafi, Abdullah Al Nomaan, et autres
Publié: (2026) -
Beyond Visual Safety: Jailbreaking Multimodal Large Language Models for Harmful Image Generation via Semantic-Agnostic Inputs
par: Yu, Mingyu, et autres
Publié: (2026) -
Open Sesame! Universal Black Box Jailbreaking of Large Language Models
par: Lapid, Raz, et autres
Publié: (2023) -
Black-Box On-Policy Distillation of Large Language Models
par: Ye, Tianzhu, et autres
Publié: (2025) -
EvoDefense: Co-Evolving Black-Box Defense with Large Language Models
par: Li, Yu, et autres
Publié: (2026)