LASH: Adaptive Semantic Hybridization for Black-Box Jailbreaking of Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Nafi, Abdullah Al Nomaan, Suya, Fnu, Bhunia, Swarup, Chakraborty, Prabuddha |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DASH: A Meta-Attack Framework for Synthesizing Effective and Stealthy Adversarial Examples
por: Nafi, Abdullah Al Nomaan, et al.
Publicado: (2025)
por: Nafi, Abdullah Al Nomaan, et al.
Publicado: (2025)
Token Inflation: How Dishonest Providers Can Overcharge for Large Language Model Usage
por: Hoque, Shahinul, et al.
Publicado: (2026)
por: Hoque, Shahinul, et al.
Publicado: (2026)
AJF: Adaptive Jailbreak Framework Based on the Comprehension Ability of Black-Box Large Language Models
por: Yu, Mingyu, et al.
Publicado: (2025)
por: Yu, Mingyu, et al.
Publicado: (2025)
X-DFS: Explainable Artificial Intelligence Guided Design-for-Security Solution Space Exploration
por: Mahfuz, Tanzim, et al.
Publicado: (2024)
por: Mahfuz, Tanzim, et al.
Publicado: (2024)
Open Sesame! Universal Black Box Jailbreaking of Large Language Models
por: Lapid, Raz, et al.
Publicado: (2023)
por: Lapid, Raz, et al.
Publicado: (2023)
HAMLOCK: HArdware-Model LOgically Combined attacK
por: Amgain, Sanskar, et al.
Publicado: (2025)
por: Amgain, Sanskar, et al.
Publicado: (2025)
MIST: Jailbreaking Black-box Large Language Models via Iterative Semantic Tuning
por: Zheng, Muyang, et al.
Publicado: (2025)
por: Zheng, Muyang, et al.
Publicado: (2025)
BlackDAN: A Black-Box Multi-Objective Approach for Effective and Contextual Jailbreaking of Large Language Models
por: Wang, Xinyuan, et al.
Publicado: (2024)
por: Wang, Xinyuan, et al.
Publicado: (2024)
Structured Semantic Cloaking for Jailbreak Attacks on Large Language Models
por: Sun, Xiaobing, et al.
Publicado: (2026)
por: Sun, Xiaobing, et al.
Publicado: (2026)
Knowledge Distillation of Black-Box Large Language Models
por: Chen, Hongzhan, et al.
Publicado: (2024)
por: Chen, Hongzhan, et al.
Publicado: (2024)
SoK: Pitfalls in Evaluating Black-Box Attacks
por: Suya, Fnu, et al.
Publicado: (2023)
por: Suya, Fnu, et al.
Publicado: (2023)
"Moralized" Multi-Step Jailbreak Prompts: Black-Box Testing of Guardrails in Large Language Models for Verbal Attacks
por: Wang, Libo
Publicado: (2024)
por: Wang, Libo
Publicado: (2024)
Defending Large Language Models against Jailbreak Attacks via Semantic Smoothing
por: Ji, Jiabao, et al.
Publicado: (2024)
por: Ji, Jiabao, et al.
Publicado: (2024)
FregeLogic at SemEval 2026 Task 11: A Hybrid Neuro-Symbolic Architecture for Content-Robust Syllogistic Validity Prediction
por: Akinfaderin, Adewale, et al.
Publicado: (2026)
por: Akinfaderin, Adewale, et al.
Publicado: (2026)
Jailbreaking Commercial Black-Box LLMs with Explicitly Harmful Prompts
por: Zhang, Chiyu, et al.
Publicado: (2025)
por: Zhang, Chiyu, et al.
Publicado: (2025)
KERL: Knowledge-Enhanced Personalized Recipe Recommendation using Large Language Models
por: Mohbat, Fnu, et al.
Publicado: (2025)
por: Mohbat, Fnu, et al.
Publicado: (2025)
Black-Box On-Policy Distillation of Large Language Models
por: Ye, Tianzhu, et al.
Publicado: (2025)
por: Ye, Tianzhu, et al.
Publicado: (2025)
RPM: Reasoning-Level Personalization for Black-Box Large Language Models
por: Kim, Jieyong, et al.
Publicado: (2025)
por: Kim, Jieyong, et al.
Publicado: (2025)
Innocence in the Crossfire: Roles of Skip Connections in Jailbreaking Visual Language Models
por: Nandi, Palash, et al.
Publicado: (2025)
por: Nandi, Palash, et al.
Publicado: (2025)
Persona Jailbreaking in Large Language Models
por: Sandhan, Jivnesh, et al.
Publicado: (2026)
por: Sandhan, Jivnesh, et al.
Publicado: (2026)
Graph of Attacks: Improved Black-Box and Interpretable Jailbreaks for LLMs
por: Akbar-Tajari, Mohammad, et al.
Publicado: (2025)
por: Akbar-Tajari, Mohammad, et al.
Publicado: (2025)
Beyond the Black Box: A Survey on the Theory and Mechanism of Large Language Models
por: Gan, Zeyu, et al.
Publicado: (2026)
por: Gan, Zeyu, et al.
Publicado: (2026)
Black Big Boxes: Tracing Adjective Order Preferences in Large Language Models
por: Jumelet, Jaap, et al.
Publicado: (2024)
por: Jumelet, Jaap, et al.
Publicado: (2024)
Tree of Attacks: Jailbreaking Black-Box LLMs Automatically
por: Mehrotra, Anay, et al.
Publicado: (2023)
por: Mehrotra, Anay, et al.
Publicado: (2023)
Black-Box Prompt Optimization: Aligning Large Language Models without Model Training
por: Cheng, Jiale, et al.
Publicado: (2023)
por: Cheng, Jiale, et al.
Publicado: (2023)
All in How You Ask for It: Simple Black-Box Method for Jailbreak Attacks
por: Takemoto, Kazuhiro
Publicado: (2024)
por: Takemoto, Kazuhiro
Publicado: (2024)
Jailbreaking Large Language Models with Morality Attacks
por: Su, Ying, et al.
Publicado: (2026)
por: Su, Ying, et al.
Publicado: (2026)
Weak-to-Strong Jailbreaking on Large Language Models
por: Zhao, Xuandong, et al.
Publicado: (2024)
por: Zhao, Xuandong, et al.
Publicado: (2024)
Diversity Helps Jailbreak Large Language Models
por: Zhao, Weiliang, et al.
Publicado: (2024)
por: Zhao, Weiliang, et al.
Publicado: (2024)
Multilingual Jailbreak Challenges in Large Language Models
por: Deng, Yue, et al.
Publicado: (2023)
por: Deng, Yue, et al.
Publicado: (2023)
Retrieval-Augmented Defense: Adaptive and Controllable Jailbreak Prevention for Large Language Models
por: Yang, Guangyu, et al.
Publicado: (2025)
por: Yang, Guangyu, et al.
Publicado: (2025)
SODA: Semi On-Policy Black-Box Distillation for Large Language Models
por: Chen, Xiwen, et al.
Publicado: (2026)
por: Chen, Xiwen, et al.
Publicado: (2026)
Hierarchical Text Classification Using Black Box Large Language Models
por: Yoshimura, Kosuke, et al.
Publicado: (2025)
por: Yoshimura, Kosuke, et al.
Publicado: (2025)
Test-time Backdoor Mitigation for Black-Box Large Language Models with Defensive Demonstrations
por: Mo, Wenjie, et al.
Publicado: (2023)
por: Mo, Wenjie, et al.
Publicado: (2023)
Effective and Efficient Jailbreaks of Black-Box LLMs with Cross-Behavior Attacks
por: Gohil, Vasudev
Publicado: (2025)
por: Gohil, Vasudev
Publicado: (2025)
SALTY: Explainable Artificial Intelligence Guided Structural Analysis for Hardware Trojan Detection
por: Mahfuz, Tanzim, et al.
Publicado: (2025)
por: Mahfuz, Tanzim, et al.
Publicado: (2025)
POLARIS: Explainable Artificial Intelligence for Mitigating Power Side-Channel Leakage
por: Mahfuz, Tanzim, et al.
Publicado: (2025)
por: Mahfuz, Tanzim, et al.
Publicado: (2025)
EasyJailbreak: A Unified Framework for Jailbreaking Large Language Models
por: Zhou, Weikang, et al.
Publicado: (2024)
por: Zhou, Weikang, et al.
Publicado: (2024)
Characterizing the Robustness of Black-Box LLM Planners Under Perturbed Observations with Adaptive Stress Testing
por: Chakraborty, Neeloy, et al.
Publicado: (2025)
por: Chakraborty, Neeloy, et al.
Publicado: (2025)
When Prompt Optimization Becomes Jailbreaking: Adaptive Red-Teaming of Large Language Models
por: Shamsi, Zafir, et al.
Publicado: (2026)
por: Shamsi, Zafir, et al.
Publicado: (2026)
Ejemplares similares
-
DASH: A Meta-Attack Framework for Synthesizing Effective and Stealthy Adversarial Examples
por: Nafi, Abdullah Al Nomaan, et al.
Publicado: (2025) -
Token Inflation: How Dishonest Providers Can Overcharge for Large Language Model Usage
por: Hoque, Shahinul, et al.
Publicado: (2026) -
AJF: Adaptive Jailbreak Framework Based on the Comprehension Ability of Black-Box Large Language Models
por: Yu, Mingyu, et al.
Publicado: (2025) -
X-DFS: Explainable Artificial Intelligence Guided Design-for-Security Solution Space Exploration
por: Mahfuz, Tanzim, et al.
Publicado: (2024) -
Open Sesame! Universal Black Box Jailbreaking of Large Language Models
por: Lapid, Raz, et al.
Publicado: (2023)