Zer0-Jack: A Memory-efficient Gradient-based Jailbreaking Method for Black-box Multi-modal Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Chen, Tiejin, Wang, Kaishen, Wei, Hua |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Uncertainty Regularized Evidential Regression
by: Ye, Kai, et al.
Published: (2024)
by: Ye, Kai, et al.
Published: (2024)
Every Response Counts: Quantifying Uncertainty of LLM-based Multi-Agent Systems through Tensor Decomposition
by: Chen, Tiejin, et al.
Published: (2026)
by: Chen, Tiejin, et al.
Published: (2026)
Jailbreaking Black Box Large Language Models in Twenty Queries
by: Chao, Patrick, et al.
Published: (2023)
by: Chao, Patrick, et al.
Published: (2023)
Knowledge Editing on Black-box Large Language Models
by: Song, Xiaoshuai, et al.
Published: (2024)
by: Song, Xiaoshuai, et al.
Published: (2024)
Conformal Feedback Alignment: Quantifying Answer-Level Reliability for Robust LLM Alignment
by: Chen, Tiejin, et al.
Published: (2026)
by: Chen, Tiejin, et al.
Published: (2026)
Arondight: Red Teaming Large Vision Language Models with Auto-generated Multi-modal Jailbreak Prompts
by: Liu, Yi, et al.
Published: (2024)
by: Liu, Yi, et al.
Published: (2024)
Connector-S: A Survey of Connectors in Multi-modal Large Language Models
by: Zhu, Xun, et al.
Published: (2025)
by: Zhu, Xun, et al.
Published: (2025)
Diagnosing Multi-step Reasoning Failures in Black-box LLMs via Stepwise Confidence Attribution
by: Liu, Xiaoou, et al.
Published: (2026)
by: Liu, Xiaoou, et al.
Published: (2026)
Black-box Gradient Attack on Graph Neural Networks: Deeper Insights in Graph-based Attack and Defense
by: Zhan, Haoxi, et al.
Published: (2021)
by: Zhan, Haoxi, et al.
Published: (2021)
Human-like Working Memory Interference in Large Language Models
by: Xiong, Hua-Dong, et al.
Published: (2026)
by: Xiong, Hua-Dong, et al.
Published: (2026)
Jailbreaking and Mitigation of Vulnerabilities in Large Language Models
by: Peng, Benji, et al.
Published: (2024)
by: Peng, Benji, et al.
Published: (2024)
Black-box Uncertainty Quantification Method for LLM-as-a-Judge
by: Wagner, Nico, et al.
Published: (2024)
by: Wagner, Nico, et al.
Published: (2024)
TROJail: Trajectory-Level Optimization for Multi-Turn Large Language Model Jailbreaks with Process Rewards
by: Xiong, Xiqiao, et al.
Published: (2025)
by: Xiong, Xiqiao, et al.
Published: (2025)
From Black-box to Causal-box: Towards Building More Interpretable Models
by: Hwang, Inwoo, et al.
Published: (2025)
by: Hwang, Inwoo, et al.
Published: (2025)
Gradient Cuff: Detecting Jailbreak Attacks on Large Language Models by Exploring Refusal Loss Landscapes
by: Hu, Xiaomeng, et al.
Published: (2024)
by: Hu, Xiaomeng, et al.
Published: (2024)
BiasJailbreak:Analyzing Ethical Biases and Jailbreak Vulnerabilities in Large Language Models
by: Lee, Isack, et al.
Published: (2024)
by: Lee, Isack, et al.
Published: (2024)
SmoothLLM: Defending Large Language Models Against Jailbreaking Attacks
by: Robey, Alexander, et al.
Published: (2023)
by: Robey, Alexander, et al.
Published: (2023)
Jailbreak Scaling Laws for Large Language Models: Polynomial-Exponential Crossover
by: Halder, Indranil, et al.
Published: (2026)
by: Halder, Indranil, et al.
Published: (2026)
Backward-Friendly Optimization: Training Large Language Models with Approximate Gradients under Memory Constraints
by: Yang, Jing, et al.
Published: (2025)
by: Yang, Jing, et al.
Published: (2025)
On Transfer-based Universal Attacks in Pure Black-box Setting
by: Jalwana, Mohammad A. A. K., et al.
Published: (2025)
by: Jalwana, Mohammad A. A. K., et al.
Published: (2025)
Hyperband-based Bayesian Optimization for Black-box Prompt Selection
by: Schneider, Lennart, et al.
Published: (2024)
by: Schneider, Lennart, et al.
Published: (2024)
BlackDAN: A Black-Box Multi-Objective Approach for Effective and Contextual Jailbreaking of Large Language Models
by: Wang, Xinyuan, et al.
Published: (2024)
by: Wang, Xinyuan, et al.
Published: (2024)
The Laminar Flow Hypothesis: Detecting Jailbreaks via Semantic Turbulence in Large Language Models
by: Rahman, Md. Hasib Ur
Published: (2025)
by: Rahman, Md. Hasib Ur
Published: (2025)
Rethinking Jailbreak Detection of Large Vision Language Models with Representational Contrastive Scoring
by: Hua, Peichun, et al.
Published: (2025)
by: Hua, Peichun, et al.
Published: (2025)
Monte Carlo Tree Search based Space Transfer for Black-box Optimization
by: Wang, Shukuan, et al.
Published: (2024)
by: Wang, Shukuan, et al.
Published: (2024)
Single-pass Detection of Jailbreaking Input in Large Language Models
by: Candogan, Leyla Naz, et al.
Published: (2025)
by: Candogan, Leyla Naz, et al.
Published: (2025)
DREAM: Domain-agnostic Reverse Engineering Attributes of Black-box Model
by: Li, Rongqing, et al.
Published: (2024)
by: Li, Rongqing, et al.
Published: (2024)
Active Policy Improvement from Multiple Black-box Oracles
by: Liu, Xuefeng, et al.
Published: (2023)
by: Liu, Xuefeng, et al.
Published: (2023)
Distributional Multi-objective Black-box Optimization for Diffusion-model Inference-time Multi-Target Generation
by: Tan, Kim Yong, et al.
Published: (2025)
by: Tan, Kim Yong, et al.
Published: (2025)
Larimar: Large Language Models with Episodic Memory Control
by: Das, Payel, et al.
Published: (2024)
by: Das, Payel, et al.
Published: (2024)
Visual Hallucinations of Multi-modal Large Language Models
by: Huang, Wen, et al.
Published: (2024)
by: Huang, Wen, et al.
Published: (2024)
Boundary-Guided Policy Optimization for Memory-efficient RL of Diffusion Large Language Models
by: Lin, Nianyi, et al.
Published: (2025)
by: Lin, Nianyi, et al.
Published: (2025)
Federated Natural Policy Gradient and Actor Critic Methods for Multi-task Reinforcement Learning
by: Yang, Tong, et al.
Published: (2023)
by: Yang, Tong, et al.
Published: (2023)
Jailbreaking Large Language Models with Symbolic Mathematics
by: Bethany, Emet, et al.
Published: (2024)
by: Bethany, Emet, et al.
Published: (2024)
LEMMA-RCA: A Large Multi-modal Multi-domain Dataset for Root Cause Analysis
by: Zheng, Lecheng, et al.
Published: (2024)
by: Zheng, Lecheng, et al.
Published: (2024)
MCD: A Model-Agnostic Counterfactual Search Method For Multi-modal Design Modifications
by: Regenwetter, Lyle, et al.
Published: (2023)
by: Regenwetter, Lyle, et al.
Published: (2023)
Improved Large Language Model Jailbreak Detection via Pretrained Embeddings
by: Galinkin, Erick, et al.
Published: (2024)
by: Galinkin, Erick, et al.
Published: (2024)
Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Alignment
by: Ghosal, Soumya Suvra, et al.
Published: (2024)
by: Ghosal, Soumya Suvra, et al.
Published: (2024)
Aligning Black-box Language Models with Human Judgments
by: Burg, Gerrit J. J. van den, et al.
Published: (2025)
by: Burg, Gerrit J. J. van den, et al.
Published: (2025)
Instruction Learning Paradigms: A Dual Perspective on White-box and Black-box LLMs
by: Ren, Yanwei, et al.
Published: (2025)
by: Ren, Yanwei, et al.
Published: (2025)
Similar Items
-
Uncertainty Regularized Evidential Regression
by: Ye, Kai, et al.
Published: (2024) -
Every Response Counts: Quantifying Uncertainty of LLM-based Multi-Agent Systems through Tensor Decomposition
by: Chen, Tiejin, et al.
Published: (2026) -
Jailbreaking Black Box Large Language Models in Twenty Queries
by: Chao, Patrick, et al.
Published: (2023) -
Knowledge Editing on Black-box Large Language Models
by: Song, Xiaoshuai, et al.
Published: (2024) -
Conformal Feedback Alignment: Quantifying Answer-Level Reliability for Robust LLM Alignment
by: Chen, Tiejin, et al.
Published: (2026)