Sparse Tokens Suffice: Jailbreaking Audio Language Models via Token-Aware Gradient Optimization
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Fang, Zheng, Wang, Xiaosen, Zhang, Shenyi, Wang, Shaokang, Ge, Zhijin |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Security Risk of Misalignment between Text and Image in Multi-modal Model
von: Wang, Xiaosen, et al.
Veröffentlicht: (2025)
von: Wang, Xiaosen, et al.
Veröffentlicht: (2025)
JALMBench: Benchmarking Jailbreak Vulnerabilities in Audio Language Models
von: Peng, Zifan, et al.
Veröffentlicht: (2025)
von: Peng, Zifan, et al.
Veröffentlicht: (2025)
Multilingual and Multi-Accent Jailbreaking of Audio LLMs
von: Roh, Jaechul, et al.
Veröffentlicht: (2025)
von: Roh, Jaechul, et al.
Veröffentlicht: (2025)
Hijacking Large Audio-Language Models via Context-Agnostic and Imperceptible Auditory Prompt Injection
von: Chen, Meng, et al.
Veröffentlicht: (2026)
von: Chen, Meng, et al.
Veröffentlicht: (2026)
STShield: Single-Token Sentinel for Real-Time Jailbreak Detection in Large Language Models
von: Wang, Xunguang, et al.
Veröffentlicht: (2025)
von: Wang, Xunguang, et al.
Veröffentlicht: (2025)
AudioJailbreak: Jailbreak Attacks against End-to-End Large Audio-Language Models
von: Chen, Guangke, et al.
Veröffentlicht: (2025)
von: Chen, Guangke, et al.
Veröffentlicht: (2025)
When Good Sounds Go Adversarial: Jailbreaking Audio-Language Models with Benign Inputs
von: Dingeto, Hiskias, et al.
Veröffentlicht: (2025)
von: Dingeto, Hiskias, et al.
Veröffentlicht: (2025)
AdvWave: Stealthy Adversarial Jailbreak Attack against Large Audio-Language Models
von: Kang, Mintong, et al.
Veröffentlicht: (2024)
von: Kang, Mintong, et al.
Veröffentlicht: (2024)
Breaking Audio Large Language Models by Attacking Only the Encoder: A Universal Targeted Latent-Space Audio Attack
von: Ziv, Roee, et al.
Veröffentlicht: (2025)
von: Ziv, Roee, et al.
Veröffentlicht: (2025)
Sirens' Whisper: Inaudible Near-Ultrasonic Jailbreaks of Speech-Driven LLMs
von: Ling, Zijian, et al.
Veröffentlicht: (2026)
von: Ling, Zijian, et al.
Veröffentlicht: (2026)
Improved Few-Shot Jailbreaking Can Circumvent Aligned Language Models and Their Defenses
von: Zheng, Xiaosen, et al.
Veröffentlicht: (2024)
von: Zheng, Xiaosen, et al.
Veröffentlicht: (2024)
Mask-GCG: Are All Tokens in Adversarial Suffixes Necessary for Jailbreak Attacks?
von: Mu, Junjie, et al.
Veröffentlicht: (2025)
von: Mu, Junjie, et al.
Veröffentlicht: (2025)
Selective Masking Adversarial Attack on Automatic Speech Recognition Systems
von: Fang, Zheng, et al.
Veröffentlicht: (2025)
von: Fang, Zheng, et al.
Veröffentlicht: (2025)
Measuring the Robustness of Audio Deepfake Detectors
von: Li, Xiang, et al.
Veröffentlicht: (2025)
von: Li, Xiang, et al.
Veröffentlicht: (2025)
Layer-Level Self-Exposure and Patch: Affirmative Token Mitigation for Jailbreak Attack Defense
von: Ouyang, Yang, et al.
Veröffentlicht: (2025)
von: Ouyang, Yang, et al.
Veröffentlicht: (2025)
JailbreakEval: An Integrated Toolkit for Evaluating Jailbreak Attempts Against Large Language Models
von: Ran, Delong, et al.
Veröffentlicht: (2024)
von: Ran, Delong, et al.
Veröffentlicht: (2024)
Direct Token Optimization: A Self-contained Approach to Large Language Model Unlearning
von: Lee, Hong kyu, et al.
Veröffentlicht: (2025)
von: Lee, Hong kyu, et al.
Veröffentlicht: (2025)
LLM-Virus: Evolutionary Jailbreak Attack on Large Language Models
von: Yu, Miao, et al.
Veröffentlicht: (2024)
von: Yu, Miao, et al.
Veröffentlicht: (2024)
Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models
von: Tu, Shangqing, et al.
Veröffentlicht: (2024)
von: Tu, Shangqing, et al.
Veröffentlicht: (2024)
Acoustic Interference: A New Paradigm Weaponizing Acoustic Latent Semantic for Universal Jailbreak against Large Audio Language Models
von: Wang, Yanyun, et al.
Veröffentlicht: (2026)
von: Wang, Yanyun, et al.
Veröffentlicht: (2026)
FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts
von: Gong, Yichen, et al.
Veröffentlicht: (2023)
von: Gong, Yichen, et al.
Veröffentlicht: (2023)
Jailbreaking Multimodal Large Language Models via Shuffle Inconsistency
von: Zhao, Shiji, et al.
Veröffentlicht: (2025)
von: Zhao, Shiji, et al.
Veröffentlicht: (2025)
RobustKV: Defending Large Language Models against Jailbreak Attacks via KV Eviction
von: Jiang, Tanqiu, et al.
Veröffentlicht: (2024)
von: Jiang, Tanqiu, et al.
Veröffentlicht: (2024)
Smark: A Watermark for Text-to-Speech Diffusion Models via Discrete Wavelet Transform
von: Zhang, Yichuan, et al.
Veröffentlicht: (2025)
von: Zhang, Yichuan, et al.
Veröffentlicht: (2025)
Continuous Embedding Attacks via Clipped Inputs in Jailbreaking Large Language Models
von: Xu, Zihao, et al.
Veröffentlicht: (2024)
von: Xu, Zihao, et al.
Veröffentlicht: (2024)
Imperceptible Jailbreaking against Large Language Models
von: Gao, Kuofeng, et al.
Veröffentlicht: (2025)
von: Gao, Kuofeng, et al.
Veröffentlicht: (2025)
Backdoor Token Unlearning: Exposing and Defending Backdoors in Pretrained Language Models
von: Jiang, Peihai, et al.
Veröffentlicht: (2025)
von: Jiang, Peihai, et al.
Veröffentlicht: (2025)
GUARD-SLM: Token Activation-Based Defense Against Jailbreak Attacks for Small Language Models
von: Mia, Md Jueal, et al.
Veröffentlicht: (2026)
von: Mia, Md Jueal, et al.
Veröffentlicht: (2026)
MetaBreak: Jailbreaking Online LLM Services via Special Token Manipulation
von: Zhu, Wentian, et al.
Veröffentlicht: (2025)
von: Zhu, Wentian, et al.
Veröffentlicht: (2025)
Token Inflation: How Dishonest Providers Can Overcharge for Large Language Model Usage
von: Hoque, Shahinul, et al.
Veröffentlicht: (2026)
von: Hoque, Shahinul, et al.
Veröffentlicht: (2026)
Protecting Your Voice: Temporal-aware Robust Watermarking
von: Li, Yue, et al.
Veröffentlicht: (2025)
von: Li, Yue, et al.
Veröffentlicht: (2025)
SOLIDO: A Robust Watermarking Method for Speech Synthesis via Low-Rank Adaptation
von: Li, Yue, et al.
Veröffentlicht: (2025)
von: Li, Yue, et al.
Veröffentlicht: (2025)
Beyond Content: A Comprehensive Speech Toxicity Dataset and Detection Framework Incorporating Paralinguistic Cues
von: Ba, Zhongjie, et al.
Veröffentlicht: (2026)
von: Ba, Zhongjie, et al.
Veröffentlicht: (2026)
from Benign import Toxic: Jailbreaking the Language Model via Adversarial Metaphors
von: Yan, Yu, et al.
Veröffentlicht: (2025)
von: Yan, Yu, et al.
Veröffentlicht: (2025)
Not All Tokens Are Created Equal: Query-Efficient Jailbreak Fuzzing for LLMs
von: Chen, Wenyu, et al.
Veröffentlicht: (2026)
von: Chen, Wenyu, et al.
Veröffentlicht: (2026)
Rapid Optimization for Jailbreaking LLMs via Subconscious Exploitation and Echopraxia
von: Shen, Guangyu, et al.
Veröffentlicht: (2024)
von: Shen, Guangyu, et al.
Veröffentlicht: (2024)
CodeChameleon: Personalized Encryption Framework for Jailbreaking Large Language Models
von: Lv, Huijie, et al.
Veröffentlicht: (2024)
von: Lv, Huijie, et al.
Veröffentlicht: (2024)
QueryAttack: Jailbreaking Aligned Large Language Models Using Structured Non-natural Query Language
von: Zou, Qingsong, et al.
Veröffentlicht: (2025)
von: Zou, Qingsong, et al.
Veröffentlicht: (2025)
ForgeDAN: An Evolutionary Framework for Jailbreaking Aligned Large Language Models
von: Cheng, Siyang, et al.
Veröffentlicht: (2025)
von: Cheng, Siyang, et al.
Veröffentlicht: (2025)
"Moralized" Multi-Step Jailbreak Prompts: Black-Box Testing of Guardrails in Large Language Models for Verbal Attacks
von: Wang, Libo
Veröffentlicht: (2024)
von: Wang, Libo
Veröffentlicht: (2024)
Ähnliche Einträge
-
Security Risk of Misalignment between Text and Image in Multi-modal Model
von: Wang, Xiaosen, et al.
Veröffentlicht: (2025) -
JALMBench: Benchmarking Jailbreak Vulnerabilities in Audio Language Models
von: Peng, Zifan, et al.
Veröffentlicht: (2025) -
Multilingual and Multi-Accent Jailbreaking of Audio LLMs
von: Roh, Jaechul, et al.
Veröffentlicht: (2025) -
Hijacking Large Audio-Language Models via Context-Agnostic and Imperceptible Auditory Prompt Injection
von: Chen, Meng, et al.
Veröffentlicht: (2026) -
STShield: Single-Token Sentinel for Real-Time Jailbreak Detection in Large Language Models
von: Wang, Xunguang, et al.
Veröffentlicht: (2025)