Adjacent Words, Divergent Intents: Jailbreaking Large Language Models via Task Concurrency
Fuente:
arXiv
Salvato in:
| Autori principali: | Jiang, Yukun, Li, Mingjie, Backes, Michael, Zhang, Yang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
$\texttt{ModSCAN}$: Measuring Stereotypical Bias in Large Vision-Language Models from Vision and Language Modalities
di: Jiang, Yukun, et al.
Pubblicazione: (2024)
di: Jiang, Yukun, et al.
Pubblicazione: (2024)
"Do Anything Now": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models
di: Shen, Xinyue, et al.
Pubblicazione: (2023)
di: Shen, Xinyue, et al.
Pubblicazione: (2023)
Sparse Models, Sparse Safety: Unsafe Routes in Mixture-of-Experts LLMs
di: Jiang, Yukun, et al.
Pubblicazione: (2026)
di: Jiang, Yukun, et al.
Pubblicazione: (2026)
JADES: A Universal Framework for Jailbreak Assessment via Decompositional Scoring
di: Chu, Junjie, et al.
Pubblicazione: (2025)
di: Chu, Junjie, et al.
Pubblicazione: (2025)
Peering Behind the Shield: Guardrail Identification in Large Language Models
di: Yang, Ziqing, et al.
Pubblicazione: (2025)
di: Yang, Ziqing, et al.
Pubblicazione: (2025)
Generated Data with Fake Privacy: Hidden Dangers of Fine-tuning Large Language Models on Generated Data
di: Akkus, Atilla, et al.
Pubblicazione: (2024)
di: Akkus, Atilla, et al.
Pubblicazione: (2024)
Voice Jailbreak Attacks Against GPT-4o
di: Shen, Xinyue, et al.
Pubblicazione: (2024)
di: Shen, Xinyue, et al.
Pubblicazione: (2024)
HarmfulSkillBench: How Do Harmful Skills Weaponize Your Agents?
di: Jiang, Yukun, et al.
Pubblicazione: (2026)
di: Jiang, Yukun, et al.
Pubblicazione: (2026)
Pop Quiz Attack: Black-box Membership Inference Attacks Against Large Language Models
di: Chen, Zeyuan, et al.
Pubblicazione: (2026)
di: Chen, Zeyuan, et al.
Pubblicazione: (2026)
Excessive Reasoning Attack on Reasoning LLMs
di: Si, Wai Man, et al.
Pubblicazione: (2025)
di: Si, Wai Man, et al.
Pubblicazione: (2025)
MasterKey: Automated Jailbreak Across Multiple Large Language Model Chatbots
di: Deng, Gelei, et al.
Pubblicazione: (2023)
di: Deng, Gelei, et al.
Pubblicazione: (2023)
Watermarking LLM-Generated Datasets in Downstream Tasks
di: Liu, Yugeng, et al.
Pubblicazione: (2025)
di: Liu, Yugeng, et al.
Pubblicazione: (2025)
Robustness Over Time: Understanding Adversarial Examples' Effectiveness on Longitudinal Versions of Large Language Models
di: Liu, Yugeng, et al.
Pubblicazione: (2023)
di: Liu, Yugeng, et al.
Pubblicazione: (2023)
Harnessing Task Overload for Scalable Jailbreak Attacks on Large Language Models
di: Dong, Yiting, et al.
Pubblicazione: (2024)
di: Dong, Yiting, et al.
Pubblicazione: (2024)
Real Money, Fake Models: Deceptive Model Claims in Shadow APIs
di: Zhang, Yage, et al.
Pubblicazione: (2026)
di: Zhang, Yage, et al.
Pubblicazione: (2026)
The Challenge of Identifying the Origin of Black-Box Large Language Models
di: Yang, Ziqing, et al.
Pubblicazione: (2025)
di: Yang, Ziqing, et al.
Pubblicazione: (2025)
Bridging the Gap in Vision Language Models in Identifying Unsafe Concepts Across Modalities
di: Qu, Yiting, et al.
Pubblicazione: (2025)
di: Qu, Yiting, et al.
Pubblicazione: (2025)
SQL Injection Jailbreak: A Structural Disaster of Large Language Models
di: Zhao, Jiawei, et al.
Pubblicazione: (2024)
di: Zhao, Jiawei, et al.
Pubblicazione: (2024)
Mitigating Jailbreaks with Intent-Aware LLMs
di: Yeo, Wei Jie, et al.
Pubblicazione: (2025)
di: Yeo, Wei Jie, et al.
Pubblicazione: (2025)
Reasoning-Oriented Programming: Chaining Semantic Gadgets to Jailbreak Large Vision Language Models
di: Zou, Quanchen, et al.
Pubblicazione: (2026)
di: Zou, Quanchen, et al.
Pubblicazione: (2026)
Tit-for-Tat: Safeguarding Large Vision-Language Models Against Jailbreak Attacks via Adversarial Defense
di: Hao, Shuyang, et al.
Pubblicazione: (2025)
di: Hao, Shuyang, et al.
Pubblicazione: (2025)
SOS! Soft Prompt Attack Against Open-Source Large Language Models
di: Yang, Ziqing, et al.
Pubblicazione: (2024)
di: Yang, Ziqing, et al.
Pubblicazione: (2024)
Sequential Comics for Jailbreaking Multimodal Large Language Models via Structured Visual Storytelling
di: Zhang, Deyue, et al.
Pubblicazione: (2025)
di: Zhang, Deyue, et al.
Pubblicazione: (2025)
JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs
di: Chu, Junjie, et al.
Pubblicazione: (2024)
di: Chu, Junjie, et al.
Pubblicazione: (2024)
SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models
di: Chen, Yulong, et al.
Pubblicazione: (2025)
di: Chen, Yulong, et al.
Pubblicazione: (2025)
From Evidence to Verdict: An Agent-Based Forensic Framework for AI-Generated Image Detection
di: Liang, Mengfei, et al.
Pubblicazione: (2025)
di: Liang, Mengfei, et al.
Pubblicazione: (2025)
Can LLMs Deeply Detect Complex Malicious Queries? A Framework for Jailbreaking via Obfuscating Intent
di: Shang, Shang, et al.
Pubblicazione: (2024)
di: Shang, Shang, et al.
Pubblicazione: (2024)
Large Language Lobotomy: Jailbreaking Mixture-of-Experts via Expert Silencing
di: Lintelo, Jona te, et al.
Pubblicazione: (2026)
di: Lintelo, Jona te, et al.
Pubblicazione: (2026)
Jailbreaking Large Language Models in Infinitely Many Ways
di: Goldstein, Oliver, et al.
Pubblicazione: (2025)
di: Goldstein, Oliver, et al.
Pubblicazione: (2025)
A Cross-Language Investigation into Jailbreak Attacks in Large Language Models
di: Li, Jie, et al.
Pubblicazione: (2024)
di: Li, Jie, et al.
Pubblicazione: (2024)
JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models
di: Chao, Patrick, et al.
Pubblicazione: (2024)
di: Chao, Patrick, et al.
Pubblicazione: (2024)
"Humans welcome to observe": A First Look at the Agent Social Network Moltbook
di: Jiang, Yukun, et al.
Pubblicazione: (2026)
di: Jiang, Yukun, et al.
Pubblicazione: (2026)
Towards Robust Multimodal Large Language Models Against Jailbreak Attacks
di: Yin, Ziyi, et al.
Pubblicazione: (2025)
di: Yin, Ziyi, et al.
Pubblicazione: (2025)
Token Highlighter: Inspecting and Mitigating Jailbreak Prompts for Large Language Models
di: Hu, Xiaomeng, et al.
Pubblicazione: (2024)
di: Hu, Xiaomeng, et al.
Pubblicazione: (2024)
Efficient Data-Free Model Stealing with Label Diversity
di: Liu, Yiyong, et al.
Pubblicazione: (2024)
di: Liu, Yiyong, et al.
Pubblicazione: (2024)
TokenProber: Jailbreaking Text-to-image Models via Fine-grained Word Impact Analysis
di: Wang, Longtian, et al.
Pubblicazione: (2025)
di: Wang, Longtian, et al.
Pubblicazione: (2025)
Composite Backdoor Attacks Against Large Language Models
di: Huang, Hai, et al.
Pubblicazione: (2023)
di: Huang, Hai, et al.
Pubblicazione: (2023)
DeepInception: Hypnotize Large Language Model to Be Jailbreaker
di: Li, Xuan, et al.
Pubblicazione: (2023)
di: Li, Xuan, et al.
Pubblicazione: (2023)
PiCo: Jailbreaking Multimodal Large Language Models via Pictorial Code Contextualization
di: Liu, Aofan, et al.
Pubblicazione: (2025)
di: Liu, Aofan, et al.
Pubblicazione: (2025)
Model-Editing-Based Jailbreak against Safety-aligned Large Language Models
di: Li, Yuxi, et al.
Pubblicazione: (2024)
di: Li, Yuxi, et al.
Pubblicazione: (2024)
Documenti analoghi
-
$\texttt{ModSCAN}$: Measuring Stereotypical Bias in Large Vision-Language Models from Vision and Language Modalities
di: Jiang, Yukun, et al.
Pubblicazione: (2024) -
"Do Anything Now": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models
di: Shen, Xinyue, et al.
Pubblicazione: (2023) -
Sparse Models, Sparse Safety: Unsafe Routes in Mixture-of-Experts LLMs
di: Jiang, Yukun, et al.
Pubblicazione: (2026) -
JADES: A Universal Framework for Jailbreak Assessment via Decompositional Scoring
di: Chu, Junjie, et al.
Pubblicazione: (2025) -
Peering Behind the Shield: Guardrail Identification in Large Language Models
di: Yang, Ziqing, et al.
Pubblicazione: (2025)