Reasoning-Oriented Programming: Chaining Semantic Gadgets to Jailbreak Large Vision Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Zou, Quanchen, Chen, Moyang, Ying, Zonghao, Xu, Wenzhuo, Xiao, Yisong, Zhang, Deyue, Yang, Dongdong, Liu, Zhao, Zhang, Xiangzheng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
PRISM: Programmatic Reasoning with Image Sequence Manipulation for LVLM Jailbreaking
di: Zou, Quanchen, et al.
Pubblicazione: (2025)
di: Zou, Quanchen, et al.
Pubblicazione: (2025)
DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs
di: Xu, Wenzhuo, et al.
Pubblicazione: (2026)
di: Xu, Wenzhuo, et al.
Pubblicazione: (2026)
Two Frames Matter: A Temporal Attack for Text-to-Video Model Jailbreaking
di: Chen, Moyang, et al.
Pubblicazione: (2026)
di: Chen, Moyang, et al.
Pubblicazione: (2026)
Probabilistic Modeling of Jailbreak on Multimodal LLMs: From Quantification to Application
di: Xu, Wenzhuo, et al.
Pubblicazione: (2025)
di: Xu, Wenzhuo, et al.
Pubblicazione: (2025)
Reasoning-Augmented Conversation for Multi-Turn Jailbreak Attacks on Large Language Models
di: Ying, Zonghao, et al.
Pubblicazione: (2025)
di: Ying, Zonghao, et al.
Pubblicazione: (2025)
Sequential Comics for Jailbreaking Multimodal Large Language Models via Structured Visual Storytelling
di: Zhang, Deyue, et al.
Pubblicazione: (2025)
di: Zhang, Deyue, et al.
Pubblicazione: (2025)
SafeHarbor: Hierarchical Memory-Augmented Guardrail for LLM Agent Safety
di: Liu, Zhe, et al.
Pubblicazione: (2026)
di: Liu, Zhe, et al.
Pubblicazione: (2026)
Robust Privacy: Inference-Time Privacy through Certified Robustness
di: Jin, Jiankai, et al.
Pubblicazione: (2026)
di: Jin, Jiankai, et al.
Pubblicazione: (2026)
Mask-GCG: Are All Tokens in Adversarial Suffixes Necessary for Jailbreak Attacks?
di: Mu, Junjie, et al.
Pubblicazione: (2025)
di: Mu, Junjie, et al.
Pubblicazione: (2025)
SPARK: Jailbreaking T2V Models by Synergistically Prompting Auditory and Recontextualized Knowledge
di: Ying, Zonghao, et al.
Pubblicazione: (2025)
di: Ying, Zonghao, et al.
Pubblicazione: (2025)
Evolving Deception: When Agents Evolve, Deception Wins
di: Ying, Zonghao, et al.
Pubblicazione: (2026)
di: Ying, Zonghao, et al.
Pubblicazione: (2026)
SoK: Understanding Vulnerabilities in the Large Language Model Supply Chain
di: Wang, Shenao, et al.
Pubblicazione: (2025)
di: Wang, Shenao, et al.
Pubblicazione: (2025)
Towards Understanding the Safety Boundaries of DeepSeek Models: Evaluation and Findings
di: Ying, Zonghao, et al.
Pubblicazione: (2025)
di: Ying, Zonghao, et al.
Pubblicazione: (2025)
Demystifying and Detecting Agentic Workflow Injection Vulnerabilities in GitHub Actions
di: Wang, Shenao, et al.
Pubblicazione: (2026)
di: Wang, Shenao, et al.
Pubblicazione: (2026)
AgentVisor: Defending LLM Agents Against Prompt Injection via Semantic Virtualization
di: Ying, Zonghao, et al.
Pubblicazione: (2026)
di: Ying, Zonghao, et al.
Pubblicazione: (2026)
Deserialization Gadget Chains are not a Pathological Problem in Android:an In-Depth Study of Java Gadget Chains in AOSP
di: Kreyssig, Bruno, et al.
Pubblicazione: (2025)
di: Kreyssig, Bruno, et al.
Pubblicazione: (2025)
Jailbreak Vision Language Models via Bi-Modal Adversarial Prompt
di: Ying, Zonghao, et al.
Pubblicazione: (2024)
di: Ying, Zonghao, et al.
Pubblicazione: (2024)
SQL Injection Jailbreak: A Structural Disaster of Large Language Models
di: Zhao, Jiawei, et al.
Pubblicazione: (2024)
di: Zhao, Jiawei, et al.
Pubblicazione: (2024)
MasterKey: Automated Jailbreak Across Multiple Large Language Model Chatbots
di: Deng, Gelei, et al.
Pubblicazione: (2023)
di: Deng, Gelei, et al.
Pubblicazione: (2023)
DLP: towards active defense against backdoor attacks with decoupled learning process
di: Ying, Zonghao, et al.
Pubblicazione: (2024)
di: Ying, Zonghao, et al.
Pubblicazione: (2024)
NBA: defensive distillation for backdoor removal via neural behavior alignment
di: Ying, Zonghao, et al.
Pubblicazione: (2024)
di: Ying, Zonghao, et al.
Pubblicazione: (2024)
Unveiling the Safety of GPT-4o: An Empirical Study using Jailbreak Attacks
di: Ying, Zonghao, et al.
Pubblicazione: (2024)
di: Ying, Zonghao, et al.
Pubblicazione: (2024)
AGENTSAFE: Benchmarking the Safety of Embodied Agents on Hazardous Instructions
di: Ying, Zonghao, et al.
Pubblicazione: (2025)
di: Ying, Zonghao, et al.
Pubblicazione: (2025)
R-CoT: A Reasoning-Layer Watermark via Redundant Chain-of-Thought in Large Language Models
di: Zhang, Ziming, et al.
Pubblicazione: (2026)
di: Zhang, Ziming, et al.
Pubblicazione: (2026)
JailDAM: Jailbreak Detection with Adaptive Memory for Vision-Language Model
di: Nian, Yi, et al.
Pubblicazione: (2025)
di: Nian, Yi, et al.
Pubblicazione: (2025)
Tit-for-Tat: Safeguarding Large Vision-Language Models Against Jailbreak Attacks via Adversarial Defense
di: Hao, Shuyang, et al.
Pubblicazione: (2025)
di: Hao, Shuyang, et al.
Pubblicazione: (2025)
Adjacent Words, Divergent Intents: Jailbreaking Large Language Models via Task Concurrency
di: Jiang, Yukun, et al.
Pubblicazione: (2025)
di: Jiang, Yukun, et al.
Pubblicazione: (2025)
CS-Eval: A Comprehensive Large Language Model Benchmark for CyberSecurity
di: Yu, Zhengmin, et al.
Pubblicazione: (2024)
di: Yu, Zhengmin, et al.
Pubblicazione: (2024)
SecureWebArena: A Holistic Security Evaluation Benchmark for LVLM-based Web Agents
di: Ying, Zonghao, et al.
Pubblicazione: (2025)
di: Ying, Zonghao, et al.
Pubblicazione: (2025)
GHunter: Universal Prototype Pollution Gadgets in JavaScript Runtimes
di: Cornelissen, Eric, et al.
Pubblicazione: (2024)
di: Cornelissen, Eric, et al.
Pubblicazione: (2024)
Safe2Harm: Semantic Isomorphism Attacks for Jailbreaking Large Language Models
di: Yang, Fan
Pubblicazione: (2025)
di: Yang, Fan
Pubblicazione: (2025)
Don't Listen To Me: Understanding and Exploring Jailbreak Prompts of Large Language Models
di: Yu, Zhiyuan, et al.
Pubblicazione: (2024)
di: Yu, Zhiyuan, et al.
Pubblicazione: (2024)
Sleeping Giants -- Activating Dormant Java Deserialization Gadget Chains through Stealthy Code Changes
di: Kreyssig, Bruno, et al.
Pubblicazione: (2025)
di: Kreyssig, Bruno, et al.
Pubblicazione: (2025)
SafeBench: A Safety Evaluation Framework for Multimodal Large Language Models
di: Ying, Zonghao, et al.
Pubblicazione: (2024)
di: Ying, Zonghao, et al.
Pubblicazione: (2024)
JBShield: Defending Large Language Models from Jailbreak Attacks through Activated Concept Analysis and Manipulation
di: Zhang, Shenyi, et al.
Pubblicazione: (2025)
di: Zhang, Shenyi, et al.
Pubblicazione: (2025)
The Trojan Example: Jailbreaking LLMs through Template Filling and Unsafety Reasoning
di: Liu, Mingrui, et al.
Pubblicazione: (2025)
di: Liu, Mingrui, et al.
Pubblicazione: (2025)
Evaluating and Enhancing the Vulnerability Reasoning Capabilities of Large Language Models
di: Lu, Li, et al.
Pubblicazione: (2026)
di: Lu, Li, et al.
Pubblicazione: (2026)
RAJ-PGA: Reasoning-Activated Jailbreak and Principle-Guided Alignment Framework for Large Reasoning Models
di: Chen, Jianhao, et al.
Pubblicazione: (2025)
di: Chen, Jianhao, et al.
Pubblicazione: (2025)
FuzzLLM: A Novel and Universal Fuzzing Framework for Proactively Discovering Jailbreak Vulnerabilities in Large Language Models
di: Yao, Dongyu, et al.
Pubblicazione: (2023)
di: Yao, Dongyu, et al.
Pubblicazione: (2023)
JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models
di: Chao, Patrick, et al.
Pubblicazione: (2024)
di: Chao, Patrick, et al.
Pubblicazione: (2024)
Documenti analoghi
-
PRISM: Programmatic Reasoning with Image Sequence Manipulation for LVLM Jailbreaking
di: Zou, Quanchen, et al.
Pubblicazione: (2025) -
DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs
di: Xu, Wenzhuo, et al.
Pubblicazione: (2026) -
Two Frames Matter: A Temporal Attack for Text-to-Video Model Jailbreaking
di: Chen, Moyang, et al.
Pubblicazione: (2026) -
Probabilistic Modeling of Jailbreak on Multimodal LLMs: From Quantification to Application
di: Xu, Wenzhuo, et al.
Pubblicazione: (2025) -
Reasoning-Augmented Conversation for Multi-Turn Jailbreak Attacks on Large Language Models
di: Ying, Zonghao, et al.
Pubblicazione: (2025)