Why does weak-OOD help? A Further Step Towards Understanding Jailbreaking VLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhou, Yuxuan, Peng, Yuzhao, Bai, Yang, Gao, Kuofeng, Zhang, Yihao, Zhang, Yechao, Chen, Xun, Yu, Tao, Dai, Tao, Xia, Shu-Tao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
JPRO: Automated Multimodal Jailbreaking via Multi-Agent Collaboration Framework
di: Zhou, Yuxuan, et al.
Pubblicazione: (2025)
di: Zhou, Yuxuan, et al.
Pubblicazione: (2025)
Why Does Little Robustness Help? A Further Step Towards Understanding Adversarial Transferability
di: Zhang, Yechao, et al.
Pubblicazione: (2023)
di: Zhang, Yechao, et al.
Pubblicazione: (2023)
Imperceptible Jailbreaking against Large Language Models
di: Gao, Kuofeng, et al.
Pubblicazione: (2025)
di: Gao, Kuofeng, et al.
Pubblicazione: (2025)
Protecting Your Video Content: Disrupting Automated Video-based LLM Annotations
di: Liu, Haitong, et al.
Pubblicazione: (2025)
di: Liu, Haitong, et al.
Pubblicazione: (2025)
Video Watermarking: Safeguarding Your Video from (Unauthorized) Annotations by Video-based LLMs
di: Li, Jinmin, et al.
Pubblicazione: (2024)
di: Li, Jinmin, et al.
Pubblicazione: (2024)
Improving Deepfake Detection with Reinforcement Learning-Based Adaptive Data Augmentation
di: Zhou, Yuxuan, et al.
Pubblicazione: (2025)
di: Zhou, Yuxuan, et al.
Pubblicazione: (2025)
Jailbreaking LLMs & VLMs: Mechanisms, Evaluation, and Unified Defense
di: Chen, Zejian, et al.
Pubblicazione: (2026)
di: Chen, Zejian, et al.
Pubblicazione: (2026)
Coward: Collision-based OOD Watermarking for Practical Proactive Federated Backdoor Detection
di: Li, Wenjie, et al.
Pubblicazione: (2025)
di: Li, Wenjie, et al.
Pubblicazione: (2025)
Denial-of-Service Poisoning Attacks against Large Language Models
di: Gao, Kuofeng, et al.
Pubblicazione: (2024)
di: Gao, Kuofeng, et al.
Pubblicazione: (2024)
Towards Dataset Copyright Evasion Attack against Personalized Text-to-Image Diffusion Models
di: Gao, Kuofeng, et al.
Pubblicazione: (2025)
di: Gao, Kuofeng, et al.
Pubblicazione: (2025)
Inducing High Energy-Latency of Large Vision-Language Models with Verbose Images
di: Gao, Kuofeng, et al.
Pubblicazione: (2024)
di: Gao, Kuofeng, et al.
Pubblicazione: (2024)
WATER-GS: Toward Copyright Protection for 3D Gaussian Splatting via Universal Watermarking
di: Tan, Yuqi, et al.
Pubblicazione: (2024)
di: Tan, Yuqi, et al.
Pubblicazione: (2024)
Take a Step Further: Understanding Page Spray in Linux Kernel Exploitation
di: Guo, Ziyi, et al.
Pubblicazione: (2024)
di: Guo, Ziyi, et al.
Pubblicazione: (2024)
Sliced Rényi Pufferfish Privacy: Directional Additive Noise Mechanism and Private Learning with Gradient Clipping
di: Zhang, Tao, et al.
Pubblicazione: (2025)
di: Zhang, Tao, et al.
Pubblicazione: (2025)
Residual-PAC Privacy: Automatic Privacy Control Beyond the Gaussian Barrier
di: Zhang, Tao, et al.
Pubblicazione: (2025)
di: Zhang, Tao, et al.
Pubblicazione: (2025)
BackdoorIndicator: Leveraging OOD Data for Proactive Backdoor Detection in Federated Learning
di: Li, Songze, et al.
Pubblicazione: (2024)
di: Li, Songze, et al.
Pubblicazione: (2024)
Alleviating the Fear of Losing Alignment in LLM Fine-tuning
di: Yang, Kang, et al.
Pubblicazione: (2025)
di: Yang, Kang, et al.
Pubblicazione: (2025)
Give Them an Inch and They Will Take a Mile:Understanding and Measuring Caller Identity Confusion in MCP-Based AI Systems
di: Huang, Yuhang, et al.
Pubblicazione: (2026)
di: Huang, Yuhang, et al.
Pubblicazione: (2026)
SINCon: Mitigate LLM-Generated Malicious Message Injection Attack for Rumor Detection
di: Zhang, Mingqing, et al.
Pubblicazione: (2025)
di: Zhang, Mingqing, et al.
Pubblicazione: (2025)
Boosting Jailbreak Attack with Momentum
di: Zhang, Yihao, et al.
Pubblicazione: (2024)
di: Zhang, Yihao, et al.
Pubblicazione: (2024)
JailbreakLens: Interpreting Jailbreak Mechanism in the Lens of Representation and Circuit
di: He, Zeqing, et al.
Pubblicazione: (2024)
di: He, Zeqing, et al.
Pubblicazione: (2024)
Secure Transfer Learning: Training Clean Models Against Backdoor in (Both) Pre-trained Encoders and Downstream Datasets
di: Zhang, Yechao, et al.
Pubblicazione: (2025)
di: Zhang, Yechao, et al.
Pubblicazione: (2025)
Rapid Optimization for Jailbreaking LLMs via Subconscious Exploitation and Echopraxia
di: Shen, Guangyu, et al.
Pubblicazione: (2024)
di: Shen, Guangyu, et al.
Pubblicazione: (2024)
STARE: Step-wise Temporal Alignment and Red-teaming Engine for Multi-modal Toxicity Attack
di: Mao, Xutao, et al.
Pubblicazione: (2026)
di: Mao, Xutao, et al.
Pubblicazione: (2026)
Security and Privacy on Generative Data in AIGC: A Survey
di: Wang, Tao, et al.
Pubblicazione: (2023)
di: Wang, Tao, et al.
Pubblicazione: (2023)
Not All Prompts Are Secure: A Switchable Backdoor Attack Against Pre-trained Vision Transformers
di: Yang, Sheng, et al.
Pubblicazione: (2024)
di: Yang, Sheng, et al.
Pubblicazione: (2024)
Unveiling the Safety of GPT-4o: An Empirical Study using Jailbreak Attacks
di: Ying, Zonghao, et al.
Pubblicazione: (2024)
di: Ying, Zonghao, et al.
Pubblicazione: (2024)
Jailbreak Vision Language Models via Bi-Modal Adversarial Prompt
di: Ying, Zonghao, et al.
Pubblicazione: (2024)
di: Ying, Zonghao, et al.
Pubblicazione: (2024)
Understanding and Enhancing the Transferability of Jailbreaking Attacks
di: Lin, Runqi, et al.
Pubblicazione: (2025)
di: Lin, Runqi, et al.
Pubblicazione: (2025)
"MCP Does Not Stand for Misuse Cryptography Protocol": Uncovering Cryptographic Misuse in Model Context Protocol at Scale
di: Yan, Biwei, et al.
Pubblicazione: (2025)
di: Yan, Biwei, et al.
Pubblicazione: (2025)
T2VShield: Model-Agnostic Jailbreak Defense for Text-to-Video Models
di: Liang, Siyuan, et al.
Pubblicazione: (2025)
di: Liang, Siyuan, et al.
Pubblicazione: (2025)
CodeChameleon: Personalized Encryption Framework for Jailbreaking Large Language Models
di: Lv, Huijie, et al.
Pubblicazione: (2024)
di: Lv, Huijie, et al.
Pubblicazione: (2024)
Fine-Grained Privacy Extraction from Retrieval-Augmented Generation Systems via Knowledge Asymmetry Exploitation
di: Chen, Yufei, et al.
Pubblicazione: (2025)
di: Chen, Yufei, et al.
Pubblicazione: (2025)
ProP: Efficient Backdoor Detection via Propagation Perturbation for Overparametrized Models
di: Ren, Tao, et al.
Pubblicazione: (2024)
di: Ren, Tao, et al.
Pubblicazione: (2024)
Lightening the Load: A Cluster-Based Framework for A Lower-Overhead, Provable Website Fingerprinting Defense
di: Khajavi, Khashayar, et al.
Pubblicazione: (2025)
di: Khajavi, Khashayar, et al.
Pubblicazione: (2025)
Blackbox Dataset Inference for LLM
di: Zhou, Ruikai, et al.
Pubblicazione: (2025)
di: Zhou, Ruikai, et al.
Pubblicazione: (2025)
Towards Robust Multimodal Large Language Models Against Jailbreak Attacks
di: Yin, Ziyi, et al.
Pubblicazione: (2025)
di: Yin, Ziyi, et al.
Pubblicazione: (2025)
SmartIntentNN: Towards Smart Contract Intent Detection
di: Huang, Youwei, et al.
Pubblicazione: (2022)
di: Huang, Youwei, et al.
Pubblicazione: (2022)
MT-JailBench: A Modular Benchmark for Understanding Multi-Turn Jailbreak Attacks
di: Zhang, Xinkai, et al.
Pubblicazione: (2026)
di: Zhang, Xinkai, et al.
Pubblicazione: (2026)
Low Rank Comes with Low Security: Gradient Assembly Poisoning Attacks against Distributed LoRA-based LLM Systems
di: Dong, Yueyan, et al.
Pubblicazione: (2026)
di: Dong, Yueyan, et al.
Pubblicazione: (2026)
Documenti analoghi
-
JPRO: Automated Multimodal Jailbreaking via Multi-Agent Collaboration Framework
di: Zhou, Yuxuan, et al.
Pubblicazione: (2025) -
Why Does Little Robustness Help? A Further Step Towards Understanding Adversarial Transferability
di: Zhang, Yechao, et al.
Pubblicazione: (2023) -
Imperceptible Jailbreaking against Large Language Models
di: Gao, Kuofeng, et al.
Pubblicazione: (2025) -
Protecting Your Video Content: Disrupting Automated Video-based LLM Annotations
di: Liu, Haitong, et al.
Pubblicazione: (2025) -
Video Watermarking: Safeguarding Your Video from (Unauthorized) Annotations by Video-based LLMs
di: Li, Jinmin, et al.
Pubblicazione: (2024)