Visual Exclusivity Attacks: Automatic Multimodal Red Teaming via Agentic Planning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Yunbei, Ge, Yingqiang, Xu, Weijie, Xu, Yuhui, Hamm, Jihun, Reddy, Chandan K. |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SoK: Can Synthetic Images Replace Real Data? A Survey of Utility and Privacy of Synthetic Image Generation
par: Chung, Yunsung, et autres
Publié: (2025)
par: Chung, Yunsung, et autres
Publié: (2025)
OpenRT: An Open-Source Red Teaming Framework for Multimodal LLMs
par: Wang, Xin, et autres
Publié: (2026)
par: Wang, Xin, et autres
Publié: (2026)
AutoMIA: Improved Baselines for Membership Inference Attack via Agentic Self-Exploration
par: Liu, Ruhao, et autres
Publié: (2026)
par: Liu, Ruhao, et autres
Publié: (2026)
SkillAttack: Automated Red Teaming of Agent Skills through Attack Path Refinement
par: Duan, Zenghao, et autres
Publié: (2026)
par: Duan, Zenghao, et autres
Publié: (2026)
Red-Teaming LLM Multi-Agent Systems via Communication Attacks
par: He, Pengfei, et autres
Publié: (2025)
par: He, Pengfei, et autres
Publié: (2025)
VLATTACK: Multimodal Adversarial Attacks on Vision-Language Tasks via Pre-trained Models
par: Yin, Ziyi, et autres
Publié: (2023)
par: Yin, Ziyi, et autres
Publié: (2023)
DREAM: Scalable Red Teaming for Text-to-Image Generative Systems via Distribution Modeling
par: Li, Boheng, et autres
Publié: (2025)
par: Li, Boheng, et autres
Publié: (2025)
RedTWIZ: Diverse LLM Red Teaming via Adaptive Attack Planning
par: Horal, Artur, et autres
Publié: (2025)
par: Horal, Artur, et autres
Publié: (2025)
MMA-Diffusion: MultiModal Attack on Diffusion Models
par: Yang, Yijun, et autres
Publié: (2023)
par: Yang, Yijun, et autres
Publié: (2023)
Rethinking and Red-Teaming Protective Perturbation in Personalized Diffusion Models
par: Liu, Yixin, et autres
Publié: (2024)
par: Liu, Yixin, et autres
Publié: (2024)
Stop Comparing LLM Agents Without Disclosing the Harness
par: Zhang, Yunbei, et autres
Publié: (2026)
par: Zhang, Yunbei, et autres
Publié: (2026)
Contextual Image Attack: How Visual Context Exposes Multimodal Safety Vulnerabilities
par: Xiong, Yuan, et autres
Publié: (2025)
par: Xiong, Yuan, et autres
Publié: (2025)
DAVSP: Safety Alignment for Large Vision-Language Models via Deep Aligned Visual Safety Prompt
par: Zhang, Yitong, et autres
Publié: (2025)
par: Zhang, Yitong, et autres
Publié: (2025)
MLSD-GAN -- Generating Strong High Quality Face Morphing Attacks using Latent Semantic Disentanglement
par: PN, Aravinda Reddy, et autres
Publié: (2024)
par: PN, Aravinda Reddy, et autres
Publié: (2024)
Backdoor Attack with Mode Mixture Latent Modification
par: Zhang, Hongwei, et autres
Publié: (2024)
par: Zhang, Hongwei, et autres
Publié: (2024)
DiffZOO: A Purely Query-Based Black-Box Attack for Red-teaming Text-to-Image Generative Model via Zeroth Order Optimization
par: Dang, Pucheng, et autres
Publié: (2024)
par: Dang, Pucheng, et autres
Publié: (2024)
SATBA: An Invisible Backdoor Attack Based On Spatial Attention
par: Zhou, Huasong, et autres
Publié: (2023)
par: Zhou, Huasong, et autres
Publié: (2023)
InverTune: Removing Backdoors from Multimodal Contrastive Learning Models via Trigger Inversion and Activation Tuning
par: Sun, Mengyuan, et autres
Publié: (2025)
par: Sun, Mengyuan, et autres
Publié: (2025)
IAG: Input-aware Backdoor Attack on VLM-based Visual Grounding
par: Li, Junxian, et autres
Publié: (2025)
par: Li, Junxian, et autres
Publié: (2025)
Revisiting the Privacy Risks of Split Inference: A GAN-Based Data Reconstruction Attack via Progressive Feature Optimization
par: Qiu, Yixiang, et autres
Publié: (2025)
par: Qiu, Yixiang, et autres
Publié: (2025)
BadBone: Backdoor Attacks Against Backbone Models in Visual Prompt Learning
par: Yang, Ziqing, et autres
Publié: (2026)
par: Yang, Ziqing, et autres
Publié: (2026)
Adversarial Attacks of Vision Tasks in the Past 10 Years: A Survey
par: Zhang, Chiyu, et autres
Publié: (2024)
par: Zhang, Chiyu, et autres
Publié: (2024)
OT-VP: Optimal Transport-guided Visual Prompting for Test-Time Adaptation
par: Zhang, Yunbei, et autres
Publié: (2024)
par: Zhang, Yunbei, et autres
Publié: (2024)
SlowPerception: Physical-World Latency Attack against Visual Perception in Autonomous Driving
par: Ma, Chen, et autres
Publié: (2024)
par: Ma, Chen, et autres
Publié: (2024)
Technical Report for ICML 2024 TiFA Workshop MLLM Attack Challenge: Suffix Injection and Projected Gradient Descent Can Easily Fool An MLLM
par: Guo, Yangyang, et autres
Publié: (2024)
par: Guo, Yangyang, et autres
Publié: (2024)
Transformer-Driven Multimodal Fusion for Explainable Suspiciousness Estimation in Visual Surveillance
par: Yadav, Kuldeep Singh, et autres
Publié: (2025)
par: Yadav, Kuldeep Singh, et autres
Publié: (2025)
OmniSafeBench-MM: A Unified Benchmark and Toolbox for Multimodal Jailbreak Attack-Defense Evaluation
par: Jia, Xiaojun, et autres
Publié: (2025)
par: Jia, Xiaojun, et autres
Publié: (2025)
Backdoor Attacks on Prompt-Driven Video Segmentation Foundation Models
par: Zhang, Zongmin, et autres
Publié: (2025)
par: Zhang, Zongmin, et autres
Publié: (2025)
Two Frames Matter: A Temporal Attack for Text-to-Video Model Jailbreaking
par: Chen, Moyang, et autres
Publié: (2026)
par: Chen, Moyang, et autres
Publié: (2026)
PAD-FT: A Lightweight Defense for Backdoor Attacks via Data Purification and Fine-Tuning
par: Xu, Yukai, et autres
Publié: (2024)
par: Xu, Yukai, et autres
Publié: (2024)
See No Evil: Adversarial Attacks Against Linguistic-Visual Association in Referring Multi-Object Tracking Systems
par: Bouzidi, Halima, et autres
Publié: (2025)
par: Bouzidi, Halima, et autres
Publié: (2025)
LOTUS: Evasive and Resilient Backdoor Attacks through Sub-Partitioning
par: Cheng, Siyuan, et autres
Publié: (2024)
par: Cheng, Siyuan, et autres
Publié: (2024)
Revisiting Physical-World Adversarial Attack on Traffic Sign Recognition: A Commercial Systems Perspective
par: Wang, Ningfei, et autres
Publié: (2024)
par: Wang, Ningfei, et autres
Publié: (2024)
MIBench: A Comprehensive Framework for Benchmarking Model Inversion Attack and Defense
par: Qiu, Yixiang, et autres
Publié: (2024)
par: Qiu, Yixiang, et autres
Publié: (2024)
Understanding Impacts of Electromagnetic Signal Injection Attacks on Object Detection
par: Zhang, Youqian, et autres
Publié: (2024)
par: Zhang, Youqian, et autres
Publié: (2024)
Probabilistic Modeling of Jailbreak on Multimodal LLMs: From Quantification to Application
par: Xu, Wenzhuo, et autres
Publié: (2025)
par: Xu, Wenzhuo, et autres
Publié: (2025)
Red-Teaming Text-to-Image Models via In-Context Experience Replay and Semantic-Preserving Prompt Rewriting
par: Chin, Zhi-Yi, et autres
Publié: (2024)
par: Chin, Zhi-Yi, et autres
Publié: (2024)
StolenLoRA: Exploring LoRA Extraction Attacks via Synthetic Data
par: Wang, Yixu, et autres
Publié: (2025)
par: Wang, Yixu, et autres
Publié: (2025)
Detecting Adversarial Attacks in Semantic Segmentation via Uncertainty Estimation: A Deep Analysis
par: Maag, Kira, et autres
Publié: (2024)
par: Maag, Kira, et autres
Publié: (2024)
iBA: Backdoor Attack on 3D Point Cloud via Reconstructing Itself
par: Bian, Yuhao, et autres
Publié: (2024)
par: Bian, Yuhao, et autres
Publié: (2024)
Documents similaires
-
SoK: Can Synthetic Images Replace Real Data? A Survey of Utility and Privacy of Synthetic Image Generation
par: Chung, Yunsung, et autres
Publié: (2025) -
OpenRT: An Open-Source Red Teaming Framework for Multimodal LLMs
par: Wang, Xin, et autres
Publié: (2026) -
AutoMIA: Improved Baselines for Membership Inference Attack via Agentic Self-Exploration
par: Liu, Ruhao, et autres
Publié: (2026) -
SkillAttack: Automated Red Teaming of Agent Skills through Attack Path Refinement
par: Duan, Zenghao, et autres
Publié: (2026) -
Red-Teaming LLM Multi-Agent Systems via Communication Attacks
par: He, Pengfei, et autres
Publié: (2025)