Universal Adversarial Attacks against Closed-Source MLLMs via Target-View Routed Meta Optimization

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Lu, Hui, Yu, Yi, Yang, Yiming, Yi, Chenyu, Ke, Xueyi, Zhang, Qixing, Shen, Bingquan, Kot, Alex, Jiang, Xudong
Format: Preprint
Published: 2026
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!
_version_ 1866910145282310144
author Lu, Hui
Yu, Yi
Yang, Yiming
Yi, Chenyu
Ke, Xueyi
Zhang, Qixing
Shen, Bingquan
Kot, Alex
Jiang, Xudong
author_facet Lu, Hui
Yu, Yi
Yang, Yiming
Yi, Chenyu
Ke, Xueyi
Zhang, Qixing
Shen, Bingquan
Kot, Alex
Jiang, Xudong
contents Targeted adversarial attacks on closed-source multimodal large language models (MLLMs) have been increasingly explored under black-box transfer, yet prior methods are predominantly sample-specific and offer limited reusability across inputs. We instead study a more stringent setting, Universal Targeted Transferable Adversarial Attacks (UTTAA), where a single perturbation must consistently steer arbitrary inputs toward a specified target across unknown commercial MLLMs. Naively adapting existing sample-wise attacks to this universal setting faces three core difficulties: (i) target supervision becomes high-variance due to target-crop randomness, (ii) token-wise matching is unreliable because universality suppresses image-specific cues that would otherwise anchor alignment, and (iii) few-source per-target adaptation is highly initialization-sensitive, which can degrade the attainable performance. In this work, we propose MCRMO-Attack, which stabilizes supervision via Multi-Crop Aggregation with an Attention-Guided Crop, improves token-level reliability through alignability-gated Token Routing, and meta-learns a cross-target perturbation prior that yields stronger per-target solutions. Across commercial MLLMs, we boost unseen-image attack success rate by +23.7\% on GPT-4o and +19.9\% on Gemini-2.0 over the strongest universal baseline.
format Preprint
id arxiv_https___arxiv_org_abs_2601_23179
institution arXiv
publishDate 2026
record_format arxiv
spellingShingle Universal Adversarial Attacks against Closed-Source MLLMs via Target-View Routed Meta Optimization
Lu, Hui
Yu, Yi
Yang, Yiming
Yi, Chenyu
Ke, Xueyi
Zhang, Qixing
Shen, Bingquan
Kot, Alex
Jiang, Xudong
Artificial Intelligence
Targeted adversarial attacks on closed-source multimodal large language models (MLLMs) have been increasingly explored under black-box transfer, yet prior methods are predominantly sample-specific and offer limited reusability across inputs. We instead study a more stringent setting, Universal Targeted Transferable Adversarial Attacks (UTTAA), where a single perturbation must consistently steer arbitrary inputs toward a specified target across unknown commercial MLLMs. Naively adapting existing sample-wise attacks to this universal setting faces three core difficulties: (i) target supervision becomes high-variance due to target-crop randomness, (ii) token-wise matching is unreliable because universality suppresses image-specific cues that would otherwise anchor alignment, and (iii) few-source per-target adaptation is highly initialization-sensitive, which can degrade the attainable performance. In this work, we propose MCRMO-Attack, which stabilizes supervision via Multi-Crop Aggregation with an Attention-Guided Crop, improves token-level reliability through alignability-gated Token Routing, and meta-learns a cross-target perturbation prior that yields stronger per-target solutions. Across commercial MLLMs, we boost unseen-image attack success rate by +23.7\% on GPT-4o and +19.9\% on Gemini-2.0 over the strongest universal baseline.
title Universal Adversarial Attacks against Closed-Source MLLMs via Target-View Routed Meta Optimization
topic Artificial Intelligence
url https://arxiv.org/abs/2601.23179