A Two-Stage Globally-Diverse Adversarial Attack for Vision-Language Pre-training Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Wutao, Zou, Huaqin, Wan, Chen, Huang, Lifeng |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Downstream Transfer Attack: Adversarial Attacks on Downstream Models with Pre-trained Vision Transformers
par: Zheng, Weijie, et autres
Publié: (2024)
par: Zheng, Weijie, et autres
Publié: (2024)
Patch is Enough: Naturalistic Adversarial Patch against Vision-Language Pre-training Models
par: Kong, Dehong, et autres
Publié: (2024)
par: Kong, Dehong, et autres
Publié: (2024)
Can Medical Vision-Language Pre-training Succeed with Purely Synthetic Data?
par: Liu, Che, et autres
Publié: (2024)
par: Liu, Che, et autres
Publié: (2024)
HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models
par: Liu, Han, et autres
Publié: (2026)
par: Liu, Han, et autres
Publié: (2026)
A Unified Understanding of Adversarial Vulnerability Regarding Unimodal Models and Vision-Language Pre-training Models
par: Zheng, Haonan, et autres
Publié: (2024)
par: Zheng, Haonan, et autres
Publié: (2024)
Do Pre-trained Vision-Language Models Encode Object States?
par: Newman, Kaleb, et autres
Publié: (2024)
par: Newman, Kaleb, et autres
Publié: (2024)
Enhancing Adversarial Transferability in Visual-Language Pre-training Models via Local Shuffle and Sample-based Attack
par: Liu, Xin, et autres
Publié: (2025)
par: Liu, Xin, et autres
Publié: (2025)
Black-Box Adversarial Attack on Vision Language Models for Autonomous Driving
par: Wang, Lu, et autres
Publié: (2025)
par: Wang, Lu, et autres
Publié: (2025)
Conjugated Semantic Pool Improves OOD Detection with Pre-trained Vision-Language Models
par: Chen, Mengyuan, et autres
Publié: (2024)
par: Chen, Mengyuan, et autres
Publié: (2024)
A Semantic Decoupling-Based Two-Stage Rainy-Day Attack for Revealing Weather Robustness Deficiencies in Vision-Language Models
par: Hu, Chengyin, et autres
Publié: (2026)
par: Hu, Chengyin, et autres
Publié: (2026)
Probing the Robustness of Vision-Language Pretrained Models: A Multimodal Adversarial Attack Approach
par: Guan, Jiwei, et autres
Publié: (2024)
par: Guan, Jiwei, et autres
Publié: (2024)
Tex3D: Objects as Attack Surfaces via Adversarial 3D Textures for Vision-Language-Action Models
par: Chen, Jiawei, et autres
Publié: (2026)
par: Chen, Jiawei, et autres
Publié: (2026)
SCA: Improve Semantic Consistent in Unrestricted Adversarial Attacks via DDPM Inversion
par: Pan, Zihao, et autres
Publié: (2024)
par: Pan, Zihao, et autres
Publié: (2024)
On Pre-training of Multimodal Language Models Customized for Chart Understanding
par: Fan, Wan-Cyuan, et autres
Publié: (2024)
par: Fan, Wan-Cyuan, et autres
Publié: (2024)
Feedback-based Modal Mutual Search for Attacking Vision-Language Pre-training Models
par: Ding, Renhua, et autres
Publié: (2024)
par: Ding, Renhua, et autres
Publié: (2024)
Low-hallucination Synthetic Captions for Large-Scale Vision-Language Model Pre-training
par: Zhang, Xinsong, et autres
Publié: (2025)
par: Zhang, Xinsong, et autres
Publié: (2025)
Perception Before Reasoning: Two-Stage Reinforcement Learning for Visual Reasoning in Vision-Language Models
par: Chen, Yan, et autres
Publié: (2025)
par: Chen, Yan, et autres
Publié: (2025)
One Prompt Word is Enough to Boost Adversarial Robustness for Pre-trained Vision-Language Models
par: Li, Lin, et autres
Publié: (2024)
par: Li, Lin, et autres
Publié: (2024)
Respecting Modality Gap in Post-hoc Out-of-distribution Detection with Pre-trained Vision-Language Models
par: Hu, Yuanwei, et autres
Publié: (2026)
par: Hu, Yuanwei, et autres
Publié: (2026)
Efficient Vision-and-Language Pre-training with Text-Relevant Image Patch Selection
par: Ye, Wei, et autres
Publié: (2024)
par: Ye, Wei, et autres
Publié: (2024)
Superpixel Semantics Representation and Pre-training for Vision-Language Task
par: Zhang, Siyu, et autres
Publié: (2023)
par: Zhang, Siyu, et autres
Publié: (2023)
When Alignment Fails: Multimodal Adversarial Attacks on Vision-Language-Action Models
par: Yan, Yuping, et autres
Publié: (2025)
par: Yan, Yuping, et autres
Publié: (2025)
SocialFusion: Addressing Social Degradation in Pre-trained Vision-Language Models
par: Tahboub, Hamza, et autres
Publié: (2025)
par: Tahboub, Hamza, et autres
Publié: (2025)
Black-box Membership Inference Attacks on the Pre-training Data of Image-generation Models
par: Qi, Tao, et autres
Publié: (2026)
par: Qi, Tao, et autres
Publié: (2026)
MAFA: Managing False Negatives for Vision-Language Pre-training
par: Byun, Jaeseok, et autres
Publié: (2023)
par: Byun, Jaeseok, et autres
Publié: (2023)
Robust Vision-Language Models via Tensor Decomposition: A Defense Against Adversarial Attacks
par: Patel, Het, et autres
Publié: (2025)
par: Patel, Het, et autres
Publié: (2025)
Securing Vision-Language Models with a Robust Encoder Against Jailbreak and Adversarial Attacks
par: Hossain, Md Zarif, et autres
Publié: (2024)
par: Hossain, Md Zarif, et autres
Publié: (2024)
Attention-Guided Patch-Wise Sparse Adversarial Attacks on Vision-Language-Action Models
par: Zhang, Naifu, et autres
Publié: (2025)
par: Zhang, Naifu, et autres
Publié: (2025)
TAP-VL: Text Layout-Aware Pre-training for Enriched Vision-Language Models
par: Fhima, Jonathan, et autres
Publié: (2024)
par: Fhima, Jonathan, et autres
Publié: (2024)
TRIPS: Efficient Vision-and-Language Pre-training with Text-Relevant Image Patch Selection
par: Jiang, Chaoya, et autres
Publié: (2023)
par: Jiang, Chaoya, et autres
Publié: (2023)
In-Depth and In-Breadth: Pre-training Multimodal Language Models Customized for Comprehensive Chart Understanding
par: Fan, Wan-Cyuan, et autres
Publié: (2025)
par: Fan, Wan-Cyuan, et autres
Publié: (2025)
MedUnifier: Unifying Vision-and-Language Pre-training on Medical Data with Vision Generation Task using Discrete Visual Representations
par: Zhang, Ziyang, et autres
Publié: (2025)
par: Zhang, Ziyang, et autres
Publié: (2025)
Pre-trained Vision-Language Models Learn Discoverable Visual Concepts
par: Zang, Yuan, et autres
Publié: (2024)
par: Zang, Yuan, et autres
Publié: (2024)
MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models
par: Zhang, Peng-Fei, et autres
Publié: (2025)
par: Zhang, Peng-Fei, et autres
Publié: (2025)
Grounded Knowledge-Enhanced Medical Vision-Language Pre-training for Chest X-Ray
par: Deng, Qiao, et autres
Publié: (2024)
par: Deng, Qiao, et autres
Publié: (2024)
AttackVLA: Benchmarking Adversarial and Backdoor Attacks on Vision-Language-Action Models
par: Li, Jiayu, et autres
Publié: (2025)
par: Li, Jiayu, et autres
Publié: (2025)
Effective Backdoor Mitigation in Vision-Language Models Depends on the Pre-training Objective
par: Verma, Sahil, et autres
Publié: (2023)
par: Verma, Sahil, et autres
Publié: (2023)
Fine-tuning Pre-trained Vision-Language Models in a Human-Annotation-Free Manner
par: Wang, Qian-Wei, et autres
Publié: (2026)
par: Wang, Qian-Wei, et autres
Publié: (2026)
Vision Language Model for Interpretable and Fine-grained Detection of Safety Compliance in Diverse Workplaces
par: Chen, Zhiling, et autres
Publié: (2024)
par: Chen, Zhiling, et autres
Publié: (2024)
Physical Prompt Injection Attacks on Large Vision-Language Models
par: Ling, Chen, et autres
Publié: (2026)
par: Ling, Chen, et autres
Publié: (2026)
Documents similaires
-
Downstream Transfer Attack: Adversarial Attacks on Downstream Models with Pre-trained Vision Transformers
par: Zheng, Weijie, et autres
Publié: (2024) -
Patch is Enough: Naturalistic Adversarial Patch against Vision-Language Pre-training Models
par: Kong, Dehong, et autres
Publié: (2024) -
Can Medical Vision-Language Pre-training Succeed with Purely Synthetic Data?
par: Liu, Che, et autres
Publié: (2024) -
HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models
par: Liu, Han, et autres
Publié: (2026) -
A Unified Understanding of Adversarial Vulnerability Regarding Unimodal Models and Vision-Language Pre-training Models
par: Zheng, Haonan, et autres
Publié: (2024)