VQAttack: Transferable Adversarial Attacks on Visual Question Answering via Pre-trained Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Yin, Ziyi, Ye, Muchao, Zhang, Tianrong, Wang, Jiaqi, Liu, Han, Chen, Jinghui, Wang, Ting, Ma, Fenglong |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
VLATTACK: Multimodal Adversarial Attacks on Vision-Language Tasks via Pre-trained Models
von: Yin, Ziyi, et al.
Veröffentlicht: (2023)
von: Yin, Ziyi, et al.
Veröffentlicht: (2023)
Design as Desired: Utilizing Visual Question Answering for Multimodal Pre-training
von: Su, Tongkun, et al.
Veröffentlicht: (2024)
von: Su, Tongkun, et al.
Veröffentlicht: (2024)
HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models
von: Liu, Han, et al.
Veröffentlicht: (2026)
von: Liu, Han, et al.
Veröffentlicht: (2026)
Downstream Transfer Attack: Adversarial Attacks on Downstream Models with Pre-trained Vision Transformers
von: Zheng, Weijie, et al.
Veröffentlicht: (2024)
von: Zheng, Weijie, et al.
Veröffentlicht: (2024)
Enhancing Adversarial Transferability in Visual-Language Pre-training Models via Local Shuffle and Sample-based Attack
von: Liu, Xin, et al.
Veröffentlicht: (2025)
von: Liu, Xin, et al.
Veröffentlicht: (2025)
Enhancing Medical Large Vision-Language Models via Alignment Distillation
von: Chang, Aofei, et al.
Veröffentlicht: (2025)
von: Chang, Aofei, et al.
Veröffentlicht: (2025)
Efficient and Effective Universal Adversarial Attack against Vision-Language Pre-training Models
von: Yang, Fan, et al.
Veröffentlicht: (2024)
von: Yang, Fan, et al.
Veröffentlicht: (2024)
Instance-Level Trojan Attacks on Visual Question Answering via Adversarial Learning in Neuron Activation Space
von: Sun, Yuwei, et al.
Veröffentlicht: (2023)
von: Sun, Yuwei, et al.
Veröffentlicht: (2023)
MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering
von: Tang, Jingqun, et al.
Veröffentlicht: (2024)
von: Tang, Jingqun, et al.
Veröffentlicht: (2024)
Adversarial Attacks on VQA-NLE: Exposing and Alleviating Inconsistencies in Visual Question Answering Explanations
von: Yeh, Yahsin, et al.
Veröffentlicht: (2025)
von: Yeh, Yahsin, et al.
Veröffentlicht: (2025)
LATERN: Test-Time Context-Aware Explainable Video Anomaly Detection
von: Piehl, Mitchell, et al.
Veröffentlicht: (2026)
von: Piehl, Mitchell, et al.
Veröffentlicht: (2026)
VILA: On Pre-training for Visual Language Models
von: Lin, Ji, et al.
Veröffentlicht: (2023)
von: Lin, Ji, et al.
Veröffentlicht: (2023)
MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models
von: Zhang, Peng-Fei, et al.
Veröffentlicht: (2025)
von: Zhang, Peng-Fei, et al.
Veröffentlicht: (2025)
Improving Generalizability and Undetectability for Targeted Adversarial Attacks on Multimodal Pre-trained Models
von: Zhang, Zhifang, et al.
Veröffentlicht: (2025)
von: Zhang, Zhifang, et al.
Veröffentlicht: (2025)
Glance and Focus: Memory Prompting for Multi-Event Video Question Answering
von: Bai, Ziyi, et al.
Veröffentlicht: (2024)
von: Bai, Ziyi, et al.
Veröffentlicht: (2024)
SRVAU-R1: Enhancing Video Anomaly Understanding via Reflection-Aware Learning
von: Zhao, Zihao, et al.
Veröffentlicht: (2026)
von: Zhao, Zihao, et al.
Veröffentlicht: (2026)
A Generative Adversarial Approach to Adversarial Attacks Guided by Contrastive Language-Image Pre-trained Model
von: Soor, Sampriti, et al.
Veröffentlicht: (2025)
von: Soor, Sampriti, et al.
Veröffentlicht: (2025)
Probing Unlearned Diffusion Models: A Transferable Adversarial Attack Perspective
von: Han, Xiaoxuan, et al.
Veröffentlicht: (2024)
von: Han, Xiaoxuan, et al.
Veröffentlicht: (2024)
Answering Diverse Questions via Text Attached with Key Audio-Visual Clues
von: Ye, Qilang, et al.
Veröffentlicht: (2024)
von: Ye, Qilang, et al.
Veröffentlicht: (2024)
Reconstruction as a Bridge for Event-Based Visual Question Answering
von: Lou, Hanyue, et al.
Veröffentlicht: (2025)
von: Lou, Hanyue, et al.
Veröffentlicht: (2025)
Surgical-VQLA++: Adversarial Contrastive Learning for Calibrated Robust Visual Question-Localized Answering in Robotic Surgery
von: Bai, Long, et al.
Veröffentlicht: (2024)
von: Bai, Long, et al.
Veröffentlicht: (2024)
Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness
von: Wang, Zeyu, et al.
Veröffentlicht: (2025)
von: Wang, Zeyu, et al.
Veröffentlicht: (2025)
Unleashing the Power of Pre-trained Encoders for Universal Adversarial Attack Detection
von: Zhang, Yinghe, et al.
Veröffentlicht: (2025)
von: Zhang, Yinghe, et al.
Veröffentlicht: (2025)
InViC: Intent-aware Visual Cues for Medical Visual Question Answering
von: Wang, Zhisong, et al.
Veröffentlicht: (2026)
von: Wang, Zhisong, et al.
Veröffentlicht: (2026)
VERA: Explainable Video Anomaly Detection via Verbalized Learning of Vision-Language Models
von: Ye, Muchao, et al.
Veröffentlicht: (2024)
von: Ye, Muchao, et al.
Veröffentlicht: (2024)
RoboSurg-VQA: A Multimodal Benchmark for Surgical Segmentation-Aware Visual Question Answering
von: Zhang, Chengyi, et al.
Veröffentlicht: (2026)
von: Zhang, Chengyi, et al.
Veröffentlicht: (2026)
ChineseVideoBench: Benchmarking Multi-modal Large Models for Chinese Video Question Answering
von: Nie, Yuxiang, et al.
Veröffentlicht: (2025)
von: Nie, Yuxiang, et al.
Veröffentlicht: (2025)
Retrieving to Recover: Towards Incomplete Audio-Visual Question Answering via Semantic-consistent Purification
von: Zhang, Jiayu, et al.
Veröffentlicht: (2026)
von: Zhang, Jiayu, et al.
Veröffentlicht: (2026)
Efficient Visual Question Answering Pipeline for Autonomous Driving via Scene Region Compression
von: Cai, Yuliang, et al.
Veröffentlicht: (2026)
von: Cai, Yuliang, et al.
Veröffentlicht: (2026)
Pre-trained Multiple Latent Variable Generative Models are good defenders against Adversarial Attacks
von: Serez, Dario, et al.
Veröffentlicht: (2024)
von: Serez, Dario, et al.
Veröffentlicht: (2024)
Improving the Transferability of Adversarial Attacks on Face Recognition with Diverse Parameters Augmentation
von: Zhou, Fengfan, et al.
Veröffentlicht: (2024)
von: Zhou, Fengfan, et al.
Veröffentlicht: (2024)
Self-Bootstrapped Visual-Language Model for Knowledge Selection and Question Answering
von: Hao, Dongze, et al.
Veröffentlicht: (2024)
von: Hao, Dongze, et al.
Veröffentlicht: (2024)
Structure Causal Models and LLMs Integration in Medical Visual Question Answering
von: Xu, Zibo, et al.
Veröffentlicht: (2025)
von: Xu, Zibo, et al.
Veröffentlicht: (2025)
CC-VQA: Conflict- and Correlation-Aware Method for Mitigating Knowledge Conflict in Knowledge-Based Visual Question Answering
von: Hong, Yuyang, et al.
Veröffentlicht: (2026)
von: Hong, Yuyang, et al.
Veröffentlicht: (2026)
Boosting Adversarial Transferability via Residual Perturbation Attack
von: Peng, Jinjia, et al.
Veröffentlicht: (2025)
von: Peng, Jinjia, et al.
Veröffentlicht: (2025)
Counterfeit Answers: Adversarial Forgery against OCR-Free Document Visual Question Answering
von: Pintore, Marco, et al.
Veröffentlicht: (2025)
von: Pintore, Marco, et al.
Veröffentlicht: (2025)
Improving Adversarial Transferability of Vision-Language Pre-training Models through Collaborative Multimodal Interaction
von: Fu, Jiyuan, et al.
Veröffentlicht: (2024)
von: Fu, Jiyuan, et al.
Veröffentlicht: (2024)
Enhanced Multimodal RAG-LLM for Accurate Visual Question Answering
von: Xue, Junxiao, et al.
Veröffentlicht: (2024)
von: Xue, Junxiao, et al.
Veröffentlicht: (2024)
RSAdapter: Adapting Multimodal Models for Remote Sensing Visual Question Answering
von: Wang, Yuduo, et al.
Veröffentlicht: (2023)
von: Wang, Yuduo, et al.
Veröffentlicht: (2023)
Questioning the Stability of Visual Question Answering
von: Rosenfeld, Amir, et al.
Veröffentlicht: (2025)
von: Rosenfeld, Amir, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
VLATTACK: Multimodal Adversarial Attacks on Vision-Language Tasks via Pre-trained Models
von: Yin, Ziyi, et al.
Veröffentlicht: (2023) -
Design as Desired: Utilizing Visual Question Answering for Multimodal Pre-training
von: Su, Tongkun, et al.
Veröffentlicht: (2024) -
HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models
von: Liu, Han, et al.
Veröffentlicht: (2026) -
Downstream Transfer Attack: Adversarial Attacks on Downstream Models with Pre-trained Vision Transformers
von: Zheng, Weijie, et al.
Veröffentlicht: (2024) -
Enhancing Adversarial Transferability in Visual-Language Pre-training Models via Local Shuffle and Sample-based Attack
von: Liu, Xin, et al.
Veröffentlicht: (2025)