Feedback-based Modal Mutual Search for Attacking Vision-Language Pre-training Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Ding, Renhua, Zhang, Xinze, Yang, Xiao, He, Kun |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training
von: Kim, Sanghwan, et al.
Veröffentlicht: (2024)
von: Kim, Sanghwan, et al.
Veröffentlicht: (2024)
Re-ranking Reasoning Context with Tree Search Makes Large Vision-Language Models Stronger
von: Yang, Qi, et al.
Veröffentlicht: (2025)
von: Yang, Qi, et al.
Veröffentlicht: (2025)
Post-pre-training for Modality Alignment in Vision-Language Foundation Models
von: Yamaguchi, Shin'ya, et al.
Veröffentlicht: (2025)
von: Yamaguchi, Shin'ya, et al.
Veröffentlicht: (2025)
Practical Continual Forgetting for Pre-trained Vision Models
von: Zhao, Hongbo, et al.
Veröffentlicht: (2025)
von: Zhao, Hongbo, et al.
Veröffentlicht: (2025)
Multi-Modal Adapter for Vision-Language Models
von: Seputis, Dominykas, et al.
Veröffentlicht: (2024)
von: Seputis, Dominykas, et al.
Veröffentlicht: (2024)
Effective Backdoor Mitigation in Vision-Language Models Depends on the Pre-training Objective
von: Verma, Sahil, et al.
Veröffentlicht: (2023)
von: Verma, Sahil, et al.
Veröffentlicht: (2023)
Vision Search Assistant: Empower Vision-Language Models as Multimodal Search Engines
von: Zhang, Zhixin, et al.
Veröffentlicht: (2024)
von: Zhang, Zhixin, et al.
Veröffentlicht: (2024)
Downstream Transfer Attack: Adversarial Attacks on Downstream Models with Pre-trained Vision Transformers
von: Zheng, Weijie, et al.
Veröffentlicht: (2024)
von: Zheng, Weijie, et al.
Veröffentlicht: (2024)
A Two-Stage Globally-Diverse Adversarial Attack for Vision-Language Pre-training Models
von: Chen, Wutao, et al.
Veröffentlicht: (2026)
von: Chen, Wutao, et al.
Veröffentlicht: (2026)
One Prompt Word is Enough to Boost Adversarial Robustness for Pre-trained Vision-Language Models
von: Li, Lin, et al.
Veröffentlicht: (2024)
von: Li, Lin, et al.
Veröffentlicht: (2024)
Respecting Modality Gap in Post-hoc Out-of-distribution Detection with Pre-trained Vision-Language Models
von: Hu, Yuanwei, et al.
Veröffentlicht: (2026)
von: Hu, Yuanwei, et al.
Veröffentlicht: (2026)
ChatGPT Encounters Morphing Attack Detection: Zero-Shot MAD with Multi-Modal Large Language Models and General Vision Models
von: Zhang, Haoyu, et al.
Veröffentlicht: (2025)
von: Zhang, Haoyu, et al.
Veröffentlicht: (2025)
Pre-trained Vision-Language Models Learn Discoverable Visual Concepts
von: Zang, Yuan, et al.
Veröffentlicht: (2024)
von: Zang, Yuan, et al.
Veröffentlicht: (2024)
Multi-modal Vision Pre-training for Medical Image Analysis
von: Rui, Shaohao, et al.
Veröffentlicht: (2024)
von: Rui, Shaohao, et al.
Veröffentlicht: (2024)
3D Modality-Aware Pre-training for Vision-Language Model in MRI Multi-organ Abnormality Detection
von: Zhu, Haowen, et al.
Veröffentlicht: (2026)
von: Zhu, Haowen, et al.
Veröffentlicht: (2026)
Pre-training Vision Transformers with Formula-driven Supervised Learning
von: Kataoka, Hirokatsu, et al.
Veröffentlicht: (2022)
von: Kataoka, Hirokatsu, et al.
Veröffentlicht: (2022)
Closed-Form Linear-Probe Dataset Distillation for Pre-trained Vision Models
von: Peng, Bincheng, et al.
Veröffentlicht: (2026)
von: Peng, Bincheng, et al.
Veröffentlicht: (2026)
ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement
von: Rao, Zhefan, et al.
Veröffentlicht: (2024)
von: Rao, Zhefan, et al.
Veröffentlicht: (2024)
Babel: A Scalable Pre-trained Model for Multi-Modal Sensing via Expandable Modality Alignment
von: Dai, Shenghong, et al.
Veröffentlicht: (2024)
von: Dai, Shenghong, et al.
Veröffentlicht: (2024)
Jailbreaking Vision-Language Models Through the Visual Modality
von: Azulay, Aharon, et al.
Veröffentlicht: (2026)
von: Azulay, Aharon, et al.
Veröffentlicht: (2026)
Freeze the backbones: A Parameter-Efficient Contrastive Approach to Robust Medical Vision-Language Pre-training
von: Qin, Jiuming, et al.
Veröffentlicht: (2024)
von: Qin, Jiuming, et al.
Veröffentlicht: (2024)
RMAdapter: Reconstruction-based Multi-Modal Adapter for Vision-Language Models
von: Lin, Xiang, et al.
Veröffentlicht: (2025)
von: Lin, Xiang, et al.
Veröffentlicht: (2025)
Do Pre-trained Vision-Language Models Encode Object States?
von: Newman, Kaleb, et al.
Veröffentlicht: (2024)
von: Newman, Kaleb, et al.
Veröffentlicht: (2024)
Gradient-based Fine-Tuning through Pre-trained Model Regularization
von: Liu, Xuanbo, et al.
Veröffentlicht: (2025)
von: Liu, Xuanbo, et al.
Veröffentlicht: (2025)
Fooling Contrastive Language-Image Pre-trained Models with CLIPMasterPrints
von: Freiberger, Matthias, et al.
Veröffentlicht: (2023)
von: Freiberger, Matthias, et al.
Veröffentlicht: (2023)
Enhancing Adversarial Transferability in Visual-Language Pre-training Models via Local Shuffle and Sample-based Attack
von: Liu, Xin, et al.
Veröffentlicht: (2025)
von: Liu, Xin, et al.
Veröffentlicht: (2025)
Low-hallucination Synthetic Captions for Large-Scale Vision-Language Model Pre-training
von: Zhang, Xinsong, et al.
Veröffentlicht: (2025)
von: Zhang, Xinsong, et al.
Veröffentlicht: (2025)
CapRecover: A Cross-Modality Feature Inversion Attack Framework on Vision Language Models
von: Xiu, Kedong, et al.
Veröffentlicht: (2025)
von: Xiu, Kedong, et al.
Veröffentlicht: (2025)
Dataset Ownership Verification in Contrastive Pre-trained Models
von: Xie, Yuechen, et al.
Veröffentlicht: (2025)
von: Xie, Yuechen, et al.
Veröffentlicht: (2025)
Toward Universal and Transferable Jailbreak Attacks on Vision-Language Models
von: Cui, Kaiyuan, et al.
Veröffentlicht: (2026)
von: Cui, Kaiyuan, et al.
Veröffentlicht: (2026)
Large-scale Multi-Modal Pre-trained Models: A Comprehensive Survey
von: Wang, Xiao, et al.
Veröffentlicht: (2023)
von: Wang, Xiao, et al.
Veröffentlicht: (2023)
SocialFusion: Addressing Social Degradation in Pre-trained Vision-Language Models
von: Tahboub, Hamza, et al.
Veröffentlicht: (2025)
von: Tahboub, Hamza, et al.
Veröffentlicht: (2025)
MedUnifier: Unifying Vision-and-Language Pre-training on Medical Data with Vision Generation Task using Discrete Visual Representations
von: Zhang, Ziyang, et al.
Veröffentlicht: (2025)
von: Zhang, Ziyang, et al.
Veröffentlicht: (2025)
Uni-Mlip: Unified Self-supervision for Medical Vision Language Pre-training
von: Bawazir, Ameera, et al.
Veröffentlicht: (2024)
von: Bawazir, Ameera, et al.
Veröffentlicht: (2024)
TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks
von: Hu, Yuanze, et al.
Veröffentlicht: (2025)
von: Hu, Yuanze, et al.
Veröffentlicht: (2025)
Robust Pre-Training of Medical Vision-and-Language Models with Domain-Invariant Multi-Modal Masked Reconstruction
von: Filvantorkaman, Melika, et al.
Veröffentlicht: (2026)
von: Filvantorkaman, Melika, et al.
Veröffentlicht: (2026)
MoRE: Multi-Modal Contrastive Pre-training with Transformers on X-Rays, ECGs, and Diagnostic Report
von: Thapa, Samrajya, et al.
Veröffentlicht: (2024)
von: Thapa, Samrajya, et al.
Veröffentlicht: (2024)
Mitigating Object Hallucinations in Vision-Language Models through Region-Aware Attention Recalibration
von: Xu, Yuanzhi, et al.
Veröffentlicht: (2026)
von: Xu, Yuanzhi, et al.
Veröffentlicht: (2026)
MAFA: Managing False Negatives for Vision-Language Pre-training
von: Byun, Jaeseok, et al.
Veröffentlicht: (2023)
von: Byun, Jaeseok, et al.
Veröffentlicht: (2023)
Enhancing Vision-Language Model Pre-training with Image-text Pair Pruning Based on Word Frequency
von: Liang, Mingliang, et al.
Veröffentlicht: (2024)
von: Liang, Mingliang, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training
von: Kim, Sanghwan, et al.
Veröffentlicht: (2024) -
Re-ranking Reasoning Context with Tree Search Makes Large Vision-Language Models Stronger
von: Yang, Qi, et al.
Veröffentlicht: (2025) -
Post-pre-training for Modality Alignment in Vision-Language Foundation Models
von: Yamaguchi, Shin'ya, et al.
Veröffentlicht: (2025) -
Practical Continual Forgetting for Pre-trained Vision Models
von: Zhao, Hongbo, et al.
Veröffentlicht: (2025) -
Multi-Modal Adapter for Vision-Language Models
von: Seputis, Dominykas, et al.
Veröffentlicht: (2024)