Feedback-based Modal Mutual Search for Attacking Vision-Language Pre-training Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Ding, Renhua, Zhang, Xinze, Yang, Xiao, He, Kun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training
por: Kim, Sanghwan, et al.
Publicado: (2024)
por: Kim, Sanghwan, et al.
Publicado: (2024)
Re-ranking Reasoning Context with Tree Search Makes Large Vision-Language Models Stronger
por: Yang, Qi, et al.
Publicado: (2025)
por: Yang, Qi, et al.
Publicado: (2025)
Post-pre-training for Modality Alignment in Vision-Language Foundation Models
por: Yamaguchi, Shin'ya, et al.
Publicado: (2025)
por: Yamaguchi, Shin'ya, et al.
Publicado: (2025)
Practical Continual Forgetting for Pre-trained Vision Models
por: Zhao, Hongbo, et al.
Publicado: (2025)
por: Zhao, Hongbo, et al.
Publicado: (2025)
Multi-Modal Adapter for Vision-Language Models
por: Seputis, Dominykas, et al.
Publicado: (2024)
por: Seputis, Dominykas, et al.
Publicado: (2024)
Effective Backdoor Mitigation in Vision-Language Models Depends on the Pre-training Objective
por: Verma, Sahil, et al.
Publicado: (2023)
por: Verma, Sahil, et al.
Publicado: (2023)
Vision Search Assistant: Empower Vision-Language Models as Multimodal Search Engines
por: Zhang, Zhixin, et al.
Publicado: (2024)
por: Zhang, Zhixin, et al.
Publicado: (2024)
Downstream Transfer Attack: Adversarial Attacks on Downstream Models with Pre-trained Vision Transformers
por: Zheng, Weijie, et al.
Publicado: (2024)
por: Zheng, Weijie, et al.
Publicado: (2024)
A Two-Stage Globally-Diverse Adversarial Attack for Vision-Language Pre-training Models
por: Chen, Wutao, et al.
Publicado: (2026)
por: Chen, Wutao, et al.
Publicado: (2026)
One Prompt Word is Enough to Boost Adversarial Robustness for Pre-trained Vision-Language Models
por: Li, Lin, et al.
Publicado: (2024)
por: Li, Lin, et al.
Publicado: (2024)
Respecting Modality Gap in Post-hoc Out-of-distribution Detection with Pre-trained Vision-Language Models
por: Hu, Yuanwei, et al.
Publicado: (2026)
por: Hu, Yuanwei, et al.
Publicado: (2026)
ChatGPT Encounters Morphing Attack Detection: Zero-Shot MAD with Multi-Modal Large Language Models and General Vision Models
por: Zhang, Haoyu, et al.
Publicado: (2025)
por: Zhang, Haoyu, et al.
Publicado: (2025)
Pre-trained Vision-Language Models Learn Discoverable Visual Concepts
por: Zang, Yuan, et al.
Publicado: (2024)
por: Zang, Yuan, et al.
Publicado: (2024)
Multi-modal Vision Pre-training for Medical Image Analysis
por: Rui, Shaohao, et al.
Publicado: (2024)
por: Rui, Shaohao, et al.
Publicado: (2024)
3D Modality-Aware Pre-training for Vision-Language Model in MRI Multi-organ Abnormality Detection
por: Zhu, Haowen, et al.
Publicado: (2026)
por: Zhu, Haowen, et al.
Publicado: (2026)
Pre-training Vision Transformers with Formula-driven Supervised Learning
por: Kataoka, Hirokatsu, et al.
Publicado: (2022)
por: Kataoka, Hirokatsu, et al.
Publicado: (2022)
Closed-Form Linear-Probe Dataset Distillation for Pre-trained Vision Models
por: Peng, Bincheng, et al.
Publicado: (2026)
por: Peng, Bincheng, et al.
Publicado: (2026)
ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement
por: Rao, Zhefan, et al.
Publicado: (2024)
por: Rao, Zhefan, et al.
Publicado: (2024)
Babel: A Scalable Pre-trained Model for Multi-Modal Sensing via Expandable Modality Alignment
por: Dai, Shenghong, et al.
Publicado: (2024)
por: Dai, Shenghong, et al.
Publicado: (2024)
Jailbreaking Vision-Language Models Through the Visual Modality
por: Azulay, Aharon, et al.
Publicado: (2026)
por: Azulay, Aharon, et al.
Publicado: (2026)
Freeze the backbones: A Parameter-Efficient Contrastive Approach to Robust Medical Vision-Language Pre-training
por: Qin, Jiuming, et al.
Publicado: (2024)
por: Qin, Jiuming, et al.
Publicado: (2024)
RMAdapter: Reconstruction-based Multi-Modal Adapter for Vision-Language Models
por: Lin, Xiang, et al.
Publicado: (2025)
por: Lin, Xiang, et al.
Publicado: (2025)
Do Pre-trained Vision-Language Models Encode Object States?
por: Newman, Kaleb, et al.
Publicado: (2024)
por: Newman, Kaleb, et al.
Publicado: (2024)
Gradient-based Fine-Tuning through Pre-trained Model Regularization
por: Liu, Xuanbo, et al.
Publicado: (2025)
por: Liu, Xuanbo, et al.
Publicado: (2025)
Fooling Contrastive Language-Image Pre-trained Models with CLIPMasterPrints
por: Freiberger, Matthias, et al.
Publicado: (2023)
por: Freiberger, Matthias, et al.
Publicado: (2023)
Enhancing Adversarial Transferability in Visual-Language Pre-training Models via Local Shuffle and Sample-based Attack
por: Liu, Xin, et al.
Publicado: (2025)
por: Liu, Xin, et al.
Publicado: (2025)
Low-hallucination Synthetic Captions for Large-Scale Vision-Language Model Pre-training
por: Zhang, Xinsong, et al.
Publicado: (2025)
por: Zhang, Xinsong, et al.
Publicado: (2025)
CapRecover: A Cross-Modality Feature Inversion Attack Framework on Vision Language Models
por: Xiu, Kedong, et al.
Publicado: (2025)
por: Xiu, Kedong, et al.
Publicado: (2025)
Dataset Ownership Verification in Contrastive Pre-trained Models
por: Xie, Yuechen, et al.
Publicado: (2025)
por: Xie, Yuechen, et al.
Publicado: (2025)
Toward Universal and Transferable Jailbreak Attacks on Vision-Language Models
por: Cui, Kaiyuan, et al.
Publicado: (2026)
por: Cui, Kaiyuan, et al.
Publicado: (2026)
Large-scale Multi-Modal Pre-trained Models: A Comprehensive Survey
por: Wang, Xiao, et al.
Publicado: (2023)
por: Wang, Xiao, et al.
Publicado: (2023)
SocialFusion: Addressing Social Degradation in Pre-trained Vision-Language Models
por: Tahboub, Hamza, et al.
Publicado: (2025)
por: Tahboub, Hamza, et al.
Publicado: (2025)
MedUnifier: Unifying Vision-and-Language Pre-training on Medical Data with Vision Generation Task using Discrete Visual Representations
por: Zhang, Ziyang, et al.
Publicado: (2025)
por: Zhang, Ziyang, et al.
Publicado: (2025)
Uni-Mlip: Unified Self-supervision for Medical Vision Language Pre-training
por: Bawazir, Ameera, et al.
Publicado: (2024)
por: Bawazir, Ameera, et al.
Publicado: (2024)
TinyAlign: Boosting Lightweight Vision-Language Models by Mitigating Modal Alignment Bottlenecks
por: Hu, Yuanze, et al.
Publicado: (2025)
por: Hu, Yuanze, et al.
Publicado: (2025)
Robust Pre-Training of Medical Vision-and-Language Models with Domain-Invariant Multi-Modal Masked Reconstruction
por: Filvantorkaman, Melika, et al.
Publicado: (2026)
por: Filvantorkaman, Melika, et al.
Publicado: (2026)
MoRE: Multi-Modal Contrastive Pre-training with Transformers on X-Rays, ECGs, and Diagnostic Report
por: Thapa, Samrajya, et al.
Publicado: (2024)
por: Thapa, Samrajya, et al.
Publicado: (2024)
Mitigating Object Hallucinations in Vision-Language Models through Region-Aware Attention Recalibration
por: Xu, Yuanzhi, et al.
Publicado: (2026)
por: Xu, Yuanzhi, et al.
Publicado: (2026)
MAFA: Managing False Negatives for Vision-Language Pre-training
por: Byun, Jaeseok, et al.
Publicado: (2023)
por: Byun, Jaeseok, et al.
Publicado: (2023)
Enhancing Vision-Language Model Pre-training with Image-text Pair Pruning Based on Word Frequency
por: Liang, Mingliang, et al.
Publicado: (2024)
por: Liang, Mingliang, et al.
Publicado: (2024)
Ejemplares similares
-
COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training
por: Kim, Sanghwan, et al.
Publicado: (2024) -
Re-ranking Reasoning Context with Tree Search Makes Large Vision-Language Models Stronger
por: Yang, Qi, et al.
Publicado: (2025) -
Post-pre-training for Modality Alignment in Vision-Language Foundation Models
por: Yamaguchi, Shin'ya, et al.
Publicado: (2025) -
Practical Continual Forgetting for Pre-trained Vision Models
por: Zhao, Hongbo, et al.
Publicado: (2025) -
Multi-Modal Adapter for Vision-Language Models
por: Seputis, Dominykas, et al.
Publicado: (2024)