PDA: Text-Augmented Defense Framework for Robust Vision-Language Models against Adversarial Image Attacks
Fuente:
arXiv
Guardado en:
| Autores principales: | Xu, Jingning, Luo, Haochen, Liu, Chen |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
PG-Attack: A Precision-Guided Adversarial Attack Framework Against Vision Foundation Models for Autonomous Driving
por: Fu, Jiyuan, et al.
Publicado: (2024)
por: Fu, Jiyuan, et al.
Publicado: (2024)
Hierarchical Refinement of Universal Multimodal Attacks on Vision-Language Models
por: Zhang, Peng-Fei, et al.
Publicado: (2026)
por: Zhang, Peng-Fei, et al.
Publicado: (2026)
Efficient Vision Language Model Fine-tuning for Text-based Person Anomaly Search
por: He, Jiayi, et al.
Publicado: (2025)
por: He, Jiayi, et al.
Publicado: (2025)
Unlearning the Noisy Correspondence Makes CLIP More Robust
por: Han, Haochen, et al.
Publicado: (2025)
por: Han, Haochen, et al.
Publicado: (2025)
Mitigating Image Captioning Hallucinations in Vision-Language Models
por: Zhao, Fei, et al.
Publicado: (2025)
por: Zhao, Fei, et al.
Publicado: (2025)
OS-HGAdapter: Open Semantic Hypergraph Adapter for Large Language Models Assisted Entropy-Enhanced Image-Text Alignment
por: Chen, Rongjun, et al.
Publicado: (2025)
por: Chen, Rongjun, et al.
Publicado: (2025)
Robust Modality-incomplete Anomaly Detection: A Modality-instructive Framework with Benchmark
por: Miao, Bingchen, et al.
Publicado: (2024)
por: Miao, Bingchen, et al.
Publicado: (2024)
TextRefiner: Internal Visual Feature as Efficient Refiner for Vision-Language Models Prompt Tuning
por: Xie, Jingjing, et al.
Publicado: (2024)
por: Xie, Jingjing, et al.
Publicado: (2024)
Enhancing Interactive Image Retrieval With Query Rewriting Using Large Language Models and Vision Language Models
por: Zhu, Hongyi, et al.
Publicado: (2024)
por: Zhu, Hongyi, et al.
Publicado: (2024)
Towards Real-World Adverse Weather Image Restoration: Enhancing Clearness and Semantics with Vision-Language Models
por: Xu, Jiaqi, et al.
Publicado: (2024)
por: Xu, Jiaqi, et al.
Publicado: (2024)
A Unified Optimal Transport Framework for Cross-Modal Retrieval with Noisy Labels
por: Han, Haochen, et al.
Publicado: (2024)
por: Han, Haochen, et al.
Publicado: (2024)
Natural Language Induced Adversarial Images
por: Zhu, Xiaopei, et al.
Publicado: (2024)
por: Zhu, Xiaopei, et al.
Publicado: (2024)
CLIP-PCQA: Exploring Subjective-Aligned Vision-Language Modeling for Point Cloud Quality Assessment
por: Liu, Yating, et al.
Publicado: (2025)
por: Liu, Yating, et al.
Publicado: (2025)
Multimodal Large Language Model is a Human-Aligned Annotator for Text-to-Image Generation
por: Wu, Xun, et al.
Publicado: (2024)
por: Wu, Xun, et al.
Publicado: (2024)
MMSD3.0: A Multi-Image Benchmark for Real-World Multimodal Sarcasm Detection
por: Zhao, Haochen, et al.
Publicado: (2025)
por: Zhao, Haochen, et al.
Publicado: (2025)
Vision-Language Models Learn Super Images for Efficient Partially Relevant Video Retrieval
por: Nishimura, Taichi, et al.
Publicado: (2023)
por: Nishimura, Taichi, et al.
Publicado: (2023)
CalliReader: Contextualizing Chinese Calligraphy via an Embedding-Aligned Vision-Language Model
por: Luo, Yuxuan, et al.
Publicado: (2025)
por: Luo, Yuxuan, et al.
Publicado: (2025)
Exploring the Distinctiveness and Fidelity of the Descriptions Generated by Large Vision-Language Models
por: Huang, Yuhang, et al.
Publicado: (2024)
por: Huang, Yuhang, et al.
Publicado: (2024)
Segmentation-Based Attention Entropy: Detecting and Mitigating Object Hallucinations in Large Vision-Language Models
por: Song, Jiale, et al.
Publicado: (2026)
por: Song, Jiale, et al.
Publicado: (2026)
Magic3DSketch: Create Colorful 3D Models From Sketch-Based 3D Modeling Guided by Text and Language-Image Pre-Training
por: Zang, Ying, et al.
Publicado: (2024)
por: Zang, Ying, et al.
Publicado: (2024)
MorphText: Deep Morphology Regularized Arbitrary-shape Scene Text Detection
por: Xu, Chengpei, et al.
Publicado: (2024)
por: Xu, Chengpei, et al.
Publicado: (2024)
Noise-Tolerant Learning for Audio-Visual Action Recognition
por: Han, Haochen, et al.
Publicado: (2022)
por: Han, Haochen, et al.
Publicado: (2022)
StableMoFusion: Towards Robust and Efficient Diffusion-based Motion Generation Framework
por: Huang, Yiheng, et al.
Publicado: (2024)
por: Huang, Yiheng, et al.
Publicado: (2024)
Improving Long-Text Alignment for Text-to-Image Diffusion Models
por: Liu, Luping, et al.
Publicado: (2024)
por: Liu, Luping, et al.
Publicado: (2024)
ML-CLIPSim: Multi-Layer CLIP Similarity for Machine-Oriented Image Quality
por: Ding, Feng, et al.
Publicado: (2026)
por: Ding, Feng, et al.
Publicado: (2026)
Cross-modal Proxy Evolving for OOD Detection with Vision-Language Models
por: Tang, Hao, et al.
Publicado: (2026)
por: Tang, Hao, et al.
Publicado: (2026)
Improving Adversarial Transferability of Vision-Language Pre-training Models through Collaborative Multimodal Interaction
por: Fu, Jiyuan, et al.
Publicado: (2024)
por: Fu, Jiyuan, et al.
Publicado: (2024)
Unveiling Encoder-Free Vision-Language Models
por: Diao, Haiwen, et al.
Publicado: (2024)
por: Diao, Haiwen, et al.
Publicado: (2024)
Learning to Rematch Mismatched Pairs for Robust Cross-Modal Retrieval
por: Han, Haochen, et al.
Publicado: (2024)
por: Han, Haochen, et al.
Publicado: (2024)
PanoGen++: Domain-Adapted Text-Guided Panoramic Environment Generation for Vision-and-Language Navigation
por: Wang, Sen, et al.
Publicado: (2025)
por: Wang, Sen, et al.
Publicado: (2025)
On the Robustness of Human-Object Interaction Detection against Distribution Shift
por: Xie, Chi, et al.
Publicado: (2025)
por: Xie, Chi, et al.
Publicado: (2025)
Exploring Phrase-Level Grounding with Text-to-Image Diffusion Model
por: Yang, Danni, et al.
Publicado: (2024)
por: Yang, Danni, et al.
Publicado: (2024)
Text-Only Data Synthesis for Vision Language Model Training
por: Yu, Xiaomin, et al.
Publicado: (2025)
por: Yu, Xiaomin, et al.
Publicado: (2025)
Spatio-Temporal Data Enhanced Vision-Language Model for Traffic Scene Understanding
por: Ma, Jingtian, et al.
Publicado: (2025)
por: Ma, Jingtian, et al.
Publicado: (2025)
Anti-Inpainting: A Proactive Defense Approach against Malicious Diffusion-based Inpainters under Unknown Conditions
por: Guo, Yimao, et al.
Publicado: (2025)
por: Guo, Yimao, et al.
Publicado: (2025)
HeGraphAdapter: Tuning Multi-Modal Vision-Language Models with Heterogeneous Graph Adapter
por: Zhao, Yumiao, et al.
Publicado: (2024)
por: Zhao, Yumiao, et al.
Publicado: (2024)
Visual Semantic Description Generation with MLLMs for Image-Text Matching
por: Chen, Junyu, et al.
Publicado: (2025)
por: Chen, Junyu, et al.
Publicado: (2025)
ComAlign: Compositional Alignment in Vision-Language Models
por: Abdollah, Ali, et al.
Publicado: (2024)
por: Abdollah, Ali, et al.
Publicado: (2024)
Improving Multi-modal Large Language Model through Boosting Vision Capabilities
por: Sun, Yanpeng, et al.
Publicado: (2024)
por: Sun, Yanpeng, et al.
Publicado: (2024)
Identity-Preserving Text-to-Video Generation via Training-Free Prompt, Image, and Guidance Enhancement
por: Gao, Jiayi, et al.
Publicado: (2025)
por: Gao, Jiayi, et al.
Publicado: (2025)
Ejemplares similares
-
PG-Attack: A Precision-Guided Adversarial Attack Framework Against Vision Foundation Models for Autonomous Driving
por: Fu, Jiyuan, et al.
Publicado: (2024) -
Hierarchical Refinement of Universal Multimodal Attacks on Vision-Language Models
por: Zhang, Peng-Fei, et al.
Publicado: (2026) -
Efficient Vision Language Model Fine-tuning for Text-based Person Anomaly Search
por: He, Jiayi, et al.
Publicado: (2025) -
Unlearning the Noisy Correspondence Makes CLIP More Robust
por: Han, Haochen, et al.
Publicado: (2025) -
Mitigating Image Captioning Hallucinations in Vision-Language Models
por: Zhao, Fei, et al.
Publicado: (2025)