Web Artifact Attacks Disrupt Vision Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Qraitem, Maan, Teterwak, Piotr, Saenko, Kate, Plummer, Bryan A. |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SLANT: Spurious Logo ANalysis Toolkit
par: Qraitem, Maan, et autres
Publié: (2024)
par: Qraitem, Maan, et autres
Publié: (2024)
Vision-LLMs Can Fool Themselves with Self-Generated Typographic Attacks
par: Qraitem, Maan, et autres
Publié: (2024)
par: Qraitem, Maan, et autres
Publié: (2024)
From Fake to Real: Pretraining on Balanced Synthetic Images to Prevent Spurious Correlations in Image Recognition
par: Qraitem, Maan, et autres
Publié: (2023)
par: Qraitem, Maan, et autres
Publié: (2023)
OP-LoRA: The Blessing of Dimensionality
par: Teterwak, Piotr, et autres
Publié: (2024)
par: Teterwak, Piotr, et autres
Publié: (2024)
CLAMP: Contrastive LAnguage Model Prompt-tuning
par: Teterwak, Piotr, et autres
Publié: (2023)
par: Teterwak, Piotr, et autres
Publié: (2023)
Is Large-Scale Pretraining the Secret to Good Domain Generalization?
par: Teterwak, Piotr, et autres
Publié: (2024)
par: Teterwak, Piotr, et autres
Publié: (2024)
ERM++: An Improved Baseline for Domain Generalization
par: Teterwak, Piotr, et autres
Publié: (2023)
par: Teterwak, Piotr, et autres
Publié: (2023)
Breaking the Assistant Mold: Modeling Behavioral Variation in LLM Based Procedural Character Generation
par: Qraitem, Maan, et autres
Publié: (2026)
par: Qraitem, Maan, et autres
Publié: (2026)
Tell Me What's Next: Textual Foresight for Generic UI Representations
par: Burns, Andrea, et autres
Publié: (2024)
par: Burns, Andrea, et autres
Publié: (2024)
KiVA: Kid-inspired Visual Analogies for Testing Large Multimodal Models
par: Yiu, Eunice, et autres
Publié: (2024)
par: Yiu, Eunice, et autres
Publié: (2024)
Koala: Key frame-conditioned long video-LLM
par: Tan, Reuben, et autres
Publié: (2024)
par: Tan, Reuben, et autres
Publié: (2024)
SPARC: Score Prompting and Adaptive Fusion for Zero-Shot Multi-Label Recognition in Vision-Language Models
par: Miller, Kevin, et autres
Publié: (2025)
par: Miller, Kevin, et autres
Publié: (2025)
Enhancing Feature Diversity Boosts Channel-Adaptive Vision Transformers
par: Pham, Chau, et autres
Publié: (2024)
par: Pham, Chau, et autres
Publié: (2024)
Scaling Up Temporal Domain Generalization via Temporal Experts Averaging
par: Liu, Aoming, et autres
Publié: (2025)
par: Liu, Aoming, et autres
Publié: (2025)
Concept Arithmetics for Circumventing Concept Inhibition in Diffusion Models
par: Petsiuk, Vitali, et autres
Publié: (2024)
par: Petsiuk, Vitali, et autres
Publié: (2024)
Mull-Tokens: Modality-Agnostic Latent Thinking
par: Ray, Arijit, et autres
Publié: (2025)
par: Ray, Arijit, et autres
Publié: (2025)
LNL+K: Enhancing Learning with Noisy Labels Through Noise Source Knowledge Integration
par: Wang, Siqi, et autres
Publié: (2023)
par: Wang, Siqi, et autres
Publié: (2023)
Walk and Read Less: Improving the Efficiency of Vision-and-Language Navigation via Tuning-Free Multimodal Token Pruning
par: Qin, Wenda, et autres
Publié: (2025)
par: Qin, Wenda, et autres
Publié: (2025)
SynArtifact: Classifying and Alleviating Artifacts in Synthetic Images via Vision-Language Model
par: Cao, Bin, et autres
Publié: (2024)
par: Cao, Bin, et autres
Publié: (2024)
SCRAMBLe : Enhancing Multimodal LLM Compositionality with Synthetic Preference Data
par: Mishra, Samarth, et autres
Publié: (2025)
par: Mishra, Samarth, et autres
Publié: (2025)
SAT: Dynamic Spatial Aptitude Training for Multimodal Language Models
par: Ray, Arijit, et autres
Publié: (2024)
par: Ray, Arijit, et autres
Publié: (2024)
Decompose, Mix, Adapt: A Unified Framework for Parameter-Efficient Neural Network Recombination and Compression
par: Tasnim, Nazia, et autres
Publié: (2026)
par: Tasnim, Nazia, et autres
Publié: (2026)
ChA-MAEViT: Unifying Channel-Aware Masked Autoencoders and Multi-Channel Vision Transformers for Improved Cross-Channel Learning
par: Pham, Chau, et autres
Publié: (2025)
par: Pham, Chau, et autres
Publié: (2025)
RECAST: Reparameterized, Compact weight Adaptation for Sequential Tasks
par: Tasnim, Nazia, et autres
Publié: (2024)
par: Tasnim, Nazia, et autres
Publié: (2024)
Enhancing Virtual Try-On with Synthetic Pairs and Error-Aware Noise Scheduling
par: Li, Nannan, et autres
Publié: (2025)
par: Li, Nannan, et autres
Publié: (2025)
Mirage: Unveiling Hidden Artifacts in Synthetic Images with Large Vision-Language Models
par: Sharma, Pranav, et autres
Publié: (2025)
par: Sharma, Pranav, et autres
Publié: (2025)
Federated Adversarial Domain Adaptation
par: Peng, Xingchao, et autres
Publié: (2019)
par: Peng, Xingchao, et autres
Publié: (2019)
FuTCR: Future-Targeted Contrast and Repulsion for Continual Panoptic Segmentation
par: Ikechukwu, Nicholas, et autres
Publié: (2026)
par: Ikechukwu, Nicholas, et autres
Publié: (2026)
SynCDR : Training Cross Domain Retrieval Models with Synthetic Data
par: Mishra, Samarth, et autres
Publié: (2023)
par: Mishra, Samarth, et autres
Publié: (2023)
INSIGHT: An Interpretable Neural Vision-Language Framework for Reasoning of Generative Artifacts
par: Bagaria, Anshul
Publié: (2025)
par: Bagaria, Anshul
Publié: (2025)
Noise-Aware Generalization: Robustness to In-Domain Noise and Out-of-Domain Generalization
par: Wang, Siqi, et autres
Publié: (2025)
par: Wang, Siqi, et autres
Publié: (2025)
Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks
par: Xie, Peng, et autres
Publié: (2024)
par: Xie, Peng, et autres
Publié: (2024)
TrojVLM: Backdoor Attack Against Vision Language Models
par: Lyu, Weimin, et autres
Publié: (2024)
par: Lyu, Weimin, et autres
Publié: (2024)
Visual Adversarial Attack on Vision-Language Models for Autonomous Driving
par: Zhang, Tianyuan, et autres
Publié: (2024)
par: Zhang, Tianyuan, et autres
Publié: (2024)
BabyVLM-V2: Toward Developmentally Grounded Pretraining and Benchmarking of Vision Foundation Models
par: Wang, Shengao, et autres
Publié: (2025)
par: Wang, Shengao, et autres
Publié: (2025)
VEAttack: Downstream-agnostic Vision Encoder Attack against Large Vision Language Models
par: Mei, Hefei, et autres
Publié: (2025)
par: Mei, Hefei, et autres
Publié: (2025)
SGHA-Attack: Semantic-Guided Hierarchical Alignment for Transferable Targeted Attacks on Vision-Language Models
par: Wang, Haobo, et autres
Publié: (2026)
par: Wang, Haobo, et autres
Publié: (2026)
BackdoorVLM: A Benchmark for Backdoor Attacks on Vision-Language Models
par: Li, Juncheng, et autres
Publié: (2025)
par: Li, Juncheng, et autres
Publié: (2025)
Multi-Turn Adaptive Prompting Attack on Large Vision-Language Models
par: Choi, In Chong, et autres
Publié: (2026)
par: Choi, In Chong, et autres
Publié: (2026)
Stealthy Backdoor Attack in Self-Supervised Learning Vision Encoders for Large Vision Language Models
par: Liu, Zhaoyi, et autres
Publié: (2025)
par: Liu, Zhaoyi, et autres
Publié: (2025)
Documents similaires
-
SLANT: Spurious Logo ANalysis Toolkit
par: Qraitem, Maan, et autres
Publié: (2024) -
Vision-LLMs Can Fool Themselves with Self-Generated Typographic Attacks
par: Qraitem, Maan, et autres
Publié: (2024) -
From Fake to Real: Pretraining on Balanced Synthetic Images to Prevent Spurious Correlations in Image Recognition
par: Qraitem, Maan, et autres
Publié: (2023) -
OP-LoRA: The Blessing of Dimensionality
par: Teterwak, Piotr, et autres
Publié: (2024) -
CLAMP: Contrastive LAnguage Model Prompt-tuning
par: Teterwak, Piotr, et autres
Publié: (2023)