Benchmarking Vision-Language Models under Contradictory Virtual Content Attacks in Augmented Reality
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xiu, Yanming, Jiang, Zhengyuan, Gong, Neil Zhenqiang, Gorlatova, Maria |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ViDDAR: Vision Language Model-Based Task-Detrimental Content Detection for Augmented Reality
par: Xiu, Yanming, et autres
Publié: (2025)
par: Xiu, Yanming, et autres
Publié: (2025)
Detecting Visual Information Manipulation Attacks in Augmented Reality: A Multimodal Semantic Reasoning Approach
par: Xiu, Yanming, et autres
Publié: (2025)
par: Xiu, Yanming, et autres
Publié: (2025)
Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble
par: Duan, Lin, et autres
Publié: (2025)
par: Duan, Lin, et autres
Publié: (2025)
User Prompting Strategies and Prompt Enhancement Methods for Open-Set Object Detection in XR Environments
par: Lin, Junfeng, et autres
Publié: (2026)
par: Lin, Junfeng, et autres
Publié: (2026)
Robustness of Vision Foundation Models to Common Perturbations
par: Liu, Hongbin, et autres
Publié: (2026)
par: Liu, Hongbin, et autres
Publié: (2026)
Toward Safe, Trustworthy and Realistic Augmented Reality User Experience
par: Xiu, Yanming
Publié: (2025)
par: Xiu, Yanming
Publié: (2025)
A Neurosymbolic Framework for Interpretable Cognitive Attack Detection in Augmented Reality
par: Chen, Rongqian, et autres
Publié: (2025)
par: Chen, Rongqian, et autres
Publié: (2025)
SafeText: Safe Text-to-image Models via Aligning the Text Encoder
par: Hu, Yuepeng, et autres
Publié: (2025)
par: Hu, Yuepeng, et autres
Publié: (2025)
Jailbreaking Safeguarded Text-to-Image Models via Large Language Models
par: Jiang, Zhengyuan, et autres
Publié: (2025)
par: Jiang, Zhengyuan, et autres
Publié: (2025)
Watermark-based Attribution of AI-Generated Content
par: Jiang, Zhengyuan, et autres
Publié: (2024)
par: Jiang, Zhengyuan, et autres
Publié: (2024)
Demonstrating Visual Information Manipulation Attacks in Augmented Reality: A Hands-On Miniature City-Based Setup
par: Xiu, Yanming, et autres
Publié: (2025)
par: Xiu, Yanming, et autres
Publié: (2025)
EditTrack: Detecting and Attributing AI-assisted Image Editing
par: Jiang, Zhengyuan, et autres
Publié: (2025)
par: Jiang, Zhengyuan, et autres
Publié: (2025)
Certifiably Robust Image Watermark
par: Jiang, Zhengyuan, et autres
Publié: (2024)
par: Jiang, Zhengyuan, et autres
Publié: (2024)
Stable Signature is Unstable: Removing Image Watermark from Diffusion Models
par: Hu, Yuepeng, et autres
Publié: (2024)
par: Hu, Yuepeng, et autres
Publié: (2024)
BackdoorVLM: A Benchmark for Backdoor Attacks on Vision-Language Models
par: Li, Juncheng, et autres
Publié: (2025)
par: Li, Juncheng, et autres
Publié: (2025)
Tracing Back the Malicious Clients in Poisoning Attacks to Federated Learning
par: Jia, Yuqi, et autres
Publié: (2024)
par: Jia, Yuqi, et autres
Publié: (2024)
VideoMarkBench: Benchmarking Robustness of Video Watermarking
par: Jiang, Zhengyuan, et autres
Publié: (2025)
par: Jiang, Zhengyuan, et autres
Publié: (2025)
CorruptEncoder: Data Poisoning based Backdoor Attacks to Contrastive Learning
par: Zhang, Jinghuai, et autres
Publié: (2022)
par: Zhang, Jinghuai, et autres
Publié: (2022)
Visual Hallucinations of Multi-modal Large Language Models
par: Huang, Wen, et autres
Publié: (2024)
par: Huang, Wen, et autres
Publié: (2024)
CapRecover: A Cross-Modality Feature Inversion Attack Framework on Vision Language Models
par: Xiu, Kedong, et autres
Publié: (2025)
par: Xiu, Kedong, et autres
Publié: (2025)
Say It, See It: A Systematic Evaluation on Speech-Based 3D Content Generation Methods in Augmented Reality
par: Xiu, Yanming, et autres
Publié: (2025)
par: Xiu, Yanming, et autres
Publié: (2025)
One Object, Multiple Lies: A Benchmark for Cross-task Adversarial Attack on Unified Vision-Language Models
par: Zhao, Jiale, et autres
Publié: (2025)
par: Zhao, Jiale, et autres
Publié: (2025)
Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: A Comprehensive Evaluation
par: Yu, Hong-Tao, et autres
Publié: (2025)
par: Yu, Hong-Tao, et autres
Publié: (2025)
Mudjacking: Patching Backdoor Vulnerabilities in Foundation Models
par: Liu, Hongbin, et autres
Publié: (2024)
par: Liu, Hongbin, et autres
Publié: (2024)
HarassGuard: Detecting Harassment Behaviors in Social Virtual Reality with Vision-Language Models
par: Lee, Junhee, et autres
Publié: (2026)
par: Lee, Junhee, et autres
Publié: (2026)
Refusing Safe Prompts for Multi-modal Large Language Models
par: Shao, Zedian, et autres
Publié: (2024)
par: Shao, Zedian, et autres
Publié: (2024)
Beyond Augmentation: Empowering Model Robustness under Extreme Capture Environments
par: Gong, Yunpeng, et autres
Publié: (2024)
par: Gong, Yunpeng, et autres
Publié: (2024)
Automatically Generating Visual Hallucination Test Cases for Multimodal Large Language Models
par: Liu, Zhongye, et autres
Publié: (2024)
par: Liu, Zhongye, et autres
Publié: (2024)
AttackVLA: Benchmarking Adversarial and Backdoor Attacks on Vision-Language-Action Models
par: Li, Jiayu, et autres
Publié: (2025)
par: Li, Jiayu, et autres
Publié: (2025)
BLEnD-Vis: Benchmarking Multimodal Cultural Understanding in Vision Language Models
par: Tan, Bryan Chen Zhengyu, et autres
Publié: (2025)
par: Tan, Bryan Chen Zhengyu, et autres
Publié: (2025)
ORIC: Benchmarking Object Recognition under Contextual Incongruity in Large Vision-Language Models
par: Li, Zhaoyang, et autres
Publié: (2025)
par: Li, Zhaoyang, et autres
Publié: (2025)
WebInject: Prompt Injection Attack to Web Agents
par: Wang, Xilong, et autres
Publié: (2025)
par: Wang, Xilong, et autres
Publié: (2025)
Leave My Images Alone: Preventing Multi-Modal Large Language Models from Analyzing Images via Visual Prompt Injection
par: Shao, Zedian, et autres
Publié: (2026)
par: Shao, Zedian, et autres
Publié: (2026)
Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models
par: Waseda, Futa, et autres
Publié: (2025)
par: Waseda, Futa, et autres
Publié: (2025)
GO-NeRF: Generating Objects in Neural Radiance Fields for Virtual Reality Content Creation
par: Dai, Peng, et autres
Publié: (2024)
par: Dai, Peng, et autres
Publié: (2024)
MMCOMPOSITION: Revisiting the Compositionality of Pre-trained Vision-Language Models
par: Hua, Hang, et autres
Publié: (2024)
par: Hua, Hang, et autres
Publié: (2024)
Towards Highly Transferable Vision-Language Attack via Semantic-Augmented Dynamic Contrastive Interaction
par: Li, Yuanbo, et autres
Publié: (2026)
par: Li, Yuanbo, et autres
Publié: (2026)
Web Artifact Attacks Disrupt Vision Language Models
par: Qraitem, Maan, et autres
Publié: (2025)
par: Qraitem, Maan, et autres
Publié: (2025)
Practical Region-level Attack against Segment Anything Models
par: Shen, Yifan, et autres
Publié: (2024)
par: Shen, Yifan, et autres
Publié: (2024)
Deep Learning for Virtual Reality User Identification: A Benchmark
par: Frizzo, Davide, et autres
Publié: (2026)
par: Frizzo, Davide, et autres
Publié: (2026)
Documents similaires
-
ViDDAR: Vision Language Model-Based Task-Detrimental Content Detection for Augmented Reality
par: Xiu, Yanming, et autres
Publié: (2025) -
Detecting Visual Information Manipulation Attacks in Augmented Reality: A Multimodal Semantic Reasoning Approach
par: Xiu, Yanming, et autres
Publié: (2025) -
Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble
par: Duan, Lin, et autres
Publié: (2025) -
User Prompting Strategies and Prompt Enhancement Methods for Open-Set Object Detection in XR Environments
par: Lin, Junfeng, et autres
Publié: (2026) -
Robustness of Vision Foundation Models to Common Perturbations
par: Liu, Hongbin, et autres
Publié: (2026)