Investigating Vulnerabilities and Defenses Against Audio-Visual Attacks: A Comprehensive Survey Emphasizing Multimodal Models
Fuente:
arXiv
Saved in:
| Main Authors: | Wen, Jinming, Wu, Xinyi, Zhao, Shuai, Jia, Yanhao, Li, Yuwen |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Medical MLLM is Vulnerable: Cross-Modality Jailbreak and Mismatched Attacks on Medical Multimodal Large Language Models
by: Huang, Xijie, et al.
Published: (2024)
by: Huang, Xijie, et al.
Published: (2024)
Structured Visual Narratives Undermine Safety Alignment in Multimodal Large Language Models
by: Tan, Rui Yang, et al.
Published: (2026)
by: Tan, Rui Yang, et al.
Published: (2026)
Watermarking Visual Concepts for Diffusion Models
by: Lei, Liangqi, et al.
Published: (2024)
by: Lei, Liangqi, et al.
Published: (2024)
Beyond Text: Multimodal Jailbreaking of Vision-Language and Audio Models through Perceptually Simple Transformations
by: Kumar, Divyanshu, et al.
Published: (2025)
by: Kumar, Divyanshu, et al.
Published: (2025)
PRISM-XR: Empowering Privacy-Aware XR Collaboration with Multimodal Large Language Models
by: Chen, Jiangong, et al.
Published: (2026)
by: Chen, Jiangong, et al.
Published: (2026)
ARGUS: Defending Against Multimodal Indirect Prompt Injection via Steering Instruction-Following Behavior
by: Lu, Weikai, et al.
Published: (2025)
by: Lu, Weikai, et al.
Published: (2025)
SyncGuard: Robust Audio Watermarking Capable of Countering Desynchronization Attacks
by: Gan, Zhenliang, et al.
Published: (2025)
by: Gan, Zhenliang, et al.
Published: (2025)
Multimodal Unlearnable Examples: Protecting Data against Multimodal Contrastive Learning
by: Liu, Xinwei, et al.
Published: (2024)
by: Liu, Xinwei, et al.
Published: (2024)
MaskAnyone Toolkit: Offering Strategies for Minimizing Privacy Risks and Maximizing Utility in Audio-Visual Data Archiving
by: Owoyele, Babajide Alamu, et al.
Published: (2024)
by: Owoyele, Babajide Alamu, et al.
Published: (2024)
The Synthetic Media Shift: Tracking the Rise, Virality, and Detectability of AI-Generated Multimodal Misinformation
by: Chrysidis, Zacharias, et al.
Published: (2026)
by: Chrysidis, Zacharias, et al.
Published: (2026)
Universal Vulnerabilities in Large Language Models: Backdoor Attacks for In-context Learning
by: Zhao, Shuai, et al.
Published: (2024)
by: Zhao, Shuai, et al.
Published: (2024)
Fast Audio Codec Identification Using Overlapping LCS
by: Jafari, Farzane
Published: (2025)
by: Jafari, Farzane
Published: (2025)
Optimization-Free Universal Watermark Forgery with Regenerative Diffusion Models
by: Zhu, Chaoyi, et al.
Published: (2025)
by: Zhu, Chaoyi, et al.
Published: (2025)
MaXsive: High-Capacity and Robust Training-Free Generative Image Watermarking in Diffusion Models
by: Mao, Po-Yuan, et al.
Published: (2025)
by: Mao, Po-Yuan, et al.
Published: (2025)
Digital Fingerprinting on Multimedia: A Survey
by: Chen, Wendi, et al.
Published: (2024)
by: Chen, Wendi, et al.
Published: (2024)
RoboKA: KAN Informed Multimodal Learning for RoboCall Surveillance System
by: Choudhury, Nitin, et al.
Published: (2026)
by: Choudhury, Nitin, et al.
Published: (2026)
Intelligent Carrier Allocation: A Cross-Modal Reasoning Framework for Adaptive Multimodal Steganography
by: Das, Abhirup, et al.
Published: (2025)
by: Das, Abhirup, et al.
Published: (2025)
Steganography Beyond Space-Time with Chain of Multimodal AI
by: Chang, Ching-Chun, et al.
Published: (2025)
by: Chang, Ching-Chun, et al.
Published: (2025)
An Undetectable Watermark for Generative Image Models
by: Gunn, Sam, et al.
Published: (2024)
by: Gunn, Sam, et al.
Published: (2024)
Steganography in Game Actions
by: Chang, Ching-Chun, et al.
Published: (2024)
by: Chang, Ching-Chun, et al.
Published: (2024)
VocalCrypt: Novel Active Defense Against Deepfake Voice Based on Masking Effect
by: Fei, Qingyuan, et al.
Published: (2025)
by: Fei, Qingyuan, et al.
Published: (2025)
P2P: A Poison-to-Poison Remedy for Reliable Backdoor Defense in LLMs
by: Zhao, Shuai, et al.
Published: (2025)
by: Zhao, Shuai, et al.
Published: (2025)
DeepfakeBench-MM: A Comprehensive Benchmark for Multimodal Deepfake Detection
by: Zhao, Kangran, et al.
Published: (2025)
by: Zhao, Kangran, et al.
Published: (2025)
A Multi-task Adversarial Attack Against Face Authentication
by: Wang, Hanrui, et al.
Published: (2024)
by: Wang, Hanrui, et al.
Published: (2024)
PRoADS: Provably Secure and Robust Audio Diffusion Steganography with latent optimization and backward Euler Inversion
by: Yan, YongPeng, et al.
Published: (2026)
by: Yan, YongPeng, et al.
Published: (2026)
Synthetic Voices, Real Threats: Evaluating Large Text-to-Speech Models in Generating Harmful Audio
by: Chen, Guangke, et al.
Published: (2025)
by: Chen, Guangke, et al.
Published: (2025)
Multichannel Steganography: A Provably Secure Hybrid Steganographic Model for Secure Communication
by: Omego, Obinna, et al.
Published: (2025)
by: Omego, Obinna, et al.
Published: (2025)
Chain-of-Jailbreak Attack for Image Generation Models via Editing Step by Step
by: Wang, Wenxuan, et al.
Published: (2024)
by: Wang, Wenxuan, et al.
Published: (2024)
Multimodal Reasoning with LLM for Encrypted Traffic Interpretation: A Benchmark
by: Zhang, Longgang, et al.
Published: (2026)
by: Zhang, Longgang, et al.
Published: (2026)
Privis: Towards Content-Aware Secure Volumetric Video Delivery
by: Hu, Kaiyuan, et al.
Published: (2025)
by: Hu, Kaiyuan, et al.
Published: (2025)
SyncGait: Robust Long-Distance Authentication for Drone Delivery via Implicit Gait Behaviors
by: Ling, Zijian, et al.
Published: (2025)
by: Ling, Zijian, et al.
Published: (2025)
SafeEar: Content Privacy-Preserving Audio Deepfake Detection
by: Li, Xinfeng, et al.
Published: (2024)
by: Li, Xinfeng, et al.
Published: (2024)
TimeWak: Temporal Chained-Hashing Watermark for Time Series Data
by: Soi, Zhi Wen, et al.
Published: (2025)
by: Soi, Zhi Wen, et al.
Published: (2025)
VA3: Virtually Assured Amplification Attack on Probabilistic Copyright Protection for Text-to-Image Generative Models
by: Li, Xiang, et al.
Published: (2023)
by: Li, Xiang, et al.
Published: (2023)
Defending Against Weight-Poisoning Backdoor Attacks for Parameter-Efficient Fine-Tuning
by: Zhao, Shuai, et al.
Published: (2024)
by: Zhao, Shuai, et al.
Published: (2024)
Rethinking Reasoning: A Survey on Reasoning-based Backdoors in LLMs
by: Hu, Man, et al.
Published: (2025)
by: Hu, Man, et al.
Published: (2025)
Adaptive Prototype Knowledge Transfer for Federated Learning with Mixed Modalities and Heterogeneous Tasks
by: Gai, Keke, et al.
Published: (2025)
by: Gai, Keke, et al.
Published: (2025)
SEA: Low-Resource Safety Alignment for Multimodal Large Language Models via Synthetic Embeddings
by: Lu, Weikai, et al.
Published: (2025)
by: Lu, Weikai, et al.
Published: (2025)
A Survey of Recent Backdoor Attacks and Defenses in Large Language Models
by: Zhao, Shuai, et al.
Published: (2024)
by: Zhao, Shuai, et al.
Published: (2024)
Arondight: Red Teaming Large Vision Language Models with Auto-generated Multi-modal Jailbreak Prompts
by: Liu, Yi, et al.
Published: (2024)
by: Liu, Yi, et al.
Published: (2024)
Similar Items
-
Medical MLLM is Vulnerable: Cross-Modality Jailbreak and Mismatched Attacks on Medical Multimodal Large Language Models
by: Huang, Xijie, et al.
Published: (2024) -
Structured Visual Narratives Undermine Safety Alignment in Multimodal Large Language Models
by: Tan, Rui Yang, et al.
Published: (2026) -
Watermarking Visual Concepts for Diffusion Models
by: Lei, Liangqi, et al.
Published: (2024) -
Beyond Text: Multimodal Jailbreaking of Vision-Language and Audio Models through Perceptually Simple Transformations
by: Kumar, Divyanshu, et al.
Published: (2025) -
PRISM-XR: Empowering Privacy-Aware XR Collaboration with Multimodal Large Language Models
by: Chen, Jiangong, et al.
Published: (2026)