CapRecover: A Cross-Modality Feature Inversion Attack Framework on Vision Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Xiu, Kedong, Zhang, Sai Qian |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Beyond Cross-Modal Alignment: Measuring and Leveraging Modality Gap in Vision-Language Models
di: Yan, Hanqi, et al.
Pubblicazione: (2025)
di: Yan, Hanqi, et al.
Pubblicazione: (2025)
GLIMPSE: Holistic Cross-Modal Explainability for Large Vision-Language Models
di: Shen, Guanxi
Pubblicazione: (2025)
di: Shen, Guanxi
Pubblicazione: (2025)
Cross-Modal Adapter for Vision-Language Retrieval
di: Jiang, Haojun, et al.
Pubblicazione: (2022)
di: Jiang, Haojun, et al.
Pubblicazione: (2022)
Interpreting and Enhancing Emotional Circuits in Large Vision-Language Models via Cross-Modal Information Flow
di: Zhang, Chengsheng, et al.
Pubblicazione: (2026)
di: Zhang, Chengsheng, et al.
Pubblicazione: (2026)
Cross-Modal Attention Analysis and Optimization in Vision-Language Models: A Study on Visual Reliability
di: Zhou, Lijie
Pubblicazione: (2026)
di: Zhou, Lijie
Pubblicazione: (2026)
BiomedAP: A Vision-Informed Dual-Anchor Framework with Gated Cross-Modal Fusion for Robust Medical Vision-Language Adaptation
di: Tong, Huanyang, et al.
Pubblicazione: (2026)
di: Tong, Huanyang, et al.
Pubblicazione: (2026)
Align-KD: Distilling Cross-Modal Alignment Knowledge for Mobile Vision-Language Model
di: Feng, Qianhan, et al.
Pubblicazione: (2024)
di: Feng, Qianhan, et al.
Pubblicazione: (2024)
Cross-Modal Safety Mechanism Transfer in Large Vision-Language Models
di: Xu, Shicheng, et al.
Pubblicazione: (2024)
di: Xu, Shicheng, et al.
Pubblicazione: (2024)
Distilling Cross-Modal Knowledge via Feature Disentanglement
di: Liu, Junhong, et al.
Pubblicazione: (2025)
di: Liu, Junhong, et al.
Pubblicazione: (2025)
Feedback-based Modal Mutual Search for Attacking Vision-Language Pre-training Models
di: Ding, Renhua, et al.
Pubblicazione: (2024)
di: Ding, Renhua, et al.
Pubblicazione: (2024)
Model Inversion Attack Against Deep Hashing
di: Zhao, Dongdong, et al.
Pubblicazione: (2025)
di: Zhao, Dongdong, et al.
Pubblicazione: (2025)
GeoVLMath: Enhancing Geometry Reasoning in Vision-Language Models via Cross-Modal Reward for Auxiliary Line Creation
di: Guo, Shasha, et al.
Pubblicazione: (2025)
di: Guo, Shasha, et al.
Pubblicazione: (2025)
VEQ: Modality-Adaptive Quantization for MoE Vision-Language Models
di: Qin, Guangshuo, et al.
Pubblicazione: (2026)
di: Qin, Guangshuo, et al.
Pubblicazione: (2026)
Robust Vision-Language Models via Tensor Decomposition: A Defense Against Adversarial Attacks
di: Patel, Het, et al.
Pubblicazione: (2025)
di: Patel, Het, et al.
Pubblicazione: (2025)
Physical Prompt Injection Attacks on Large Vision-Language Models
di: Ling, Chen, et al.
Pubblicazione: (2026)
di: Ling, Chen, et al.
Pubblicazione: (2026)
Breaking Modality Heterogeneity in Low-Bit Quantization for Large Vision-Language Models
di: Zhong, Yi, et al.
Pubblicazione: (2026)
di: Zhong, Yi, et al.
Pubblicazione: (2026)
QAVA: Query-Agnostic Visual Attack to Large Vision-Language Models
di: Zhang, Yudong, et al.
Pubblicazione: (2025)
di: Zhang, Yudong, et al.
Pubblicazione: (2025)
Natural Reflection Backdoor Attack on Vision Language Model for Autonomous Driving
di: Liu, Ming, et al.
Pubblicazione: (2025)
di: Liu, Ming, et al.
Pubblicazione: (2025)
Biomed-DPT: Dual Modality Prompt Tuning for Biomedical Vision-Language Models
di: Peng, Wei, et al.
Pubblicazione: (2025)
di: Peng, Wei, et al.
Pubblicazione: (2025)
BalCapRL: A Balanced Framework for RL-Based MLLM Image Captioning
di: Ye, Shaokai, et al.
Pubblicazione: (2026)
di: Ye, Shaokai, et al.
Pubblicazione: (2026)
Black-Box Adversarial Attack on Vision Language Models for Autonomous Driving
di: Wang, Lu, et al.
Pubblicazione: (2025)
di: Wang, Lu, et al.
Pubblicazione: (2025)
Cross-Modal Transferable Image-to-Video Attack on Video Quality Metrics
di: Gotin, Georgii, et al.
Pubblicazione: (2025)
di: Gotin, Georgii, et al.
Pubblicazione: (2025)
Freeze and Reveal: Exposing Modality Bias in Vision-Language Models
di: Kavuri, Vivek Hruday, et al.
Pubblicazione: (2025)
di: Kavuri, Vivek Hruday, et al.
Pubblicazione: (2025)
MBQ: Modality-Balanced Quantization for Large Vision-Language Models
di: Li, Shiyao, et al.
Pubblicazione: (2024)
di: Li, Shiyao, et al.
Pubblicazione: (2024)
CRFT: Consistent-Recurrent Feature Flow Transformer for Cross-Modal Image Registration
di: Liu, Xuecong, et al.
Pubblicazione: (2026)
di: Liu, Xuecong, et al.
Pubblicazione: (2026)
Unifying Visual and Semantic Feature Spaces with Diffusion Models for Enhanced Cross-Modal Alignment
di: Zheng, Yuze, et al.
Pubblicazione: (2024)
di: Zheng, Yuze, et al.
Pubblicazione: (2024)
When Alignment Fails: Multimodal Adversarial Attacks on Vision-Language-Action Models
di: Yan, Yuping, et al.
Pubblicazione: (2025)
di: Yan, Yuping, et al.
Pubblicazione: (2025)
A Unified Debiasing Approach for Vision-Language Models across Modalities and Tasks
di: Jung, Hoin, et al.
Pubblicazione: (2024)
di: Jung, Hoin, et al.
Pubblicazione: (2024)
A Parameter-Efficient Mixture-of-Experts Framework for Cross-Modal Geo-Localization
di: Li, LinFeng, et al.
Pubblicazione: (2025)
di: Li, LinFeng, et al.
Pubblicazione: (2025)
Attention-Guided Patch-Wise Sparse Adversarial Attacks on Vision-Language-Action Models
di: Zhang, Naifu, et al.
Pubblicazione: (2025)
di: Zhang, Naifu, et al.
Pubblicazione: (2025)
Efficient and Comprehensive Feature Extraction in Large Vision-Language Model for Pathology Analysis
di: Zhang, Shengxuming, et al.
Pubblicazione: (2024)
di: Zhang, Shengxuming, et al.
Pubblicazione: (2024)
SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models
di: Tang, Zhenwei, et al.
Pubblicazione: (2025)
di: Tang, Zhenwei, et al.
Pubblicazione: (2025)
MM-MoralBench: A MultiModal Moral Evaluation Benchmark for Large Vision-Language Models
di: Yan, Bei, et al.
Pubblicazione: (2024)
di: Yan, Bei, et al.
Pubblicazione: (2024)
Single-Sample Black-Box Membership Inference Attack against Vision-Language Models via Cross-modal Semantic Alignment
di: Li, Jiaqing, et al.
Pubblicazione: (2026)
di: Li, Jiaqing, et al.
Pubblicazione: (2026)
SwiftVLM: Efficient Vision-Language Model Inference via Cross-Layer Token Bypass
di: Qian, Chen, et al.
Pubblicazione: (2026)
di: Qian, Chen, et al.
Pubblicazione: (2026)
SpaceMind: Camera-Guided Modality Fusion for Spatial Reasoning in Vision-Language Models
di: Zhao, Ruosen, et al.
Pubblicazione: (2025)
di: Zhao, Ruosen, et al.
Pubblicazione: (2025)
Learning to Detect Unknown Jailbreak Attacks in Large Vision-Language Models
di: Liang, Shuang, et al.
Pubblicazione: (2025)
di: Liang, Shuang, et al.
Pubblicazione: (2025)
MoKus: Leveraging Cross-Modal Knowledge Transfer for Knowledge-Aware Concept Customization
di: Zhu, Chenyang, et al.
Pubblicazione: (2026)
di: Zhu, Chenyang, et al.
Pubblicazione: (2026)
Probing the Robustness of Vision-Language Pretrained Models: A Multimodal Adversarial Attack Approach
di: Guan, Jiwei, et al.
Pubblicazione: (2024)
di: Guan, Jiwei, et al.
Pubblicazione: (2024)
ChatGPT Encounters Morphing Attack Detection: Zero-Shot MAD with Multi-Modal Large Language Models and General Vision Models
di: Zhang, Haoyu, et al.
Pubblicazione: (2025)
di: Zhang, Haoyu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Beyond Cross-Modal Alignment: Measuring and Leveraging Modality Gap in Vision-Language Models
di: Yan, Hanqi, et al.
Pubblicazione: (2025) -
GLIMPSE: Holistic Cross-Modal Explainability for Large Vision-Language Models
di: Shen, Guanxi
Pubblicazione: (2025) -
Cross-Modal Adapter for Vision-Language Retrieval
di: Jiang, Haojun, et al.
Pubblicazione: (2022) -
Interpreting and Enhancing Emotional Circuits in Large Vision-Language Models via Cross-Modal Information Flow
di: Zhang, Chengsheng, et al.
Pubblicazione: (2026) -
Cross-Modal Attention Analysis and Optimization in Vision-Language Models: A Study on Visual Reliability
di: Zhou, Lijie
Pubblicazione: (2026)