Rethinking Bottlenecks in Safety Fine-Tuning of Vision Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Ding, Yi, Li, Lijun, Cao, Bing, Shao, Jing |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Visual Contextual Attack: Jailbreaking MLLMs with Image-Driven Context Injection
por: Miao, Ziqi, et al.
Publicado: (2025)
por: Miao, Ziqi, et al.
Publicado: (2025)
Self-adaptive Dataset Construction for Real-World Multimodal Safety Scenarios
por: Qu, Jingen, et al.
Publicado: (2025)
por: Qu, Jingen, et al.
Publicado: (2025)
Contextual Image Attack: How Visual Context Exposes Multimodal Safety Vulnerabilities
por: Xiong, Yuan, et al.
Publicado: (2025)
por: Xiong, Yuan, et al.
Publicado: (2025)
Image-Based Geolocation Using Large Vision-Language Models
por: Liu, Yi, et al.
Publicado: (2024)
por: Liu, Yi, et al.
Publicado: (2024)
Lazy Layers to Make Fine-Tuned Diffusion Models More Traceable
por: Liu, Haozhe, et al.
Publicado: (2024)
por: Liu, Haozhe, et al.
Publicado: (2024)
To See is Not to Learn: Protecting Multimodal Data from Unauthorized Fine-Tuning of Large Vision-Language Model
por: Zhao, Chengshuai, et al.
Publicado: (2026)
por: Zhao, Chengshuai, et al.
Publicado: (2026)
VLSBench: Unveiling Visual Leakage in Multimodal Safety
por: Hu, Xuhao, et al.
Publicado: (2024)
por: Hu, Xuhao, et al.
Publicado: (2024)
Recovering the Pre-Fine-Tuning Weights of Generative Models
por: Horwitz, Eliahu, et al.
Publicado: (2024)
por: Horwitz, Eliahu, et al.
Publicado: (2024)
Are Vision-Language Models Safe in the Wild? A Meme-Based Benchmark Study
por: Lee, DongGeon, et al.
Publicado: (2025)
por: Lee, DongGeon, et al.
Publicado: (2025)
Effective and Efficient Adversarial Detection for Vision-Language Models via A Single Vector
por: Huang, Youcheng, et al.
Publicado: (2024)
por: Huang, Youcheng, et al.
Publicado: (2024)
Evolving Contextual Safety in Multi-Modal Large Language Models via Inference-Time Self-Reflective Memory
por: Zhang, Ce, et al.
Publicado: (2026)
por: Zhang, Ce, et al.
Publicado: (2026)
DAVSP: Safety Alignment for Large Vision-Language Models via Deep Aligned Visual Safety Prompt
por: Zhang, Yitong, et al.
Publicado: (2025)
por: Zhang, Yitong, et al.
Publicado: (2025)
Doubly-Universal Adversarial Perturbations: Deceiving Vision-Language Models Across Both Images and Text with a Single Perturbation
por: Kim, Hee-Seon, et al.
Publicado: (2024)
por: Kim, Hee-Seon, et al.
Publicado: (2024)
PII-VisBench: Evaluating Personally Identifiable Information Safety in Vision Language Models Along a Continuum of Visibility
por: Shahariar, G M, et al.
Publicado: (2026)
por: Shahariar, G M, et al.
Publicado: (2026)
DeepSight: An All-in-One LM Safety Toolkit
por: Zhang, Bo, et al.
Publicado: (2026)
por: Zhang, Bo, et al.
Publicado: (2026)
R-TPT: Improving Adversarial Robustness of Vision-Language Models through Test-Time Prompt Tuning
por: Sheng, Lijun, et al.
Publicado: (2025)
por: Sheng, Lijun, et al.
Publicado: (2025)
The Safety Reminder: A Soft Prompt to Reactivate Delayed Safety Awareness in Vision-Language Models
por: Tang, Peiyuan, et al.
Publicado: (2025)
por: Tang, Peiyuan, et al.
Publicado: (2025)
A Survey of Safety on Large Vision-Language Models: Attacks, Defenses and Evaluations
por: Ye, Mang, et al.
Publicado: (2025)
por: Ye, Mang, et al.
Publicado: (2025)
JailbreakZoo: Survey, Landscapes, and Horizons in Jailbreaking Large Language and Vision-Language Models
por: Jin, Haibo, et al.
Publicado: (2024)
por: Jin, Haibo, et al.
Publicado: (2024)
Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety
por: Ma, Xingjun, et al.
Publicado: (2025)
por: Ma, Xingjun, et al.
Publicado: (2025)
MLLM-Protector: Ensuring MLLM's Safety without Hurting Performance
por: Pi, Renjie, et al.
Publicado: (2024)
por: Pi, Renjie, et al.
Publicado: (2024)
Rethinking Machine Unlearning in Image Generation Models
por: Liu, Renyang, et al.
Publicado: (2025)
por: Liu, Renyang, et al.
Publicado: (2025)
X-Boundary: Establishing Exact Safety Boundary to Shield LLMs from Multi-Turn Jailbreaks without Compromising Usability
por: Lu, Xiaoya, et al.
Publicado: (2025)
por: Lu, Xiaoya, et al.
Publicado: (2025)
Few-Shot Adversarial Prompt Learning on Vision-Language Models
por: Zhou, Yiwei, et al.
Publicado: (2024)
por: Zhou, Yiwei, et al.
Publicado: (2024)
Are GUI Agents Focused Enough? Automated Distraction via Semantic-level UI Element Injection
por: Yang, Wenkui, et al.
Publicado: (2026)
por: Yang, Wenkui, et al.
Publicado: (2026)
VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models
por: Liao, Qilin, et al.
Publicado: (2025)
por: Liao, Qilin, et al.
Publicado: (2025)
CAT: Concept-level backdoor ATtacks for Concept Bottleneck Models
por: Lai, Songning, et al.
Publicado: (2024)
por: Lai, Songning, et al.
Publicado: (2024)
Jailbreaking Safeguarded Text-to-Image Models via Large Language Models
por: Jiang, Zhengyuan, et al.
Publicado: (2025)
por: Jiang, Zhengyuan, et al.
Publicado: (2025)
Spot Risks Before Speaking! Unraveling Safety Attention Heads in Large Vision-Language Models
por: Zheng, Ziwei, et al.
Publicado: (2025)
por: Zheng, Ziwei, et al.
Publicado: (2025)
Revisiting Data Auditing in Large Vision-Language Models
por: Zhu, Hongyu, et al.
Publicado: (2025)
por: Zhu, Hongyu, et al.
Publicado: (2025)
Backdoor Mitigation in Object Detection via Adversarial Fine-Tuning
por: Dunnett, Kealan, et al.
Publicado: (2026)
por: Dunnett, Kealan, et al.
Publicado: (2026)
Differentially Private Bias-Term Fine-tuning of Foundation Models
por: Bu, Zhiqi, et al.
Publicado: (2022)
por: Bu, Zhiqi, et al.
Publicado: (2022)
Differentially Private Fine-Tuning of Diffusion Models
por: Tsai, Yu-Lin, et al.
Publicado: (2024)
por: Tsai, Yu-Lin, et al.
Publicado: (2024)
Responsible Diffusion: A Comprehensive Survey on Safety, Ethics, and Trust in Diffusion Models
por: Wei, Kang, et al.
Publicado: (2025)
por: Wei, Kang, et al.
Publicado: (2025)
Rethinking Robust Adversarial Concept Erasure in Diffusion Models
por: Yin, Qinghong, et al.
Publicado: (2025)
por: Yin, Qinghong, et al.
Publicado: (2025)
Guarding the Gate: ConceptGuard Battles Concept-Level Backdoors in Concept Bottleneck Models
por: Lai, Songning, et al.
Publicado: (2024)
por: Lai, Songning, et al.
Publicado: (2024)
Membership Inference Attacks against Large Vision-Language Models
por: Li, Zhan, et al.
Publicado: (2024)
por: Li, Zhan, et al.
Publicado: (2024)
Inducing High Energy-Latency of Large Vision-Language Models with Verbose Images
por: Gao, Kuofeng, et al.
Publicado: (2024)
por: Gao, Kuofeng, et al.
Publicado: (2024)
MultiPriv: Benchmarking Individual-Level Privacy Reasoning in Vision-Language Models
por: Sun, Xiongtao, et al.
Publicado: (2025)
por: Sun, Xiongtao, et al.
Publicado: (2025)
IAG: Input-aware Backdoor Attack on VLM-based Visual Grounding
por: Li, Junxian, et al.
Publicado: (2025)
por: Li, Junxian, et al.
Publicado: (2025)
Ejemplares similares
-
Visual Contextual Attack: Jailbreaking MLLMs with Image-Driven Context Injection
por: Miao, Ziqi, et al.
Publicado: (2025) -
Self-adaptive Dataset Construction for Real-World Multimodal Safety Scenarios
por: Qu, Jingen, et al.
Publicado: (2025) -
Contextual Image Attack: How Visual Context Exposes Multimodal Safety Vulnerabilities
por: Xiong, Yuan, et al.
Publicado: (2025) -
Image-Based Geolocation Using Large Vision-Language Models
por: Liu, Yi, et al.
Publicado: (2024) -
Lazy Layers to Make Fine-Tuned Diffusion Models More Traceable
por: Liu, Haozhe, et al.
Publicado: (2024)