TAIJI: Textual Anchoring for Immunizing Jailbreak Images in Vision Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Yin, Xiangyu, Qi, Yi, Hu, Jinwei, Chen, Zhen, Dong, Yi, Zhao, Xingyu, Huang, Xiaowei, Ruan, Wenjie |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
CeTAD: Towards Certified Toxicity-Aware Distance in Vision Language Models
por: Yin, Xiangyu, et al.
Publicado: (2025)
por: Yin, Xiangyu, et al.
Publicado: (2025)
Fragile by Design: On the Limits of Adversarial Defenses in Personalized Generation
por: Chen, Zhen, et al.
Publicado: (2025)
por: Chen, Zhen, et al.
Publicado: (2025)
ProTIP: Probabilistic Robustness Verification on Text-to-Image Diffusion Models against Stochastic Perturbation
por: Zhang, Yi, et al.
Publicado: (2024)
por: Zhang, Yi, et al.
Publicado: (2024)
GPO-V: Jailbreak Diffusion Vision Language Model by Global Probability Optimization
por: Pan, Yu, et al.
Publicado: (2026)
por: Pan, Yu, et al.
Publicado: (2026)
Boosting Adversarial Training via Fisher-Rao Norm-based Regularization
por: Yin, Xiangyu, et al.
Publicado: (2024)
por: Yin, Xiangyu, et al.
Publicado: (2024)
Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models
por: Wu, Sihao, et al.
Publicado: (2025)
por: Wu, Sihao, et al.
Publicado: (2025)
FALCON: Fine-grained Activation Manipulation by Contrastive Orthogonal Unalignment for Large Language Model
por: Hu, Jinwei, et al.
Publicado: (2025)
por: Hu, Jinwei, et al.
Publicado: (2025)
ImgTrojan: Jailbreaking Vision-Language Models with ONE Image
por: Tao, Xijia, et al.
Publicado: (2024)
por: Tao, Xijia, et al.
Publicado: (2024)
A Black-Box Evaluation Framework for Semantic Robustness in Bird's Eye View Detection
por: Wang, Fu, et al.
Publicado: (2024)
por: Wang, Fu, et al.
Publicado: (2024)
SIDA: Social Media Image Deepfake Detection, Localization and Explanation with Large Multimodal Model
por: Huang, Zhenglin, et al.
Publicado: (2024)
por: Huang, Zhenglin, et al.
Publicado: (2024)
Principled Steering via Null-space Projection for Jailbreak Defense in Vision-Language Models
por: Zhu, Xingyu, et al.
Publicado: (2026)
por: Zhu, Xingyu, et al.
Publicado: (2026)
Building Guardrails for Large Language Models
por: Dong, Yi, et al.
Publicado: (2024)
por: Dong, Yi, et al.
Publicado: (2024)
Spatial-DISE: A Unified Benchmark for Evaluating Spatial Reasoning in Vision-Language Models
por: Huang, Xinmiao, et al.
Publicado: (2025)
por: Huang, Xinmiao, et al.
Publicado: (2025)
Cross-Modal Obfuscation for Jailbreak Attacks on Large Vision-Language Models
por: Jiang, Lei, et al.
Publicado: (2025)
por: Jiang, Lei, et al.
Publicado: (2025)
Risk Controlled Image Retrieval
por: Cai, Kaiwen, et al.
Publicado: (2023)
por: Cai, Kaiwen, et al.
Publicado: (2023)
Contrastive Language-Image Learning with Augmented Textual Prompts for 3D/4D FER Using Vision-Language Model
por: Behzad, Muzammil, et al.
Publicado: (2025)
por: Behzad, Muzammil, et al.
Publicado: (2025)
PRBench: A Standardized Probabilistic Robustness Benchmark
por: Zhang, Yi, et al.
Publicado: (2025)
por: Zhang, Yi, et al.
Publicado: (2025)
Proxy Robustness in Vision Language Models is Effortlessly Transferable
por: Fu, Xiaowei, et al.
Publicado: (2026)
por: Fu, Xiaowei, et al.
Publicado: (2026)
Advancing Textual Prompt Learning with Anchored Attributes
por: Li, Zheng, et al.
Publicado: (2024)
por: Li, Zheng, et al.
Publicado: (2024)
Exploring Textual Semantics Diversity for Image Transmission in Semantic Communication Systems using Visual Language Model
por: Huang, Peishan, et al.
Publicado: (2025)
por: Huang, Peishan, et al.
Publicado: (2025)
JaiLIP: Jailbreaking Vision-Language Models via Loss Guided Image Perturbation
por: Mia, Md Jueal, et al.
Publicado: (2025)
por: Mia, Md Jueal, et al.
Publicado: (2025)
Immuno-VLM: Immunizing Large Vision-Language Models via Generative Semantic Antibodies for Open-World Trustworthiness
por: Fang, Xiang, et al.
Publicado: (2026)
por: Fang, Xiang, et al.
Publicado: (2026)
Towards Real-World Adverse Weather Image Restoration: Enhancing Clearness and Semantics with Vision-Language Models
por: Xu, Jiaqi, et al.
Publicado: (2024)
por: Xu, Jiaqi, et al.
Publicado: (2024)
Vision-DeepResearch Benchmark: Rethinking Visual and Textual Search for Multimodal Large Language Models
por: Zeng, Yu, et al.
Publicado: (2026)
por: Zeng, Yu, et al.
Publicado: (2026)
Towards Fairness-Aware Adversarial Learning
por: Zhang, Yanghao, et al.
Publicado: (2024)
por: Zhang, Yanghao, et al.
Publicado: (2024)
JailbreakZoo: Survey, Landscapes, and Horizons in Jailbreaking Large Language and Vision-Language Models
por: Jin, Haibo, et al.
Publicado: (2024)
por: Jin, Haibo, et al.
Publicado: (2024)
Towards Long-window Anchoring in Vision-Language Model Distillation
por: Zhou, Haoyi, et al.
Publicado: (2025)
por: Zhou, Haoyi, et al.
Publicado: (2025)
ImageRef-VL: Enabling Contextual Image Referencing in Vision-Language Models
por: Yi, Jingwei, et al.
Publicado: (2025)
por: Yi, Jingwei, et al.
Publicado: (2025)
Enhancing Vision-Language Tracking by Effectively Converting Textual Cues into Visual Cues
por: Feng, X., et al.
Publicado: (2024)
por: Feng, X., et al.
Publicado: (2024)
Jailbreaks on Vision Language Model via Multimodal Reasoning
por: Noheria, Aarush, et al.
Publicado: (2026)
por: Noheria, Aarush, et al.
Publicado: (2026)
Text is All You Need for Vision-Language Model Jailbreaking
por: Chen, Yihang, et al.
Publicado: (2026)
por: Chen, Yihang, et al.
Publicado: (2026)
Omniview-Tuning: Boosting Viewpoint Invariance of Vision-Language Pre-training Models
por: Ruan, Shouwei, et al.
Publicado: (2024)
por: Ruan, Shouwei, et al.
Publicado: (2024)
Immunizing Images from Text to Image Editing via Adversarial Cross-Attention
por: Trippodo, Matteo, et al.
Publicado: (2025)
por: Trippodo, Matteo, et al.
Publicado: (2025)
ViTCoP: Accelerating Large Vision-Language Models via Visual and Textual Semantic Collaborative Pruning
por: Luo, Wen, et al.
Publicado: (2026)
por: Luo, Wen, et al.
Publicado: (2026)
Vision Foundation Models as Generalist Tokenizers for Image Generation
por: Zheng, Anlin, et al.
Publicado: (2026)
por: Zheng, Anlin, et al.
Publicado: (2026)
Jailbreak Large Vision-Language Models Through Multi-Modal Linkage
por: Wang, Yu, et al.
Publicado: (2024)
por: Wang, Yu, et al.
Publicado: (2024)
JailBound: Jailbreaking Internal Safety Boundaries of Vision-Language Models
por: Song, Jiaxin, et al.
Publicado: (2025)
por: Song, Jiaxin, et al.
Publicado: (2025)
Trust-Oriented Adaptive Guardrails for Large Language Models
por: Hu, Jinwei, et al.
Publicado: (2024)
por: Hu, Jinwei, et al.
Publicado: (2024)
Toward Universal and Transferable Jailbreak Attacks on Vision-Language Models
por: Cui, Kaiyuan, et al.
Publicado: (2026)
por: Cui, Kaiyuan, et al.
Publicado: (2026)
Exploring Visual Vulnerabilities via Multi-Loss Adversarial Search for Jailbreaking Vision-Language Models
por: Hao, Shuyang, et al.
Publicado: (2024)
por: Hao, Shuyang, et al.
Publicado: (2024)
Ejemplares similares
-
CeTAD: Towards Certified Toxicity-Aware Distance in Vision Language Models
por: Yin, Xiangyu, et al.
Publicado: (2025) -
Fragile by Design: On the Limits of Adversarial Defenses in Personalized Generation
por: Chen, Zhen, et al.
Publicado: (2025) -
ProTIP: Probabilistic Robustness Verification on Text-to-Image Diffusion Models against Stochastic Perturbation
por: Zhang, Yi, et al.
Publicado: (2024) -
GPO-V: Jailbreak Diffusion Vision Language Model by Global Probability Optimization
por: Pan, Yu, et al.
Publicado: (2026) -
Boosting Adversarial Training via Fisher-Rao Norm-based Regularization
por: Yin, Xiangyu, et al.
Publicado: (2024)