Adversary-Aware DPO: Enhancing Safety Alignment in Vision Language Models via Adversarial Training
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Weng, Fenghua, Lou, Jian, Feng, Jun, Huang, Minlie, Wang, Wenjie |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
DELMAN: Dynamic Defense Against Large Language Model Jailbreaking with Model Editing
von: Wang, Yi, et al.
Veröffentlicht: (2025)
von: Wang, Yi, et al.
Veröffentlicht: (2025)
$\textit{MMJ-Bench}$: A Comprehensive Study on Jailbreak Attacks and Defenses for Multimodal Large Language Models
von: Weng, Fenghua, et al.
Veröffentlicht: (2024)
von: Weng, Fenghua, et al.
Veröffentlicht: (2024)
Tit-for-Tat: Safeguarding Large Vision-Language Models Against Jailbreak Attacks via Adversarial Defense
von: Hao, Shuyang, et al.
Veröffentlicht: (2025)
von: Hao, Shuyang, et al.
Veröffentlicht: (2025)
LocalAlign: Enabling Generalizable Prompt Injection Defense via Generation of Near-Target Adversarial Examples for Alignment Training
von: Gong, Yuyang, et al.
Veröffentlicht: (2026)
von: Gong, Yuyang, et al.
Veröffentlicht: (2026)
FPT-Noise: Dynamic Scene-Aware Counterattack for Test-Time Adversarial Defense in Vision-Language Models
von: Deng, Jia, et al.
Veröffentlicht: (2025)
von: Deng, Jia, et al.
Veröffentlicht: (2025)
Enhancing Adversarial Transferability with Adversarial Weight Tuning
von: Chen, Jiahao, et al.
Veröffentlicht: (2024)
von: Chen, Jiahao, et al.
Veröffentlicht: (2024)
Quantization Aware Attack: Enhancing Transferable Adversarial Attacks by Model Quantization
von: Yang, Yulong, et al.
Veröffentlicht: (2023)
von: Yang, Yulong, et al.
Veröffentlicht: (2023)
Vulnerability-Aware Robust Multimodal Adversarial Training
von: Zhang, Junrui, et al.
Veröffentlicht: (2025)
von: Zhang, Junrui, et al.
Veröffentlicht: (2025)
PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training
von: Du, Pengfei
Veröffentlicht: (2025)
von: Du, Pengfei
Veröffentlicht: (2025)
Enhancing Adversarial Attacks via Parameter Adaptive Adversarial Attack
von: Jin, Zhibo, et al.
Veröffentlicht: (2024)
von: Jin, Zhibo, et al.
Veröffentlicht: (2024)
Adversarial Attack-Defense Co-Evolution for LLM Safety Alignment via Tree-Group Dual-Aware Search and Optimization
von: Li, Xurui, et al.
Veröffentlicht: (2025)
von: Li, Xurui, et al.
Veröffentlicht: (2025)
EVA: Editing for Versatile Alignment against Jailbreaks
von: Wang, Yi, et al.
Veröffentlicht: (2026)
von: Wang, Yi, et al.
Veröffentlicht: (2026)
Adversarial attacks against Modern Vision-Language Models
von: La Torre, Alejandro Paredes
Veröffentlicht: (2026)
von: La Torre, Alejandro Paredes
Veröffentlicht: (2026)
Transferable Backdoor Attacks for Code Models via Sharpness-Aware Adversarial Perturbation
von: Chang, Shuyu, et al.
Veröffentlicht: (2026)
von: Chang, Shuyu, et al.
Veröffentlicht: (2026)
Medical Multimodal Model Stealing Attacks via Adversarial Domain Alignment
von: Shen, Yaling, et al.
Veröffentlicht: (2025)
von: Shen, Yaling, et al.
Veröffentlicht: (2025)
How to Enhance Downstream Adversarial Robustness (almost) without Touching the Pre-Trained Foundation Model?
von: Liu, Meiqi, et al.
Veröffentlicht: (2025)
von: Liu, Meiqi, et al.
Veröffentlicht: (2025)
Dynamic Dual-level Defense Routing for Continual Adversarial Training
von: Wang, Wenxuan, et al.
Veröffentlicht: (2025)
von: Wang, Wenxuan, et al.
Veröffentlicht: (2025)
Co-Evolutionary Multi-Modal Alignment via Structured Adversarial Evolution
von: Shi, Guoxin, et al.
Veröffentlicht: (2026)
von: Shi, Guoxin, et al.
Veröffentlicht: (2026)
NCCR: to Evaluate the Robustness of Neural Networks and Adversarial Examples
von: Pu, Shi, et al.
Veröffentlicht: (2025)
von: Pu, Shi, et al.
Veröffentlicht: (2025)
Jailbreak Vision Language Models via Bi-Modal Adversarial Prompt
von: Ying, Zonghao, et al.
Veröffentlicht: (2024)
von: Ying, Zonghao, et al.
Veröffentlicht: (2024)
Boosting Adversarial Transferability with Spatial Adversarial Alignment
von: Chen, Zhaoyu, et al.
Veröffentlicht: (2025)
von: Chen, Zhaoyu, et al.
Veröffentlicht: (2025)
Large Language Model Adversarial Landscape Through the Lens of Attack Objectives
von: Wang, Nan, et al.
Veröffentlicht: (2025)
von: Wang, Nan, et al.
Veröffentlicht: (2025)
Steering Beyond the Support: Adversarial Training on Unsupervised Jailbroken Activation Simulation
von: Chen, Luoyu, et al.
Veröffentlicht: (2026)
von: Chen, Luoyu, et al.
Veröffentlicht: (2026)
DUMB and DUMBer: Is Adversarial Training Worth It in the Real World?
von: Marchiori, Francesco, et al.
Veröffentlicht: (2025)
von: Marchiori, Francesco, et al.
Veröffentlicht: (2025)
BEEAR: Embedding-based Adversarial Removal of Safety Backdoors in Instruction-tuned Language Models
von: Zeng, Yi, et al.
Veröffentlicht: (2024)
von: Zeng, Yi, et al.
Veröffentlicht: (2024)
DualTAP: A Dual-Task Adversarial Protector for Mobile MLLM Agents
von: Zhang, Fuyao, et al.
Veröffentlicht: (2025)
von: Zhang, Fuyao, et al.
Veröffentlicht: (2025)
SwitchPatch: Physical Adversarial Attack Strategy with Switchable Adversarial Objectives
von: Jiang, Hanrui, et al.
Veröffentlicht: (2025)
von: Jiang, Hanrui, et al.
Veröffentlicht: (2025)
Information Theoretic Adversarial Training of Large Language Models
von: Zhang, Yiwei, et al.
Veröffentlicht: (2026)
von: Zhang, Yiwei, et al.
Veröffentlicht: (2026)
Adversarially Robust Assembly Language Model for Packed Executables Detection
von: Li, Shijia, et al.
Veröffentlicht: (2025)
von: Li, Shijia, et al.
Veröffentlicht: (2025)
VLATTACK: Multimodal Adversarial Attacks on Vision-Language Tasks via Pre-trained Models
von: Yin, Ziyi, et al.
Veröffentlicht: (2023)
von: Yin, Ziyi, et al.
Veröffentlicht: (2023)
Towards Understanding and Enhancing Security of Proof-of-Training for DNN Model Ownership Verification
von: Chang, Yijia, et al.
Veröffentlicht: (2024)
von: Chang, Yijia, et al.
Veröffentlicht: (2024)
Generalization Properties of Adversarial Training for $\ell_0$-Bounded Adversarial Attacks
von: Delgosha, Payam, et al.
Veröffentlicht: (2024)
von: Delgosha, Payam, et al.
Veröffentlicht: (2024)
Persona-Conditioned Adversarial Prompting (PCAP): Multi-Identity Red-Teaming for Enhanced Adversarial Prompt Discovery
von: Morasso, Cristian, et al.
Veröffentlicht: (2026)
von: Morasso, Cristian, et al.
Veröffentlicht: (2026)
Evaluating the Robustness of Large Language Model Safety Guardrails Against Adversarial Attacks
von: Young, Richard J.
Veröffentlicht: (2025)
von: Young, Richard J.
Veröffentlicht: (2025)
TRAP: Hijacking VLA CoT-Reasoning via Adversarial Patches
von: Huang, Zhengxian, et al.
Veröffentlicht: (2026)
von: Huang, Zhengxian, et al.
Veröffentlicht: (2026)
A Unified Framework for Adversary-Aware Differential Privacy Bounds
von: Swanberg, Marika, et al.
Veröffentlicht: (2025)
von: Swanberg, Marika, et al.
Veröffentlicht: (2025)
Understanding and Improving Continuous Adversarial Training for LLMs via In-context Learning Theory
von: Fu, Shaopeng, et al.
Veröffentlicht: (2026)
von: Fu, Shaopeng, et al.
Veröffentlicht: (2026)
Enhancing Adversarial Resistance in LLMs with Recursion
von: Li, Bryan, et al.
Veröffentlicht: (2024)
von: Li, Bryan, et al.
Veröffentlicht: (2024)
Frequency-Domain Regularized Adversarial Alignment for Transferable Attacks against Closed-Source MLLMs
von: Yuan, Leitao, et al.
Veröffentlicht: (2026)
von: Yuan, Leitao, et al.
Veröffentlicht: (2026)
Mitigating Error Amplification in Fast Adversarial Training
von: Zhao, Mengnan, et al.
Veröffentlicht: (2026)
von: Zhao, Mengnan, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
DELMAN: Dynamic Defense Against Large Language Model Jailbreaking with Model Editing
von: Wang, Yi, et al.
Veröffentlicht: (2025) -
$\textit{MMJ-Bench}$: A Comprehensive Study on Jailbreak Attacks and Defenses for Multimodal Large Language Models
von: Weng, Fenghua, et al.
Veröffentlicht: (2024) -
Tit-for-Tat: Safeguarding Large Vision-Language Models Against Jailbreak Attacks via Adversarial Defense
von: Hao, Shuyang, et al.
Veröffentlicht: (2025) -
LocalAlign: Enabling Generalizable Prompt Injection Defense via Generation of Near-Target Adversarial Examples for Alignment Training
von: Gong, Yuyang, et al.
Veröffentlicht: (2026) -
FPT-Noise: Dynamic Scene-Aware Counterattack for Test-Time Adversarial Defense in Vision-Language Models
von: Deng, Jia, et al.
Veröffentlicht: (2025)