Adversarial Attack-Defense Co-Evolution for LLM Safety Alignment via Tree-Group Dual-Aware Search and Optimization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Xurui, Song, Kaisong, Zhu, Rui, Chen, Pin-Yu, Tang, Haixu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Model-Agnostic Lifelong LLM Safety via Externalized Attack-Defense Co-Evolution
par: Zhang, Xiaozhe, et autres
Publié: (2026)
par: Zhang, Xiaozhe, et autres
Publié: (2026)
Attack via Overfitting: 10-shot Benign Fine-tuning to Jailbreak LLMs
par: Xie, Zhixin, et autres
Publié: (2025)
par: Xie, Zhixin, et autres
Publié: (2025)
Improving LLM Safety Alignment with Dual-Objective Optimization
par: Zhao, Xuandong, et autres
Publié: (2025)
par: Zhao, Xuandong, et autres
Publié: (2025)
Adversary-Aware DPO: Enhancing Safety Alignment in Vision Language Models via Adversarial Training
par: Weng, Fenghua, et autres
Publié: (2025)
par: Weng, Fenghua, et autres
Publié: (2025)
Defensive Prompt Patch: A Robust and Interpretable Defense of LLMs against Jailbreak Attacks
par: Xiong, Chen, et autres
Publié: (2024)
par: Xiong, Chen, et autres
Publié: (2024)
Gradient Shaping: Enhancing Backdoor Attack Against Reverse Engineering
par: Zhu, Rui, et autres
Publié: (2023)
par: Zhu, Rui, et autres
Publié: (2023)
Tit-for-Tat: Safeguarding Large Vision-Language Models Against Jailbreak Attacks via Adversarial Defense
par: Hao, Shuyang, et autres
Publié: (2025)
par: Hao, Shuyang, et autres
Publié: (2025)
Layer-Aware Representation Filtering: Purifying Finetuning Data to Preserve LLM Safety Alignment
par: Li, Hao, et autres
Publié: (2025)
par: Li, Hao, et autres
Publié: (2025)
Co-Evolutionary Multi-Modal Alignment via Structured Adversarial Evolution
par: Shi, Guoxin, et autres
Publié: (2026)
par: Shi, Guoxin, et autres
Publié: (2026)
Dynamic Dual-level Defense Routing for Continual Adversarial Training
par: Wang, Wenxuan, et autres
Publié: (2025)
par: Wang, Wenxuan, et autres
Publié: (2025)
The VLLM Safety Paradox: Dual Ease in Jailbreak Attack and Defense
par: Guo, Yangyang, et autres
Publié: (2024)
par: Guo, Yangyang, et autres
Publié: (2024)
SATversary: Adversarial Attacks and Defenses for Satellite Fingerprinting
par: Smailes, Joshua, et autres
Publié: (2025)
par: Smailes, Joshua, et autres
Publié: (2025)
SecurityLingua: Efficient Defense of LLM Jailbreak Attacks via Security-Aware Prompt Compression
par: Li, Yucheng, et autres
Publié: (2025)
par: Li, Yucheng, et autres
Publié: (2025)
Deep Learning Model Inversion Attacks and Defenses: A Comprehensive Survey
par: Yang, Wencheng, et autres
Publié: (2025)
par: Yang, Wencheng, et autres
Publié: (2025)
AutoJailbreak: Exploring Jailbreak Attacks and Defenses through a Dependency Lens
par: Lu, Lin, et autres
Publié: (2024)
par: Lu, Lin, et autres
Publié: (2024)
Defense Against Prompt Injection Attack by Leveraging Attack Techniques
par: Chen, Yulin, et autres
Publié: (2024)
par: Chen, Yulin, et autres
Publié: (2024)
Behavior-Aware and Generalizable Defense Against Black-Box Adversarial Attacks for ML-Based IDS
par: Ennaji, Sabrine, et autres
Publié: (2025)
par: Ennaji, Sabrine, et autres
Publié: (2025)
Adversarial Machine Learning: Attacks, Defenses, and Open Challenges
par: Jha, Pranav K
Publié: (2025)
par: Jha, Pranav K
Publié: (2025)
Revisiting Adversarial Perception Attacks and Defense Methods on Autonomous Driving Systems
par: Chen, Cheng, et autres
Publié: (2025)
par: Chen, Cheng, et autres
Publié: (2025)
Quantization Aware Attack: Enhancing Transferable Adversarial Attacks by Model Quantization
par: Yang, Yulong, et autres
Publié: (2023)
par: Yang, Yulong, et autres
Publié: (2023)
TrojanPraise: Jailbreak LLMs via Benign Fine-Tuning
par: Xie, Zhixin, et autres
Publié: (2026)
par: Xie, Zhixin, et autres
Publié: (2026)
Where to Start Alignment? Diffusion Large Language Model May Demand a Distinct Position
par: Xie, Zhixin, et autres
Publié: (2025)
par: Xie, Zhixin, et autres
Publié: (2025)
LocalAlign: Enabling Generalizable Prompt Injection Defense via Generation of Near-Target Adversarial Examples for Alignment Training
par: Gong, Yuyang, et autres
Publié: (2026)
par: Gong, Yuyang, et autres
Publié: (2026)
Enhancing Adversarial Attacks via Parameter Adaptive Adversarial Attack
par: Jin, Zhibo, et autres
Publié: (2024)
par: Jin, Zhibo, et autres
Publié: (2024)
CAVGAN: Unifying Jailbreak and Defense of LLMs via Generative Adversarial Attacks on their Internal Representations
par: Li, Xiaohu, et autres
Publié: (2025)
par: Li, Xiaohu, et autres
Publié: (2025)
Adversarial Contrastive Learning for LLM Quantization Attacks
par: Song, Dinghong, et autres
Publié: (2026)
par: Song, Dinghong, et autres
Publié: (2026)
LLM-Enhanced Software Patch Localization
par: Yu, Jinhong, et autres
Publié: (2024)
par: Yu, Jinhong, et autres
Publié: (2024)
ShellForge: Adversarial Co-Evolution of Webshell Generation and Multi-View Detection for Robust Webshell Defense
par: Ding, Yizhong
Publié: (2026)
par: Ding, Yizhong
Publié: (2026)
A Scheduling-Aware Defense Against Prefetching-Based Side-Channel Attacks
par: Schlüter, Till, et autres
Publié: (2024)
par: Schlüter, Till, et autres
Publié: (2024)
RoboJailBench: Benchmarking Adversarial Attacks and Defenses in Embodied Robotic Agents
par: Yeke, Doguhuan, et autres
Publié: (2026)
par: Yeke, Doguhuan, et autres
Publié: (2026)
A No-Defense Defense Against Gradient-Based Adversarial Attacks on ML-NIDS: Is Less More?
par: elShehaby, Mohamed, et autres
Publié: (2026)
par: elShehaby, Mohamed, et autres
Publié: (2026)
Test-time Adversarial Defense with Opposite Adversarial Path and High Attack Time Cost
par: Yeh, Cheng-Han, et autres
Publié: (2024)
par: Yeh, Cheng-Han, et autres
Publié: (2024)
From LLMs to MLLMs to Agents: A Survey of Emerging Paradigms in Jailbreak Attacks and Defenses within LLM Ecosystem
par: Mao, Yanxu, et autres
Publié: (2025)
par: Mao, Yanxu, et autres
Publié: (2025)
Detection and Defense Against Prominent Attacks on Preconditioned LLM-Integrated Virtual Assistants
par: Chan, Chun Fai, et autres
Publié: (2024)
par: Chan, Chun Fai, et autres
Publié: (2024)
Medical Multimodal Model Stealing Attacks via Adversarial Domain Alignment
par: Shen, Yaling, et autres
Publié: (2025)
par: Shen, Yaling, et autres
Publié: (2025)
DYNAMITE: Dynamic Defense Selection for Enhancing Machine Learning-based Intrusion Detection Against Adversarial Attacks
par: Chen, Jing, et autres
Publié: (2025)
par: Chen, Jing, et autres
Publié: (2025)
The Trojan Knowledge: Bypassing Commercial LLM Guardrails via Harmless Prompt Weaving and Adaptive Tree Search
par: Wei, Rongzhe, et autres
Publié: (2025)
par: Wei, Rongzhe, et autres
Publié: (2025)
Backdoor-Powered Prompt Injection Attacks Nullify Defense Methods
par: Chen, Yulin, et autres
Publié: (2025)
par: Chen, Yulin, et autres
Publié: (2025)
SafeAligner: Safety Alignment against Jailbreak Attacks via Response Disparity Guidance
par: Huang, Caishuang, et autres
Publié: (2024)
par: Huang, Caishuang, et autres
Publié: (2024)
Safety and Security Risk Mitigation in Satellite Missions via Attack-Fault-Defense Trees
par: Soltani, Reza, et autres
Publié: (2025)
par: Soltani, Reza, et autres
Publié: (2025)
Documents similaires
-
Model-Agnostic Lifelong LLM Safety via Externalized Attack-Defense Co-Evolution
par: Zhang, Xiaozhe, et autres
Publié: (2026) -
Attack via Overfitting: 10-shot Benign Fine-tuning to Jailbreak LLMs
par: Xie, Zhixin, et autres
Publié: (2025) -
Improving LLM Safety Alignment with Dual-Objective Optimization
par: Zhao, Xuandong, et autres
Publié: (2025) -
Adversary-Aware DPO: Enhancing Safety Alignment in Vision Language Models via Adversarial Training
par: Weng, Fenghua, et autres
Publié: (2025) -
Defensive Prompt Patch: A Robust and Interpretable Defense of LLMs against Jailbreak Attacks
par: Xiong, Chen, et autres
Publié: (2024)