Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Jiawen, Chen, Kejia, He, Lipeng, Lou, Jian, Li, Dan, Feng, Zunlei, Song, Mingli, Liu, Jian, Ren, Kui, Yang, Xiaohu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SecPE: Secure Prompt Ensembling for Private and Robust Large Language Models
par: Zhang, Jiawen, et autres
Publié: (2025)
par: Zhang, Jiawen, et autres
Publié: (2025)
Mitigating Many-shot Jailbreak Attacks with One Single Demonstration
par: Chen, Kejia, et autres
Publié: (2026)
par: Chen, Kejia, et autres
Publié: (2026)
A Comprehensive Analysis of Routing Vulnerabilities and Defense Strategies in IoT Networks
par: Jae-Dong, Kim
Publié: (2024)
par: Jae-Dong, Kim
Publié: (2024)
FINER: Enhancing State-of-the-art Classifiers with Feature Attribution to Facilitate Security Analysis
par: He, Yiling, et autres
Publié: (2023)
par: He, Yiling, et autres
Publié: (2023)
Can LLMs be Fooled? Investigating Vulnerabilities in LLMs
par: Abdali, Sara, et autres
Publié: (2024)
par: Abdali, Sara, et autres
Publié: (2024)
A Certified Robust Watermark For Large Language Models
par: Feng, Xianheng, et autres
Publié: (2024)
par: Feng, Xianheng, et autres
Publié: (2024)
Edge Learning for 6G-enabled Internet of Things: A Comprehensive Survey of Vulnerabilities, Datasets, and Defenses
par: Ferrag, Mohamed Amine, et autres
Publié: (2023)
par: Ferrag, Mohamed Amine, et autres
Publié: (2023)
MegaVul: A C/C++ Vulnerability Dataset with Comprehensive Code Representation
par: Ni, Chao, et autres
Publié: (2024)
par: Ni, Chao, et autres
Publié: (2024)
Adversary-Aware DPO: Enhancing Safety Alignment in Vision Language Models via Adversarial Training
par: Weng, Fenghua, et autres
Publié: (2025)
par: Weng, Fenghua, et autres
Publié: (2025)
JNI Global References Are Still Vulnerable: Attacks and Defenses
par: He, Yi, et autres
Publié: (2024)
par: He, Yi, et autres
Publié: (2024)
Benchmarking LLMs and LLM-based Agents in Practical Vulnerability Detection for Code Repositories
par: Yildiz, Alperen, et autres
Publié: (2025)
par: Yildiz, Alperen, et autres
Publié: (2025)
You Can't Eat Your Cake and Have It Too: The Performance Degradation of LLMs with Jailbreak Defense
par: Mai, Wuyuao, et autres
Publié: (2025)
par: Mai, Wuyuao, et autres
Publié: (2025)
CAVGAN: Unifying Jailbreak and Defense of LLMs via Generative Adversarial Attacks on their Internal Representations
par: Li, Xiaohu, et autres
Publié: (2025)
par: Li, Xiaohu, et autres
Publié: (2025)
Can Small Language Models Reliably Resist Jailbreak Attacks? A Comprehensive Evaluation
par: Zhang, Wenhui, et autres
Publié: (2025)
par: Zhang, Wenhui, et autres
Publié: (2025)
Cross-Task Defense: Instruction-Tuning LLMs for Content Safety
par: Fu, Yu, et autres
Publié: (2024)
par: Fu, Yu, et autres
Publié: (2024)
LookAhead: Preventing DeFi Attacks via Unveiling Adversarial Contracts
par: Ren, Shoupeng, et autres
Publié: (2024)
par: Ren, Shoupeng, et autres
Publié: (2024)
Targeting Alignment: Extracting Safety Classifiers of Aligned LLMs
par: Ferrand, Jean-Charles Noirot, et autres
Publié: (2025)
par: Ferrand, Jean-Charles Noirot, et autres
Publié: (2025)
Enhancing Code Vulnerability Detection via Vulnerability-Preserving Data Augmentation
par: Liu, Shangqing, et autres
Publié: (2024)
par: Liu, Shangqing, et autres
Publié: (2024)
SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models
par: Chen, Yulong, et autres
Publié: (2025)
par: Chen, Yulong, et autres
Publié: (2025)
ERASER: Machine Unlearning in MLaaS via an Inference Serving-Aware Approach
par: Hu, Yuke, et autres
Publié: (2023)
par: Hu, Yuke, et autres
Publié: (2023)
MemHunter: Automated and Verifiable Memorization Detection at Dataset-scale in LLMs
par: Wu, Zhenpeng, et autres
Publié: (2024)
par: Wu, Zhenpeng, et autres
Publié: (2024)
Deep Learning Model Inversion Attacks and Defenses: A Comprehensive Survey
par: Yang, Wencheng, et autres
Publié: (2025)
par: Yang, Wencheng, et autres
Publié: (2025)
Architectural Backdoors in Deep Learning: A Survey of Vulnerabilities, Detection, and Defense
par: Childress, Victoria, et autres
Publié: (2025)
par: Childress, Victoria, et autres
Publié: (2025)
GSPR: Aligning LLM Safeguards as Generalizable Safety Policy Reasoners
par: Li, Haoran, et autres
Publié: (2025)
par: Li, Haoran, et autres
Publié: (2025)
Never Compromise to Vulnerabilities: A Comprehensive Survey on AI Governance
par: Jiang, Yuchu, et autres
Publié: (2025)
par: Jiang, Yuchu, et autres
Publié: (2025)
LLMs Cannot Reliably Identify and Reason About Security Vulnerabilities (Yet?): A Comprehensive Evaluation, Framework, and Benchmarks
par: Ullah, Saad, et autres
Publié: (2023)
par: Ullah, Saad, et autres
Publié: (2023)
The Blind Spot of Agent Safety: How Benign User Instructions Expose Critical Vulnerabilities in Computer-Use Agents
par: Ding, Xuwei, et autres
Publié: (2026)
par: Ding, Xuwei, et autres
Publié: (2026)
Defensive Prompt Patch: A Robust and Interpretable Defense of LLMs against Jailbreak Attacks
par: Xiong, Chen, et autres
Publié: (2024)
par: Xiong, Chen, et autres
Publié: (2024)
Class-Conditional Neural Polarizer: A Lightweight and Effective Backdoor Defense by Purifying Poisoned Features
par: Zhu, Mingli, et autres
Publié: (2025)
par: Zhu, Mingli, et autres
Publié: (2025)
Improving Adversarial Robustness via Feature Pattern Consistency Constraint
par: Hu, Jiacong, et autres
Publié: (2024)
par: Hu, Jiacong, et autres
Publié: (2024)
A Comprehensive Study of Exploitable Patterns in Smart Contracts: From Vulnerability to Defense
par: Ding, Yuchen, et autres
Publié: (2025)
par: Ding, Yuchen, et autres
Publié: (2025)
Defense against Poisoning Attacks under Shuffle-DP
par: Wang, Siyi, et autres
Publié: (2026)
par: Wang, Siyi, et autres
Publié: (2026)
Stop Tracking Me! Proactive Defense Against Attribute Inference Attack in LLMs
par: Yan, Dong, et autres
Publié: (2026)
par: Yan, Dong, et autres
Publié: (2026)
S-Eval: Towards Automated and Comprehensive Safety Evaluation for Large Language Models
par: Yuan, Xiaohan, et autres
Publié: (2024)
par: Yuan, Xiaohan, et autres
Publié: (2024)
EAGER: Edge-Aligned LLM Defense for Robust, Efficient, and Accurate Cybersecurity Question Answering
par: Gungor, Onat, et autres
Publié: (2025)
par: Gungor, Onat, et autres
Publié: (2025)
Jailbreaking LLMs & VLMs: Mechanisms, Evaluation, and Unified Defense
par: Chen, Zejian, et autres
Publié: (2026)
par: Chen, Zejian, et autres
Publié: (2026)
FederBoost: Private Federated Learning for GBDT
par: Tian, Zhihua, et autres
Publié: (2020)
par: Tian, Zhihua, et autres
Publié: (2020)
Towards Identification and Intervention of Safety-Critical Parameters in Large Language Models
par: Qi, Weiwei, et autres
Publié: (2026)
par: Qi, Weiwei, et autres
Publié: (2026)
Comprehensive Vulnerability Analysis is Necessary for Trustworthy LLM-MAS
par: He, Pengfei, et autres
Publié: (2025)
par: He, Pengfei, et autres
Publié: (2025)
Enhancing Model Defense Against Jailbreaks with Proactive Safety Reasoning
par: Yang, Xianglin, et autres
Publié: (2025)
par: Yang, Xianglin, et autres
Publié: (2025)
Documents similaires
-
SecPE: Secure Prompt Ensembling for Private and Robust Large Language Models
par: Zhang, Jiawen, et autres
Publié: (2025) -
Mitigating Many-shot Jailbreak Attacks with One Single Demonstration
par: Chen, Kejia, et autres
Publié: (2026) -
A Comprehensive Analysis of Routing Vulnerabilities and Defense Strategies in IoT Networks
par: Jae-Dong, Kim
Publié: (2024) -
FINER: Enhancing State-of-the-art Classifiers with Feature Attribution to Facilitate Security Analysis
par: He, Yiling, et autres
Publié: (2023) -
Can LLMs be Fooled? Investigating Vulnerabilities in LLMs
par: Abdali, Sara, et autres
Publié: (2024)