Position: Retire the "Positive Backdoor" Label -- Secret Alignment Requires Strict and Systematic Evaluation
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Jianwei, Kim, Jung-Eun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Purifying Generative LLMs from Backdoors without Prior Knowledge or Clean Reference
di: Li, Jianwei, et al.
Pubblicazione: (2026)
di: Li, Jianwei, et al.
Pubblicazione: (2026)
Safety Alignment Can Be Not Superficial With Explicit Safety Signals
di: Li, Jianwei, et al.
Pubblicazione: (2025)
di: Li, Jianwei, et al.
Pubblicazione: (2025)
Superficial Safety Alignment Hypothesis
di: Li, Jianwei, et al.
Pubblicazione: (2024)
di: Li, Jianwei, et al.
Pubblicazione: (2024)
Backdoor Secrets Unveiled: Identifying Backdoor Data with Optimized Scaled Prediction Consistency
di: Pal, Soumyadeep, et al.
Pubblicazione: (2024)
di: Pal, Soumyadeep, et al.
Pubblicazione: (2024)
Undetectable Backdoors in Model Parameters: Hiding Sparse Secrets in High Dimensions
di: Choudhary, Sarthak, et al.
Pubblicazione: (2026)
di: Choudhary, Sarthak, et al.
Pubblicazione: (2026)
Trustworthy AI: Safety, Bias, and Privacy -- A Survey
di: Fang, Xingli, et al.
Pubblicazione: (2025)
di: Fang, Xingli, et al.
Pubblicazione: (2025)
Learnability and Privacy Vulnerability are Entangled in a Few Critical Weights
di: Fang, Xingli, et al.
Pubblicazione: (2026)
di: Fang, Xingli, et al.
Pubblicazione: (2026)
Decoupling Generalizability and Membership Privacy Risks in Neural Networks
di: Fang, Xingli, et al.
Pubblicazione: (2026)
di: Fang, Xingli, et al.
Pubblicazione: (2026)
Center-Based Relaxed Learning Against Membership Inference Attacks
di: Fang, Xingli, et al.
Pubblicazione: (2024)
di: Fang, Xingli, et al.
Pubblicazione: (2024)
Hide in Plain Sight: Clean-Label Backdoor for Auditing Membership Inference
di: Chen, Depeng, et al.
Pubblicazione: (2024)
di: Chen, Depeng, et al.
Pubblicazione: (2024)
Strategic Sample Selection for Improved Clean-Label Backdoor Attacks in Text Classification
di: Kirci, Onur Alp, et al.
Pubblicazione: (2025)
di: Kirci, Onur Alp, et al.
Pubblicazione: (2025)
Position: Explain to Question not to Justify
di: Biecek, Przemyslaw, et al.
Pubblicazione: (2024)
di: Biecek, Przemyslaw, et al.
Pubblicazione: (2024)
Backdoor Graph Condensation
di: Wu, Jiahao, et al.
Pubblicazione: (2024)
di: Wu, Jiahao, et al.
Pubblicazione: (2024)
Heterogeneous Graph Backdoor Attack
di: Chen, Jiawei, et al.
Pubblicazione: (2025)
di: Chen, Jiawei, et al.
Pubblicazione: (2025)
Backdoor Vectors: a Task Arithmetic View on Backdoor Attacks and Defenses
di: Pawlak, Stanisław, et al.
Pubblicazione: (2025)
di: Pawlak, Stanisław, et al.
Pubblicazione: (2025)
A Backdoor-based Explainable AI Benchmark for High Fidelity Evaluation of Attributions
di: Yang, Peiyu, et al.
Pubblicazione: (2024)
di: Yang, Peiyu, et al.
Pubblicazione: (2024)
Position: AI Security Policy Should Target Systems, Not Models
di: Riegler, Michael A., et al.
Pubblicazione: (2026)
di: Riegler, Michael A., et al.
Pubblicazione: (2026)
Rethinking Pruning for Backdoor Mitigation: An Optimization Perspective
di: Li, Nan, et al.
Pubblicazione: (2024)
di: Li, Nan, et al.
Pubblicazione: (2024)
Magnitude-based Neuron Pruning for Backdoor Defens
di: Li, Nan, et al.
Pubblicazione: (2024)
di: Li, Nan, et al.
Pubblicazione: (2024)
Position: Challenges and Opportunities for Differential Privacy in the U.S. Federal Government
di: Khanna, Amol, et al.
Pubblicazione: (2024)
di: Khanna, Amol, et al.
Pubblicazione: (2024)
From Data Leak to Secret Misses: The Impact of Data Leakage on Secret Detection Models
di: Soltaniani, Farnaz, et al.
Pubblicazione: (2026)
di: Soltaniani, Farnaz, et al.
Pubblicazione: (2026)
Unlearn to Relearn Backdoors: Deferred Backdoor Functionality Attacks on Deep Learning Models
di: Shin, Jeongjin, et al.
Pubblicazione: (2024)
di: Shin, Jeongjin, et al.
Pubblicazione: (2024)
Graph Neural Backdoor: Fundamentals, Methodologies, Applications, and Future Directions
di: Yang, Xiao, et al.
Pubblicazione: (2024)
di: Yang, Xiao, et al.
Pubblicazione: (2024)
Position: Privacy Is Not Just Memorization!
di: Mireshghallah, Niloofar, et al.
Pubblicazione: (2025)
di: Mireshghallah, Niloofar, et al.
Pubblicazione: (2025)
Backdoor defense, learnability and obfuscation
di: Christiano, Paul, et al.
Pubblicazione: (2024)
di: Christiano, Paul, et al.
Pubblicazione: (2024)
How to Backdoor the Knowledge Distillation
di: Wu, Chen, et al.
Pubblicazione: (2025)
di: Wu, Chen, et al.
Pubblicazione: (2025)
PSBD: Prediction Shift Uncertainty Unlocks Backdoor Detection
di: Li, Wei, et al.
Pubblicazione: (2024)
di: Li, Wei, et al.
Pubblicazione: (2024)
Uncovering, Explaining, and Mitigating the Superficial Safety of Backdoor Defense
di: Min, Rui, et al.
Pubblicazione: (2024)
di: Min, Rui, et al.
Pubblicazione: (2024)
Compromising Embodied Agents with Contextual Backdoor Attacks
di: Liu, Aishan, et al.
Pubblicazione: (2024)
di: Liu, Aishan, et al.
Pubblicazione: (2024)
TERD: A Unified Framework for Safeguarding Diffusion Models Against Backdoors
di: Mo, Yichuan, et al.
Pubblicazione: (2024)
di: Mo, Yichuan, et al.
Pubblicazione: (2024)
Trusted Weights, Treacherous Optimizations? Optimization-Triggered Backdoor Attacks on LLMs
di: Wang, Yifei, et al.
Pubblicazione: (2026)
di: Wang, Yifei, et al.
Pubblicazione: (2026)
Your Agent Can Defend Itself against Backdoor Attacks
di: Changjiang, Li, et al.
Pubblicazione: (2025)
di: Changjiang, Li, et al.
Pubblicazione: (2025)
Revisiting Backdoor Attacks on Time Series Classification in the Frequency Domain
di: Huang, Yuanmin, et al.
Pubblicazione: (2025)
di: Huang, Yuanmin, et al.
Pubblicazione: (2025)
BAFFLE: Hiding Backdoors in Offline Reinforcement Learning Datasets
di: Gong, Chen, et al.
Pubblicazione: (2022)
di: Gong, Chen, et al.
Pubblicazione: (2022)
OCGEC: One-class Graph Embedding Classification for DNN Backdoor Detection
di: Jiang, Haoyu, et al.
Pubblicazione: (2023)
di: Jiang, Haoyu, et al.
Pubblicazione: (2023)
Mutual Information Guided Backdoor Mitigation for Pre-trained Encoders
di: Han, Tingxu, et al.
Pubblicazione: (2024)
di: Han, Tingxu, et al.
Pubblicazione: (2024)
How to Craft Backdoors with Unlabeled Data Alone?
di: Wang, Yifei, et al.
Pubblicazione: (2024)
di: Wang, Yifei, et al.
Pubblicazione: (2024)
Injecting Universal Jailbreak Backdoors into LLMs in Minutes
di: Chen, Zhuowei, et al.
Pubblicazione: (2025)
di: Chen, Zhuowei, et al.
Pubblicazione: (2025)
LoBAM: LoRA-Based Backdoor Attack on Model Merging
di: Yin, Ming, et al.
Pubblicazione: (2024)
di: Yin, Ming, et al.
Pubblicazione: (2024)
Structure-Aware Distributed Backdoor Attacks in Federated Learning
di: Jian, Wang, et al.
Pubblicazione: (2026)
di: Jian, Wang, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Purifying Generative LLMs from Backdoors without Prior Knowledge or Clean Reference
di: Li, Jianwei, et al.
Pubblicazione: (2026) -
Safety Alignment Can Be Not Superficial With Explicit Safety Signals
di: Li, Jianwei, et al.
Pubblicazione: (2025) -
Superficial Safety Alignment Hypothesis
di: Li, Jianwei, et al.
Pubblicazione: (2024) -
Backdoor Secrets Unveiled: Identifying Backdoor Data with Optimized Scaled Prediction Consistency
di: Pal, Soumyadeep, et al.
Pubblicazione: (2024) -
Undetectable Backdoors in Model Parameters: Hiding Sparse Secrets in High Dimensions
di: Choudhary, Sarthak, et al.
Pubblicazione: (2026)