Activation Differences Reveal Backdoors: A Comparison of SAE Architectures
Fuente:
arXiv
Salvato in:
| Autore principale: | Kumar, Sachin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Cross-LLM Generalization of Behavioral Backdoor Detection in AI Agent Supply Chains
di: Sanna, Arun Chowdary
Pubblicazione: (2025)
di: Sanna, Arun Chowdary
Pubblicazione: (2025)
Token-Level Generalization in LoRA Adapter Backdoors: Attack Characterization and Behavioral Detection
di: Lelle, Travis
Pubblicazione: (2026)
di: Lelle, Travis
Pubblicazione: (2026)
Closing the Distribution Gap in Adversarial Training for LLMs
di: Hu, Chengzhi, et al.
Pubblicazione: (2026)
di: Hu, Chengzhi, et al.
Pubblicazione: (2026)
Illuminating the Black Box: Real-Time Monitoring of Backdoor Unlearning in CNNs via Explainable AI
di: Hoang, Tien Dat
Pubblicazione: (2025)
di: Hoang, Tien Dat
Pubblicazione: (2025)
Towards Low-Latency and Adaptive Ransomware Detection Using Contrastive Learning
di: Pan, Zhixin, et al.
Pubblicazione: (2025)
di: Pan, Zhixin, et al.
Pubblicazione: (2025)
Depth-Dependent Indirect Prompt Injection in Tool-Calling ReAct Agents: Injection Depth, Payload Framing, and Turn-Budget Sensitivity
di: Rashidi, Mohammadreza
Pubblicazione: (2026)
di: Rashidi, Mohammadreza
Pubblicazione: (2026)
SCAFDS: Edge-Feature Graph Attention for Interbank Fraud Detection with Attribution-Grounded SAR Generation
di: Uddin, Mohammad Nasir
Pubblicazione: (2026)
di: Uddin, Mohammad Nasir
Pubblicazione: (2026)
Density-aware Sample-specific Attack
di: Wang, Qiyuan, et al.
Pubblicazione: (2026)
di: Wang, Qiyuan, et al.
Pubblicazione: (2026)
Dr. Jekyll and Mr. Hyde: Two Faces of LLMs
di: Collu, Matteo Gioele, et al.
Pubblicazione: (2023)
di: Collu, Matteo Gioele, et al.
Pubblicazione: (2023)
Scalable APT Malware Classification via Parallel Feature Extraction and GPU-Accelerated Learning
di: Subedar, Noah, et al.
Pubblicazione: (2025)
di: Subedar, Noah, et al.
Pubblicazione: (2025)
A Protocol-Language Model for Network Intrusion (Without Deep Packet Inspection)
di: Sharma, Vivek Kumar
Pubblicazione: (2026)
di: Sharma, Vivek Kumar
Pubblicazione: (2026)
Multi-Agent Honeypot-Based Request-Response Context Dataset for Improved SQL Injection Detection Performance
di: Yu, Hao, et al.
Pubblicazione: (2026)
di: Yu, Hao, et al.
Pubblicazione: (2026)
Signal-Based Malware Classification Using 1D CNNs
di: Wilkie, Jack, et al.
Pubblicazione: (2025)
di: Wilkie, Jack, et al.
Pubblicazione: (2025)
Few-Shot Network Intrusion Detection Using Online Triplet Mining
di: Wilkie, Jack, et al.
Pubblicazione: (2026)
di: Wilkie, Jack, et al.
Pubblicazione: (2026)
A Novel Contrastive Loss for Zero-Day Network Intrusion Detection
di: Wilkie, Jack, et al.
Pubblicazione: (2026)
di: Wilkie, Jack, et al.
Pubblicazione: (2026)
Contrastive Self-Supervised Network Intrusion Detection using Augmented Negative Pairs
di: Wilkie, Jack, et al.
Pubblicazione: (2025)
di: Wilkie, Jack, et al.
Pubblicazione: (2025)
Benchmarking Autonomous Agents against Temporal, Spatial, and Semantic Evasions
di: Ma, Jianan, et al.
Pubblicazione: (2026)
di: Ma, Jianan, et al.
Pubblicazione: (2026)
A High-Recall Cost-Sensitive Machine Learning Framework for Real-Time Online Banking Transaction Fraud Detection
di: R., Karthikeyan V., et al.
Pubblicazione: (2026)
di: R., Karthikeyan V., et al.
Pubblicazione: (2026)
RADEP: A Resilient Adaptive Defense Framework Against Model Extraction Attacks
di: Chakraborty, Amit, et al.
Pubblicazione: (2025)
di: Chakraborty, Amit, et al.
Pubblicazione: (2025)
Generalizable and Interpretable RF Fingerprinting with Shapelet-Enhanced Large Language Models
di: Zhao, Tianya, et al.
Pubblicazione: (2026)
di: Zhao, Tianya, et al.
Pubblicazione: (2026)
Phishing Detection System: An Ensemble Approach Using Character-Level CNN and Feature Engineering
di: Dubey, Rudra, et al.
Pubblicazione: (2025)
di: Dubey, Rudra, et al.
Pubblicazione: (2025)
Sensitivity Uncertainty Alignment in Large Language Models
di: Hiremath, Prakul Sunil, et al.
Pubblicazione: (2026)
di: Hiremath, Prakul Sunil, et al.
Pubblicazione: (2026)
SALLIE: Safeguarding Against Latent Language & Image Exploits
di: Azov, Guy, et al.
Pubblicazione: (2026)
di: Azov, Guy, et al.
Pubblicazione: (2026)
Federated Learning over Blockchain-Enabled Cloud Infrastructure
di: Garg, Saloni, et al.
Pubblicazione: (2026)
di: Garg, Saloni, et al.
Pubblicazione: (2026)
The Hiremath Early Detection (HED) Score: A Measure-Theoretic Evaluation Standard for Temporal Intelligence
di: Hiremath, Prakul Sunil
Pubblicazione: (2026)
di: Hiremath, Prakul Sunil
Pubblicazione: (2026)
LLM Detectors Still Fall Short of Real World: Case of LLM-Generated Short News-Like Posts
di: Gameiro, Henrique Da Silva, et al.
Pubblicazione: (2024)
di: Gameiro, Henrique Da Silva, et al.
Pubblicazione: (2024)
AI Bill of Materials and Beyond: Systematizing Security Assurance through the AI Risk Scanning (AIRS) Framework
di: Nathanson, Samuel, et al.
Pubblicazione: (2025)
di: Nathanson, Samuel, et al.
Pubblicazione: (2025)
Breaking to Build: A Threat Model of Prompt-Based Attacks for Securing LLMs
di: Hill, Brennen, et al.
Pubblicazione: (2025)
di: Hill, Brennen, et al.
Pubblicazione: (2025)
Same Payload, Different Channel: Measuring Trust Asymmetry in Tool-Using Language Models
di: Syed, Mohammed Sameer, et al.
Pubblicazione: (2026)
di: Syed, Mohammed Sameer, et al.
Pubblicazione: (2026)
Is My Data in Your Retrieval Database? Membership Inference Attacks Against Retrieval Augmented Generation
di: Anderson, Maya, et al.
Pubblicazione: (2024)
di: Anderson, Maya, et al.
Pubblicazione: (2024)
A Dual-Path Generative Framework for Zero-Day Fraud Detection in Banking Systems
di: Ismail, Nasim Abdirahman, et al.
Pubblicazione: (2026)
di: Ismail, Nasim Abdirahman, et al.
Pubblicazione: (2026)
Breaking the Illusion of Security via Interpretation: Interpretable Vision Transformer Systems under Attack
di: Abdukhamidov, Eldor, et al.
Pubblicazione: (2025)
di: Abdukhamidov, Eldor, et al.
Pubblicazione: (2025)
Risk-Calibrated Bayesian Streaming Intrusion Detection with SRE-Aligned Decisions
di: Youssef, Michel
Pubblicazione: (2025)
di: Youssef, Michel
Pubblicazione: (2025)
Jailbreak Mimicry: Automated Discovery of Narrative-Based Jailbreaks for Large Language Models
di: Ntais, Pavlos
Pubblicazione: (2025)
di: Ntais, Pavlos
Pubblicazione: (2025)
Towards trustworthy agentic AI: a comprehensive survey of safety, robustness, privacy, and system security
di: Qi, Jinhu, et al.
Pubblicazione: (2026)
di: Qi, Jinhu, et al.
Pubblicazione: (2026)
Countermind: A Multi-Layered Security Architecture for Large Language Models
di: Schwarz, Dominik
Pubblicazione: (2025)
di: Schwarz, Dominik
Pubblicazione: (2025)
Architecture-Agnostic Feature Synergy for Universal Defense Against Heterogeneous Generative Threats
di: Zhang, Bingxue, et al.
Pubblicazione: (2026)
di: Zhang, Bingxue, et al.
Pubblicazione: (2026)
VOLTRON: Detecting Unknown Malware Using Graph-Based Zero-Shot Learning
di: Akdeniz, M. Tahir, et al.
Pubblicazione: (2025)
di: Akdeniz, M. Tahir, et al.
Pubblicazione: (2025)
Amplifying Training Data Exposure through Fine-Tuning with Pseudo-Labeled Memberships
di: Oh, Myung Gyo, et al.
Pubblicazione: (2024)
di: Oh, Myung Gyo, et al.
Pubblicazione: (2024)
Network Structures as an Attack Surface: Topology-Based Privacy Leakage in Federated Learning
di: Rangwala, Murtaza, et al.
Pubblicazione: (2025)
di: Rangwala, Murtaza, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Cross-LLM Generalization of Behavioral Backdoor Detection in AI Agent Supply Chains
di: Sanna, Arun Chowdary
Pubblicazione: (2025) -
Token-Level Generalization in LoRA Adapter Backdoors: Attack Characterization and Behavioral Detection
di: Lelle, Travis
Pubblicazione: (2026) -
Closing the Distribution Gap in Adversarial Training for LLMs
di: Hu, Chengzhi, et al.
Pubblicazione: (2026) -
Illuminating the Black Box: Real-Time Monitoring of Backdoor Unlearning in CNNs via Explainable AI
di: Hoang, Tien Dat
Pubblicazione: (2025) -
Towards Low-Latency and Adaptive Ransomware Detection Using Contrastive Learning
di: Pan, Zhixin, et al.
Pubblicazione: (2025)