Game of Trojans: Adaptive Adversaries Against Output-based Trojaned-Model Detectors
Fuente:
arXiv
Salvato in:
| Autori principali: | Sahabandu, Dinuka, Xu, Xiaojun, Rajabi, Arezoo, Niu, Luyao, Ramasubramanian, Bhaskar, Li, Bo, Poovendran, Radha |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CleanGen: Mitigating Backdoor Attacks for Generation Tasks in Large Language Models
di: Li, Yuetai, et al.
Pubblicazione: (2024)
di: Li, Yuetai, et al.
Pubblicazione: (2024)
Double-Dip: Thwarting Label-Only Membership Inference Attacks with Transfer Learning and Randomization
di: Rajabi, Arezoo, et al.
Pubblicazione: (2024)
di: Rajabi, Arezoo, et al.
Pubblicazione: (2024)
BadChain: Backdoor Chain-of-Thought Prompting for Large Language Models
di: Xiang, Zhen, et al.
Pubblicazione: (2024)
di: Xiang, Zhen, et al.
Pubblicazione: (2024)
ACE: A Model Poisoning Attack on Contribution Evaluation Methods in Federated Learning
di: Xu, Zhangchen, et al.
Pubblicazione: (2024)
di: Xu, Zhangchen, et al.
Pubblicazione: (2024)
SoSBench: Benchmarking Safety Alignment on Six Scientific Domains
di: Jiang, Fengqing, et al.
Pubblicazione: (2025)
di: Jiang, Fengqing, et al.
Pubblicazione: (2025)
Who is Responsible? Explaining Safety Violations in Multi-Agent Cyber-Physical Systems
di: Niu, Luyao, et al.
Pubblicazione: (2024)
di: Niu, Luyao, et al.
Pubblicazione: (2024)
ChatBug: A Common Vulnerability of Aligned LLMs Induced by Chat Templates
di: Jiang, Fengqing, et al.
Pubblicazione: (2024)
di: Jiang, Fengqing, et al.
Pubblicazione: (2024)
CANTXSec: A Deterministic Intrusion Detection and Prevention System for CAN Bus Monitoring ECU Activations
di: Donadel, Denis, et al.
Pubblicazione: (2025)
di: Donadel, Denis, et al.
Pubblicazione: (2025)
TrojanGYM: A Detector-in-the-Loop LLM for Adaptive RTL Hardware Trojan Insertion
di: Sreekumar, Saideep, et al.
Pubblicazione: (2026)
di: Sreekumar, Saideep, et al.
Pubblicazione: (2026)
Brave: Byzantine-Resilient and Privacy-Preserving Peer-to-Peer Federated Learning
di: Xu, Zhangchen, et al.
Pubblicazione: (2024)
di: Xu, Zhangchen, et al.
Pubblicazione: (2024)
TrojanForge: Generating Adversarial Hardware Trojan Examples Using Reinforcement Learning
di: Sarihi, Amin, et al.
Pubblicazione: (2024)
di: Sarihi, Amin, et al.
Pubblicazione: (2024)
Trojan Cleansing with Neural Collapse
di: Gu, Xihe, et al.
Pubblicazione: (2024)
di: Gu, Xihe, et al.
Pubblicazione: (2024)
Evasive Hardware Trojan through Adversarial Power Trace
di: Omidi, Behnam, et al.
Pubblicazione: (2024)
di: Omidi, Behnam, et al.
Pubblicazione: (2024)
TrojanLoC: LLM-based Framework for RTL Trojan Localization
di: Xiao, Weihua, et al.
Pubblicazione: (2025)
di: Xiao, Weihua, et al.
Pubblicazione: (2025)
TrojanPuzzle: Covertly Poisoning Code-Suggestion Models
di: Aghakhani, Hojjat, et al.
Pubblicazione: (2023)
di: Aghakhani, Hojjat, et al.
Pubblicazione: (2023)
Neural Trojans
di: Liu, Yuntao, et al.
Pubblicazione: (2017)
di: Liu, Yuntao, et al.
Pubblicazione: (2017)
TrojanEdit: Multimodal Backdoor Attack Against Image Editing Model
di: Guo, Ji, et al.
Pubblicazione: (2024)
di: Guo, Ji, et al.
Pubblicazione: (2024)
On Trojan Signatures in Large Language Models of Code
di: Hussain, Aftab, et al.
Pubblicazione: (2024)
di: Hussain, Aftab, et al.
Pubblicazione: (2024)
A Method for Fast Autonomy Transfer in Reinforcement Learning
di: Sahabandu, Dinuka, et al.
Pubblicazione: (2024)
di: Sahabandu, Dinuka, et al.
Pubblicazione: (2024)
TrojanPraise: Jailbreak LLMs via Benign Fine-Tuning
di: Xie, Zhixin, et al.
Pubblicazione: (2026)
di: Xie, Zhixin, et al.
Pubblicazione: (2026)
Trojan Horse Hunt in Time Series Forecasting for Space Operations
di: Kotowski, Krzysztof, et al.
Pubblicazione: (2025)
di: Kotowski, Krzysztof, et al.
Pubblicazione: (2025)
HeisenTrojans: They Are Not There Until They Are Triggered
di: Mavurapu, Akshita Reddy, et al.
Pubblicazione: (2023)
di: Mavurapu, Akshita Reddy, et al.
Pubblicazione: (2023)
Evil from Within: Machine Learning Backdoors through Hardware Trojans
di: Warnecke, Alexander, et al.
Pubblicazione: (2023)
di: Warnecke, Alexander, et al.
Pubblicazione: (2023)
TROJAN-GUARD: Hardware Trojans Detection Using GNN in RTL Designs
di: Thorat, Kiran, et al.
Pubblicazione: (2025)
di: Thorat, Kiran, et al.
Pubblicazione: (2025)
Trojans in Artificial Intelligence (TrojAI) Final Report
di: Reese, Kristopher W., et al.
Pubblicazione: (2026)
di: Reese, Kristopher W., et al.
Pubblicazione: (2026)
An AI Architecture with the Capability to Classify and Explain Hardware Trojans
di: Whitten, Paul, et al.
Pubblicazione: (2024)
di: Whitten, Paul, et al.
Pubblicazione: (2024)
TrojanWhisper: Evaluating Pre-trained LLMs to Detect and Localize Hardware Trojans
di: Faruque, Md Omar, et al.
Pubblicazione: (2024)
di: Faruque, Md Omar, et al.
Pubblicazione: (2024)
TrojanDec: Data-free Detection of Trojan Inputs in Self-supervised Learning
di: Liu, Yupei, et al.
Pubblicazione: (2025)
di: Liu, Yupei, et al.
Pubblicazione: (2025)
The Philosopher's Stone: Trojaning Plugins of Large Language Models
di: Dong, Tian, et al.
Pubblicazione: (2023)
di: Dong, Tian, et al.
Pubblicazione: (2023)
Protecting Model Adaptation from Trojans in the Unlabeled Data
di: Sheng, Lijun, et al.
Pubblicazione: (2024)
di: Sheng, Lijun, et al.
Pubblicazione: (2024)
Are You Using Reliable Graph Prompts? Trojan Prompt Attacks on Graph Neural Networks
di: Lin, Minhua, et al.
Pubblicazione: (2024)
di: Lin, Minhua, et al.
Pubblicazione: (2024)
The Trojan Knowledge: Bypassing Commercial LLM Guardrails via Harmless Prompt Weaving and Adaptive Tree Search
di: Wei, Rongzhe, et al.
Pubblicazione: (2025)
di: Wei, Rongzhe, et al.
Pubblicazione: (2025)
Hardware Trojans in Quantum Circuits, Their Impacts, and Defense
di: Roy, Rupshali, et al.
Pubblicazione: (2024)
di: Roy, Rupshali, et al.
Pubblicazione: (2024)
Trojan horse hunt in deep forecasting models: Insights from the European Space Agency competition
di: Kotowski, Krzysztof, et al.
Pubblicazione: (2026)
di: Kotowski, Krzysztof, et al.
Pubblicazione: (2026)
Meme Trojan: Backdoor Attacks Against Hateful Meme Detection via Cross-Modal Triggers
di: Wang, Ruofei, et al.
Pubblicazione: (2024)
di: Wang, Ruofei, et al.
Pubblicazione: (2024)
TrojanDam: Detection-Free Backdoor Defense in Federated Learning through Proactive Model Robustification utilizing OOD Data
di: Dai, Yanbo, et al.
Pubblicazione: (2025)
di: Dai, Yanbo, et al.
Pubblicazione: (2025)
Uncertainty-Aware Hardware Trojan Detection Using Multimodal Deep Learning
di: Vishwakarma, Rahul, et al.
Pubblicazione: (2024)
di: Vishwakarma, Rahul, et al.
Pubblicazione: (2024)
SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding
di: Xu, Zhangchen, et al.
Pubblicazione: (2024)
di: Xu, Zhangchen, et al.
Pubblicazione: (2024)
If You Don't Understand It, Don't Use It: Eliminating Trojans with Filters Between Layers
di: Hernandez, Adriano
Pubblicazione: (2024)
di: Hernandez, Adriano
Pubblicazione: (2024)
BadScientist: Can a Research Agent Write Convincing but Unsound Papers that Fool LLM Reviewers?
di: Jiang, Fengqing, et al.
Pubblicazione: (2025)
di: Jiang, Fengqing, et al.
Pubblicazione: (2025)
Documenti analoghi
-
CleanGen: Mitigating Backdoor Attacks for Generation Tasks in Large Language Models
di: Li, Yuetai, et al.
Pubblicazione: (2024) -
Double-Dip: Thwarting Label-Only Membership Inference Attacks with Transfer Learning and Randomization
di: Rajabi, Arezoo, et al.
Pubblicazione: (2024) -
BadChain: Backdoor Chain-of-Thought Prompting for Large Language Models
di: Xiang, Zhen, et al.
Pubblicazione: (2024) -
ACE: A Model Poisoning Attack on Contribution Evaluation Methods in Federated Learning
di: Xu, Zhangchen, et al.
Pubblicazione: (2024) -
SoSBench: Benchmarking Safety Alignment on Six Scientific Domains
di: Jiang, Fengqing, et al.
Pubblicazione: (2025)