Game of Trojans: Adaptive Adversaries Against Output-based Trojaned-Model Detectors
Fuente:
arXiv
Saved in:
| Main Authors: | Sahabandu, Dinuka, Xu, Xiaojun, Rajabi, Arezoo, Niu, Luyao, Ramasubramanian, Bhaskar, Li, Bo, Poovendran, Radha |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
CleanGen: Mitigating Backdoor Attacks for Generation Tasks in Large Language Models
by: Li, Yuetai, et al.
Published: (2024)
by: Li, Yuetai, et al.
Published: (2024)
Double-Dip: Thwarting Label-Only Membership Inference Attacks with Transfer Learning and Randomization
by: Rajabi, Arezoo, et al.
Published: (2024)
by: Rajabi, Arezoo, et al.
Published: (2024)
BadChain: Backdoor Chain-of-Thought Prompting for Large Language Models
by: Xiang, Zhen, et al.
Published: (2024)
by: Xiang, Zhen, et al.
Published: (2024)
ACE: A Model Poisoning Attack on Contribution Evaluation Methods in Federated Learning
by: Xu, Zhangchen, et al.
Published: (2024)
by: Xu, Zhangchen, et al.
Published: (2024)
SoSBench: Benchmarking Safety Alignment on Six Scientific Domains
by: Jiang, Fengqing, et al.
Published: (2025)
by: Jiang, Fengqing, et al.
Published: (2025)
Who is Responsible? Explaining Safety Violations in Multi-Agent Cyber-Physical Systems
by: Niu, Luyao, et al.
Published: (2024)
by: Niu, Luyao, et al.
Published: (2024)
ChatBug: A Common Vulnerability of Aligned LLMs Induced by Chat Templates
by: Jiang, Fengqing, et al.
Published: (2024)
by: Jiang, Fengqing, et al.
Published: (2024)
CANTXSec: A Deterministic Intrusion Detection and Prevention System for CAN Bus Monitoring ECU Activations
by: Donadel, Denis, et al.
Published: (2025)
by: Donadel, Denis, et al.
Published: (2025)
TrojanGYM: A Detector-in-the-Loop LLM for Adaptive RTL Hardware Trojan Insertion
by: Sreekumar, Saideep, et al.
Published: (2026)
by: Sreekumar, Saideep, et al.
Published: (2026)
Brave: Byzantine-Resilient and Privacy-Preserving Peer-to-Peer Federated Learning
by: Xu, Zhangchen, et al.
Published: (2024)
by: Xu, Zhangchen, et al.
Published: (2024)
TrojanForge: Generating Adversarial Hardware Trojan Examples Using Reinforcement Learning
by: Sarihi, Amin, et al.
Published: (2024)
by: Sarihi, Amin, et al.
Published: (2024)
Trojan Cleansing with Neural Collapse
by: Gu, Xihe, et al.
Published: (2024)
by: Gu, Xihe, et al.
Published: (2024)
Evasive Hardware Trojan through Adversarial Power Trace
by: Omidi, Behnam, et al.
Published: (2024)
by: Omidi, Behnam, et al.
Published: (2024)
TrojanLoC: LLM-based Framework for RTL Trojan Localization
by: Xiao, Weihua, et al.
Published: (2025)
by: Xiao, Weihua, et al.
Published: (2025)
TrojanPuzzle: Covertly Poisoning Code-Suggestion Models
by: Aghakhani, Hojjat, et al.
Published: (2023)
by: Aghakhani, Hojjat, et al.
Published: (2023)
Neural Trojans
by: Liu, Yuntao, et al.
Published: (2017)
by: Liu, Yuntao, et al.
Published: (2017)
TrojanEdit: Multimodal Backdoor Attack Against Image Editing Model
by: Guo, Ji, et al.
Published: (2024)
by: Guo, Ji, et al.
Published: (2024)
On Trojan Signatures in Large Language Models of Code
by: Hussain, Aftab, et al.
Published: (2024)
by: Hussain, Aftab, et al.
Published: (2024)
A Method for Fast Autonomy Transfer in Reinforcement Learning
by: Sahabandu, Dinuka, et al.
Published: (2024)
by: Sahabandu, Dinuka, et al.
Published: (2024)
TrojanPraise: Jailbreak LLMs via Benign Fine-Tuning
by: Xie, Zhixin, et al.
Published: (2026)
by: Xie, Zhixin, et al.
Published: (2026)
Trojan Horse Hunt in Time Series Forecasting for Space Operations
by: Kotowski, Krzysztof, et al.
Published: (2025)
by: Kotowski, Krzysztof, et al.
Published: (2025)
HeisenTrojans: They Are Not There Until They Are Triggered
by: Mavurapu, Akshita Reddy, et al.
Published: (2023)
by: Mavurapu, Akshita Reddy, et al.
Published: (2023)
Evil from Within: Machine Learning Backdoors through Hardware Trojans
by: Warnecke, Alexander, et al.
Published: (2023)
by: Warnecke, Alexander, et al.
Published: (2023)
TROJAN-GUARD: Hardware Trojans Detection Using GNN in RTL Designs
by: Thorat, Kiran, et al.
Published: (2025)
by: Thorat, Kiran, et al.
Published: (2025)
Trojans in Artificial Intelligence (TrojAI) Final Report
by: Reese, Kristopher W., et al.
Published: (2026)
by: Reese, Kristopher W., et al.
Published: (2026)
An AI Architecture with the Capability to Classify and Explain Hardware Trojans
by: Whitten, Paul, et al.
Published: (2024)
by: Whitten, Paul, et al.
Published: (2024)
TrojanWhisper: Evaluating Pre-trained LLMs to Detect and Localize Hardware Trojans
by: Faruque, Md Omar, et al.
Published: (2024)
by: Faruque, Md Omar, et al.
Published: (2024)
TrojanDec: Data-free Detection of Trojan Inputs in Self-supervised Learning
by: Liu, Yupei, et al.
Published: (2025)
by: Liu, Yupei, et al.
Published: (2025)
The Philosopher's Stone: Trojaning Plugins of Large Language Models
by: Dong, Tian, et al.
Published: (2023)
by: Dong, Tian, et al.
Published: (2023)
Protecting Model Adaptation from Trojans in the Unlabeled Data
by: Sheng, Lijun, et al.
Published: (2024)
by: Sheng, Lijun, et al.
Published: (2024)
Are You Using Reliable Graph Prompts? Trojan Prompt Attacks on Graph Neural Networks
by: Lin, Minhua, et al.
Published: (2024)
by: Lin, Minhua, et al.
Published: (2024)
The Trojan Knowledge: Bypassing Commercial LLM Guardrails via Harmless Prompt Weaving and Adaptive Tree Search
by: Wei, Rongzhe, et al.
Published: (2025)
by: Wei, Rongzhe, et al.
Published: (2025)
Hardware Trojans in Quantum Circuits, Their Impacts, and Defense
by: Roy, Rupshali, et al.
Published: (2024)
by: Roy, Rupshali, et al.
Published: (2024)
Trojan horse hunt in deep forecasting models: Insights from the European Space Agency competition
by: Kotowski, Krzysztof, et al.
Published: (2026)
by: Kotowski, Krzysztof, et al.
Published: (2026)
Meme Trojan: Backdoor Attacks Against Hateful Meme Detection via Cross-Modal Triggers
by: Wang, Ruofei, et al.
Published: (2024)
by: Wang, Ruofei, et al.
Published: (2024)
TrojanDam: Detection-Free Backdoor Defense in Federated Learning through Proactive Model Robustification utilizing OOD Data
by: Dai, Yanbo, et al.
Published: (2025)
by: Dai, Yanbo, et al.
Published: (2025)
Uncertainty-Aware Hardware Trojan Detection Using Multimodal Deep Learning
by: Vishwakarma, Rahul, et al.
Published: (2024)
by: Vishwakarma, Rahul, et al.
Published: (2024)
SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding
by: Xu, Zhangchen, et al.
Published: (2024)
by: Xu, Zhangchen, et al.
Published: (2024)
If You Don't Understand It, Don't Use It: Eliminating Trojans with Filters Between Layers
by: Hernandez, Adriano
Published: (2024)
by: Hernandez, Adriano
Published: (2024)
BadScientist: Can a Research Agent Write Convincing but Unsound Papers that Fool LLM Reviewers?
by: Jiang, Fengqing, et al.
Published: (2025)
by: Jiang, Fengqing, et al.
Published: (2025)
Similar Items
-
CleanGen: Mitigating Backdoor Attacks for Generation Tasks in Large Language Models
by: Li, Yuetai, et al.
Published: (2024) -
Double-Dip: Thwarting Label-Only Membership Inference Attacks with Transfer Learning and Randomization
by: Rajabi, Arezoo, et al.
Published: (2024) -
BadChain: Backdoor Chain-of-Thought Prompting for Large Language Models
by: Xiang, Zhen, et al.
Published: (2024) -
ACE: A Model Poisoning Attack on Contribution Evaluation Methods in Federated Learning
by: Xu, Zhangchen, et al.
Published: (2024) -
SoSBench: Benchmarking Safety Alignment on Six Scientific Domains
by: Jiang, Fengqing, et al.
Published: (2025)