Inverting Trojans in LLMs
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Zhengxing, Yang, Guangmingmei, Raghuram, Jayaram, Miller, David J., Kesidis, George |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Improving the Sensitivity of Backdoor Detectors via Class Subspace Orthogonalization
por: Yang, Guangmingmei, et al.
Publicado: (2025)
por: Yang, Guangmingmei, et al.
Publicado: (2025)
A Study of Backdoors in Instruction Fine-tuned Language Models
por: Raghuram, Jayaram, et al.
Publicado: (2024)
por: Raghuram, Jayaram, et al.
Publicado: (2024)
CEPA: Consensus Embedded Perturbation for Agnostic Detection and Inversion of Backdoors
por: Yang, Guangmingmei, et al.
Publicado: (2024)
por: Yang, Guangmingmei, et al.
Publicado: (2024)
Adaptive Concept Bottleneck for Foundation Models Under Distribution Shifts
por: Choi, Jihye, et al.
Publicado: (2024)
por: Choi, Jihye, et al.
Publicado: (2024)
Understanding and Rectifying Safety Perception Distortion in VLMs
por: Zou, Xiaohan, et al.
Publicado: (2025)
por: Zou, Xiaohan, et al.
Publicado: (2025)
TrojanPraise: Jailbreak LLMs via Benign Fine-Tuning
por: Xie, Zhixin, et al.
Publicado: (2026)
por: Xie, Zhixin, et al.
Publicado: (2026)
Game of Trojans: Adaptive Adversaries Against Output-based Trojaned-Model Detectors
por: Sahabandu, Dinuka, et al.
Publicado: (2024)
por: Sahabandu, Dinuka, et al.
Publicado: (2024)
Generalisation in Multitask Fitted Q-Iteration and Offline Q-learning
por: Manda, Kausthubh, et al.
Publicado: (2025)
por: Manda, Kausthubh, et al.
Publicado: (2025)
Forward versus Backward: Comparing Reasoning Objectives in Direct Preference Optimization
por: Nikzad, Murtaza, et al.
Publicado: (2026)
por: Nikzad, Murtaza, et al.
Publicado: (2026)
TrojanTO: Action-Level Backdoor Attacks against Trajectory Optimization Models
por: Dai, Yang, et al.
Publicado: (2025)
por: Dai, Yang, et al.
Publicado: (2025)
Causally Testing Gender Bias in LLMs: A Case Study on Occupational Bias
por: Chen, Yuen, et al.
Publicado: (2022)
por: Chen, Yuen, et al.
Publicado: (2022)
Trojan Cleansing with Neural Collapse
por: Gu, Xihe, et al.
Publicado: (2024)
por: Gu, Xihe, et al.
Publicado: (2024)
PalmBench: A Comprehensive Benchmark of Compressed Large Language Models on Mobile Platforms
por: Li, Yilong, et al.
Publicado: (2024)
por: Li, Yilong, et al.
Publicado: (2024)
Full-Gradient Successor Feature Representations
por: Shrirao, Ritish, et al.
Publicado: (2026)
por: Shrirao, Ritish, et al.
Publicado: (2026)
Scanning Trojaned Models Using Out-of-Distribution Samples
por: Mirzaei, Hossein, et al.
Publicado: (2025)
por: Mirzaei, Hossein, et al.
Publicado: (2025)
GPU Cluster Scheduling for Network-Sensitive Deep Learning
por: Sharma, Aakash, et al.
Publicado: (2024)
por: Sharma, Aakash, et al.
Publicado: (2024)
TrojanPuzzle: Covertly Poisoning Code-Suggestion Models
por: Aghakhani, Hojjat, et al.
Publicado: (2023)
por: Aghakhani, Hojjat, et al.
Publicado: (2023)
TrojFSP: Trojan Insertion in Few-shot Prompt Tuning
por: Zheng, Mengxin, et al.
Publicado: (2023)
por: Zheng, Mengxin, et al.
Publicado: (2023)
Explainability Methods for Hardware Trojan Detection: A Systematic Comparison
por: Whitten, Paul, et al.
Publicado: (2026)
por: Whitten, Paul, et al.
Publicado: (2026)
How to Inverting the Leverage Score Distribution?
por: Li, Zhihang, et al.
Publicado: (2024)
por: Li, Zhihang, et al.
Publicado: (2024)
Learning Distinguishable Representations in Deep Q-Networks for Linear Transfer
por: Sathish, Sooraj, et al.
Publicado: (2025)
por: Sathish, Sooraj, et al.
Publicado: (2025)
TrojanForge: Generating Adversarial Hardware Trojan Examples Using Reinforcement Learning
por: Sarihi, Amin, et al.
Publicado: (2024)
por: Sarihi, Amin, et al.
Publicado: (2024)
roto 2.0: The Robot Tactile Olympiad
por: Miller, Elle, et al.
Publicado: (2026)
por: Miller, Elle, et al.
Publicado: (2026)
Trojan Horse Hunt in Time Series Forecasting for Space Operations
por: Kotowski, Krzysztof, et al.
Publicado: (2025)
por: Kotowski, Krzysztof, et al.
Publicado: (2025)
On Trojan Signatures in Large Language Models of Code
por: Hussain, Aftab, et al.
Publicado: (2024)
por: Hussain, Aftab, et al.
Publicado: (2024)
Contextual Tokenization for Graph Inverted Indices
por: Chakraborty, Pritish, et al.
Publicado: (2025)
por: Chakraborty, Pritish, et al.
Publicado: (2025)
Trojans in Artificial Intelligence (TrojAI) Final Report
por: Reese, Kristopher W., et al.
Publicado: (2026)
por: Reese, Kristopher W., et al.
Publicado: (2026)
Inverting the Leverage Score Gradient: An Efficient Approximate Newton Method
por: Li, Chenyang, et al.
Publicado: (2024)
por: Li, Chenyang, et al.
Publicado: (2024)
Cycle-Consistent Helmholtz Machine: Goal-Seeded Simulation via Inverted Inference
por: Li, Xin
Publicado: (2025)
por: Li, Xin
Publicado: (2025)
Inverting Non-Injective Functions with Twin Neural Network Regression
por: Wetzel, Sebastian J.
Publicado: (2026)
por: Wetzel, Sebastian J.
Publicado: (2026)
Adaptive Sampled Softmax with Inverted Multi-Index: Methods, Theory and Applications
por: Chen, Jin, et al.
Publicado: (2025)
por: Chen, Jin, et al.
Publicado: (2025)
From Trojan Horses to Castle Walls: Unveiling Bilateral Data Poisoning Effects in Diffusion Models
por: Pan, Zhuoshi, et al.
Publicado: (2023)
por: Pan, Zhuoshi, et al.
Publicado: (2023)
TROJAN-GUARD: Hardware Trojans Detection Using GNN in RTL Designs
por: Thorat, Kiran, et al.
Publicado: (2025)
por: Thorat, Kiran, et al.
Publicado: (2025)
Evil from Within: Machine Learning Backdoors through Hardware Trojans
por: Warnecke, Alexander, et al.
Publicado: (2023)
por: Warnecke, Alexander, et al.
Publicado: (2023)
Commercial LLM Agents Are Already Vulnerable to Simple Yet Dangerous Attacks
por: Li, Ang, et al.
Publicado: (2025)
por: Li, Ang, et al.
Publicado: (2025)
Evasive Hardware Trojan through Adversarial Power Trace
por: Omidi, Behnam, et al.
Publicado: (2024)
por: Omidi, Behnam, et al.
Publicado: (2024)
An AI Architecture with the Capability to Classify and Explain Hardware Trojans
por: Whitten, Paul, et al.
Publicado: (2024)
por: Whitten, Paul, et al.
Publicado: (2024)
Inverting estimating equations for causal inference on quantiles
por: Cheng, Chao, et al.
Publicado: (2024)
por: Cheng, Chao, et al.
Publicado: (2024)
Multi-Agent Inverted Transformer for Flight Trajectory Prediction
por: Yoon, Seokbin, et al.
Publicado: (2025)
por: Yoon, Seokbin, et al.
Publicado: (2025)
Adaptive Inverted-Index Routing for Granular Mixtures-of-Experts
por: Kladny, Klaus-Rudolf, et al.
Publicado: (2026)
por: Kladny, Klaus-Rudolf, et al.
Publicado: (2026)
Ejemplares similares
-
Improving the Sensitivity of Backdoor Detectors via Class Subspace Orthogonalization
por: Yang, Guangmingmei, et al.
Publicado: (2025) -
A Study of Backdoors in Instruction Fine-tuned Language Models
por: Raghuram, Jayaram, et al.
Publicado: (2024) -
CEPA: Consensus Embedded Perturbation for Agnostic Detection and Inversion of Backdoors
por: Yang, Guangmingmei, et al.
Publicado: (2024) -
Adaptive Concept Bottleneck for Foundation Models Under Distribution Shifts
por: Choi, Jihye, et al.
Publicado: (2024) -
Understanding and Rectifying Safety Perception Distortion in VLMs
por: Zou, Xiaohan, et al.
Publicado: (2025)