BackdoorAgent: A Unified Framework for Backdoor Attacks on LLM-based Agents
Fuente:
arXiv
Guardado en:
| Autores principales: | Feng, Yunhao, Li, Yige, Wu, Yutao, Tan, Yingshui, Guo, Yanming, Ding, Yifan, Zhai, Kun, Ma, Xingjun, Jiang, Yu-Gang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
AgentHazard: A Benchmark for Evaluating Harmful Behavior in Computer-Use Agents
por: Feng, Yunhao, et al.
Publicado: (2026)
por: Feng, Yunhao, et al.
Publicado: (2026)
SkillTrojan: Backdoor Attacks on Skill-Based Agent Systems
por: Feng, Yunhao, et al.
Publicado: (2026)
por: Feng, Yunhao, et al.
Publicado: (2026)
AutoBackdoor: Automating Backdoor Attacks via LLM Agents
por: Li, Yige, et al.
Publicado: (2025)
por: Li, Yige, et al.
Publicado: (2025)
BackdoorVLM: A Benchmark for Backdoor Attacks on Vision-Language Models
por: Li, Juncheng, et al.
Publicado: (2025)
por: Li, Juncheng, et al.
Publicado: (2025)
BackdoorLLM: A Comprehensive Benchmark for Backdoor Attacks and Defenses on Large Language Models
por: Li, Yige, et al.
Publicado: (2024)
por: Li, Yige, et al.
Publicado: (2024)
Shortcuts Everywhere and Nowhere: Exploring Multi-Trigger Backdoor Attacks
por: Li, Yige, et al.
Publicado: (2024)
por: Li, Yige, et al.
Publicado: (2024)
Expose Before You Defend: Unifying and Enhancing Backdoor Defenses via Exposed Models
por: Li, Yige, et al.
Publicado: (2024)
por: Li, Yige, et al.
Publicado: (2024)
BraveGuard: From Open-World Threats to Safer Computer-Use Agents
por: Feng, Yunhao, et al.
Publicado: (2026)
por: Feng, Yunhao, et al.
Publicado: (2026)
AttackVLA: Benchmarking Adversarial and Backdoor Attacks on Vision-Language-Action Models
por: Li, Jiayu, et al.
Publicado: (2025)
por: Li, Jiayu, et al.
Publicado: (2025)
Backdoor4Good: Benchmarking Beneficial Uses of Backdoors in LLMs
por: Li, Yige, et al.
Publicado: (2026)
por: Li, Yige, et al.
Publicado: (2026)
DemonAgent: Dynamically Encrypted Multi-Backdoor Implantation Attack on LLM-based Agent
por: Zhu, Pengyu, et al.
Publicado: (2025)
por: Zhu, Pengyu, et al.
Publicado: (2025)
End-to-End Anti-Backdoor Learning on Images and Time Series
por: Jiang, Yujing, et al.
Publicado: (2024)
por: Jiang, Yujing, et al.
Publicado: (2024)
Detecting Backdoor Samples in Contrastive Language Image Pretraining
por: Huang, Hanxun, et al.
Publicado: (2025)
por: Huang, Hanxun, et al.
Publicado: (2025)
Backdoor Token Unlearning: Exposing and Defending Backdoors in Pretrained Language Models
por: Jiang, Peihai, et al.
Publicado: (2025)
por: Jiang, Peihai, et al.
Publicado: (2025)
BadAgent: Inserting and Activating Backdoor Attacks in LLM Agents
por: Wang, Yifei, et al.
Publicado: (2024)
por: Wang, Yifei, et al.
Publicado: (2024)
DropVLA: An Action-Level Backdoor Attack on Vision-Language-Action Models
por: Xu, Zonghuan, et al.
Publicado: (2025)
por: Xu, Zonghuan, et al.
Publicado: (2025)
HoneypotNet: Backdoor Attacks Against Model Extraction
por: Wang, Yixu, et al.
Publicado: (2025)
por: Wang, Yixu, et al.
Publicado: (2025)
Compromising Embodied Agents with Contextual Backdoor Attacks
por: Liu, Aishan, et al.
Publicado: (2024)
por: Liu, Aishan, et al.
Publicado: (2024)
Just Ask: Curious Code Agents Reveal System Prompts in Frontier LLMs
por: Zheng, Xiang, et al.
Publicado: (2026)
por: Zheng, Xiang, et al.
Publicado: (2026)
PaperAsk: A Benchmark for Reliability Evaluation of LLMs in Paper Search and Reading
por: Wu, Yutao, et al.
Publicado: (2025)
por: Wu, Yutao, et al.
Publicado: (2025)
Stateful Agent Backdoor
por: Dai, Zhengchunmin, et al.
Publicado: (2026)
por: Dai, Zhengchunmin, et al.
Publicado: (2026)
Towards Unified Robustness Against Both Backdoor and Adversarial Attacks
por: Niu, Zhenxing, et al.
Publicado: (2024)
por: Niu, Zhenxing, et al.
Publicado: (2024)
Collaborative Shadows: Distributed Backdoor Attacks in LLM-Based Multi-Agent Systems
por: Zhu, Pengyu, et al.
Publicado: (2025)
por: Zhu, Pengyu, et al.
Publicado: (2025)
Physical Backdoor: Towards Temperature-based Backdoor Attacks in the Physical World
por: Yin, Wen, et al.
Publicado: (2024)
por: Yin, Wen, et al.
Publicado: (2024)
Mitigating Backdoor Attack by Injecting Proactive Defensive Backdoor
por: Wei, Shaokui, et al.
Publicado: (2024)
por: Wei, Shaokui, et al.
Publicado: (2024)
Backdoor for Debias: Mitigating Model Bias with Backdoor Attack-based Artificial Bias
por: Wu, Shangxi, et al.
Publicado: (2023)
por: Wu, Shangxi, et al.
Publicado: (2023)
Your Agent Can Defend Itself against Backdoor Attacks
por: Changjiang, Li, et al.
Publicado: (2025)
por: Changjiang, Li, et al.
Publicado: (2025)
Toward Universal and Transferable Jailbreak Attacks on Vision-Language Models
por: Cui, Kaiyuan, et al.
Publicado: (2026)
por: Cui, Kaiyuan, et al.
Publicado: (2026)
AgentRAE: Remote Action Execution through Notification-based Visual Backdoors against Screenshots-based Mobile GUI Agents
por: Luo, Yutao, et al.
Publicado: (2026)
por: Luo, Yutao, et al.
Publicado: (2026)
ADMIT: Few-shot Knowledge Poisoning Attacks on RAG-based Fact Checking
por: Wu, Yutao, et al.
Publicado: (2025)
por: Wu, Yutao, et al.
Publicado: (2025)
VillanDiffusion: A Unified Backdoor Attack Framework for Diffusion Models
por: Chou, Sheng-Yen, et al.
Publicado: (2023)
por: Chou, Sheng-Yen, et al.
Publicado: (2023)
Is the Trigger Essential? A Feature-Based Triggerless Backdoor Attack in Vertical Federated Learning
por: Liu, Yige, et al.
Publicado: (2026)
por: Liu, Yige, et al.
Publicado: (2026)
Watch Out for Your Agents! Investigating Backdoor Threats to LLM-Based Agents
por: Yang, Wenkai, et al.
Publicado: (2024)
por: Yang, Wenkai, et al.
Publicado: (2024)
When Backdoors Speak: Understanding LLM Backdoor Attacks Through Model-Generated Explanations
por: Ge, Huaizhi, et al.
Publicado: (2024)
por: Ge, Huaizhi, et al.
Publicado: (2024)
Parasite: A Steganography-based Backdoor Attack Framework for Diffusion Models
por: Chen, Jiahao, et al.
Publicado: (2025)
por: Chen, Jiahao, et al.
Publicado: (2025)
Event Trojan: Asynchronous Event-based Backdoor Attacks
por: Wang, Ruofei, et al.
Publicado: (2024)
por: Wang, Ruofei, et al.
Publicado: (2024)
Data Free Backdoor Attacks
por: Cao, Bochuan, et al.
Publicado: (2024)
por: Cao, Bochuan, et al.
Publicado: (2024)
Can We Trust Embodied Agents? Exploring Backdoor Attacks against Embodied LLM-based Decision-Making Systems
por: Jiao, Ruochen, et al.
Publicado: (2024)
por: Jiao, Ruochen, et al.
Publicado: (2024)
Persistent Backdoor Attacks in Continual Learning
por: Guo, Zhen, et al.
Publicado: (2024)
por: Guo, Zhen, et al.
Publicado: (2024)
Invisible Backdoor Attacks on Diffusion Models
por: Li, Sen, et al.
Publicado: (2024)
por: Li, Sen, et al.
Publicado: (2024)
Ejemplares similares
-
AgentHazard: A Benchmark for Evaluating Harmful Behavior in Computer-Use Agents
por: Feng, Yunhao, et al.
Publicado: (2026) -
SkillTrojan: Backdoor Attacks on Skill-Based Agent Systems
por: Feng, Yunhao, et al.
Publicado: (2026) -
AutoBackdoor: Automating Backdoor Attacks via LLM Agents
por: Li, Yige, et al.
Publicado: (2025) -
BackdoorVLM: A Benchmark for Backdoor Attacks on Vision-Language Models
por: Li, Juncheng, et al.
Publicado: (2025) -
BackdoorLLM: A Comprehensive Benchmark for Backdoor Attacks and Defenses on Large Language Models
por: Li, Yige, et al.
Publicado: (2024)