Trusted Weights, Treacherous Optimizations? Optimization-Triggered Backdoor Attacks on LLMs
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Yifei, Li, Tianlin, Zhang, Xiaohan, Yang, Yida, Zhang, Xiaoyu, Pan, Li |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Compromising Embodied Agents with Contextual Backdoor Attacks
por: Liu, Aishan, et al.
Publicado: (2024)
por: Liu, Aishan, et al.
Publicado: (2024)
Concealing Backdoor Model Updates in Federated Learning by Trigger-Optimized Data Poisoning
por: Zhang, Yujie, et al.
Publicado: (2024)
por: Zhang, Yujie, et al.
Publicado: (2024)
Revisiting Backdoor Attacks on Time Series Classification in the Frequency Domain
por: Huang, Yuanmin, et al.
Publicado: (2025)
por: Huang, Yuanmin, et al.
Publicado: (2025)
The Art of Deception: Robust Backdoor Attack using Dynamic Stacking of Triggers
por: Mengara, Orson
Publicado: (2024)
por: Mengara, Orson
Publicado: (2024)
BadAgent: Inserting and Activating Backdoor Attacks in LLM Agents
por: Wang, Yifei, et al.
Publicado: (2024)
por: Wang, Yifei, et al.
Publicado: (2024)
Rethinking Pruning for Backdoor Mitigation: An Optimization Perspective
por: Li, Nan, et al.
Publicado: (2024)
por: Li, Nan, et al.
Publicado: (2024)
Heterogeneous Graph Backdoor Attack
por: Chen, Jiawei, et al.
Publicado: (2025)
por: Chen, Jiawei, et al.
Publicado: (2025)
Backdoor Secrets Unveiled: Identifying Backdoor Data with Optimized Scaled Prediction Consistency
por: Pal, Soumyadeep, et al.
Publicado: (2024)
por: Pal, Soumyadeep, et al.
Publicado: (2024)
Trapping Attacker in Dilemma: Examining Internal Correlations and External Influences of Trigger for Defending GNN Backdoors
por: Yang, Fan, et al.
Publicado: (2026)
por: Yang, Fan, et al.
Publicado: (2026)
LoBAM: LoRA-Based Backdoor Attack on Model Merging
por: Yin, Ming, et al.
Publicado: (2024)
por: Yin, Ming, et al.
Publicado: (2024)
Your Agent Can Defend Itself against Backdoor Attacks
por: Changjiang, Li, et al.
Publicado: (2025)
por: Changjiang, Li, et al.
Publicado: (2025)
Injecting Universal Jailbreak Backdoors into LLMs in Minutes
por: Chen, Zhuowei, et al.
Publicado: (2025)
por: Chen, Zhuowei, et al.
Publicado: (2025)
How to Craft Backdoors with Unlabeled Data Alone?
por: Wang, Yifei, et al.
Publicado: (2024)
por: Wang, Yifei, et al.
Publicado: (2024)
Pay Attention to the Triggers: Constructing Backdoors That Survive Distillation
por: De Muri, Giovanni, et al.
Publicado: (2025)
por: De Muri, Giovanni, et al.
Publicado: (2025)
TooBadRL: Trigger Optimization to Boost Effectiveness of Backdoor Attacks on Deep Reinforcement Learning
por: Zhang, Mingxuan, et al.
Publicado: (2025)
por: Zhang, Mingxuan, et al.
Publicado: (2025)
GenBFA: An Evolutionary Optimization Approach to Bit-Flip Attacks on LLMs
por: Das, Sanjay, et al.
Publicado: (2024)
por: Das, Sanjay, et al.
Publicado: (2024)
Data-Chain Backdoor: Do You Trust Diffusion Models as Generative Data Supplier?
por: Lu, Junchi, et al.
Publicado: (2025)
por: Lu, Junchi, et al.
Publicado: (2025)
Backdoor Vectors: a Task Arithmetic View on Backdoor Attacks and Defenses
por: Pawlak, Stanisław, et al.
Publicado: (2025)
por: Pawlak, Stanisław, et al.
Publicado: (2025)
Winning the MIDST Challenge: New Membership Inference Attacks on Diffusion Models for Tabular Data Synthesis
por: Wu, Xiaoyu, et al.
Publicado: (2025)
por: Wu, Xiaoyu, et al.
Publicado: (2025)
Structure-Aware Distributed Backdoor Attacks in Federated Learning
por: Jian, Wang, et al.
Publicado: (2026)
por: Jian, Wang, et al.
Publicado: (2026)
Unlearn to Relearn Backdoors: Deferred Backdoor Functionality Attacks on Deep Learning Models
por: Shin, Jeongjin, et al.
Publicado: (2024)
por: Shin, Jeongjin, et al.
Publicado: (2024)
UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning
por: Ma, Oubo, et al.
Publicado: (2025)
por: Ma, Oubo, et al.
Publicado: (2025)
Backdoor Attack on Vertical Federated Graph Neural Network Learning
por: Yang, Jirui, et al.
Publicado: (2024)
por: Yang, Jirui, et al.
Publicado: (2024)
Purifying Generative LLMs from Backdoors without Prior Knowledge or Clean Reference
por: Li, Jianwei, et al.
Publicado: (2026)
por: Li, Jianwei, et al.
Publicado: (2026)
Stealthy Dual-Trigger Backdoors: Attacking Prompt Tuning in LM-Empowered Graph Foundation Models
por: Xue, Xiaoyu, et al.
Publicado: (2025)
por: Xue, Xiaoyu, et al.
Publicado: (2025)
ICLShield: Exploring and Mitigating In-Context Learning Backdoor Attacks
por: Ren, Zhiyao, et al.
Publicado: (2025)
por: Ren, Zhiyao, et al.
Publicado: (2025)
BACKTIME: Backdoor Attacks on Multivariate Time Series Forecasting
por: Lin, Xiao, et al.
Publicado: (2024)
por: Lin, Xiao, et al.
Publicado: (2024)
Invisible Backdoor Attack Through Singular Value Decomposition
por: Chen, Wenmin, et al.
Publicado: (2024)
por: Chen, Wenmin, et al.
Publicado: (2024)
Graph Neural Backdoor: Fundamentals, Methodologies, Applications, and Future Directions
por: Yang, Xiao, et al.
Publicado: (2024)
por: Yang, Xiao, et al.
Publicado: (2024)
Towards Sample-specific Backdoor Attack with Clean Labels via Attribute Trigger
por: Zhu, Mingyan, et al.
Publicado: (2023)
por: Zhu, Mingyan, et al.
Publicado: (2023)
Instruction Backdoor Attacks Against Customized LLMs
por: Zhang, Rui, et al.
Publicado: (2024)
por: Zhang, Rui, et al.
Publicado: (2024)
Exploiting Layer-Specific Vulnerabilities to Backdoor Attack in Federated Learning
por: Foroughi, Mohammad Hadi, et al.
Publicado: (2026)
por: Foroughi, Mohammad Hadi, et al.
Publicado: (2026)
Backdoor Attacks on Fault Detection and Localization in Cyber-Physical Systems
por: Jean, Abile, et al.
Publicado: (2026)
por: Jean, Abile, et al.
Publicado: (2026)
Client-Side Patching against Backdoor Attacks in Federated Learning
por: Molina-Coronado, Borja
Publicado: (2024)
por: Molina-Coronado, Borja
Publicado: (2024)
Guiding not Forcing: Enhancing the Transferability of Jailbreaking Attacks on LLMs via Removing Superfluous Constraints
por: Yang, Junxiao, et al.
Publicado: (2025)
por: Yang, Junxiao, et al.
Publicado: (2025)
PRUNE: A Patching Based Repair Framework for Certifiable Unlearning of Neural Networks
por: Li, Xuran, et al.
Publicado: (2025)
por: Li, Xuran, et al.
Publicado: (2025)
BadImplant: Injection-based Multi-Targeted Graph Backdoor Attack
por: Khan, Md Nabi Newaz, et al.
Publicado: (2026)
por: Khan, Md Nabi Newaz, et al.
Publicado: (2026)
Backdoor Graph Condensation
por: Wu, Jiahao, et al.
Publicado: (2024)
por: Wu, Jiahao, et al.
Publicado: (2024)
Uncovering, Explaining, and Mitigating the Superficial Safety of Backdoor Defense
por: Min, Rui, et al.
Publicado: (2024)
por: Min, Rui, et al.
Publicado: (2024)
POT: Inducing Overthinking in LLMs via Black-Box Iterative Optimization
por: Li, Xinyu, et al.
Publicado: (2025)
por: Li, Xinyu, et al.
Publicado: (2025)
Ejemplares similares
-
Compromising Embodied Agents with Contextual Backdoor Attacks
por: Liu, Aishan, et al.
Publicado: (2024) -
Concealing Backdoor Model Updates in Federated Learning by Trigger-Optimized Data Poisoning
por: Zhang, Yujie, et al.
Publicado: (2024) -
Revisiting Backdoor Attacks on Time Series Classification in the Frequency Domain
por: Huang, Yuanmin, et al.
Publicado: (2025) -
The Art of Deception: Robust Backdoor Attack using Dynamic Stacking of Triggers
por: Mengara, Orson
Publicado: (2024) -
BadAgent: Inserting and Activating Backdoor Attacks in LLM Agents
por: Wang, Yifei, et al.
Publicado: (2024)