Backdoor in Seconds: Unlocking Vulnerabilities in Large Pre-trained Models via Model Editing
Fuente:
arXiv
Guardado en:
| Autores principales: | Guo, Dongliang, Hu, Mengxuan, Guan, Zihan, Guo, Junfeng, Hartvigsen, Thomas, Li, Sheng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
BalancEdit: Dynamically Balancing the Generality-Locality Trade-off in Multi-modal Model Editing
por: Guo, Dongliang, et al.
Publicado: (2025)
por: Guo, Dongliang, et al.
Publicado: (2025)
Enhanced Diagnostic Performance via Large-Resolution Inference Optimization for Pathology Foundation Models
por: Hu, Mengxuan, et al.
Publicado: (2026)
por: Hu, Mengxuan, et al.
Publicado: (2026)
MEGen: Generative Backdoor into Large Language Models via Model Editing
por: Qiu, Jiyang, et al.
Publicado: (2024)
por: Qiu, Jiyang, et al.
Publicado: (2024)
Text2Seg: Remote Sensing Image Semantic Segmentation via Text-Guided Visual Foundation Models
por: Zhang, Jielu, et al.
Publicado: (2023)
por: Zhang, Jielu, et al.
Publicado: (2023)
Efficient Knowledge Editing via Minimal Precomputation
por: Gupta, Akshat, et al.
Publicado: (2025)
por: Gupta, Akshat, et al.
Publicado: (2025)
UOR: Universal Backdoor Attacks on Pre-trained Language Models
por: Du, Wei, et al.
Publicado: (2023)
por: Du, Wei, et al.
Publicado: (2023)
Large Language Models for Causal Discovery: Current Landscape and Future Directions
por: Wan, Guangya, et al.
Publicado: (2024)
por: Wan, Guangya, et al.
Publicado: (2024)
UFID: A Unified Framework for Input-level Backdoor Detection on Diffusion Models
por: Guan, Zihan, et al.
Publicado: (2024)
por: Guan, Zihan, et al.
Publicado: (2024)
Are LLMs Ready for Neural-integrated Mechanistic Modeling? A Benchmark and Agentic Framework
por: Guan, Zihan, et al.
Publicado: (2026)
por: Guan, Zihan, et al.
Publicado: (2026)
Unlocking Emergent Modularity in Large Language Models
por: Qiu, Zihan, et al.
Publicado: (2023)
por: Qiu, Zihan, et al.
Publicado: (2023)
Leveraging Pre-trained Large Language Models with Refined Prompting for Online Task and Motion Planning
por: Guo, Huihui, et al.
Publicado: (2025)
por: Guo, Huihui, et al.
Publicado: (2025)
Instructions as Backdoors: Backdoor Vulnerabilities of Instruction Tuning for Large Language Models
por: Xu, Jiashu, et al.
Publicado: (2023)
por: Xu, Jiashu, et al.
Publicado: (2023)
Backdoor Samples Detection Based on Perturbation Discrepancy Consistency in Pre-trained Language Models
por: Peng, Zuquan, et al.
Publicado: (2025)
por: Peng, Zuquan, et al.
Publicado: (2025)
ReasonEdit: Editing Vision-Language Models using Human Reasoning
por: Qiu, Jiaxing, et al.
Publicado: (2026)
por: Qiu, Jiaxing, et al.
Publicado: (2026)
Img2Loc: Revisiting Image Geolocalization using Multi-modality Foundation Models and Image-based Retrieval-Augmented Generation
por: Zhou, Zhongliang, et al.
Publicado: (2024)
por: Zhou, Zhongliang, et al.
Publicado: (2024)
Revisiting Pre-trained Language Models for Vulnerability Detection
por: Li, Youpeng, et al.
Publicado: (2025)
por: Li, Youpeng, et al.
Publicado: (2025)
Exploiting the Vulnerability of Large Language Models via Defense-Aware Architectural Backdoor
por: Miah, Abdullah Arafat, et al.
Publicado: (2024)
por: Miah, Abdullah Arafat, et al.
Publicado: (2024)
Alignment-Weighted DPO: A principled reasoning approach to improve safety alignment
por: Hu, Mengxuan, et al.
Publicado: (2026)
por: Hu, Mengxuan, et al.
Publicado: (2026)
FGBERT: Function-Driven Pre-trained Gene Language Model for Metagenomics
por: Duan, ChenRui, et al.
Publicado: (2024)
por: Duan, ChenRui, et al.
Publicado: (2024)
Data Darwinism Part I: Unlocking the Value of Scientific Data for Pre-training
por: Qin, Yiwei, et al.
Publicado: (2026)
por: Qin, Yiwei, et al.
Publicado: (2026)
Pre-train and Fine-tune: Recommenders as Large Models
por: Jiang, Zhenhao, et al.
Publicado: (2025)
por: Jiang, Zhenhao, et al.
Publicado: (2025)
Exploring Backdoor Vulnerabilities of Chat Models
por: Hao, Yunzhuo, et al.
Publicado: (2024)
por: Hao, Yunzhuo, et al.
Publicado: (2024)
Selection-Based Vulnerabilities: Clean-Label Backdoor Attacks in Active Learning
por: Zhi, Yuhan, et al.
Publicado: (2025)
por: Zhi, Yuhan, et al.
Publicado: (2025)
How to Set the Learning Rate for Large-Scale Pre-training?
por: Zhou, Yunhua, et al.
Publicado: (2026)
por: Zhou, Yunhua, et al.
Publicado: (2026)
Universal Vulnerabilities in Large Language Models: Backdoor Attacks for In-context Learning
por: Zhao, Shuai, et al.
Publicado: (2024)
por: Zhao, Shuai, et al.
Publicado: (2024)
Protecting Copyright of Medical Pre-trained Language Models: Training-Free Backdoor Model Watermarking
por: Kong, Cong, et al.
Publicado: (2024)
por: Kong, Cong, et al.
Publicado: (2024)
CBV: Clean-label Backdoor Attacks on Vision Language Models via Diffusion Models
por: Guo, Ji, et al.
Publicado: (2026)
por: Guo, Ji, et al.
Publicado: (2026)
Your Compiler is Backdooring Your Model: Understanding and Exploiting Compilation Inconsistency Vulnerabilities in Deep Learning Compilers
por: Chen, Simin, et al.
Publicado: (2025)
por: Chen, Simin, et al.
Publicado: (2025)
Robust Knowledge Distillation Based on Feature Variance Against Backdoored Teacher Model
por: Chen, Jinyin, et al.
Publicado: (2024)
por: Chen, Jinyin, et al.
Publicado: (2024)
Synthesize-on-Graph: Knowledgeable Synthetic Data Generation for Continue Pre-training of Large Language Models
por: Ma, Shengjie, et al.
Publicado: (2025)
por: Ma, Shengjie, et al.
Publicado: (2025)
How to Set the Batch Size for Large-Scale Pre-training?
por: Zhou, Yunhua, et al.
Publicado: (2026)
por: Zhou, Yunhua, et al.
Publicado: (2026)
PersGuard: Preventing Malicious Personalization via Backdoor Attacks on Pre-trained Text-to-Image Diffusion Models
por: Liu, Xinwei, et al.
Publicado: (2025)
por: Liu, Xinwei, et al.
Publicado: (2025)
A Unified Understanding of Adversarial Vulnerability Regarding Unimodal Models and Vision-Language Pre-training Models
por: Zheng, Haonan, et al.
Publicado: (2024)
por: Zheng, Haonan, et al.
Publicado: (2024)
Unlocking the Power of Large Language Models for Entity Alignment
por: Jiang, Xuhui, et al.
Publicado: (2024)
por: Jiang, Xuhui, et al.
Publicado: (2024)
Effective Backdoor Mitigation in Vision-Language Models Depends on the Pre-training Objective
por: Verma, Sahil, et al.
Publicado: (2023)
por: Verma, Sahil, et al.
Publicado: (2023)
A Vision-Language Pre-training Model-Guided Approach for Mitigating Backdoor Attacks in Federated Learning
por: Gai, Keke, et al.
Publicado: (2025)
por: Gai, Keke, et al.
Publicado: (2025)
Mutual Information Guided Backdoor Mitigation for Pre-trained Encoders
por: Han, Tingxu, et al.
Publicado: (2024)
por: Han, Tingxu, et al.
Publicado: (2024)
Prompt as Triggers for Backdoor Attack: Examining the Vulnerability in Language Models
por: Zhao, Shuai, et al.
Publicado: (2023)
por: Zhao, Shuai, et al.
Publicado: (2023)
Token by Token, Compromised: Backdoor Vulnerabilities in Unified Autoregressive Models
por: Braun, Tobias, et al.
Publicado: (2026)
por: Braun, Tobias, et al.
Publicado: (2026)
Unlocking the Power of Spatial and Temporal Information in Medical Multimodal Pre-training
por: Yang, Jinxia, et al.
Publicado: (2024)
por: Yang, Jinxia, et al.
Publicado: (2024)
Ejemplares similares
-
BalancEdit: Dynamically Balancing the Generality-Locality Trade-off in Multi-modal Model Editing
por: Guo, Dongliang, et al.
Publicado: (2025) -
Enhanced Diagnostic Performance via Large-Resolution Inference Optimization for Pathology Foundation Models
por: Hu, Mengxuan, et al.
Publicado: (2026) -
MEGen: Generative Backdoor into Large Language Models via Model Editing
por: Qiu, Jiyang, et al.
Publicado: (2024) -
Text2Seg: Remote Sensing Image Semantic Segmentation via Text-Guided Visual Foundation Models
por: Zhang, Jielu, et al.
Publicado: (2023) -
Efficient Knowledge Editing via Minimal Precomputation
por: Gupta, Akshat, et al.
Publicado: (2025)