Privacy Backdoors: Enhancing Membership Inference through Poisoning Pre-trained Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wen, Yuxin, Marchyok, Leo, Hong, Sanghyun, Geiping, Jonas, Goldstein, Tom, Carlini, Nicholas |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Discovering Universal Activation Directions for PII Leakage in Language Models
par: Marchyok, Leo, et autres
Publié: (2026)
par: Marchyok, Leo, et autres
Publié: (2026)
Certified Robustness to Clean-Label Poisoning Using Diffusion Denoising
par: Hong, Sanghyun, et autres
Publié: (2024)
par: Hong, Sanghyun, et autres
Publié: (2024)
A Watermark for Large Language Models
par: Kirchenbauer, John, et autres
Publié: (2023)
par: Kirchenbauer, John, et autres
Publié: (2023)
Generating Potent Poisons and Backdoors from Scratch with Guided Diffusion
par: Souri, Hossein, et autres
Publié: (2024)
par: Souri, Hossein, et autres
Publié: (2024)
Coercing LLMs to do and reveal (almost) anything
par: Geiping, Jonas, et autres
Publié: (2024)
par: Geiping, Jonas, et autres
Publié: (2024)
IF-GUIDE: Influence Function-Guided Detoxification of LLMs
par: Coalson, Zachary, et autres
Publié: (2025)
par: Coalson, Zachary, et autres
Publié: (2025)
Privacy Auditing of Multi-domain Graph Pre-trained Model under Membership Inference Attacks
par: Luo, Jiayi, et autres
Publié: (2025)
par: Luo, Jiayi, et autres
Publié: (2025)
Remote Timing Attacks on Efficient Language Model Inference
par: Carlini, Nicholas, et autres
Publié: (2024)
par: Carlini, Nicholas, et autres
Publié: (2024)
Winter Soldier: Backdooring Language Models at Pre-Training with Indirect Data Poisoning
par: Bouaziz, Wassim, et autres
Publié: (2025)
par: Bouaziz, Wassim, et autres
Publié: (2025)
What Really is a Member? Discrediting Membership Inference via Poisoning
par: Mangaokar, Neal, et autres
Publié: (2025)
par: Mangaokar, Neal, et autres
Publié: (2025)
On the Reliability of Watermarks for Large Language Models
par: Kirchenbauer, John, et autres
Publié: (2023)
par: Kirchenbauer, John, et autres
Publié: (2023)
Cutting through buggy adversarial example defenses: fixing 1 line of code breaks Sabre
par: Carlini, Nicholas
Publié: (2024)
par: Carlini, Nicholas
Publié: (2024)
Model Supply Chain Poisoning: Backdooring Pre-trained Models via Embedding Indistinguishability
par: Wang, Hao, et autres
Publié: (2024)
par: Wang, Hao, et autres
Publié: (2024)
The Sample Complexity of Membership Inference and Privacy Auditing
par: Haghifam, Mahdi, et autres
Publié: (2025)
par: Haghifam, Mahdi, et autres
Publié: (2025)
Hide in Plain Sight: Clean-Label Backdoor for Auditing Membership Inference
par: Chen, Depeng, et autres
Publié: (2024)
par: Chen, Depeng, et autres
Publié: (2024)
Enhancing One-run Privacy Auditing with Quantile Regression-Based Membership Inference
par: Liu, Terrance, et autres
Publié: (2025)
par: Liu, Terrance, et autres
Publié: (2025)
Membership Inference Attacks and Privacy in Topic Modeling
par: Manzonelli, Nico, et autres
Publié: (2024)
par: Manzonelli, Nico, et autres
Publié: (2024)
Secure Transfer Learning: Training Clean Models Against Backdoor in (Both) Pre-trained Encoders and Downstream Datasets
par: Zhang, Yechao, et autres
Publié: (2025)
par: Zhang, Yechao, et autres
Publié: (2025)
Hard Work Does Not Always Pay Off: Poisoning Attacks on Neural Architecture Search
par: Coalson, Zachary, et autres
Publié: (2024)
par: Coalson, Zachary, et autres
Publié: (2024)
Training Data Reconstruction: Privacy due to Uncertainty?
par: Runkel, Christina, et autres
Publié: (2024)
par: Runkel, Christina, et autres
Publié: (2024)
Modeling Neural Networks with Privacy Using Neural Stochastic Differential Equations
par: Hong, Sanghyun, et autres
Publié: (2025)
par: Hong, Sanghyun, et autres
Publié: (2025)
Mitigating Privacy Risk in Membership Inference by Convex-Concave Loss
par: Liu, Zhenlong, et autres
Publié: (2024)
par: Liu, Zhenlong, et autres
Publié: (2024)
Indiscriminate Data Poisoning Attacks on Pre-trained Feature Extractors
par: Lu, Yiwei, et autres
Publié: (2024)
par: Lu, Yiwei, et autres
Publié: (2024)
ToxicTextCLIP: Text-Based Poisoning and Backdoor Attacks on CLIP Pre-training
par: Yao, Xin, et autres
Publié: (2025)
par: Yao, Xin, et autres
Publié: (2025)
Backdoor Learning Curves: Explaining Backdoor Poisoning Beyond Influence Functions
par: Cinà, Antonio Emanuele, et autres
Publié: (2021)
par: Cinà, Antonio Emanuele, et autres
Publié: (2021)
Bits for Privacy: Evaluating Post-Training Quantization via Membership Inference
par: Zhang, Chenxiang, et autres
Publié: (2025)
par: Zhang, Chenxiang, et autres
Publié: (2025)
A Critical Review on the Effectiveness and Privacy Threats of Membership Inference Attacks
par: Jebreel, Najeeb, et autres
Publié: (2026)
par: Jebreel, Najeeb, et autres
Publié: (2026)
Context-Aware Membership Inference Attacks against Pre-trained Large Language Models
par: Chang, Hongyan, et autres
Publié: (2024)
par: Chang, Hongyan, et autres
Publié: (2024)
DeepLeak: Privacy Enhancing Hardening of Model Explanations Against Membership Leakage
par: Hmida, Firas Ben, et autres
Publié: (2026)
par: Hmida, Firas Ben, et autres
Publié: (2026)
Membership Inference Attacks on Sequence Models
par: Rossi, Lorenzo, et autres
Publié: (2025)
par: Rossi, Lorenzo, et autres
Publié: (2025)
Comments on "Privacy-Enhanced Federated Learning Against Poisoning Adversaries"
par: Schneider, Thomas, et autres
Publié: (2024)
par: Schneider, Thomas, et autres
Publié: (2024)
Poisoning Web-Scale Training Datasets is Practical
par: Carlini, Nicholas, et autres
Publié: (2023)
par: Carlini, Nicholas, et autres
Publié: (2023)
VoxGuard: Evaluating User and Attribute Privacy in Speech via Membership Inference Attacks
par: Tsaprazlis, Efthymios, et autres
Publié: (2025)
par: Tsaprazlis, Efthymios, et autres
Publié: (2025)
Persistent Pre-Training Poisoning of LLMs
par: Zhang, Yiming, et autres
Publié: (2024)
par: Zhang, Yiming, et autres
Publié: (2024)
Enhancing Membership Inference Attacks on Diffusion Models from a Frequency-Domain Perspective
par: Lian, Puwei, et autres
Publié: (2025)
par: Lian, Puwei, et autres
Publié: (2025)
Membership Inference for Contrastive Pre-training Models with Text-only PII Queries
par: Cheng, Ruoxi, et autres
Publié: (2026)
par: Cheng, Ruoxi, et autres
Publié: (2026)
Unveiling the Unseen: Exploring Whitebox Membership Inference through the Lens of Explainability
par: Li, Chenxi, et autres
Publié: (2024)
par: Li, Chenxi, et autres
Publié: (2024)
Imitative Membership Inference Attack
par: Du, Yuntao, et autres
Publié: (2025)
par: Du, Yuntao, et autres
Publié: (2025)
Poisoning the Pixels: Revisiting Backdoor Attacks on Semantic Segmentation
par: Zhang, Guangsheng, et autres
Publié: (2026)
par: Zhang, Guangsheng, et autres
Publié: (2026)
Has My System Prompt Been Used? Large Language Model Prompt Membership Inference
par: Levin, Roman, et autres
Publié: (2025)
par: Levin, Roman, et autres
Publié: (2025)
Documents similaires
-
Discovering Universal Activation Directions for PII Leakage in Language Models
par: Marchyok, Leo, et autres
Publié: (2026) -
Certified Robustness to Clean-Label Poisoning Using Diffusion Denoising
par: Hong, Sanghyun, et autres
Publié: (2024) -
A Watermark for Large Language Models
par: Kirchenbauer, John, et autres
Publié: (2023) -
Generating Potent Poisons and Backdoors from Scratch with Guided Diffusion
par: Souri, Hossein, et autres
Publié: (2024) -
Coercing LLMs to do and reveal (almost) anything
par: Geiping, Jonas, et autres
Publié: (2024)