Repurposing and Evaluating the (In)Feasibility of Dataset Poisoning enabled Watermarking for Contrastive Learning

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Dai, Zhiyang, Gao, Yansong, Kuang, Boyu, Li, Haodong, Chang, Qi, Varshney, Gaurav, Abbott, Derek, Fu, Anmin
Format: Preprint
Published: 2026
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!
_version_ 1866909011415138304
author Dai, Zhiyang
Gao, Yansong
Kuang, Boyu
Li, Haodong
Chang, Qi
Varshney, Gaurav
Abbott, Derek
Fu, Anmin
author_facet Dai, Zhiyang
Gao, Yansong
Kuang, Boyu
Li, Haodong
Chang, Qi
Varshney, Gaurav
Abbott, Derek
Fu, Anmin
contents Contrastive learning (CL) reduces annotation cost via auto-derived supervisory signals. Since large-scale in-house CL datasets are infeasible, reliance on third-party or internet data is common. Recent studies show CL models are vulnerable to data-poisoning backdoor attacks, but their generalization and robustness are underexplored. We systematically evaluate existing data-poisoning backdoor attacks on CL, revealing limitations: poor dataset adaptability, low success rates, limited portability, and restrictive assumptions (e.g., downstream task knowledge). Interestingly, trigger samples exhibit distinguishable statistical divergence from clean samples, which inspires repurposing it as a watermark for dataset IP protection. Direct repurposing is challenging due to low success rates; we overcome this by statistical verification using a unified density metric. We further propose a multi-level watermarking scheme adapting to feature-level, soft-label, or hard-label outputs in CL. Experiments show some backdoor attacks can be repurposed as effective watermarks with trade-offs among fidelity, verifiability, and robustness. This work demonstrates weak backdoor effects become reliable signals for dataset IP protection in challenging CL settings.
format Preprint
id arxiv_https___arxiv_org_abs_2605_01834
institution arXiv
publishDate 2026
record_format arxiv
spellingShingle Repurposing and Evaluating the (In)Feasibility of Dataset Poisoning enabled Watermarking for Contrastive Learning
Dai, Zhiyang
Gao, Yansong
Kuang, Boyu
Li, Haodong
Chang, Qi
Varshney, Gaurav
Abbott, Derek
Fu, Anmin
Cryptography and Security
Artificial Intelligence
Contrastive learning (CL) reduces annotation cost via auto-derived supervisory signals. Since large-scale in-house CL datasets are infeasible, reliance on third-party or internet data is common. Recent studies show CL models are vulnerable to data-poisoning backdoor attacks, but their generalization and robustness are underexplored. We systematically evaluate existing data-poisoning backdoor attacks on CL, revealing limitations: poor dataset adaptability, low success rates, limited portability, and restrictive assumptions (e.g., downstream task knowledge). Interestingly, trigger samples exhibit distinguishable statistical divergence from clean samples, which inspires repurposing it as a watermark for dataset IP protection. Direct repurposing is challenging due to low success rates; we overcome this by statistical verification using a unified density metric. We further propose a multi-level watermarking scheme adapting to feature-level, soft-label, or hard-label outputs in CL. Experiments show some backdoor attacks can be repurposed as effective watermarks with trade-offs among fidelity, verifiability, and robustness. This work demonstrates weak backdoor effects become reliable signals for dataset IP protection in challenging CL settings.
title Repurposing and Evaluating the (In)Feasibility of Dataset Poisoning enabled Watermarking for Contrastive Learning
topic Cryptography and Security
Artificial Intelligence
url https://arxiv.org/abs/2605.01834