WARDEN: Multi-Directional Backdoor Watermarks for Embedding-as-a-Service Copyright Protection
Fuente:
arXiv
Salvato in:
| Autori principali: | Shetty, Anudeex, Teng, Yue, He, Ke, Xu, Qiongkai |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
WET: Overcoming Paraphrasing Vulnerabilities in Embeddings-as-a-Service with Linear Transformation Watermarks
di: Shetty, Anudeex, et al.
Pubblicazione: (2024)
di: Shetty, Anudeex, et al.
Pubblicazione: (2024)
Watermarks for Embeddings-as-a-Service Large Language Models
di: Shetty, Anudeex
Pubblicazione: (2025)
di: Shetty, Anudeex
Pubblicazione: (2025)
Geometry-Aware Localized Watermarking for Copyright Protection in Embedding-as-a-Service
di: Chen, Zhimin, et al.
Pubblicazione: (2026)
di: Chen, Zhimin, et al.
Pubblicazione: (2026)
In Vino Veritas and Vulnerabilities: Examining LLM Safety via Drunk Language Inducement
di: Shetty, Anudeex, et al.
Pubblicazione: (2026)
di: Shetty, Anudeex, et al.
Pubblicazione: (2026)
IDT: Dual-Task Adversarial Attacks for Privacy Protection
di: Faustini, Pedro, et al.
Pubblicazione: (2024)
di: Faustini, Pedro, et al.
Pubblicazione: (2024)
From Essence to Defense: Adaptive Semantic-aware Watermarking for Embedding-as-a-Service Copyright Protection
di: Li, Hao, et al.
Pubblicazione: (2025)
di: Li, Hao, et al.
Pubblicazione: (2025)
RegionMarker: A Region-Triggered Semantic Watermarking Framework for Embedding-as-a-Service Copyright Protection
di: Yang, Shufan, et al.
Pubblicazione: (2025)
di: Yang, Shufan, et al.
Pubblicazione: (2025)
Copyright-Protected Language Generation via Adaptive Model Fusion
di: Abad, Javier, et al.
Pubblicazione: (2024)
di: Abad, Javier, et al.
Pubblicazione: (2024)
DiffusionShield: A Watermark for Copyright Protection against Generative Diffusion Models
di: Cui, Yingqian, et al.
Pubblicazione: (2023)
di: Cui, Yingqian, et al.
Pubblicazione: (2023)
Protecting Copyright of Medical Pre-trained Language Models: Training-Free Backdoor Model Watermarking
di: Kong, Cong, et al.
Pubblicazione: (2024)
di: Kong, Cong, et al.
Pubblicazione: (2024)
TextSeal: A Localized LLM Watermark for Provenance & Distillation Protection
di: Sander, Tom, et al.
Pubblicazione: (2026)
di: Sander, Tom, et al.
Pubblicazione: (2026)
Cut the Deadwood Out: Backdoor Purification via Guided Module Substitution
di: Tong, Yao, et al.
Pubblicazione: (2024)
di: Tong, Yao, et al.
Pubblicazione: (2024)
Multi-Trigger Poisoning Amplifies Backdoor Vulnerabilities in LLMs
di: Sivapiromrat, Sanhanat, et al.
Pubblicazione: (2025)
di: Sivapiromrat, Sanhanat, et al.
Pubblicazione: (2025)
SEEP: Training Dynamics Grounds Latent Representation Search for Mitigating Backdoor Poisoning Attacks
di: He, Xuanli, et al.
Pubblicazione: (2024)
di: He, Xuanli, et al.
Pubblicazione: (2024)
Watermarks in the Sand: Impossibility of Strong Watermarking for Generative Models
di: Zhang, Hanlin, et al.
Pubblicazione: (2023)
di: Zhang, Hanlin, et al.
Pubblicazione: (2023)
Generative Models are Self-Watermarked: Declaring Model Authentication through Re-Generation
di: Desu, Aditya, et al.
Pubblicazione: (2024)
di: Desu, Aditya, et al.
Pubblicazione: (2024)
Watermark under Fire: A Robustness Evaluation of LLM Watermarking
di: Liang, Jiacheng, et al.
Pubblicazione: (2024)
di: Liang, Jiacheng, et al.
Pubblicazione: (2024)
Protecting Copyrighted Material with Unique Identifiers in Large Language Model Training
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
No Free Lunch in LLM Watermarking: Trade-offs in Watermarking Design Choices
di: Pang, Qi, et al.
Pubblicazione: (2024)
di: Pang, Qi, et al.
Pubblicazione: (2024)
Digger: Detecting Copyright Content Mis-usage in Large Language Model Training
di: Li, Haodong, et al.
Pubblicazione: (2024)
di: Li, Haodong, et al.
Pubblicazione: (2024)
SteganoBackdoor: Stealthy and Data-Efficient Backdoor Attacks on Language Models
di: Xue, Eric, et al.
Pubblicazione: (2025)
di: Xue, Eric, et al.
Pubblicazione: (2025)
On the Learnability of Watermarks for Language Models
di: Gu, Chenchen, et al.
Pubblicazione: (2023)
di: Gu, Chenchen, et al.
Pubblicazione: (2023)
FreqMark: Frequency-Based Watermark for Sentence-Level Detection of LLM-Generated Text
di: Xu, Zhenyu, et al.
Pubblicazione: (2024)
di: Xu, Zhenyu, et al.
Pubblicazione: (2024)
A Transfer Attack to Image Watermarks
di: Hu, Yuepeng, et al.
Pubblicazione: (2024)
di: Hu, Yuepeng, et al.
Pubblicazione: (2024)
Revisiting the Robustness of Watermarking to Paraphrasing Attacks
di: Rastogi, Saksham, et al.
Pubblicazione: (2024)
di: Rastogi, Saksham, et al.
Pubblicazione: (2024)
A Watermark for Large Language Models
di: Kirchenbauer, John, et al.
Pubblicazione: (2023)
di: Kirchenbauer, John, et al.
Pubblicazione: (2023)
Watermarking Needs Input Repetition Masking
di: Khachaturov, David, et al.
Pubblicazione: (2025)
di: Khachaturov, David, et al.
Pubblicazione: (2025)
On the Reliability of Watermarks for Large Language Models
di: Kirchenbauer, John, et al.
Pubblicazione: (2023)
di: Kirchenbauer, John, et al.
Pubblicazione: (2023)
Publicly-Detectable Watermarking for Language Models
di: Fairoze, Jaiden, et al.
Pubblicazione: (2023)
di: Fairoze, Jaiden, et al.
Pubblicazione: (2023)
TuBA: Cross-Lingual Transferability of Backdoor Attacks in LLMs with Instruction Tuning
di: He, Xuanli, et al.
Pubblicazione: (2024)
di: He, Xuanli, et al.
Pubblicazione: (2024)
Watermarking Language Models through Language Models
di: Dasgupta, Agnibh, et al.
Pubblicazione: (2024)
di: Dasgupta, Agnibh, et al.
Pubblicazione: (2024)
Topic-Based Watermarks for Large Language Models
di: Nemecek, Alexander, et al.
Pubblicazione: (2024)
di: Nemecek, Alexander, et al.
Pubblicazione: (2024)
Watermarking Language Models with Error Correcting Codes
di: Chao, Patrick, et al.
Pubblicazione: (2024)
di: Chao, Patrick, et al.
Pubblicazione: (2024)
A Watermark for Black-Box Language Models
di: Bahri, Dara, et al.
Pubblicazione: (2024)
di: Bahri, Dara, et al.
Pubblicazione: (2024)
Robust Distortion-free Watermarks for Language Models
di: Kuditipudi, Rohith, et al.
Pubblicazione: (2023)
di: Kuditipudi, Rohith, et al.
Pubblicazione: (2023)
Watch Out for Your Guidance on Generation! Exploring Conditional Backdoor Attacks against Large Language Models
di: He, Jiaming, et al.
Pubblicazione: (2024)
di: He, Jiaming, et al.
Pubblicazione: (2024)
PVMark: Enabling Public Verifiability for LLM Watermarking Schemes
di: Duan, Haohua, et al.
Pubblicazione: (2025)
di: Duan, Haohua, et al.
Pubblicazione: (2025)
Composite Backdoor Attacks Against Large Language Models
di: Huang, Hai, et al.
Pubblicazione: (2023)
di: Huang, Hai, et al.
Pubblicazione: (2023)
Robust Data Watermarking in Language Models by Injecting Fictitious Knowledge
di: Cui, Xinyue, et al.
Pubblicazione: (2025)
di: Cui, Xinyue, et al.
Pubblicazione: (2025)
Instructions as Backdoors: Backdoor Vulnerabilities of Instruction Tuning for Large Language Models
di: Xu, Jiashu, et al.
Pubblicazione: (2023)
di: Xu, Jiashu, et al.
Pubblicazione: (2023)
Documenti analoghi
-
WET: Overcoming Paraphrasing Vulnerabilities in Embeddings-as-a-Service with Linear Transformation Watermarks
di: Shetty, Anudeex, et al.
Pubblicazione: (2024) -
Watermarks for Embeddings-as-a-Service Large Language Models
di: Shetty, Anudeex
Pubblicazione: (2025) -
Geometry-Aware Localized Watermarking for Copyright Protection in Embedding-as-a-Service
di: Chen, Zhimin, et al.
Pubblicazione: (2026) -
In Vino Veritas and Vulnerabilities: Examining LLM Safety via Drunk Language Inducement
di: Shetty, Anudeex, et al.
Pubblicazione: (2026) -
IDT: Dual-Task Adversarial Attacks for Privacy Protection
di: Faustini, Pedro, et al.
Pubblicazione: (2024)