On the Reliability of Watermarks for Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Kirchenbauer, John, Geiping, Jonas, Wen, Yuxin, Shu, Manli, Saifullah, Khalid, Kong, Kezhi, Fernando, Kasun, Saha, Aniruddha, Goldblum, Micah, Goldstein, Tom |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
A Watermark for Large Language Models
by: Kirchenbauer, John, et al.
Published: (2023)
by: Kirchenbauer, John, et al.
Published: (2023)
Coercing LLMs to do and reveal (almost) anything
by: Geiping, Jonas, et al.
Published: (2024)
by: Geiping, Jonas, et al.
Published: (2024)
Generating Potent Poisons and Backdoors from Scratch with Guided Diffusion
by: Souri, Hossein, et al.
Published: (2024)
by: Souri, Hossein, et al.
Published: (2024)
Privacy Backdoors: Enhancing Membership Inference through Poisoning Pre-trained Models
by: Wen, Yuxin, et al.
Published: (2024)
by: Wen, Yuxin, et al.
Published: (2024)
NESSiE: The Necessary Safety Benchmark -- Identifying Errors that should not Exist
by: Bertram, Johannes, et al.
Published: (2026)
by: Bertram, Johannes, et al.
Published: (2026)
Shadowcast: Stealthy Data Poisoning Attacks Against Vision-Language Models
by: Xu, Yuancheng, et al.
Published: (2024)
by: Xu, Yuancheng, et al.
Published: (2024)
Privacy-Preserving Mechanisms Enable Cheap Verifiable Inference of LLMs
by: Pal, Arka, et al.
Published: (2026)
by: Pal, Arka, et al.
Published: (2026)
DP-DocLDM: Differentially Private Document Image Generation using Latent Diffusion Models
by: Saifullah, Saifullah, et al.
Published: (2025)
by: Saifullah, Saifullah, et al.
Published: (2025)
A Nested Watermark for Large Language Models
by: Nagatsuka, Koichi, et al.
Published: (2025)
by: Nagatsuka, Koichi, et al.
Published: (2025)
Turning Your Strength into Watermark: Watermarking Large Language Model via Knowledge Injection
by: Li, Shuai, et al.
Published: (2023)
by: Li, Shuai, et al.
Published: (2023)
Learning to Watermark: A Selective Watermarking Framework for Large Language Models via Multi-Objective Optimization
by: Wang, Chenrui, et al.
Published: (2025)
by: Wang, Chenrui, et al.
Published: (2025)
PRIVMARK: Private Large Language Models Watermarking with MPC
by: Fargues, Thomas, et al.
Published: (2025)
by: Fargues, Thomas, et al.
Published: (2025)
A Certified Robust Watermark For Large Language Models
by: Feng, Xianheng, et al.
Published: (2024)
by: Feng, Xianheng, et al.
Published: (2024)
Cascade: Token-Sharded Private LLM Inference
by: Thomas, Rahul, et al.
Published: (2025)
by: Thomas, Rahul, et al.
Published: (2025)
An Attack to Break Permutation-Based Private Third-Party Inference Schemes for LLMs
by: Thomas, Rahul, et al.
Published: (2025)
by: Thomas, Rahul, et al.
Published: (2025)
WAVES: Benchmarking the Robustness of Image Watermarks
by: An, Bang, et al.
Published: (2024)
by: An, Bang, et al.
Published: (2024)
VOW: Verifiable and Oblivious Watermark Detection for Large Language Models
by: Luan, Xiaokun, et al.
Published: (2026)
by: Luan, Xiaokun, et al.
Published: (2026)
MorphMark: Flexible Adaptive Watermarking for Large Language Models
by: Wang, Zongqi, et al.
Published: (2025)
by: Wang, Zongqi, et al.
Published: (2025)
Watermarking Text Data on Large Language Models for Dataset Copyright
by: Liu, Yixin, et al.
Published: (2023)
by: Liu, Yixin, et al.
Published: (2023)
FedGMark: Certifiably Robust Watermarking for Federated Graph Learning
by: Yang, Yuxin, et al.
Published: (2024)
by: Yang, Yuxin, et al.
Published: (2024)
An Interpretable N-gram Perplexity Threat Model for Large Language Model Jailbreaks
by: Boreiko, Valentyn, et al.
Published: (2024)
by: Boreiko, Valentyn, et al.
Published: (2024)
EditMark: Watermarking Large Language Models based on Model Editing
by: Li, Shuai, et al.
Published: (2025)
by: Li, Shuai, et al.
Published: (2025)
An End-to-End Model for Logits-Based Large Language Models Watermarking
by: Wong, Kahim, et al.
Published: (2025)
by: Wong, Kahim, et al.
Published: (2025)
Signal Watermark on Large Language Models
by: Xu, Zhenyu, et al.
Published: (2024)
by: Xu, Zhenyu, et al.
Published: (2024)
Let Watermarks Speak: A Robust and Unforgeable Watermark for Language Models
by: Bai, Minhao
Published: (2024)
by: Bai, Minhao
Published: (2024)
A Robust Semantics-based Watermark for Large Language Model against Paraphrasing
by: Ren, Jie, et al.
Published: (2023)
by: Ren, Jie, et al.
Published: (2023)
Has My System Prompt Been Used? Large Language Model Prompt Membership Inference
by: Levin, Roman, et al.
Published: (2025)
by: Levin, Roman, et al.
Published: (2025)
Yet Another Watermark for Large Language Models
by: Bao, Siyuan, et al.
Published: (2025)
by: Bao, Siyuan, et al.
Published: (2025)
Functional Subspace Watermarking for Large Language Models
by: Ding, Zikang, et al.
Published: (2026)
by: Ding, Zikang, et al.
Published: (2026)
RL Is a Hammer and LLMs Are Nails: A Simple Reinforcement Learning Recipe for Strong Prompt Injection
by: Wen, Yuxin, et al.
Published: (2025)
by: Wen, Yuxin, et al.
Published: (2025)
VertMark: A Unified Training-Free Robust Watermarking Framework for Vertical Domain Pre-trained Language Models
by: Kong, Cong, et al.
Published: (2026)
by: Kong, Cong, et al.
Published: (2026)
BackFlush: Knowledge-Free Backdoor Detection and Elimination with Watermark Preservation in Large Language Models
by: Rachapudi, Jagadeesh, et al.
Published: (2026)
by: Rachapudi, Jagadeesh, et al.
Published: (2026)
Majority Bit-Aware Watermarking For Large Language Models
by: Xu, Jiahao, et al.
Published: (2025)
by: Xu, Jiahao, et al.
Published: (2025)
Breaking Distortion-free Watermarks in Large Language Models
by: Reynolds, Shayleen, et al.
Published: (2025)
by: Reynolds, Shayleen, et al.
Published: (2025)
Watermarking Techniques for Large Language Models: A Survey
by: Liang, Yuqing, et al.
Published: (2024)
by: Liang, Yuqing, et al.
Published: (2024)
Evaluating the Reliability and Fidelity of Automated Judgment Systems of Large Language Models
by: Biskupski, Tom, et al.
Published: (2026)
by: Biskupski, Tom, et al.
Published: (2026)
An Ensemble Framework for Unbiased Language Model Watermarking
by: Wu, Yihan, et al.
Published: (2025)
by: Wu, Yihan, et al.
Published: (2025)
Analyzing and Evaluating Unbiased Language Model Watermark
by: Wu, Yihan, et al.
Published: (2025)
by: Wu, Yihan, et al.
Published: (2025)
Provable Privacy Guarantee for Individual Identities and Locations in Large-Scale Contact Tracing
by: Nicewarner, Tyler, et al.
Published: (2024)
by: Nicewarner, Tyler, et al.
Published: (2024)
Assertain: Automated Security Assertion Generation Using Large Language Models
by: Tarek, Shams, et al.
Published: (2026)
by: Tarek, Shams, et al.
Published: (2026)
Similar Items
-
A Watermark for Large Language Models
by: Kirchenbauer, John, et al.
Published: (2023) -
Coercing LLMs to do and reveal (almost) anything
by: Geiping, Jonas, et al.
Published: (2024) -
Generating Potent Poisons and Backdoors from Scratch with Guided Diffusion
by: Souri, Hossein, et al.
Published: (2024) -
Privacy Backdoors: Enhancing Membership Inference through Poisoning Pre-trained Models
by: Wen, Yuxin, et al.
Published: (2024) -
NESSiE: The Necessary Safety Benchmark -- Identifying Errors that should not Exist
by: Bertram, Johannes, et al.
Published: (2026)