A Watermark for Black-Box Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Bahri, Dara, Wieting, John |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Improving Detection of Watermarked Language Models
por: Bahri, Dara, et al.
Publicado: (2025)
por: Bahri, Dara, et al.
Publicado: (2025)
PostMark: A Robust Blackbox Watermark for Large Language Models
por: Chang, Yapei, et al.
Publicado: (2024)
por: Chang, Yapei, et al.
Publicado: (2024)
A Watermark for Large Language Models
por: Kirchenbauer, John, et al.
Publicado: (2023)
por: Kirchenbauer, John, et al.
Publicado: (2023)
Robust Distortion-free Watermarks for Language Models
por: Kuditipudi, Rohith, et al.
Publicado: (2023)
por: Kuditipudi, Rohith, et al.
Publicado: (2023)
On the Reliability of Watermarks for Large Language Models
por: Kirchenbauer, John, et al.
Publicado: (2023)
por: Kirchenbauer, John, et al.
Publicado: (2023)
Auto-Tuning Safety Guardrails for Black-Box Large Language Models
por: Abdulkadir, Perry
Publicado: (2025)
por: Abdulkadir, Perry
Publicado: (2025)
Watermarking Language Models through Language Models
por: Dasgupta, Agnibh, et al.
Publicado: (2024)
por: Dasgupta, Agnibh, et al.
Publicado: (2024)
On the Learnability of Watermarks for Language Models
por: Gu, Chenchen, et al.
Publicado: (2023)
por: Gu, Chenchen, et al.
Publicado: (2023)
Black-Box Detection of Language Model Watermarks
por: Gloaguen, Thibaud, et al.
Publicado: (2024)
por: Gloaguen, Thibaud, et al.
Publicado: (2024)
Publicly-Detectable Watermarking for Language Models
por: Fairoze, Jaiden, et al.
Publicado: (2023)
por: Fairoze, Jaiden, et al.
Publicado: (2023)
Topic-Based Watermarks for Large Language Models
por: Nemecek, Alexander, et al.
Publicado: (2024)
por: Nemecek, Alexander, et al.
Publicado: (2024)
Watermarking Language Models with Error Correcting Codes
por: Chao, Patrick, et al.
Publicado: (2024)
por: Chao, Patrick, et al.
Publicado: (2024)
Watermarks for Embeddings-as-a-Service Large Language Models
por: Shetty, Anudeex
Publicado: (2025)
por: Shetty, Anudeex
Publicado: (2025)
Watermarks in the Sand: Impossibility of Strong Watermarking for Generative Models
por: Zhang, Hanlin, et al.
Publicado: (2023)
por: Zhang, Hanlin, et al.
Publicado: (2023)
A Resilient and Accessible Distribution-Preserving Watermark for Large Language Models
por: Wu, Yihan, et al.
Publicado: (2023)
por: Wu, Yihan, et al.
Publicado: (2023)
Robust Data Watermarking in Language Models by Injecting Fictitious Knowledge
por: Cui, Xinyue, et al.
Publicado: (2025)
por: Cui, Xinyue, et al.
Publicado: (2025)
Token-Specific Watermarking with Enhanced Detectability and Semantic Coherence for Large Language Models
por: Huo, Mingjia, et al.
Publicado: (2024)
por: Huo, Mingjia, et al.
Publicado: (2024)
PAL: Proxy-Guided Black-Box Attack on Large Language Models
por: Sitawarin, Chawin, et al.
Publicado: (2024)
por: Sitawarin, Chawin, et al.
Publicado: (2024)
Watermark under Fire: A Robustness Evaluation of LLM Watermarking
por: Liang, Jiacheng, et al.
Publicado: (2024)
por: Liang, Jiacheng, et al.
Publicado: (2024)
Robust and Secure Code Watermarking for Large Language Models via ML/Crypto Codesign
por: Zhang, Ruisi, et al.
Publicado: (2025)
por: Zhang, Ruisi, et al.
Publicado: (2025)
Debiasing Watermarks for Large Language Models via Maximal Coupling
por: Xie, Yangxinyu, et al.
Publicado: (2024)
por: Xie, Yangxinyu, et al.
Publicado: (2024)
Watermarking Makes Language Models Radioactive
por: Sander, Tom, et al.
Publicado: (2024)
por: Sander, Tom, et al.
Publicado: (2024)
No Free Lunch in LLM Watermarking: Trade-offs in Watermarking Design Choices
por: Pang, Qi, et al.
Publicado: (2024)
por: Pang, Qi, et al.
Publicado: (2024)
A Transfer Attack to Image Watermarks
por: Hu, Yuepeng, et al.
Publicado: (2024)
por: Hu, Yuepeng, et al.
Publicado: (2024)
Duwak: Dual Watermarks in Large Language Models
por: Zhu, Chaoyi, et al.
Publicado: (2024)
por: Zhu, Chaoyi, et al.
Publicado: (2024)
Revisiting the Robustness of Watermarking to Paraphrasing Attacks
por: Rastogi, Saksham, et al.
Publicado: (2024)
por: Rastogi, Saksham, et al.
Publicado: (2024)
Watermarking Needs Input Repetition Masking
por: Khachaturov, David, et al.
Publicado: (2025)
por: Khachaturov, David, et al.
Publicado: (2025)
GaussMark: A Practical Approach for Structural Watermarking of Language Models
por: Block, Adam, et al.
Publicado: (2025)
por: Block, Adam, et al.
Publicado: (2025)
Implicit Identity Technologies for LLMs: Fingerprinting and Watermarking across Datasets, Models, and Generated Content
por: Liu, Bing, et al.
Publicado: (2026)
por: Liu, Bing, et al.
Publicado: (2026)
SimMark: A Robust Sentence-Level Similarity-Based Watermarking Algorithm for Large Language Models
por: Dabiriaghdam, Amirhossein, et al.
Publicado: (2025)
por: Dabiriaghdam, Amirhossein, et al.
Publicado: (2025)
TextSeal: A Localized LLM Watermark for Provenance & Distillation Protection
por: Sander, Tom, et al.
Publicado: (2026)
por: Sander, Tom, et al.
Publicado: (2026)
PVMark: Enabling Public Verifiability for LLM Watermarking Schemes
por: Duan, Haohua, et al.
Publicado: (2025)
por: Duan, Haohua, et al.
Publicado: (2025)
Tree of Attacks: Jailbreaking Black-Box LLMs Automatically
por: Mehrotra, Anay, et al.
Publicado: (2023)
por: Mehrotra, Anay, et al.
Publicado: (2023)
Cross-Lingual Summarization as a Black-Box Watermark Removal Attack
por: Ganesan, Gokul
Publicado: (2025)
por: Ganesan, Gokul
Publicado: (2025)
Optimal Detection for Language Watermarks with Pseudorandom Collision
por: Cai, T. Tony, et al.
Publicado: (2025)
por: Cai, T. Tony, et al.
Publicado: (2025)
STAMP Your Content: Proving Dataset Membership via Watermarked Rephrasings
por: Rastogi, Saksham, et al.
Publicado: (2025)
por: Rastogi, Saksham, et al.
Publicado: (2025)
BlackDAN: A Black-Box Multi-Objective Approach for Effective and Contextual Jailbreaking of Large Language Models
por: Wang, Xinyuan, et al.
Publicado: (2024)
por: Wang, Xinyuan, et al.
Publicado: (2024)
Watermarking Degrades Alignment in Language Models: Analysis and Mitigation
por: Verma, Apurv, et al.
Publicado: (2025)
por: Verma, Apurv, et al.
Publicado: (2025)
WARDEN: Multi-Directional Backdoor Watermarks for Embedding-as-a-Service Copyright Protection
por: Shetty, Anudeex, et al.
Publicado: (2024)
por: Shetty, Anudeex, et al.
Publicado: (2024)
WET: Overcoming Paraphrasing Vulnerabilities in Embeddings-as-a-Service with Linear Transformation Watermarks
por: Shetty, Anudeex, et al.
Publicado: (2024)
por: Shetty, Anudeex, et al.
Publicado: (2024)
Ejemplares similares
-
Improving Detection of Watermarked Language Models
por: Bahri, Dara, et al.
Publicado: (2025) -
PostMark: A Robust Blackbox Watermark for Large Language Models
por: Chang, Yapei, et al.
Publicado: (2024) -
A Watermark for Large Language Models
por: Kirchenbauer, John, et al.
Publicado: (2023) -
Robust Distortion-free Watermarks for Language Models
por: Kuditipudi, Rohith, et al.
Publicado: (2023) -
On the Reliability of Watermarks for Large Language Models
por: Kirchenbauer, John, et al.
Publicado: (2023)