Entropy-Guided Watermarking for LLMs: A Test-Time Framework for Robust and Traceable Text Generation

Fuente: arXiv
Guardado en:
Detalles Bibliográficos
Autores principales: Cai, Shizhan, Ding, Liang, Tao, Dacheng
Formato: Preprint
Publicado: 2025
Materias:
Acceso en línea:
Etiquetas: Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
_version_ 1866912331440586752
author Cai, Shizhan
Ding, Liang
Tao, Dacheng
author_facet Cai, Shizhan
Ding, Liang
Tao, Dacheng
contents The rapid development of Large Language Models (LLMs) has intensified concerns about content traceability and potential misuse. Existing watermarking schemes for sampled text often face trade-offs between maintaining text quality and ensuring robust detection against various attacks. To address these issues, we propose a novel watermarking scheme that improves both detectability and text quality by introducing a cumulative watermark entropy threshold. Our approach is compatible with and generalizes existing sampling functions, enhancing adaptability. Experimental results across multiple LLMs show that our scheme significantly outperforms existing methods, achieving over 80\% improvements on widely-used datasets, e.g., MATH and GSM8K, while maintaining high detection accuracy.
format Preprint
id arxiv_https___arxiv_org_abs_2504_12108
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle Entropy-Guided Watermarking for LLMs: A Test-Time Framework for Robust and Traceable Text Generation
Cai, Shizhan
Ding, Liang
Tao, Dacheng
Computation and Language
The rapid development of Large Language Models (LLMs) has intensified concerns about content traceability and potential misuse. Existing watermarking schemes for sampled text often face trade-offs between maintaining text quality and ensuring robust detection against various attacks. To address these issues, we propose a novel watermarking scheme that improves both detectability and text quality by introducing a cumulative watermark entropy threshold. Our approach is compatible with and generalizes existing sampling functions, enhancing adaptability. Experimental results across multiple LLMs show that our scheme significantly outperforms existing methods, achieving over 80\% improvements on widely-used datasets, e.g., MATH and GSM8K, while maintaining high detection accuracy.
title Entropy-Guided Watermarking for LLMs: A Test-Time Framework for Robust and Traceable Text Generation
topic Computation and Language
url https://arxiv.org/abs/2504.12108