Learning to Watermark LLM-generated Text via Reinforcement Learning
Fuente:
arXiv
Saved in:
| Main Authors: | Xu, Xiaojun, Yao, Yuanshun, Liu, Yang |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
CLASP: Training-Free LLM-Assisted Source Code Watermarking via Semantic-Preserving Transformations
by: Xu, Rui, et al.
Published: (2025)
by: Xu, Rui, et al.
Published: (2025)
Ward: Provable RAG Dataset Inference via LLM Watermarks
by: Jovanović, Nikola, et al.
Published: (2024)
by: Jovanović, Nikola, et al.
Published: (2024)
Double-I Watermark: Protecting Model Copyright for LLM Fine-tuning
by: Li, Shen, et al.
Published: (2024)
by: Li, Shen, et al.
Published: (2024)
PoLO: Proof-of-Learning and Proof-of-Ownership at Once with Chained Watermarking
by: Deng, Haiyu, et al.
Published: (2025)
by: Deng, Haiyu, et al.
Published: (2025)
A Unified Framework for LLM Watermarks
by: Gloaguen, Thibaud, et al.
Published: (2026)
by: Gloaguen, Thibaud, et al.
Published: (2026)
Explanation as a Watermark: Towards Harmless and Multi-bit Model Ownership Verification via Watermarking Feature Attribution
by: Shao, Shuo, et al.
Published: (2024)
by: Shao, Shuo, et al.
Published: (2024)
AuthorMist: Evading AI Text Detectors with Reinforcement Learning
by: David, Isaac, et al.
Published: (2025)
by: David, Isaac, et al.
Published: (2025)
Sigil: Server-Enforced Watermarking in U-Shaped Split Federated Learning via Gradient Injection
by: Dai, Zhengchunmin, et al.
Published: (2025)
by: Dai, Zhengchunmin, et al.
Published: (2025)
Enhancing Cloud Network Resilience via a Robust LLM-Empowered Multi-Agent Reinforcement Learning Framework
by: Peng, Yixiao, et al.
Published: (2026)
by: Peng, Yixiao, et al.
Published: (2026)
FLClear: Visually Verifiable Multi-Client Watermarking for Federated Learning
by: Gu, Chen, et al.
Published: (2025)
by: Gu, Chen, et al.
Published: (2025)
PRO: Enabling Precise and Robust Text Watermark for Open-Source LLMs
by: Xue, Jiaqi, et al.
Published: (2025)
by: Xue, Jiaqi, et al.
Published: (2025)
Mark Your LLM: Detecting the Misuse of Open-Source Large Language Models via Watermarking
by: Xu, Yijie, et al.
Published: (2025)
by: Xu, Yijie, et al.
Published: (2025)
SWAP: Towards Copyright Auditing of Soft Prompts via Sequential Watermarking
by: Yang, Wenyuan, et al.
Published: (2025)
by: Yang, Wenyuan, et al.
Published: (2025)
Security and Detectability Analysis of Unicode Text Watermarking Methods Against Large Language Models
by: Hellmeier, Malte
Published: (2025)
by: Hellmeier, Malte
Published: (2025)
Odysseus: Jailbreaking Commercial Multimodal LLM-integrated Systems via Dual Steganography
by: Li, Songze, et al.
Published: (2025)
by: Li, Songze, et al.
Published: (2025)
Unforgeable Watermarks for Language Models via Robust Signatures
by: Lin, Huijia, et al.
Published: (2026)
by: Lin, Huijia, et al.
Published: (2026)
StealthRL: Reinforcement Learning Paraphrase Attacks for Multi-Detector Evasion of AI-Text Detectors
by: Ranganath, Suraj, et al.
Published: (2026)
by: Ranganath, Suraj, et al.
Published: (2026)
BAFFLE: Hiding Backdoors in Offline Reinforcement Learning Datasets
by: Gong, Chen, et al.
Published: (2022)
by: Gong, Chen, et al.
Published: (2022)
MarkTune: Improving the Quality-Detectability Trade-off in Open-Weight LLM Watermarking
by: Zhao, Yizhou, et al.
Published: (2025)
by: Zhao, Yizhou, et al.
Published: (2025)
Edit Distance Robust Watermarks via Indexing Pseudorandom Codes
by: Golowich, Noah, et al.
Published: (2024)
by: Golowich, Noah, et al.
Published: (2024)
Evading Deep Learning-Based Malware Detectors via Obfuscation: A Deep Reinforcement Learning Approach
by: Etter, Brian, et al.
Published: (2024)
by: Etter, Brian, et al.
Published: (2024)
Mitigating Watermark Forgery in Generative Models via Randomized Key Selection
by: Aremu, Toluwani, et al.
Published: (2025)
by: Aremu, Toluwani, et al.
Published: (2025)
Universal Black-Box Reward Poisoning Attack against Offline Reinforcement Learning
by: Xu, Yinglun, et al.
Published: (2024)
by: Xu, Yinglun, et al.
Published: (2024)
Watermarking Diffusion Language Models
by: Gloaguen, Thibaud, et al.
Published: (2025)
by: Gloaguen, Thibaud, et al.
Published: (2025)
RICE: Breaking Through the Training Bottlenecks of Reinforcement Learning with Explanation
by: Cheng, Zelei, et al.
Published: (2024)
by: Cheng, Zelei, et al.
Published: (2024)
On Evaluating The Performance of Watermarked Machine-Generated Texts Under Adversarial Attacks
by: Liu, Zesen, et al.
Published: (2024)
by: Liu, Zesen, et al.
Published: (2024)
Generative Models are Self-Watermarked: Declaring Model Authentication through Re-Generation
by: Desu, Aditya, et al.
Published: (2024)
by: Desu, Aditya, et al.
Published: (2024)
Watermark Stealing in Large Language Models
by: Jovanović, Nikola, et al.
Published: (2024)
by: Jovanović, Nikola, et al.
Published: (2024)
Downstream Trade-offs of a Family of Text Watermarks
by: Ajith, Anirudh, et al.
Published: (2023)
by: Ajith, Anirudh, et al.
Published: (2023)
SUB-PLAY: Adversarial Policies against Partially Observed Multi-Agent Reinforcement Learning Systems
by: Ma, Oubo, et al.
Published: (2024)
by: Ma, Oubo, et al.
Published: (2024)
DMark: Order-Agnostic Watermarking for Diffusion Large Language Models
by: Wu, Linyu, et al.
Published: (2025)
by: Wu, Linyu, et al.
Published: (2025)
Autonomous Network Defence using Reinforcement Learning
by: Foley, Myles, et al.
Published: (2024)
by: Foley, Myles, et al.
Published: (2024)
Discovering Spoofing Attempts on Language Model Watermarks
by: Gloaguen, Thibaud, et al.
Published: (2024)
by: Gloaguen, Thibaud, et al.
Published: (2024)
SoK: Watermarking for AI-Generated Content
by: Zhao, Xuandong, et al.
Published: (2024)
by: Zhao, Xuandong, et al.
Published: (2024)
Protecting Copyright of Medical Pre-trained Language Models: Training-Free Backdoor Model Watermarking
by: Kong, Cong, et al.
Published: (2024)
by: Kong, Cong, et al.
Published: (2024)
Differentially Private Deep Model-Based Reinforcement Learning
by: Rio, Alexandre, et al.
Published: (2024)
by: Rio, Alexandre, et al.
Published: (2024)
Near-Optimal Reinforcement Learning with Shuffle Differential Privacy
by: Bai, Shaojie, et al.
Published: (2024)
by: Bai, Shaojie, et al.
Published: (2024)
DynaMark: A Reinforcement Learning Framework for Dynamic Watermarking in Industrial Machine Tool Controllers
by: Aftabi, Navid, et al.
Published: (2025)
by: Aftabi, Navid, et al.
Published: (2025)
Angel or Demon: Investigating the Plasticity Interventions' Impact on Backdoor Threats in Deep Reinforcement Learning
by: Ma, Oubo, et al.
Published: (2026)
by: Ma, Oubo, et al.
Published: (2026)
UNIDOOR: A Universal Framework for Action-Level Backdoor Attacks in Deep Reinforcement Learning
by: Ma, Oubo, et al.
Published: (2025)
by: Ma, Oubo, et al.
Published: (2025)
Similar Items
-
CLASP: Training-Free LLM-Assisted Source Code Watermarking via Semantic-Preserving Transformations
by: Xu, Rui, et al.
Published: (2025) -
Ward: Provable RAG Dataset Inference via LLM Watermarks
by: Jovanović, Nikola, et al.
Published: (2024) -
Double-I Watermark: Protecting Model Copyright for LLM Fine-tuning
by: Li, Shen, et al.
Published: (2024) -
PoLO: Proof-of-Learning and Proof-of-Ownership at Once with Chained Watermarking
by: Deng, Haiyu, et al.
Published: (2025) -
A Unified Framework for LLM Watermarks
by: Gloaguen, Thibaud, et al.
Published: (2026)