Watermarking LLM Agent Trajectories
Fuente:
arXiv
Salvato in:
| Autori principali: | Meng, Wenlong, Gong, Chen, Zhuo, Terry Yue, Zhang, Fan, Li, Kecen, Liu, Zheng, Yang, Zhou, Wei, Chengkun, Chen, Wenzhi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
GradEscape: A Gradient-Based Evader Against AI-Generated Text Detectors
di: Meng, Wenlong, et al.
Pubblicazione: (2025)
di: Meng, Wenlong, et al.
Pubblicazione: (2025)
PrivCode: When Code Generation Meets Differential Privacy
di: Liu, Zheng, et al.
Pubblicazione: (2025)
di: Liu, Zheng, et al.
Pubblicazione: (2025)
TrajDeleter: Enabling Trajectory Forgetting in Offline Reinforcement Learning Agents
di: Gong, Chen, et al.
Pubblicazione: (2024)
di: Gong, Chen, et al.
Pubblicazione: (2024)
DC-SGD: Differentially Private SGD with Dynamic Clipping through Gradient Norm Distribution Estimation
di: Wei, Chengkun, et al.
Pubblicazione: (2025)
di: Wei, Chengkun, et al.
Pubblicazione: (2025)
Defending LLM Watermarking Against Spoofing Attacks with Contrastive Representation Learning
di: An, Li, et al.
Pubblicazione: (2025)
di: An, Li, et al.
Pubblicazione: (2025)
Invisible Entropy: Towards Safe and Efficient Low-Entropy LLM Watermarking
di: Gu, Tianle, et al.
Pubblicazione: (2025)
di: Gu, Tianle, et al.
Pubblicazione: (2025)
PrivORL: Differentially Private Synthetic Dataset for Offline Reinforcement Learning
di: Gong, Chen, et al.
Pubblicazione: (2025)
di: Gong, Chen, et al.
Pubblicazione: (2025)
DP-SAPF: Saliency-Aware Parameter Fine-tuning of Public Models for Differentially Private Image Synthesis
di: Gong, Chen, et al.
Pubblicazione: (2026)
di: Gong, Chen, et al.
Pubblicazione: (2026)
No Free Lunch in LLM Watermarking: Trade-offs in Watermarking Design Choices
di: Pang, Qi, et al.
Pubblicazione: (2024)
di: Pang, Qi, et al.
Pubblicazione: (2024)
WorldCup Sampling for Multi-bit LLM Watermarking
di: Wang, Yidan, et al.
Pubblicazione: (2026)
di: Wang, Yidan, et al.
Pubblicazione: (2026)
Geometry-Aware Localized Watermarking for Copyright Protection in Embedding-as-a-Service
di: Chen, Zhimin, et al.
Pubblicazione: (2026)
di: Chen, Zhimin, et al.
Pubblicazione: (2026)
Factuality Beyond Coherence: Evaluating LLM Watermarking Methods for Medical Texts
di: Hastuti, Rochana Prih, et al.
Pubblicazione: (2025)
di: Hastuti, Rochana Prih, et al.
Pubblicazione: (2025)
Cyber-Zero: Training Cybersecurity Agents without Runtime
di: Zhuo, Terry Yue, et al.
Pubblicazione: (2025)
di: Zhuo, Terry Yue, et al.
Pubblicazione: (2025)
More Haste, Less Speed: Weaker Single-Layer Watermark Improves Distortion-Free Watermark Ensembles
di: Chen, Ruibo, et al.
Pubblicazione: (2026)
di: Chen, Ruibo, et al.
Pubblicazione: (2026)
HackWorld: Evaluating Computer-Use Agents on Exploiting Web Application Vulnerabilities
di: Ren, Xiaoxue, et al.
Pubblicazione: (2025)
di: Ren, Xiaoxue, et al.
Pubblicazione: (2025)
Watermarking Conditional Text Generation for AI Detection: Unveiling Challenges and a Semantic-Aware Watermark Remedy
di: Fu, Yu, et al.
Pubblicazione: (2023)
di: Fu, Yu, et al.
Pubblicazione: (2023)
EnchTable: Unified Safety Alignment Transfer in Fine-tuned Large Language Models
di: Wu, Jialin, et al.
Pubblicazione: (2025)
di: Wu, Jialin, et al.
Pubblicazione: (2025)
LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments
di: Zhang, Chiyu, et al.
Pubblicazione: (2026)
di: Zhang, Chiyu, et al.
Pubblicazione: (2026)
Watermarking LLM-Generated Datasets in Downstream Tasks
di: Liu, Yugeng, et al.
Pubblicazione: (2025)
di: Liu, Yugeng, et al.
Pubblicazione: (2025)
Position: LLM Watermarking Should Align Stakeholders' Incentives for Practical Adoption
di: Liu, Yepeng, et al.
Pubblicazione: (2025)
di: Liu, Yepeng, et al.
Pubblicazione: (2025)
Multi-use LLM Watermarking and the False Detection Problem
di: Fu, Zihao, et al.
Pubblicazione: (2025)
di: Fu, Zihao, et al.
Pubblicazione: (2025)
Differentially Private Contrastive Learning via Bounding Group-level Contribution
di: Li, Kecen, et al.
Pubblicazione: (2026)
di: Li, Kecen, et al.
Pubblicazione: (2026)
Robust LLM Watermarking with Minimal Semantic Distortion for IP Protection
di: Dang, Kieu, et al.
Pubblicazione: (2026)
di: Dang, Kieu, et al.
Pubblicazione: (2026)
REMARK-LLM: A Robust and Efficient Watermarking Framework for Generative Large Language Models
di: Zhang, Ruisi, et al.
Pubblicazione: (2023)
di: Zhang, Ruisi, et al.
Pubblicazione: (2023)
DPImageBench: A Unified Benchmark for Differentially Private Image Synthesis
di: Gong, Chen, et al.
Pubblicazione: (2025)
di: Gong, Chen, et al.
Pubblicazione: (2025)
Watermark under Fire: A Robustness Evaluation of LLM Watermarking
di: Liang, Jiacheng, et al.
Pubblicazione: (2024)
di: Liang, Jiacheng, et al.
Pubblicazione: (2024)
Yet Another Watermark for Large Language Models
di: Bao, Siyuan, et al.
Pubblicazione: (2025)
di: Bao, Siyuan, et al.
Pubblicazione: (2025)
PMark: Towards Robust and Distortion-free Semantic-level Watermarking with Channel Constraints
di: Huo, Jiahao, et al.
Pubblicazione: (2025)
di: Huo, Jiahao, et al.
Pubblicazione: (2025)
Rethinking LLM Watermark Detection in Black-Box Settings: A Non-Intrusive Third-Party Framework
di: Wang, Zhuoshang, et al.
Pubblicazione: (2026)
di: Wang, Zhuoshang, et al.
Pubblicazione: (2026)
RLSpoofer: A Lightweight Evaluator for LLM Watermark Spoofing Resilience
di: Huang, Hanbo, et al.
Pubblicazione: (2026)
di: Huang, Hanbo, et al.
Pubblicazione: (2026)
Secure Code Generation via Online Reinforcement Learning with Vulnerability Reward Model
di: Wu, Tianyi, et al.
Pubblicazione: (2026)
di: Wu, Tianyi, et al.
Pubblicazione: (2026)
RLCracker: Evaluating the Worst-Case Vulnerability of LLM Watermarks with Adaptive RL Attacks
di: Huang, Hanbo, et al.
Pubblicazione: (2025)
di: Huang, Hanbo, et al.
Pubblicazione: (2025)
Sugar-Coated Poison: Benign Generation Unlocks LLM Jailbreaking
di: Wu, Yu-Hang, et al.
Pubblicazione: (2025)
di: Wu, Yu-Hang, et al.
Pubblicazione: (2025)
PVMark: Enabling Public Verifiability for LLM Watermarking Schemes
di: Duan, Haohua, et al.
Pubblicazione: (2025)
di: Duan, Haohua, et al.
Pubblicazione: (2025)
GaussMarker: Robust Dual-Domain Watermark for Diffusion Models
di: Li, Kecen, et al.
Pubblicazione: (2025)
di: Li, Kecen, et al.
Pubblicazione: (2025)
Toward Copyright Integrity and Verifiability via Multi-Bit Watermarking for Intelligent Transportation Systems
di: Wang, Yihao, et al.
Pubblicazione: (2025)
di: Wang, Yihao, et al.
Pubblicazione: (2025)
Watch Out for Your Agents! Investigating Backdoor Threats to LLM-Based Agents
di: Yang, Wenkai, et al.
Pubblicazione: (2024)
di: Yang, Wenkai, et al.
Pubblicazione: (2024)
Training Language Model Agents to Find Vulnerabilities with CTF-Dojo
di: Zhuo, Terry Yue, et al.
Pubblicazione: (2025)
di: Zhuo, Terry Yue, et al.
Pubblicazione: (2025)
XMark: Reliable Multi-Bit Watermarking for LLM-Generated Texts
di: Xu, Jiahao, et al.
Pubblicazione: (2026)
di: Xu, Jiahao, et al.
Pubblicazione: (2026)
Trust No Tool: Evaluating and Defending LLM Agents under Untrusted Tool Feedback
di: Yan, Lecheng, et al.
Pubblicazione: (2026)
di: Yan, Lecheng, et al.
Pubblicazione: (2026)
Documenti analoghi
-
GradEscape: A Gradient-Based Evader Against AI-Generated Text Detectors
di: Meng, Wenlong, et al.
Pubblicazione: (2025) -
PrivCode: When Code Generation Meets Differential Privacy
di: Liu, Zheng, et al.
Pubblicazione: (2025) -
TrajDeleter: Enabling Trajectory Forgetting in Offline Reinforcement Learning Agents
di: Gong, Chen, et al.
Pubblicazione: (2024) -
DC-SGD: Differentially Private SGD with Dynamic Clipping through Gradient Norm Distribution Estimation
di: Wei, Chengkun, et al.
Pubblicazione: (2025) -
Defending LLM Watermarking Against Spoofing Attacks with Contrastive Representation Learning
di: An, Li, et al.
Pubblicazione: (2025)