PASA: A Principled Embedding-Space Watermarking Approach for LLM-Generated Text under Semantic-Invariant Attacks
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ai, Zhenxin, He, Haiyun |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Your Semantic-Independent Watermark is Fragile: A Semantic Perturbation Attack against EaaS Watermark
par: Fei, Zekun, et autres
Publié: (2024)
par: Fei, Zekun, et autres
Publié: (2024)
Blind PRNG Hijacking: An Undetectable Integrity-Preserving Attack Against LLM Watermarking
par: You, Ziyang, et autres
Publié: (2026)
par: You, Ziyang, et autres
Publié: (2026)
Modification and Generated-Text Detection: Achieving Dual Detection Capabilities for the Outputs of LLM by Watermark
par: Cai, Yuhang, et autres
Publié: (2025)
par: Cai, Yuhang, et autres
Publié: (2025)
Enhancing LLM Watermark Resilience Against Both Scrubbing and Spoofing Attacks
par: Shen, Huanming, et autres
Publié: (2025)
par: Shen, Huanming, et autres
Publié: (2025)
PASA: Attack Agnostic Unsupervised Adversarial Detection using Prediction & Attribution Sensitivity Analysis
par: Bhusal, Dipkamal, et autres
Publié: (2024)
par: Bhusal, Dipkamal, et autres
Publié: (2024)
Attack-Resistant Watermarking for AIGC Image Forensics via Diffusion-based Semantic Deflection
par: Liu, Qingyu, et autres
Publié: (2026)
par: Liu, Qingyu, et autres
Publié: (2026)
On Evaluating The Performance of Watermarked Machine-Generated Texts Under Adversarial Attacks
par: Liu, Zesen, et autres
Publié: (2024)
par: Liu, Zesen, et autres
Publié: (2024)
XMark: Reliable Multi-Bit Watermarking for LLM-Generated Texts
par: Xu, Jiahao, et autres
Publié: (2026)
par: Xu, Jiahao, et autres
Publié: (2026)
Invariant-based Robust Weights Watermark for Large Language Models
par: Guo, Qingxiao, et autres
Publié: (2025)
par: Guo, Qingxiao, et autres
Publié: (2025)
Character-Level Perturbations Disrupt LLM Watermarks
par: Zhang, Zhaoxi, et autres
Publié: (2025)
par: Zhang, Zhaoxi, et autres
Publié: (2025)
On Google's SynthID-Text LLM Watermarking System: Theoretical Analysis and Empirical Validation
par: Omidi, Romina, et autres
Publié: (2026)
par: Omidi, Romina, et autres
Publié: (2026)
Watermark Overwriting Attack on StegaStamp algorithm
par: Serzhenko, I. F., et autres
Publié: (2025)
par: Serzhenko, I. F., et autres
Publié: (2025)
Optimizing Adaptive Attacks against Watermarks for Language Models
par: Diaa, Abdulrahman, et autres
Publié: (2024)
par: Diaa, Abdulrahman, et autres
Publié: (2024)
Sequential Behavioral Watermarking for LLM Agents
par: An, Hyeseon, et autres
Publié: (2026)
par: An, Hyeseon, et autres
Publié: (2026)
Functional Invariants to Watermark Large Transformers
par: Fernandez, Pierre, et autres
Publié: (2023)
par: Fernandez, Pierre, et autres
Publié: (2023)
Semantic-level Backdoor Attack against Text-to-Image Diffusion Models
par: Chen, Tianxin, et autres
Publié: (2026)
par: Chen, Tianxin, et autres
Publié: (2026)
TH-Bench: Evaluating Evading Attacks via Humanizing AI Text on Machine-Generated Text Detectors
par: Zheng, Jingyi, et autres
Publié: (2025)
par: Zheng, Jingyi, et autres
Publié: (2025)
Marking Code Without Breaking It: Code Watermarking for Detecting LLM-Generated Code
par: Kim, Jungin, et autres
Publié: (2025)
par: Kim, Jungin, et autres
Publié: (2025)
DITTO: A Spoofing Attack Framework on Watermarked LLMs via Knowledge Distillation
par: An, Hyeseon, et autres
Publié: (2025)
par: An, Hyeseon, et autres
Publié: (2025)
LLM Watermark Evasion via Bias Inversion
par: Hwang, Jeongyeon, et autres
Publié: (2025)
par: Hwang, Jeongyeon, et autres
Publié: (2025)
From Similarity to Vulnerability: Key Collision Attack on LLM Semantic Caching
par: Zhang, Zhixiang, et autres
Publié: (2026)
par: Zhang, Zhixiang, et autres
Publié: (2026)
Learning to Watermark LLM-generated Text via Reinforcement Learning
par: Xu, Xiaojun, et autres
Publié: (2024)
par: Xu, Xiaojun, et autres
Publié: (2024)
RTLMarker: Protecting LLM-Generated RTL Copyright via a Hardware Watermarking Framework
par: Wang, Kun, et autres
Publié: (2025)
par: Wang, Kun, et autres
Publié: (2025)
Eguard: Defending LLM Embeddings Against Inversion Attacks via Text Mutual Information Optimization
par: Liu, Tiantian, et autres
Publié: (2024)
par: Liu, Tiantian, et autres
Publié: (2024)
Neural Honeytrace: Plug&Play Watermarking Framework against Model Extraction Attacks
par: Xu, Yixiao, et autres
Publié: (2025)
par: Xu, Yixiao, et autres
Publié: (2025)
Fast, Secure, and High-Capacity Image Watermarking with Autoencoded Text Vectors
par: Evennou, Gautier, et autres
Publié: (2025)
par: Evennou, Gautier, et autres
Publié: (2025)
RobWE: Robust Watermark Embedding for Personalized Federated Learning Model Ownership Protection
par: Xu, Yang, et autres
Publié: (2024)
par: Xu, Yang, et autres
Publié: (2024)
Every Bit, Everywhere, All at Once: A Binomial Multibit LLM Watermark
par: Gloaguen, Thibaud, et autres
Publié: (2026)
par: Gloaguen, Thibaud, et autres
Publié: (2026)
Black-Box Forgery Attacks on Semantic Watermarks for Diffusion Models
par: Müller, Andreas, et autres
Publié: (2024)
par: Müller, Andreas, et autres
Publié: (2024)
RAG-WM: An Efficient Black-Box Watermarking Approach for Retrieval-Augmented Generation of Large Language Models
par: Lv, Peizhuo, et autres
Publié: (2025)
par: Lv, Peizhuo, et autres
Publié: (2025)
The Coding Limits of Robust Watermarking for Generative Models
par: Francati, Danilo, et autres
Publié: (2025)
par: Francati, Danilo, et autres
Publié: (2025)
CODE ACROSTIC: Robust Watermarking for Code Generation
par: Lin, Li, et autres
Publié: (2025)
par: Lin, Li, et autres
Publié: (2025)
Nightshade: Prompt-Specific Poisoning Attacks on Text-to-Image Generative Models
par: Shan, Shawn, et autres
Publié: (2023)
par: Shan, Shawn, et autres
Publié: (2023)
MirrorMark: Generalizable Mirrored Sampling for Multi-bit LLM Watermarking
par: Jiang, Ya, et autres
Publié: (2026)
par: Jiang, Ya, et autres
Publié: (2026)
A Unified Framework for LLM Watermarks
par: Gloaguen, Thibaud, et autres
Publié: (2026)
par: Gloaguen, Thibaud, et autres
Publié: (2026)
Targeted Bit-Flip Attacks on LLM-Based Agents
par: Wang, Jialai, et autres
Publié: (2026)
par: Wang, Jialai, et autres
Publié: (2026)
VoiceMark: Zero-Shot Voice Cloning-Resistant Watermarking Approach Leveraging Speaker-Specific Latents
par: Li, Haiyun, et autres
Publié: (2025)
par: Li, Haiyun, et autres
Publié: (2025)
CLASP: Training-Free LLM-Assisted Source Code Watermarking via Semantic-Preserving Transformations
par: Xu, Rui, et autres
Publié: (2025)
par: Xu, Rui, et autres
Publié: (2025)
Signed-Prompt: A New Approach to Prevent Prompt Injection Attacks Against LLM-Integrated Applications
par: Suo, Xuchen
Publié: (2024)
par: Suo, Xuchen
Publié: (2024)
Revealing Weaknesses in Text Watermarking Through Self-Information Rewrite Attacks
par: Cheng, Yixin, et autres
Publié: (2025)
par: Cheng, Yixin, et autres
Publié: (2025)
Documents similaires
-
Your Semantic-Independent Watermark is Fragile: A Semantic Perturbation Attack against EaaS Watermark
par: Fei, Zekun, et autres
Publié: (2024) -
Blind PRNG Hijacking: An Undetectable Integrity-Preserving Attack Against LLM Watermarking
par: You, Ziyang, et autres
Publié: (2026) -
Modification and Generated-Text Detection: Achieving Dual Detection Capabilities for the Outputs of LLM by Watermark
par: Cai, Yuhang, et autres
Publié: (2025) -
Enhancing LLM Watermark Resilience Against Both Scrubbing and Spoofing Attacks
par: Shen, Huanming, et autres
Publié: (2025) -
PASA: Attack Agnostic Unsupervised Adversarial Detection using Prediction & Attribution Sensitivity Analysis
par: Bhusal, Dipkamal, et autres
Publié: (2024)