Rethinking LLM Watermark Detection in Black-Box Settings: A Non-Intrusive Third-Party Framework
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Zhuoshang, Ren, Yubing, Cao, Yanan, Fang, Fang, Li, Xiaoxue, Guo, Li |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
WorldCup Sampling for Multi-bit LLM Watermarking
par: Wang, Yidan, et autres
Publié: (2026)
par: Wang, Yidan, et autres
Publié: (2026)
From Trade-off to Synergy: A Versatile Symbiotic Watermarking Framework for Large Language Models
par: Wang, Yidan, et autres
Publié: (2025)
par: Wang, Yidan, et autres
Publié: (2025)
From Essence to Defense: Adaptive Semantic-aware Watermarking for Embedding-as-a-Service Copyright Protection
par: Li, Hao, et autres
Publié: (2025)
par: Li, Hao, et autres
Publié: (2025)
DualGuard: Dual-stream Large Language Model Watermarking Defense against Paraphrase and Spoofing Attack
par: Li, Hao, et autres
Publié: (2025)
par: Li, Hao, et autres
Publié: (2025)
PIG: Privacy Jailbreak Attack on LLMs via Gradient-based Iterative In-Context Optimization
par: Wang, Yidan, et autres
Publié: (2025)
par: Wang, Yidan, et autres
Publié: (2025)
Cross-Lingual Summarization as a Black-Box Watermark Removal Attack
par: Ganesan, Gokul
Publié: (2025)
par: Ganesan, Gokul
Publié: (2025)
A Watermark for Black-Box Language Models
par: Bahri, Dara, et autres
Publié: (2024)
par: Bahri, Dara, et autres
Publié: (2024)
RTD-Guard: A Black-Box Textual Adversarial Detection Framework via Replacement Token Detection
par: Zhu, He, et autres
Publié: (2026)
par: Zhu, He, et autres
Publié: (2026)
Jailbreaking Commercial Black-Box LLMs with Explicitly Harmful Prompts
par: Zhang, Chiyu, et autres
Publié: (2025)
par: Zhang, Chiyu, et autres
Publié: (2025)
Exploring Answer Set Programming for Provenance Graph-Based Cyber Threat Detection: A Novel Approach
par: Li, Fang, et autres
Publié: (2025)
par: Li, Fang, et autres
Publié: (2025)
FlexLLM: Exploring LLM Customization for Moving Target Defense on Black-Box LLMs Against Jailbreak Attacks
par: Chen, Bocheng, et autres
Publié: (2024)
par: Chen, Bocheng, et autres
Publié: (2024)
Watermarking LLM Agent Trajectories
par: Meng, Wenlong, et autres
Publié: (2026)
par: Meng, Wenlong, et autres
Publié: (2026)
Multi-use LLM Watermarking and the False Detection Problem
par: Fu, Zihao, et autres
Publié: (2025)
par: Fu, Zihao, et autres
Publié: (2025)
Removing Box-Free Watermarks for Image-to-Image Models via Query-Based Reverse Engineering
par: An, Haonan, et autres
Publié: (2025)
par: An, Haonan, et autres
Publié: (2025)
EvoDefense: Co-Evolving Black-Box Defense with Large Language Models
par: Li, Yu, et autres
Publié: (2026)
par: Li, Yu, et autres
Publié: (2026)
Black-Box Detection of Language Model Watermarks
par: Gloaguen, Thibaud, et autres
Publié: (2024)
par: Gloaguen, Thibaud, et autres
Publié: (2024)
TrailBlazer: History-Guided Reinforcement Learning for Black-Box LLM Jailbreaking
par: Yoon, Sung-Hoon, et autres
Publié: (2026)
par: Yoon, Sung-Hoon, et autres
Publié: (2026)
PSM: Prompt Sensitivity Minimization via LLM-Guided Black-Box Optimization
par: Jawad, Huseein, et autres
Publié: (2025)
par: Jawad, Huseein, et autres
Publié: (2025)
NSmark: Null Space Based Black-box Watermarking Defense Framework for Language Models
par: Zhao, Haodong, et autres
Publié: (2024)
par: Zhao, Haodong, et autres
Publié: (2024)
AutoEG: Exploiting Known Third-Party Vulnerabilities in Black-Box Web Applications
par: Yang, Ruozhao, et autres
Publié: (2026)
par: Yang, Ruozhao, et autres
Publié: (2026)
Defending LLM Watermarking Against Spoofing Attacks with Contrastive Representation Learning
par: An, Li, et autres
Publié: (2025)
par: An, Li, et autres
Publié: (2025)
Black-Box Guardrail Reverse-engineering Attack
par: Yao, Hongwei, et autres
Publié: (2025)
par: Yao, Hongwei, et autres
Publié: (2025)
REMARK-LLM: A Robust and Efficient Watermarking Framework for Generative Large Language Models
par: Zhang, Ruisi, et autres
Publié: (2023)
par: Zhang, Ruisi, et autres
Publié: (2023)
Rethinking Backdoor Detection Evaluation for Language Models
par: Yan, Jun, et autres
Publié: (2024)
par: Yan, Jun, et autres
Publié: (2024)
SLIM: Stealthy Low-Coverage Black-Box Watermarking via Latent-Space Confusion Zones
par: Wu, Hengyu, et autres
Publié: (2026)
par: Wu, Hengyu, et autres
Publié: (2026)
ComMark: Covert and Robust Black-Box Model Watermarking with Compressed Samples
par: Yang, Yunfei, et autres
Publié: (2025)
par: Yang, Yunfei, et autres
Publié: (2025)
Watermark under Fire: A Robustness Evaluation of LLM Watermarking
par: Liang, Jiacheng, et autres
Publié: (2024)
par: Liang, Jiacheng, et autres
Publié: (2024)
Invisible Entropy: Towards Safe and Efficient Low-Entropy LLM Watermarking
par: Gu, Tianle, et autres
Publié: (2025)
par: Gu, Tianle, et autres
Publié: (2025)
Watermarking Conditional Text Generation for AI Detection: Unveiling Challenges and a Semantic-Aware Watermark Remedy
par: Fu, Yu, et autres
Publié: (2023)
par: Fu, Yu, et autres
Publié: (2023)
Robust LLM Watermarking with Minimal Semantic Distortion for IP Protection
par: Dang, Kieu, et autres
Publié: (2026)
par: Dang, Kieu, et autres
Publié: (2026)
Attacks on Third-Party APIs of Large Language Models
par: Zhao, Wanru, et autres
Publié: (2024)
par: Zhao, Wanru, et autres
Publié: (2024)
BinarySelect to Improve Accessibility of Black-Box Attack Research
par: Ghosh, Shatarupa, et autres
Publié: (2024)
par: Ghosh, Shatarupa, et autres
Publié: (2024)
Factuality Beyond Coherence: Evaluating LLM Watermarking Methods for Medical Texts
par: Hastuti, Rochana Prih, et autres
Publié: (2025)
par: Hastuti, Rochana Prih, et autres
Publié: (2025)
Position: LLM Watermarking Should Align Stakeholders' Incentives for Practical Adoption
par: Liu, Yepeng, et autres
Publié: (2025)
par: Liu, Yepeng, et autres
Publié: (2025)
Auditing Black-Box LLM APIs with a Rank-Based Uniformity Test
par: Zhu, Xiaoyuan, et autres
Publié: (2025)
par: Zhu, Xiaoyuan, et autres
Publié: (2025)
Fine-Tuning Jailbreaks under Highly Constrained Black-Box Settings: A Three-Pronged Approach
par: Li, Xiangfang, et autres
Publié: (2025)
par: Li, Xiangfang, et autres
Publié: (2025)
No Free Lunch in LLM Watermarking: Trade-offs in Watermarking Design Choices
par: Pang, Qi, et autres
Publié: (2024)
par: Pang, Qi, et autres
Publié: (2024)
Efficient and Universal Watermarking for LLM-Generated Code Detection
par: Li, Boquan, et autres
Publié: (2024)
par: Li, Boquan, et autres
Publié: (2024)
"Someone Hid It": Query-Agnostic Black-Box Attacks on LLM-Based Retrieval
par: Li, Jiate, et autres
Publié: (2026)
par: Li, Jiate, et autres
Publié: (2026)
Mark My Words: Analyzing and Evaluating Language Model Watermarks
par: Piet, Julien, et autres
Publié: (2023)
par: Piet, Julien, et autres
Publié: (2023)
Documents similaires
-
WorldCup Sampling for Multi-bit LLM Watermarking
par: Wang, Yidan, et autres
Publié: (2026) -
From Trade-off to Synergy: A Versatile Symbiotic Watermarking Framework for Large Language Models
par: Wang, Yidan, et autres
Publié: (2025) -
From Essence to Defense: Adaptive Semantic-aware Watermarking for Embedding-as-a-Service Copyright Protection
par: Li, Hao, et autres
Publié: (2025) -
DualGuard: Dual-stream Large Language Model Watermarking Defense against Paraphrase and Spoofing Attack
par: Li, Hao, et autres
Publié: (2025) -
PIG: Privacy Jailbreak Attack on LLMs via Gradient-based Iterative In-Context Optimization
par: Wang, Yidan, et autres
Publié: (2025)