Rethinking LLM Watermark Detection in Black-Box Settings: A Non-Intrusive Third-Party Framework
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Zhuoshang, Ren, Yubing, Cao, Yanan, Fang, Fang, Li, Xiaoxue, Guo, Li |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
WorldCup Sampling for Multi-bit LLM Watermarking
por: Wang, Yidan, et al.
Publicado: (2026)
por: Wang, Yidan, et al.
Publicado: (2026)
From Trade-off to Synergy: A Versatile Symbiotic Watermarking Framework for Large Language Models
por: Wang, Yidan, et al.
Publicado: (2025)
por: Wang, Yidan, et al.
Publicado: (2025)
From Essence to Defense: Adaptive Semantic-aware Watermarking for Embedding-as-a-Service Copyright Protection
por: Li, Hao, et al.
Publicado: (2025)
por: Li, Hao, et al.
Publicado: (2025)
DualGuard: Dual-stream Large Language Model Watermarking Defense against Paraphrase and Spoofing Attack
por: Li, Hao, et al.
Publicado: (2025)
por: Li, Hao, et al.
Publicado: (2025)
PIG: Privacy Jailbreak Attack on LLMs via Gradient-based Iterative In-Context Optimization
por: Wang, Yidan, et al.
Publicado: (2025)
por: Wang, Yidan, et al.
Publicado: (2025)
Cross-Lingual Summarization as a Black-Box Watermark Removal Attack
por: Ganesan, Gokul
Publicado: (2025)
por: Ganesan, Gokul
Publicado: (2025)
A Watermark for Black-Box Language Models
por: Bahri, Dara, et al.
Publicado: (2024)
por: Bahri, Dara, et al.
Publicado: (2024)
RTD-Guard: A Black-Box Textual Adversarial Detection Framework via Replacement Token Detection
por: Zhu, He, et al.
Publicado: (2026)
por: Zhu, He, et al.
Publicado: (2026)
Jailbreaking Commercial Black-Box LLMs with Explicitly Harmful Prompts
por: Zhang, Chiyu, et al.
Publicado: (2025)
por: Zhang, Chiyu, et al.
Publicado: (2025)
Exploring Answer Set Programming for Provenance Graph-Based Cyber Threat Detection: A Novel Approach
por: Li, Fang, et al.
Publicado: (2025)
por: Li, Fang, et al.
Publicado: (2025)
FlexLLM: Exploring LLM Customization for Moving Target Defense on Black-Box LLMs Against Jailbreak Attacks
por: Chen, Bocheng, et al.
Publicado: (2024)
por: Chen, Bocheng, et al.
Publicado: (2024)
Watermarking LLM Agent Trajectories
por: Meng, Wenlong, et al.
Publicado: (2026)
por: Meng, Wenlong, et al.
Publicado: (2026)
Multi-use LLM Watermarking and the False Detection Problem
por: Fu, Zihao, et al.
Publicado: (2025)
por: Fu, Zihao, et al.
Publicado: (2025)
Removing Box-Free Watermarks for Image-to-Image Models via Query-Based Reverse Engineering
por: An, Haonan, et al.
Publicado: (2025)
por: An, Haonan, et al.
Publicado: (2025)
EvoDefense: Co-Evolving Black-Box Defense with Large Language Models
por: Li, Yu, et al.
Publicado: (2026)
por: Li, Yu, et al.
Publicado: (2026)
Black-Box Detection of Language Model Watermarks
por: Gloaguen, Thibaud, et al.
Publicado: (2024)
por: Gloaguen, Thibaud, et al.
Publicado: (2024)
TrailBlazer: History-Guided Reinforcement Learning for Black-Box LLM Jailbreaking
por: Yoon, Sung-Hoon, et al.
Publicado: (2026)
por: Yoon, Sung-Hoon, et al.
Publicado: (2026)
PSM: Prompt Sensitivity Minimization via LLM-Guided Black-Box Optimization
por: Jawad, Huseein, et al.
Publicado: (2025)
por: Jawad, Huseein, et al.
Publicado: (2025)
NSmark: Null Space Based Black-box Watermarking Defense Framework for Language Models
por: Zhao, Haodong, et al.
Publicado: (2024)
por: Zhao, Haodong, et al.
Publicado: (2024)
AutoEG: Exploiting Known Third-Party Vulnerabilities in Black-Box Web Applications
por: Yang, Ruozhao, et al.
Publicado: (2026)
por: Yang, Ruozhao, et al.
Publicado: (2026)
Defending LLM Watermarking Against Spoofing Attacks with Contrastive Representation Learning
por: An, Li, et al.
Publicado: (2025)
por: An, Li, et al.
Publicado: (2025)
Black-Box Guardrail Reverse-engineering Attack
por: Yao, Hongwei, et al.
Publicado: (2025)
por: Yao, Hongwei, et al.
Publicado: (2025)
REMARK-LLM: A Robust and Efficient Watermarking Framework for Generative Large Language Models
por: Zhang, Ruisi, et al.
Publicado: (2023)
por: Zhang, Ruisi, et al.
Publicado: (2023)
Rethinking Backdoor Detection Evaluation for Language Models
por: Yan, Jun, et al.
Publicado: (2024)
por: Yan, Jun, et al.
Publicado: (2024)
SLIM: Stealthy Low-Coverage Black-Box Watermarking via Latent-Space Confusion Zones
por: Wu, Hengyu, et al.
Publicado: (2026)
por: Wu, Hengyu, et al.
Publicado: (2026)
ComMark: Covert and Robust Black-Box Model Watermarking with Compressed Samples
por: Yang, Yunfei, et al.
Publicado: (2025)
por: Yang, Yunfei, et al.
Publicado: (2025)
Watermark under Fire: A Robustness Evaluation of LLM Watermarking
por: Liang, Jiacheng, et al.
Publicado: (2024)
por: Liang, Jiacheng, et al.
Publicado: (2024)
Invisible Entropy: Towards Safe and Efficient Low-Entropy LLM Watermarking
por: Gu, Tianle, et al.
Publicado: (2025)
por: Gu, Tianle, et al.
Publicado: (2025)
Watermarking Conditional Text Generation for AI Detection: Unveiling Challenges and a Semantic-Aware Watermark Remedy
por: Fu, Yu, et al.
Publicado: (2023)
por: Fu, Yu, et al.
Publicado: (2023)
Robust LLM Watermarking with Minimal Semantic Distortion for IP Protection
por: Dang, Kieu, et al.
Publicado: (2026)
por: Dang, Kieu, et al.
Publicado: (2026)
Attacks on Third-Party APIs of Large Language Models
por: Zhao, Wanru, et al.
Publicado: (2024)
por: Zhao, Wanru, et al.
Publicado: (2024)
BinarySelect to Improve Accessibility of Black-Box Attack Research
por: Ghosh, Shatarupa, et al.
Publicado: (2024)
por: Ghosh, Shatarupa, et al.
Publicado: (2024)
Factuality Beyond Coherence: Evaluating LLM Watermarking Methods for Medical Texts
por: Hastuti, Rochana Prih, et al.
Publicado: (2025)
por: Hastuti, Rochana Prih, et al.
Publicado: (2025)
Position: LLM Watermarking Should Align Stakeholders' Incentives for Practical Adoption
por: Liu, Yepeng, et al.
Publicado: (2025)
por: Liu, Yepeng, et al.
Publicado: (2025)
Auditing Black-Box LLM APIs with a Rank-Based Uniformity Test
por: Zhu, Xiaoyuan, et al.
Publicado: (2025)
por: Zhu, Xiaoyuan, et al.
Publicado: (2025)
Fine-Tuning Jailbreaks under Highly Constrained Black-Box Settings: A Three-Pronged Approach
por: Li, Xiangfang, et al.
Publicado: (2025)
por: Li, Xiangfang, et al.
Publicado: (2025)
No Free Lunch in LLM Watermarking: Trade-offs in Watermarking Design Choices
por: Pang, Qi, et al.
Publicado: (2024)
por: Pang, Qi, et al.
Publicado: (2024)
Efficient and Universal Watermarking for LLM-Generated Code Detection
por: Li, Boquan, et al.
Publicado: (2024)
por: Li, Boquan, et al.
Publicado: (2024)
"Someone Hid It": Query-Agnostic Black-Box Attacks on LLM-Based Retrieval
por: Li, Jiate, et al.
Publicado: (2026)
por: Li, Jiate, et al.
Publicado: (2026)
Mark My Words: Analyzing and Evaluating Language Model Watermarks
por: Piet, Julien, et al.
Publicado: (2023)
por: Piet, Julien, et al.
Publicado: (2023)
Ejemplares similares
-
WorldCup Sampling for Multi-bit LLM Watermarking
por: Wang, Yidan, et al.
Publicado: (2026) -
From Trade-off to Synergy: A Versatile Symbiotic Watermarking Framework for Large Language Models
por: Wang, Yidan, et al.
Publicado: (2025) -
From Essence to Defense: Adaptive Semantic-aware Watermarking for Embedding-as-a-Service Copyright Protection
por: Li, Hao, et al.
Publicado: (2025) -
DualGuard: Dual-stream Large Language Model Watermarking Defense against Paraphrase and Spoofing Attack
por: Li, Hao, et al.
Publicado: (2025) -
PIG: Privacy Jailbreak Attack on LLMs via Gradient-based Iterative In-Context Optimization
por: Wang, Yidan, et al.
Publicado: (2025)