Dataset Watermarking for Closed LLMs with Provable Detection
Fuente:
arXiv
Guardado en:
| Autores principales: | Huang, Pengrun, Chaudhuri, Kamalika, Wang, Yu-Xiang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Better Membership Inference Privacy Measurement through Discrepancy
por: Wu, Ruihan, et al.
Publicado: (2024)
por: Wu, Ruihan, et al.
Publicado: (2024)
Can We Infer Confidential Properties of Training Data from LLMs?
por: Huang, Pengrun, et al.
Publicado: (2025)
por: Huang, Pengrun, et al.
Publicado: (2025)
DPrivBench: Benchmarking LLMs' Reasoning for Differential Privacy
por: Wang, Erchi, et al.
Publicado: (2026)
por: Wang, Erchi, et al.
Publicado: (2026)
A Closer Look at the Learnability of Out-of-Distribution (OOD) Detection
por: Garov, Konstantin, et al.
Publicado: (2025)
por: Garov, Konstantin, et al.
Publicado: (2025)
Learning-Time Encoding Shapes Unlearning in LLMs
por: Wu, Ruihan, et al.
Publicado: (2025)
por: Wu, Ruihan, et al.
Publicado: (2025)
Distribution Learning with Valid Outputs Beyond the Worst-Case
por: Rittler, Nick, et al.
Publicado: (2024)
por: Rittler, Nick, et al.
Publicado: (2024)
Unified Uncertainty Calibration
por: Chaudhuri, Kamalika, et al.
Publicado: (2023)
por: Chaudhuri, Kamalika, et al.
Publicado: (2023)
Beyond Discrepancy: A Closer Look at the Theory of Distribution Shift
por: Bhattacharjee, Robi, et al.
Publicado: (2024)
por: Bhattacharjee, Robi, et al.
Publicado: (2024)
Z0-Inf: Zeroth Order Approximation for Data Influence
por: Kokhlikyan, Narine, et al.
Publicado: (2025)
por: Kokhlikyan, Narine, et al.
Publicado: (2025)
Data Redaction from Conditional Generative Models
por: Kong, Zhifeng, et al.
Publicado: (2023)
por: Kong, Zhifeng, et al.
Publicado: (2023)
Provable Watermarking for Data Poisoning Attacks
por: Zhu, Yifan, et al.
Publicado: (2025)
por: Zhu, Yifan, et al.
Publicado: (2025)
Auditing $f$-Differential Privacy in One Run
por: Mahloujifar, Saeed, et al.
Publicado: (2024)
por: Mahloujifar, Saeed, et al.
Publicado: (2024)
Influence-based Attributions can be Manipulated
por: Yadav, Chhavi, et al.
Publicado: (2024)
por: Yadav, Chhavi, et al.
Publicado: (2024)
Not-a-Bandit: Provably No-Regret Drafter Selection in Speculative Decoding for LLMs
por: Liu, Hongyi, et al.
Publicado: (2025)
por: Liu, Hongyi, et al.
Publicado: (2025)
Ward: Provable RAG Dataset Inference via LLM Watermarks
por: Jovanović, Nikola, et al.
Publicado: (2024)
por: Jovanović, Nikola, et al.
Publicado: (2024)
Déjà Vu Memorization in Vision-Language Models
por: Jayaraman, Bargav, et al.
Publicado: (2024)
por: Jayaraman, Bargav, et al.
Publicado: (2024)
Privacy Blur: Quantifying Privacy and Utility for Image Data Release
por: Mahloujifar, Saeed, et al.
Publicado: (2025)
por: Mahloujifar, Saeed, et al.
Publicado: (2025)
Implicit Identity Technologies for LLMs: Fingerprinting and Watermarking across Datasets, Models, and Generated Content
por: Liu, Bing, et al.
Publicado: (2026)
por: Liu, Bing, et al.
Publicado: (2026)
RL Is a Hammer and LLMs Are Nails: A Simple Reinforcement Learning Recipe for Strong Prompt Injection
por: Wen, Yuxin, et al.
Publicado: (2025)
por: Wen, Yuxin, et al.
Publicado: (2025)
Machine Learning with Privacy for Protected Attributes
por: Mahloujifar, Saeed, et al.
Publicado: (2025)
por: Mahloujifar, Saeed, et al.
Publicado: (2025)
Closing the Loop: A Control-Theoretic Framework for Provably Stable Time Series Forecasting with LLMs
por: Zhang, Xingyu, et al.
Publicado: (2026)
por: Zhang, Xingyu, et al.
Publicado: (2026)
Privacy Amplification for the Gaussian Mechanism via Bounded Support
por: Hu, Shengyuan, et al.
Publicado: (2024)
por: Hu, Shengyuan, et al.
Publicado: (2024)
FairProof : Confidential and Certifiable Fairness for Neural Networks
por: Yadav, Chhavi, et al.
Publicado: (2024)
por: Yadav, Chhavi, et al.
Publicado: (2024)
On Differentially Private U Statistics
por: Chaudhuri, Kamalika, et al.
Publicado: (2024)
por: Chaudhuri, Kamalika, et al.
Publicado: (2024)
ExpProof : Operationalizing Explanations for Confidential Models with ZKPs
por: Yadav, Chhavi, et al.
Publicado: (2025)
por: Yadav, Chhavi, et al.
Publicado: (2025)
Measuring Déjà vu Memorization Efficiently
por: Kokhlikyan, Narine, et al.
Publicado: (2025)
por: Kokhlikyan, Narine, et al.
Publicado: (2025)
On the Empirical Power of Goodness-of-Fit Tests in Watermark Detection
por: He, Weiqing, et al.
Publicado: (2025)
por: He, Weiqing, et al.
Publicado: (2025)
Detecting Post-generation Edits to Watermarked LLM Outputs via Combinatorial Watermarking
por: Xie, Liyan, et al.
Publicado: (2025)
por: Xie, Liyan, et al.
Publicado: (2025)
SecAlign: Defending Against Prompt Injection with Preference Optimization
por: Chen, Sizhe, et al.
Publicado: (2024)
por: Chen, Sizhe, et al.
Publicado: (2024)
Provable Risk-Sensitive Distributional Reinforcement Learning with General Function Approximation
por: Chen, Yu, et al.
Publicado: (2024)
por: Chen, Yu, et al.
Publicado: (2024)
Differentially Private Representation Learning via Image Captioning
por: Sander, Tom, et al.
Publicado: (2024)
por: Sander, Tom, et al.
Publicado: (2024)
Towards Watermarking of Open-Source LLMs
por: Gloaguen, Thibaud, et al.
Publicado: (2025)
por: Gloaguen, Thibaud, et al.
Publicado: (2025)
Guarantees of confidentiality via Hammersley-Chapman-Robbins bounds
por: Chaudhuri, Kamalika, et al.
Publicado: (2024)
por: Chaudhuri, Kamalika, et al.
Publicado: (2024)
Gradient-guided Attention Map Editing: Towards Efficient Contextual Hallucination Mitigation
por: Wang, Yu, et al.
Publicado: (2025)
por: Wang, Yu, et al.
Publicado: (2025)
BiMarker: Enhancing Text Watermark Detection for Large Language Models with Bipolar Watermarks
por: Li, Zhuang, et al.
Publicado: (2025)
por: Li, Zhuang, et al.
Publicado: (2025)
Towards Better Statistical Understanding of Watermarking LLMs
por: Cai, Zhongze, et al.
Publicado: (2024)
por: Cai, Zhongze, et al.
Publicado: (2024)
Provable Training for Graph Contrastive Learning
por: Yu, Yue, et al.
Publicado: (2023)
por: Yu, Yue, et al.
Publicado: (2023)
WaterMAS: Sharpness-Aware Maximization for Neural Network Watermarking
por: Trias, Carl De Sousa, et al.
Publicado: (2024)
por: Trias, Carl De Sousa, et al.
Publicado: (2024)
The Behavior Gap: Evaluating Zero-shot LLM Agents in Complex Task-Oriented Dialogs
por: Baidya, Avinash, et al.
Publicado: (2025)
por: Baidya, Avinash, et al.
Publicado: (2025)
Refined Detection for Gumbel Watermarking
por: Lattimore, Tor
Publicado: (2026)
por: Lattimore, Tor
Publicado: (2026)
Ejemplares similares
-
Better Membership Inference Privacy Measurement through Discrepancy
por: Wu, Ruihan, et al.
Publicado: (2024) -
Can We Infer Confidential Properties of Training Data from LLMs?
por: Huang, Pengrun, et al.
Publicado: (2025) -
DPrivBench: Benchmarking LLMs' Reasoning for Differential Privacy
por: Wang, Erchi, et al.
Publicado: (2026) -
A Closer Look at the Learnability of Out-of-Distribution (OOD) Detection
por: Garov, Konstantin, et al.
Publicado: (2025) -
Learning-Time Encoding Shapes Unlearning in LLMs
por: Wu, Ruihan, et al.
Publicado: (2025)