Watermark Smoothing Attacks against Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chang, Hongyan, Hassani, Hamed, Shokri, Reza |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Context-Aware Membership Inference Attacks against Pre-trained Large Language Models
par: Chang, Hongyan, et autres
Publié: (2024)
par: Chang, Hongyan, et autres
Publié: (2024)
SmoothLLM: Defending Large Language Models Against Jailbreaking Attacks
par: Robey, Alexander, et autres
Publié: (2023)
par: Robey, Alexander, et autres
Publié: (2023)
Watermarking Language Models with Error Correcting Codes
par: Chao, Patrick, et autres
Publié: (2024)
par: Chao, Patrick, et autres
Publié: (2024)
Range Membership Inference Attacks
par: Tao, Jiashu, et autres
Publié: (2024)
par: Tao, Jiashu, et autres
Publié: (2024)
Low-Cost High-Power Membership Inference Attacks
par: Zarifzadeh, Sajjad, et autres
Publié: (2023)
par: Zarifzadeh, Sajjad, et autres
Publié: (2023)
Generalization Properties of Adversarial Training for $\ell_0$-Bounded Adversarial Attacks
par: Delgosha, Payam, et autres
Publié: (2024)
par: Delgosha, Payam, et autres
Publié: (2024)
(Token-Level) InfoRMIA: Stronger Membership Inference and Memorization Assessment for LLMs
par: Tao, Jiashu, et autres
Publié: (2025)
par: Tao, Jiashu, et autres
Publié: (2025)
Machine Learning from Explanations
par: Tao, Jiashu, et autres
Publié: (2025)
par: Tao, Jiashu, et autres
Publié: (2025)
Evaluating the Performance of Large Language Models via Debates
par: Moniri, Behrad, et autres
Publié: (2024)
par: Moniri, Behrad, et autres
Publié: (2024)
Feature Learning in Linear-Width Two-Layer Networks: Two vs. One Step of Gradient Descent
par: Moniri, Behrad, et autres
Publié: (2026)
par: Moniri, Behrad, et autres
Publié: (2026)
On the Mechanisms of Weak-to-Strong Generalization: A Theoretical Perspective
par: Moniri, Behrad, et autres
Publié: (2025)
par: Moniri, Behrad, et autres
Publié: (2025)
MEA-Defender: A Robust Watermark against Model Extraction Attack
par: Lv, Peizhuo, et autres
Publié: (2024)
par: Lv, Peizhuo, et autres
Publié: (2024)
Signal-Plus-Noise Decomposition of Nonlinear Spiked Random Matrix Models
par: Moniri, Behrad, et autres
Publié: (2024)
par: Moniri, Behrad, et autres
Publié: (2024)
Asymptotics of Linear Regression with Linearly Dependent Data
par: Moniri, Behrad, et autres
Publié: (2024)
par: Moniri, Behrad, et autres
Publié: (2024)
The curse of overparametrization in adversarial training: Precise analysis of robust generalization for random features regression
par: Hassani, Hamed, et autres
Publié: (2022)
par: Hassani, Hamed, et autres
Publié: (2022)
Defending Large Language Models against Jailbreak Attacks via Semantic Smoothing
par: Ji, Jiabao, et autres
Publié: (2024)
par: Ji, Jiabao, et autres
Publié: (2024)
Smaller Language Models are Better Black-box Machine-Generated Text Detectors
par: Mireshghallah, Niloofar, et autres
Publié: (2023)
par: Mireshghallah, Niloofar, et autres
Publié: (2023)
Rethinking Hallucinations: Correctness, Consistency, and Prompt Multiplicity
par: Ganesh, Prakhar, et autres
Publié: (2026)
par: Ganesh, Prakhar, et autres
Publié: (2026)
Fast Adversarial Training against Sparse Attacks Requires Loss Smoothing
par: Zhong, Xuyang, et autres
Publié: (2025)
par: Zhong, Xuyang, et autres
Publié: (2025)
Conformal Information Pursuit for Interactively Guiding Large Language Models
par: Chan, Kwan Ho Ryan, et autres
Publié: (2025)
par: Chan, Kwan Ho Ryan, et autres
Publié: (2025)
Conformal Prediction with Learned Features
par: Kiyani, Shayan, et autres
Publié: (2024)
par: Kiyani, Shayan, et autres
Publié: (2024)
BrainLeaks: On the Privacy-Preserving Properties of Neuromorphic Architectures against Model Inversion Attacks
par: Poursiami, Hamed, et autres
Publié: (2024)
par: Poursiami, Hamed, et autres
Publié: (2024)
Conformal Prediction Beyond the Seen: A Missing Mass Perspective for Uncertainty Quantification in Generative Models
par: Noorani, Sima, et autres
Publié: (2025)
par: Noorani, Sima, et autres
Publié: (2025)
Leave-one-out Distinguishability in Machine Learning
par: Ye, Jiayuan, et autres
Publié: (2023)
par: Ye, Jiayuan, et autres
Publié: (2023)
Semantic Membership Inference Attack against Large Language Models
par: Mozaffari, Hamid, et autres
Publié: (2024)
par: Mozaffari, Hamid, et autres
Publié: (2024)
Jailbreaking Black Box Large Language Models in Twenty Queries
par: Chao, Patrick, et autres
Publié: (2023)
par: Chao, Patrick, et autres
Publié: (2023)
Length Optimization in Conformal Prediction
par: Kiyani, Shayan, et autres
Publié: (2024)
par: Kiyani, Shayan, et autres
Publié: (2024)
A Theory of Non-Linear Feature Learning with One Gradient Step in Two-Layer Neural Networks
par: Moniri, Behrad, et autres
Publié: (2023)
par: Moniri, Behrad, et autres
Publié: (2023)
Provable tradeoffs in adversarially robust classification
par: Dobriban, Edgar, et autres
Publié: (2020)
par: Dobriban, Edgar, et autres
Publié: (2020)
InfoSFT: Learn More and Forget Less with Information-Aware Token Weighting
par: Sabbaghi, Mahdi, et autres
Publié: (2026)
par: Sabbaghi, Mahdi, et autres
Publié: (2026)
Multi-Round Human-AI Collaboration with User-Specified Requirements
par: Noorani, Sima, et autres
Publié: (2026)
par: Noorani, Sima, et autres
Publié: (2026)
MultiRisk: Multiple Risk Control via Iterative Score Thresholding
par: Joshi, Sunay, et autres
Publié: (2025)
par: Joshi, Sunay, et autres
Publié: (2025)
Robust Policy Optimization to Prevent Catastrophic Forgetting
par: Sabbaghi, Mahdi, et autres
Publié: (2026)
par: Sabbaghi, Mahdi, et autres
Publié: (2026)
Neural Estimation of the Rate-Distortion Function With Applications to Operational Source Coding
par: Lei, Eric, et autres
Publié: (2022)
par: Lei, Eric, et autres
Publié: (2022)
Optimal Neural Compressors for the Rate-Distortion-Perception Tradeoff
par: Lei, Eric, et autres
Publié: (2025)
par: Lei, Eric, et autres
Publié: (2025)
Provable Watermarking for Data Poisoning Attacks
par: Zhu, Yifan, et autres
Publié: (2025)
par: Zhu, Yifan, et autres
Publié: (2025)
BiMarker: Enhancing Text Watermark Detection for Large Language Models with Bipolar Watermarks
par: Li, Zhuang, et autres
Publié: (2025)
par: Li, Zhuang, et autres
Publié: (2025)
Generalization in LLM Problem Solving: The Case of the Shortest Path
par: Tong, Yao, et autres
Publié: (2026)
par: Tong, Yao, et autres
Publié: (2026)
Adversarial Evasion Attack Efficiency against Large Language Models
par: Vitorino, João, et autres
Publié: (2024)
par: Vitorino, João, et autres
Publié: (2024)
Defending Object Detectors against Patch Attacks with Out-of-Distribution Smoothing
par: Feng, Ryan, et autres
Publié: (2022)
par: Feng, Ryan, et autres
Publié: (2022)
Documents similaires
-
Context-Aware Membership Inference Attacks against Pre-trained Large Language Models
par: Chang, Hongyan, et autres
Publié: (2024) -
SmoothLLM: Defending Large Language Models Against Jailbreaking Attacks
par: Robey, Alexander, et autres
Publié: (2023) -
Watermarking Language Models with Error Correcting Codes
par: Chao, Patrick, et autres
Publié: (2024) -
Range Membership Inference Attacks
par: Tao, Jiashu, et autres
Publié: (2024) -
Low-Cost High-Power Membership Inference Attacks
par: Zarifzadeh, Sajjad, et autres
Publié: (2023)