Double-I Watermark: Protecting Model Copyright for LLM Fine-tuning
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Shen, Yao, Liuyi, Gao, Jinyang, Zhang, Lan, Li, Yaliang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Safety Layers in Aligned Large Language Models: The Key to LLM Security
por: Li, Shen, et al.
Publicado: (2024)
por: Li, Shen, et al.
Publicado: (2024)
Protecting Copyright of Medical Pre-trained Language Models: Training-Free Backdoor Model Watermarking
por: Kong, Cong, et al.
Publicado: (2024)
por: Kong, Cong, et al.
Publicado: (2024)
SWAP: Towards Copyright Auditing of Soft Prompts via Sequential Watermarking
por: Yang, Wenyuan, et al.
Publicado: (2025)
por: Yang, Wenyuan, et al.
Publicado: (2025)
Pharmacist: Safety Alignment Data Curation for Large Language Models against Harmful Fine-tuning
por: Liu, Guozhi, et al.
Publicado: (2025)
por: Liu, Guozhi, et al.
Publicado: (2025)
I can't see it but I can Fine-tune it: On Encrypted Fine-tuning of Transformers using Fully Homomorphic Encryption
por: Panzade, Prajwal, et al.
Publicado: (2024)
por: Panzade, Prajwal, et al.
Publicado: (2024)
Can Differentially Private Fine-tuning LLMs Protect Against Privacy Attacks?
por: Du, Hao, et al.
Publicado: (2025)
por: Du, Hao, et al.
Publicado: (2025)
AGATE: Stealthy Black-box Watermarking for Multimodal Model Copyright Protection
por: Gao, Jianbo, et al.
Publicado: (2025)
por: Gao, Jianbo, et al.
Publicado: (2025)
Learning to Watermark LLM-generated Text via Reinforcement Learning
por: Xu, Xiaojun, et al.
Publicado: (2024)
por: Xu, Xiaojun, et al.
Publicado: (2024)
Explanation as a Watermark: Towards Harmless and Multi-bit Model Ownership Verification via Watermarking Feature Attribution
por: Shao, Shuo, et al.
Publicado: (2024)
por: Shao, Shuo, et al.
Publicado: (2024)
DMark: Order-Agnostic Watermarking for Diffusion Large Language Models
por: Wu, Linyu, et al.
Publicado: (2025)
por: Wu, Linyu, et al.
Publicado: (2025)
A Unified Framework for LLM Watermarks
por: Gloaguen, Thibaud, et al.
Publicado: (2026)
por: Gloaguen, Thibaud, et al.
Publicado: (2026)
RTLMarker: Protecting LLM-Generated RTL Copyright via a Hardware Watermarking Framework
por: Wang, Kun, et al.
Publicado: (2025)
por: Wang, Kun, et al.
Publicado: (2025)
TEESlice: Protecting Sensitive Neural Network Models in Trusted Execution Environments When Attackers have Pre-Trained Models
por: Li, Ding, et al.
Publicado: (2024)
por: Li, Ding, et al.
Publicado: (2024)
Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey
por: Huang, Tiansheng, et al.
Publicado: (2024)
por: Huang, Tiansheng, et al.
Publicado: (2024)
Ward: Provable RAG Dataset Inference via LLM Watermarks
por: Jovanović, Nikola, et al.
Publicado: (2024)
por: Jovanović, Nikola, et al.
Publicado: (2024)
Watermarking Diffusion Language Models
por: Gloaguen, Thibaud, et al.
Publicado: (2025)
por: Gloaguen, Thibaud, et al.
Publicado: (2025)
Deep Learning-based Dual Watermarking for Image Copyright Protection and Authentication
por: Padhi, Sudev Kumar, et al.
Publicado: (2025)
por: Padhi, Sudev Kumar, et al.
Publicado: (2025)
Watermark Stealing in Large Language Models
por: Jovanović, Nikola, et al.
Publicado: (2024)
por: Jovanović, Nikola, et al.
Publicado: (2024)
CLASP: Training-Free LLM-Assisted Source Code Watermarking via Semantic-Preserving Transformations
por: Xu, Rui, et al.
Publicado: (2025)
por: Xu, Rui, et al.
Publicado: (2025)
Discovering Spoofing Attempts on Language Model Watermarks
por: Gloaguen, Thibaud, et al.
Publicado: (2024)
por: Gloaguen, Thibaud, et al.
Publicado: (2024)
MarkTune: Improving the Quality-Detectability Trade-off in Open-Weight LLM Watermarking
por: Zhao, Yizhou, et al.
Publicado: (2025)
por: Zhao, Yizhou, et al.
Publicado: (2025)
SentinelLMs: Encrypted Input Adaptation and Fine-tuning of Language Models for Private and Secure Inference
por: Mishra, Abhijit, et al.
Publicado: (2023)
por: Mishra, Abhijit, et al.
Publicado: (2023)
©Plug-in Authorization for Human Content Copyright Protection in Text-to-Image Model
por: Zhou, Chao, et al.
Publicado: (2024)
por: Zhou, Chao, et al.
Publicado: (2024)
Mitigating Watermark Forgery in Generative Models via Randomized Key Selection
por: Aremu, Toluwani, et al.
Publicado: (2025)
por: Aremu, Toluwani, et al.
Publicado: (2025)
Unforgeable Watermarks for Language Models via Robust Signatures
por: Lin, Huijia, et al.
Publicado: (2026)
por: Lin, Huijia, et al.
Publicado: (2026)
SOFT: Selective Data Obfuscation for Protecting LLM Fine-tuning against Membership Inference Attacks
por: Zhang, Kaiyuan, et al.
Publicado: (2025)
por: Zhang, Kaiyuan, et al.
Publicado: (2025)
SoK: Watermarking for AI-Generated Content
por: Zhao, Xuandong, et al.
Publicado: (2024)
por: Zhao, Xuandong, et al.
Publicado: (2024)
A Study of Backdoors in Instruction Fine-tuned Language Models
por: Raghuram, Jayaram, et al.
Publicado: (2024)
por: Raghuram, Jayaram, et al.
Publicado: (2024)
Generative Models are Self-Watermarked: Declaring Model Authentication through Re-Generation
por: Desu, Aditya, et al.
Publicado: (2024)
por: Desu, Aditya, et al.
Publicado: (2024)
PRO: Enabling Precise and Robust Text Watermark for Open-Source LLMs
por: Xue, Jiaqi, et al.
Publicado: (2025)
por: Xue, Jiaqi, et al.
Publicado: (2025)
Towards Copyright Protection for Knowledge Bases of Retrieval-augmented Language Models via Reasoning
por: Guo, Junfeng, et al.
Publicado: (2025)
por: Guo, Junfeng, et al.
Publicado: (2025)
Intellectual Property Protection for Deep Learning Model and Dataset Intelligence
por: Jiang, Yongqi, et al.
Publicado: (2024)
por: Jiang, Yongqi, et al.
Publicado: (2024)
An Undetectable Watermark for Generative Image Models
por: Gunn, Sam, et al.
Publicado: (2024)
por: Gunn, Sam, et al.
Publicado: (2024)
AttackQA: Development and Adoption of a Dataset for Assisting Cybersecurity Operations using Fine-tuned and Open-Source LLMs
por: Krishna, Varun Badrinath
Publicado: (2024)
por: Krishna, Varun Badrinath
Publicado: (2024)
Security and Detectability Analysis of Unicode Text Watermarking Methods Against Large Language Models
por: Hellmeier, Malte
Publicado: (2025)
por: Hellmeier, Malte
Publicado: (2025)
Watermarking across Modalities for Content Tracing and Generative AI
por: Fernandez, Pierre
Publicado: (2025)
por: Fernandez, Pierre
Publicado: (2025)
Towards Resilient Safety-driven Unlearning for Diffusion Models against Downstream Fine-tuning
por: Li, Boheng, et al.
Publicado: (2025)
por: Li, Boheng, et al.
Publicado: (2025)
Virus: Harmful Fine-tuning Attack for Large Language Models Bypassing Guardrail Moderation
por: Huang, Tiansheng, et al.
Publicado: (2025)
por: Huang, Tiansheng, et al.
Publicado: (2025)
Security in the Fine-Tuning Lifecycle of Large Language Models: Threats, Defenses,Evaluation, and Future Directions
por: Li, Wenjuan, et al.
Publicado: (2026)
por: Li, Wenjuan, et al.
Publicado: (2026)
Edit Distance Robust Watermarks via Indexing Pseudorandom Codes
por: Golowich, Noah, et al.
Publicado: (2024)
por: Golowich, Noah, et al.
Publicado: (2024)
Ejemplares similares
-
Safety Layers in Aligned Large Language Models: The Key to LLM Security
por: Li, Shen, et al.
Publicado: (2024) -
Protecting Copyright of Medical Pre-trained Language Models: Training-Free Backdoor Model Watermarking
por: Kong, Cong, et al.
Publicado: (2024) -
SWAP: Towards Copyright Auditing of Soft Prompts via Sequential Watermarking
por: Yang, Wenyuan, et al.
Publicado: (2025) -
Pharmacist: Safety Alignment Data Curation for Large Language Models against Harmful Fine-tuning
por: Liu, Guozhi, et al.
Publicado: (2025) -
I can't see it but I can Fine-tune it: On Encrypted Fine-tuning of Transformers using Fully Homomorphic Encryption
por: Panzade, Prajwal, et al.
Publicado: (2024)