Unified attacks to large language model watermarks: spoofing and scrubbing in unauthorized knowledge distillation
Fuente:
arXiv
Saved in:
| Main Authors: | Yi, Xin, Li, Yue, Zheng, Shunfan, Wang, Linlin, Wang, Xiaoling, He, Liang |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
A safety realignment framework via subspace-oriented model fusion for large language models
by: Yi, Xin, et al.
Published: (2024)
by: Yi, Xin, et al.
Published: (2024)
Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks
by: Yi, Xin, et al.
Published: (2025)
by: Yi, Xin, et al.
Published: (2025)
NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning
by: Yi, Xin, et al.
Published: (2024)
by: Yi, Xin, et al.
Published: (2024)
Unified Defense for Large Language Models against Jailbreak and Fine-Tuning Attacks in Education
by: Yi, Xin, et al.
Published: (2025)
by: Yi, Xin, et al.
Published: (2025)
Hierarchical Divide-and-Conquer for Fine-Grained Alignment in LLM-Based Medical Evaluation
by: Zheng, Shunfan, et al.
Published: (2025)
by: Zheng, Shunfan, et al.
Published: (2025)
Optimizing watermarks for large language models
by: Wouters, Bram
Published: (2023)
by: Wouters, Bram
Published: (2023)
ACE-$M^3$: Automatic Capability Evaluator for Multimodal Medical Models
by: Zhang, Xiechi, et al.
Published: (2024)
by: Zhang, Xiechi, et al.
Published: (2024)
Fine-Grained Detoxification via Instance-Level Prefixes for Large Language Models
by: Yi, Xin, et al.
Published: (2024)
by: Yi, Xin, et al.
Published: (2024)
Assessing biomedical knowledge robustness in large language models by query-efficient sampling attacks
by: Xian, R. Patrick, et al.
Published: (2024)
by: Xian, R. Patrick, et al.
Published: (2024)
Can adversarial attacks by large language models be attributed?
by: Cebrian, Manuel, et al.
Published: (2024)
by: Cebrian, Manuel, et al.
Published: (2024)
Multi-round jailbreak attack on large language models
by: Zhou, Yihua, et al.
Published: (2024)
by: Zhou, Yihua, et al.
Published: (2024)
Dynamic data sampler for cross-language transfer learning in large language models
by: Li, Yudong, et al.
Published: (2024)
by: Li, Yudong, et al.
Published: (2024)
Retrieval augmentation of large language models for lay language generation
by: Guo, Yue, et al.
Published: (2022)
by: Guo, Yue, et al.
Published: (2022)
ADMEDTAGGER: an annotation framework for distillation of expert knowledge for the Polish medical language
by: Górski, Franciszek, et al.
Published: (2025)
by: Górski, Franciszek, et al.
Published: (2025)
Uncovering inequalities in new knowledge learning by large language models across different languages
by: Wang, Chenglong, et al.
Published: (2025)
by: Wang, Chenglong, et al.
Published: (2025)
Hierarchical Safety Realignment: Lightweight Restoration of Safety in Pruned Large Vision-Language Models
by: Li, Yue, et al.
Published: (2025)
by: Li, Yue, et al.
Published: (2025)
Biomedical knowledge graph-optimized prompt generation for large language models
by: Soman, Karthik, et al.
Published: (2023)
by: Soman, Karthik, et al.
Published: (2023)
Learning diverse attacks on large language models for robust red-teaming and safety tuning
by: Lee, Seanie, et al.
Published: (2024)
by: Lee, Seanie, et al.
Published: (2024)
Do large language models resemble humans in language use?
by: Cai, Zhenguang G., et al.
Published: (2023)
by: Cai, Zhenguang G., et al.
Published: (2023)
TechGPT-2.0: A large language model project to solve the task of knowledge graph construction
by: Wang, Jiaqi, et al.
Published: (2024)
by: Wang, Jiaqi, et al.
Published: (2024)
PersonaMark: Personalized LLM watermarking for model protection and user attribution
by: Zhang, Yuehan, et al.
Published: (2024)
by: Zhang, Yuehan, et al.
Published: (2024)
Proving membership in LLM pretraining data via data watermarks
by: Wei, Johnny Tian-Zheng, et al.
Published: (2024)
by: Wei, Johnny Tian-Zheng, et al.
Published: (2024)
Permute-and-Flip: An optimally stable and watermarkable decoder for LLMs
by: Zhao, Xuandong, et al.
Published: (2024)
by: Zhao, Xuandong, et al.
Published: (2024)
Had enough of experts? Quantitative knowledge retrieval from large language models
by: Selby, David, et al.
Published: (2024)
by: Selby, David, et al.
Published: (2024)
Performance of large language models in numerical vs. semantic medical knowledge: Benchmarking on evidence-based Q&As
by: Avnat, Eden, et al.
Published: (2024)
by: Avnat, Eden, et al.
Published: (2024)
VLA-Mark: A cross modal watermark for large vision-language alignment model
by: Liu, Shuliang, et al.
Published: (2025)
by: Liu, Shuliang, et al.
Published: (2025)
MindScope: Exploring cognitive biases in large language models through Multi-Agent Systems
by: Xie, Zhentao, et al.
Published: (2024)
by: Xie, Zhentao, et al.
Published: (2024)
LegalCiteBench: Evaluating Citation Reliability in Legal Language Models
by: Chen, Sijia, et al.
Published: (2026)
by: Chen, Sijia, et al.
Published: (2026)
KGLink: A column type annotation method that combines knowledge graph and pre-trained language model
by: Wang, Yubo, et al.
Published: (2024)
by: Wang, Yubo, et al.
Published: (2024)
How Do Humans Write Code? Large Models Do It the Same Way Too
by: Li, Long, et al.
Published: (2024)
by: Li, Long, et al.
Published: (2024)
Is your multimodal large language model a good science tutor?
by: Liu, Ming, et al.
Published: (2025)
by: Liu, Ming, et al.
Published: (2025)
MLRIP: Pre-training a military language representation model with informative factual knowledge and professional knowledge base
by: Li, Hui, et al.
Published: (2022)
by: Li, Hui, et al.
Published: (2022)
TeleEval-OS: Performance evaluations of large language models for operations scheduling
by: Wang, Yanyan, et al.
Published: (2025)
by: Wang, Yanyan, et al.
Published: (2025)
Dissociating language and thought in large language models
by: Mahowald, Kyle, et al.
Published: (2023)
by: Mahowald, Kyle, et al.
Published: (2023)
Empirical study of pretrained multilingual language models for zero-shot cross-lingual knowledge transfer in generation
by: Chirkova, Nadezhda, et al.
Published: (2023)
by: Chirkova, Nadezhda, et al.
Published: (2023)
BARD: budget-aware reasoning distillation
by: Niu, Lujie, et al.
Published: (2025)
by: Niu, Lujie, et al.
Published: (2025)
Developmental trajectories of decision making and affective dynamics in large language models
by: Wang, Zhihao, et al.
Published: (2025)
by: Wang, Zhihao, et al.
Published: (2025)
Advancing bioinformatics with large language models: components, applications and perspectives
by: Liu, Jiajia, et al.
Published: (2024)
by: Liu, Jiajia, et al.
Published: (2024)
Developing ChemDFM as a large language foundation model for chemistry
by: Zhao, Zihan, et al.
Published: (2024)
by: Zhao, Zihan, et al.
Published: (2024)
AutoMedEval: Harnessing Language Models for Automatic Medical Capability Evaluation
by: Zhang, Xiechi, et al.
Published: (2025)
by: Zhang, Xiechi, et al.
Published: (2025)
Similar Items
-
A safety realignment framework via subspace-oriented model fusion for large language models
by: Yi, Xin, et al.
Published: (2024) -
Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks
by: Yi, Xin, et al.
Published: (2025) -
NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning
by: Yi, Xin, et al.
Published: (2024) -
Unified Defense for Large Language Models against Jailbreak and Fine-Tuning Attacks in Education
by: Yi, Xin, et al.
Published: (2025) -
Hierarchical Divide-and-Conquer for Fine-Grained Alignment in LLM-Based Medical Evaluation
by: Zheng, Shunfan, et al.
Published: (2025)