DualGuard: Dual-stream Large Language Model Watermarking Defense against Paraphrase and Spoofing Attack
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Hao, Ren, Yubing, Cao, Yanan, Li, Yingjie, Fang, Fang, Wang, Shi, Guo, Li |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
From Essence to Defense: Adaptive Semantic-aware Watermarking for Embedding-as-a-Service Copyright Protection
por: Li, Hao, et al.
Publicado: (2025)
por: Li, Hao, et al.
Publicado: (2025)
From Trade-off to Synergy: A Versatile Symbiotic Watermarking Framework for Large Language Models
por: Wang, Yidan, et al.
Publicado: (2025)
por: Wang, Yidan, et al.
Publicado: (2025)
Rethinking LLM Watermark Detection in Black-Box Settings: A Non-Intrusive Third-Party Framework
por: Wang, Zhuoshang, et al.
Publicado: (2026)
por: Wang, Zhuoshang, et al.
Publicado: (2026)
WorldCup Sampling for Multi-bit LLM Watermarking
por: Wang, Yidan, et al.
Publicado: (2026)
por: Wang, Yidan, et al.
Publicado: (2026)
PIG: Privacy Jailbreak Attack on LLMs via Gradient-based Iterative In-Context Optimization
por: Wang, Yidan, et al.
Publicado: (2025)
por: Wang, Yidan, et al.
Publicado: (2025)
Defending LLM Watermarking Against Spoofing Attacks with Contrastive Representation Learning
por: An, Li, et al.
Publicado: (2025)
por: An, Li, et al.
Publicado: (2025)
Revisiting the Robustness of Watermarking to Paraphrasing Attacks
por: Rastogi, Saksham, et al.
Publicado: (2024)
por: Rastogi, Saksham, et al.
Publicado: (2024)
A Robust Semantics-based Watermark for Large Language Model against Paraphrasing
por: Ren, Jie, et al.
Publicado: (2023)
por: Ren, Jie, et al.
Publicado: (2023)
DINA: A Dual Defense Framework Against Internal Noise and External Attacks in Natural Language Processing
por: Chuang, Ko-Wei, et al.
Publicado: (2025)
por: Chuang, Ko-Wei, et al.
Publicado: (2025)
Privacy in Large Language Models: Attacks, Defenses and Future Directions
por: Li, Haoran, et al.
Publicado: (2023)
por: Li, Haoran, et al.
Publicado: (2023)
PandaGuard: Systematic Evaluation of LLM Safety against Jailbreaking Attacks
por: Shen, Guobin, et al.
Publicado: (2025)
por: Shen, Guobin, et al.
Publicado: (2025)
Towards Label-Only Membership Inference Attack against Pre-trained Large Language Models
por: He, Yu, et al.
Publicado: (2025)
por: He, Yu, et al.
Publicado: (2025)
TraceGuard: Process-Guided Firewall against Reasoning Backdoors in Large Language Models
por: Guo, Zhen, et al.
Publicado: (2026)
por: Guo, Zhen, et al.
Publicado: (2026)
EvoDefense: Co-Evolving Black-Box Defense with Large Language Models
por: Li, Yu, et al.
Publicado: (2026)
por: Li, Yu, et al.
Publicado: (2026)
Duwak: Dual Watermarks in Large Language Models
por: Zhu, Chaoyi, et al.
Publicado: (2024)
por: Zhu, Chaoyi, et al.
Publicado: (2024)
Probe before You Talk: Towards Black-box Defense against Backdoor Unalignment for Large Language Models
por: Yi, Biao, et al.
Publicado: (2025)
por: Yi, Biao, et al.
Publicado: (2025)
Dual-Guard: Dual-Channel Latent Watermarking for Provenance and Tamper Localization in Diffusion Images
por: Xie, JinFeng, et al.
Publicado: (2026)
por: Xie, JinFeng, et al.
Publicado: (2026)
PRP: Propagating Universal Perturbations to Attack Large Language Model Guard-Rails
por: Mangaokar, Neal, et al.
Publicado: (2024)
por: Mangaokar, Neal, et al.
Publicado: (2024)
FATH: Authentication-based Test-time Defense against Indirect Prompt Injection Attacks
por: Wang, Jiongxiao, et al.
Publicado: (2024)
por: Wang, Jiongxiao, et al.
Publicado: (2024)
Removal Attack and Defense on AI-generated Content Latent-based Watermarking
por: Lee, De Zhang, et al.
Publicado: (2025)
por: Lee, De Zhang, et al.
Publicado: (2025)
AliMark: Enhancing Robustness of Sentence-Level Watermarking Against Text Paraphrasing
por: Li, Yuexin, et al.
Publicado: (2026)
por: Li, Yuexin, et al.
Publicado: (2026)
LLM-Virus: Evolutionary Jailbreak Attack on Large Language Models
por: Yu, Miao, et al.
Publicado: (2024)
por: Yu, Miao, et al.
Publicado: (2024)
Yet Another Watermark for Large Language Models
por: Bao, Siyuan, et al.
Publicado: (2025)
por: Bao, Siyuan, et al.
Publicado: (2025)
Bileve: Securing Text Provenance in Large Language Models Against Spoofing with Bi-level Signature
por: Zhou, Tong, et al.
Publicado: (2024)
por: Zhou, Tong, et al.
Publicado: (2024)
Detecting RAG Extraction Attack via Dual-Path Runtime Integrity Game
por: Xie, Yuanbo, et al.
Publicado: (2026)
por: Xie, Yuanbo, et al.
Publicado: (2026)
BadLingual: A Novel Lingual-Backdoor Attack against Large Language Models
por: Wang, Zihan, et al.
Publicado: (2025)
por: Wang, Zihan, et al.
Publicado: (2025)
NSmark: Null Space Based Black-box Watermarking Defense Framework for Language Models
por: Zhao, Haodong, et al.
Publicado: (2024)
por: Zhao, Haodong, et al.
Publicado: (2024)
Breaking Down the Defenses: A Comparative Survey of Attacks on Large Language Models
por: Chowdhury, Arijit Ghosh, et al.
Publicado: (2024)
por: Chowdhury, Arijit Ghosh, et al.
Publicado: (2024)
ConfGuard: A Simple and Effective Backdoor Detection for Large Language Models
por: Wang, Zihan, et al.
Publicado: (2025)
por: Wang, Zihan, et al.
Publicado: (2025)
AutoDefense: Multi-Agent LLM Defense against Jailbreak Attacks
por: Zeng, Yifan, et al.
Publicado: (2024)
por: Zeng, Yifan, et al.
Publicado: (2024)
SCOUT: A Defense Against Data Poisoning Attacks in Fine-Tuned Language Models
por: Afane, Mohamed, et al.
Publicado: (2025)
por: Afane, Mohamed, et al.
Publicado: (2025)
Denial-of-Service Poisoning Attacks against Large Language Models
por: Gao, Kuofeng, et al.
Publicado: (2024)
por: Gao, Kuofeng, et al.
Publicado: (2024)
Towards Code Watermarking with Dual-Channel Transformations
por: Yang, Borui, et al.
Publicado: (2023)
por: Yang, Borui, et al.
Publicado: (2023)
A Survey of Recent Backdoor Attacks and Defenses in Large Language Models
por: Zhao, Shuai, et al.
Publicado: (2024)
por: Zhao, Shuai, et al.
Publicado: (2024)
ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models
por: Zhao, Yunhan, et al.
Publicado: (2026)
por: Zhao, Yunhan, et al.
Publicado: (2026)
WET: Overcoming Paraphrasing Vulnerabilities in Embeddings-as-a-Service with Linear Transformation Watermarks
por: Shetty, Anudeex, et al.
Publicado: (2024)
por: Shetty, Anudeex, et al.
Publicado: (2024)
SAMark: A Self-Anchored Text Watermarking with Paragraph-Level Paraphrase Robustness
por: Huo, Jiahao, et al.
Publicado: (2026)
por: Huo, Jiahao, et al.
Publicado: (2026)
Scalable Defense against In-the-wild Jailbreaking Attacks with Safety Context Retrieval
por: Chen, Taiye, et al.
Publicado: (2025)
por: Chen, Taiye, et al.
Publicado: (2025)
Model-Agnostic Lifelong LLM Safety via Externalized Attack-Defense Co-Evolution
por: Zhang, Xiaozhe, et al.
Publicado: (2026)
por: Zhang, Xiaozhe, et al.
Publicado: (2026)
CrossGuard: Safeguarding MLLMs against Joint-Modal Implicit Malicious Attacks
por: Zhang, Xu, et al.
Publicado: (2025)
por: Zhang, Xu, et al.
Publicado: (2025)
Ejemplares similares
-
From Essence to Defense: Adaptive Semantic-aware Watermarking for Embedding-as-a-Service Copyright Protection
por: Li, Hao, et al.
Publicado: (2025) -
From Trade-off to Synergy: A Versatile Symbiotic Watermarking Framework for Large Language Models
por: Wang, Yidan, et al.
Publicado: (2025) -
Rethinking LLM Watermark Detection in Black-Box Settings: A Non-Intrusive Third-Party Framework
por: Wang, Zhuoshang, et al.
Publicado: (2026) -
WorldCup Sampling for Multi-bit LLM Watermarking
por: Wang, Yidan, et al.
Publicado: (2026) -
PIG: Privacy Jailbreak Attack on LLMs via Gradient-based Iterative In-Context Optimization
por: Wang, Yidan, et al.
Publicado: (2025)