Enregistré dans:
| Auteurs principaux: | Zhou, Tong, Zhao, Xuandong, Xu, Xiaolin, Ren, Shaolei |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2406.01946 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DualGuard: Dual-stream Large Language Model Watermarking Defense against Paraphrase and Spoofing Attack
par: Li, Hao, et autres
Publié: (2025)
par: Li, Hao, et autres
Publié: (2025)
ProDiF: Protecting Domain-Invariant Features to Secure Pre-Trained Models Against Extraction
par: Zhou, Tong, et autres
Publié: (2025)
par: Zhou, Tong, et autres
Publié: (2025)
Model Provenance Testing for Large Language Models
par: Nikolic, Ivica, et autres
Publié: (2025)
par: Nikolic, Ivica, et autres
Publié: (2025)
Defending LLM Watermarking Against Spoofing Attacks with Contrastive Representation Learning
par: An, Li, et autres
Publié: (2025)
par: An, Li, et autres
Publié: (2025)
Dataset Protection via Watermarked Canaries in Retrieval-Augmented LLMs
par: Liu, Yepeng, et autres
Publié: (2025)
par: Liu, Yepeng, et autres
Publié: (2025)
Prompt Stealing Attacks Against Large Language Models
par: Sha, Zeyang, et autres
Publié: (2024)
par: Sha, Zeyang, et autres
Publié: (2024)
Are You Getting What You Pay For? Auditing Model Substitution in LLM APIs
par: Cai, Will, et autres
Publié: (2025)
par: Cai, Will, et autres
Publié: (2025)
Composite Backdoor Attacks Against Large Language Models
par: Huang, Hai, et autres
Publié: (2023)
par: Huang, Hai, et autres
Publié: (2023)
Data Defenses Against Large Language Models
par: Agnew, William, et autres
Publié: (2024)
par: Agnew, William, et autres
Publié: (2024)
Eguard: Defending LLM Embeddings Against Inversion Attacks via Text Mutual Information Optimization
par: Liu, Tiantian, et autres
Publié: (2024)
par: Liu, Tiantian, et autres
Publié: (2024)
garak: A Framework for Security Probing Large Language Models
par: Derczynski, Leon, et autres
Publié: (2024)
par: Derczynski, Leon, et autres
Publié: (2024)
Position: LLM Watermarking Should Align Stakeholders' Incentives for Practical Adoption
par: Liu, Yepeng, et autres
Publié: (2025)
par: Liu, Yepeng, et autres
Publié: (2025)
Permute-and-Flip: An optimally stable and watermarkable decoder for LLMs
par: Zhao, Xuandong, et autres
Publié: (2024)
par: Zhao, Xuandong, et autres
Publié: (2024)
Waterfall: Framework for Robust and Scalable Text Watermarking and Provenance for LLMs
par: Lau, Gregory Kang Ruey, et autres
Publié: (2024)
par: Lau, Gregory Kang Ruey, et autres
Publié: (2024)
Text Embedding Inversion Security for Multilingual Language Models
par: Chen, Yiyi, et autres
Publié: (2024)
par: Chen, Yiyi, et autres
Publié: (2024)
Building Resilient SMEs: Harnessing Large Language Models for Cyber Security in Australia
par: Kereopa-Yorke, Benjamin
Publié: (2023)
par: Kereopa-Yorke, Benjamin
Publié: (2023)
The Landscape of Memorization in LLMs: Mechanisms, Measurement, and Mitigation
par: Xiong, Alexander, et autres
Publié: (2025)
par: Xiong, Alexander, et autres
Publié: (2025)
$PD^3F$: A Pluggable and Dynamic DoS-Defense Framework Against Resource Consumption Attacks Targeting Large Language Models
par: Zhang, Yuanhe, et autres
Publié: (2025)
par: Zhang, Yuanhe, et autres
Publié: (2025)
TextSeal: A Localized LLM Watermark for Provenance & Distillation Protection
par: Sander, Tom, et autres
Publié: (2026)
par: Sander, Tom, et autres
Publié: (2026)
An Investigation into Misuse of Java Security APIs by Large Language Models
par: Mousavi, Zahra, et autres
Publié: (2024)
par: Mousavi, Zahra, et autres
Publié: (2024)
Prefix Guidance: A Steering Wheel for Large Language Models to Defend Against Jailbreak Attacks
par: Zhao, Jiawei, et autres
Publié: (2024)
par: Zhao, Jiawei, et autres
Publié: (2024)
MPMA: Preference Manipulation Attack Against Model Context Protocol
par: Wang, Zihan, et autres
Publié: (2025)
par: Wang, Zihan, et autres
Publié: (2025)
Securing Genomic Data Against Inference Attacks in Federated Learning Environments
par: Pathade, Chetan, et autres
Publié: (2025)
par: Pathade, Chetan, et autres
Publié: (2025)
GenBreak: Red Teaming Text-to-Image Generators Using Large Language Models
par: Wang, Zilong, et autres
Publié: (2025)
par: Wang, Zilong, et autres
Publié: (2025)
MetaSeal: Defending Against Image Attribution Forgery Through Content-Dependent Cryptographic Watermarks
par: Zhou, Tong, et autres
Publié: (2025)
par: Zhou, Tong, et autres
Publié: (2025)
ConfGuard: A Simple and Effective Backdoor Detection for Large Language Models
par: Wang, Zihan, et autres
Publié: (2025)
par: Wang, Zihan, et autres
Publié: (2025)
From Trade-off to Synergy: A Versatile Symbiotic Watermarking Framework for Large Language Models
par: Wang, Yidan, et autres
Publié: (2025)
par: Wang, Yidan, et autres
Publié: (2025)
StructuralSleight: Automated Jailbreak Attacks on Large Language Models Utilizing Uncommon Text-Organization Structures
par: Li, Bangxin, et autres
Publié: (2024)
par: Li, Bangxin, et autres
Publié: (2024)
Security and Privacy Challenges of Large Language Models: A Survey
par: Das, Badhan Chandra, et autres
Publié: (2024)
par: Das, Badhan Chandra, et autres
Publié: (2024)
Privacy-Preserving Instructions for Aligning Large Language Models
par: Yu, Da, et autres
Publié: (2024)
par: Yu, Da, et autres
Publié: (2024)
Majority Bit-Aware Watermarking For Large Language Models
par: Xu, Jiahao, et autres
Publié: (2025)
par: Xu, Jiahao, et autres
Publié: (2025)
SOS! Soft Prompt Attack Against Open-Source Large Language Models
par: Yang, Ziqing, et autres
Publié: (2024)
par: Yang, Ziqing, et autres
Publié: (2024)
Securing Multi-turn Conversational Language Models From Distributed Backdoor Triggers
par: Tong, Terry, et autres
Publié: (2024)
par: Tong, Terry, et autres
Publié: (2024)
Enhance Robustness of Language Models Against Variation Attack through Graph Integration
par: Xiong, Zi, et autres
Publié: (2024)
par: Xiong, Zi, et autres
Publié: (2024)
SecureLLM: Using Compositionality to Build Provably Secure Language Models for Private, Sensitive, and Secret Data
par: Alabdulkareem, Abdulrahman, et autres
Publié: (2024)
par: Alabdulkareem, Abdulrahman, et autres
Publié: (2024)
BadLingual: A Novel Lingual-Backdoor Attack against Large Language Models
par: Wang, Zihan, et autres
Publié: (2025)
par: Wang, Zihan, et autres
Publié: (2025)
CTRAP: Embedding Collapse Trap to Safeguard Large Language Models from Harmful Fine-Tuning
par: Yi, Biao, et autres
Publié: (2025)
par: Yi, Biao, et autres
Publié: (2025)
JailbreakLens: Visual Analysis of Jailbreak Attacks Against Large Language Models
par: Feng, Yingchaojie, et autres
Publié: (2024)
par: Feng, Yingchaojie, et autres
Publié: (2024)
SafeKey: Amplifying Aha-Moment Insights for Safety Reasoning
par: Zhou, Kaiwen, et autres
Publié: (2025)
par: Zhou, Kaiwen, et autres
Publié: (2025)
Institutional Platform for Secure Self-Service Large Language Model Exploration
par: Bumgardner, V. K. Cody, et autres
Publié: (2024)
par: Bumgardner, V. K. Cody, et autres
Publié: (2024)
Documents similaires
-
DualGuard: Dual-stream Large Language Model Watermarking Defense against Paraphrase and Spoofing Attack
par: Li, Hao, et autres
Publié: (2025) -
ProDiF: Protecting Domain-Invariant Features to Secure Pre-Trained Models Against Extraction
par: Zhou, Tong, et autres
Publié: (2025) -
Model Provenance Testing for Large Language Models
par: Nikolic, Ivica, et autres
Publié: (2025) -
Defending LLM Watermarking Against Spoofing Attacks with Contrastive Representation Learning
par: An, Li, et autres
Publié: (2025) -
Dataset Protection via Watermarked Canaries in Retrieval-Augmented LLMs
par: Liu, Yepeng, et autres
Publié: (2025)