Silent Guardian: Protecting Text from Malicious Exploitation by Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhao, Jiawei, Chen, Kejiang, Yuan, Xiaojian, Qi, Yuang, Zhang, Weiming, Yu, Nenghai |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
PSRT: Accelerating LRM-based Guard Models via Prefilled Safe Reasoning Traces
par: Zhao, Jiawei, et autres
Publié: (2025)
par: Zhao, Jiawei, et autres
Publié: (2025)
SQL Injection Jailbreak: A Structural Disaster of Large Language Models
par: Zhao, Jiawei, et autres
Publié: (2024)
par: Zhao, Jiawei, et autres
Publié: (2024)
Prefix Guidance: A Steering Wheel for Large Language Models to Defend Against Jailbreak Attacks
par: Zhao, Jiawei, et autres
Publié: (2024)
par: Zhao, Jiawei, et autres
Publié: (2024)
STEAD: Robust Provably Secure Linguistic Steganography with Diffusion Language Model
par: Qi, Yuang, et autres
Publié: (2026)
par: Qi, Yuang, et autres
Publié: (2026)
On the Vulnerability of Text Sanitization
par: Tong, Meng, et autres
Publié: (2024)
par: Tong, Meng, et autres
Publié: (2024)
InferDPT: Privacy-Preserving Inference for Closed-box Large Language Model
par: Tong, Meng, et autres
Publié: (2023)
par: Tong, Meng, et autres
Publié: (2023)
Provably Secure Disambiguating Neural Linguistic Steganography
par: Qi, Yuang, et autres
Publié: (2024)
par: Qi, Yuang, et autres
Publié: (2024)
Performance-lossless Black-box Model Watermarking
par: Zhao, Na, et autres
Publié: (2023)
par: Zhao, Na, et autres
Publié: (2023)
GIFDL: Generated Image Fluctuation Distortion Learning for Enhancing Steganographic Security
par: Wang, Xiangkun, et autres
Publié: (2025)
par: Wang, Xiangkun, et autres
Publié: (2025)
Turning Your Strength into Watermark: Watermarking Large Language Model via Knowledge Injection
par: Li, Shuai, et autres
Publié: (2023)
par: Li, Shuai, et autres
Publié: (2023)
EditMark: Watermarking Large Language Models based on Model Editing
par: Li, Shuai, et autres
Publié: (2025)
par: Li, Shuai, et autres
Publié: (2025)
A high-capacity linguistic steganography based on entropy-driven rank-token mapping
par: Jiang, Jun, et autres
Publié: (2025)
par: Jiang, Jun, et autres
Publié: (2025)
Provably Secure Public-Key Steganography Based on Admissible Encoding
par: Zhang, Xin, et autres
Publié: (2025)
par: Zhang, Xin, et autres
Publié: (2025)
Provably Secure Agent Guardrail
par: Wu, Benlong, et autres
Publié: (2026)
par: Wu, Benlong, et autres
Publié: (2026)
De-AntiFake: Rethinking the Protective Perturbations Against Voice Cloning Attacks
par: Fan, Wei, et autres
Publié: (2025)
par: Fan, Wei, et autres
Publié: (2025)
Provably Secure Robust Image Steganography via Cross-Modal Error Correction
par: Qi, Yuang, et autres
Publié: (2024)
par: Qi, Yuang, et autres
Publié: (2024)
Gaussian Shading: Provable Performance-Lossless Image Watermarking for Diffusion Models
par: Yang, Zijin, et autres
Publié: (2024)
par: Yang, Zijin, et autres
Publié: (2024)
Membership Inference Attacks on Tokenizers of Large Language Models
par: Tong, Meng, et autres
Publié: (2025)
par: Tong, Meng, et autres
Publié: (2025)
Natias: Neuron Attribution based Transferable Image Adversarial Steganography
par: Fan, Zexin, et autres
Publié: (2024)
par: Fan, Zexin, et autres
Publié: (2024)
Silent Guardians: Independent and Secure Decision Tree Evaluation Without Chatter
par: Li, Jinyuan, et autres
Publié: (2026)
par: Li, Jinyuan, et autres
Publié: (2026)
©Plug-in Authorization for Human Content Copyright Protection in Text-to-Image Model
par: Zhou, Chao, et autres
Publié: (2024)
par: Zhou, Chao, et autres
Publié: (2024)
AutoPT: How Far Are We from the End2End Automated Web Penetration Testing?
par: Wu, Benlong, et autres
Publié: (2024)
par: Wu, Benlong, et autres
Publié: (2024)
LiteUpdate: A Lightweight Framework for Updating AI-Generated Image Detectors
par: Lu, Jiajie, et autres
Publié: (2025)
par: Lu, Jiajie, et autres
Publié: (2025)
WavInWav: Time-domain Speech Hiding via Invertible Neural Network
par: Fan, Wei, et autres
Publié: (2025)
par: Fan, Wei, et autres
Publié: (2025)
SemBind: Binding Diffusion Watermarks to Semantics Against Black-Box Forgery Attacks
par: Zhang, Xin, et autres
Publié: (2026)
par: Zhang, Xin, et autres
Publié: (2026)
Gaussian Shading++: Rethinking the Realistic Deployment Challenge of Performance-Lossless Image Watermark for Diffusion Models
par: Yang, Zijin, et autres
Publié: (2025)
par: Yang, Zijin, et autres
Publié: (2025)
An Empirical Study on the Effectiveness of Large Language Models for Binary Code Understanding
par: Shang, Xiuwei, et autres
Publié: (2025)
par: Shang, Xiuwei, et autres
Publié: (2025)
AquaLoRA: Toward White-box Protection for Customized Stable Diffusion Models via Watermark LoRA
par: Feng, Weitao, et autres
Publié: (2024)
par: Feng, Weitao, et autres
Publié: (2024)
How Far Have We Gone in Binary Code Understanding Using Large Language Models
par: Shang, Xiuwei, et autres
Publié: (2024)
par: Shang, Xiuwei, et autres
Publié: (2024)
Character as a Latent Variable in Large Language Models: A Mechanistic Account of Emergent Misalignment and Conditional Safety Failures
par: Su, Yanghao, et autres
Publié: (2026)
par: Su, Yanghao, et autres
Publié: (2026)
Model-Guardian: Protecting against Data-Free Model Stealing Using Gradient Representations and Deceptive Predictions
par: Yang, Yunfei, et autres
Publié: (2025)
par: Yang, Yunfei, et autres
Publié: (2025)
FoC: Figure out the Cryptographic Functions in Stripped Binaries with LLMs
par: Shang, Xiuwei, et autres
Publié: (2024)
par: Shang, Xiuwei, et autres
Publié: (2024)
State-Dependent Safety Failures in Multi-Turn Language Model Interaction
par: Li, Pengcheng, et autres
Publié: (2026)
par: Li, Pengcheng, et autres
Publié: (2026)
USBIPS Framework: Protecting Hosts from Malicious USB Peripherals
par: Wang, Chun-Yi, et autres
Publié: (2024)
par: Wang, Chun-Yi, et autres
Publié: (2024)
Towards Browser Controls to Protect Cookies from Malicious Extensions
par: Tyler, Liam, et autres
Publié: (2024)
par: Tyler, Liam, et autres
Publié: (2024)
Guardians of the Ledger: Protecting Decentralized Exchanges from State Derailment Defects
par: Li, Zongwei, et autres
Publié: (2024)
par: Li, Zongwei, et autres
Publié: (2024)
Probe-Me-Not: Protecting Pre-trained Encoders from Malicious Probing
par: Ding, Ruyi, et autres
Publié: (2024)
par: Ding, Ruyi, et autres
Publié: (2024)
SCAMPER -- Synchrophasor Covert chAnnel for Malicious and Protective ERrands
par: Krishnamurthy, Prashanth, et autres
Publié: (2025)
par: Krishnamurthy, Prashanth, et autres
Publié: (2025)
Model X-ray:Detecting Backdoored Models via Decision Boundary
par: Su, Yanghao, et autres
Publié: (2024)
par: Su, Yanghao, et autres
Publié: (2024)
TZ-LLM: Protecting On-Device Large Language Models with Arm TrustZone
par: Wang, Xunjie, et autres
Publié: (2025)
par: Wang, Xunjie, et autres
Publié: (2025)
Documents similaires
-
PSRT: Accelerating LRM-based Guard Models via Prefilled Safe Reasoning Traces
par: Zhao, Jiawei, et autres
Publié: (2025) -
SQL Injection Jailbreak: A Structural Disaster of Large Language Models
par: Zhao, Jiawei, et autres
Publié: (2024) -
Prefix Guidance: A Steering Wheel for Large Language Models to Defend Against Jailbreak Attacks
par: Zhao, Jiawei, et autres
Publié: (2024) -
STEAD: Robust Provably Secure Linguistic Steganography with Diffusion Language Model
par: Qi, Yuang, et autres
Publié: (2026) -
On the Vulnerability of Text Sanitization
par: Tong, Meng, et autres
Publié: (2024)