Safeguarding Large Language Models: A Survey
Fuente:
arXiv
Salvato in:
| Autori principali: | Dong, Yi, Mu, Ronghui, Zhang, Yanghao, Sun, Siqi, Zhang, Tianle, Wu, Changshun, Jin, Gaojie, Qi, Yi, Hu, Jinwei, Meng, Jie, Bensalem, Saddek, Huang, Xiaowei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
POT: Inducing Overthinking in LLMs via Black-Box Iterative Optimization
di: Li, Xinyu, et al.
Pubblicazione: (2025)
di: Li, Xinyu, et al.
Pubblicazione: (2025)
DDSA: Dual-Domain Strategic Attack for Spatial-Temporal Efficiency in Adversarial Robustness Testing
di: Hu, Jinwei, et al.
Pubblicazione: (2026)
di: Hu, Jinwei, et al.
Pubblicazione: (2026)
Counterfactual Explainable Incremental Prompt Attack Analysis on Large Language Models
di: Shu, Dong, et al.
Pubblicazione: (2024)
di: Shu, Dong, et al.
Pubblicazione: (2024)
Formal Verification of Robustness and Resilience of Learning-Enabled State Estimation Systems
di: Huang, Wei, et al.
Pubblicazione: (2020)
di: Huang, Wei, et al.
Pubblicazione: (2020)
CTRAP: Embedding Collapse Trap to Safeguard Large Language Models from Harmful Fine-Tuning
di: Yi, Biao, et al.
Pubblicazione: (2025)
di: Yi, Biao, et al.
Pubblicazione: (2025)
InferDPT: Privacy-Preserving Inference for Closed-box Large Language Model
di: Tong, Meng, et al.
Pubblicazione: (2023)
di: Tong, Meng, et al.
Pubblicazione: (2023)
TensorShield: Safeguarding On-Device Inference by Shielding Critical DNN Tensors with TEE
di: Sun, Tong, et al.
Pubblicazione: (2025)
di: Sun, Tong, et al.
Pubblicazione: (2025)
BadThink: Triggered Overthinking Attacks on Chain-of-Thought Reasoning in Large Language Models
di: Liu, Shuaitong, et al.
Pubblicazione: (2025)
di: Liu, Shuaitong, et al.
Pubblicazione: (2025)
Automatic Generation of a Cryptography Misuse Taxonomy Using Large Language Models
di: Zhang, Yang, et al.
Pubblicazione: (2025)
di: Zhang, Yang, et al.
Pubblicazione: (2025)
PRIVMARK: Private Large Language Models Watermarking with MPC
di: Fargues, Thomas, et al.
Pubblicazione: (2025)
di: Fargues, Thomas, et al.
Pubblicazione: (2025)
Machine Unlearning for Traditional Models and Large Language Models: A Short Survey
di: Xu, Yi
Pubblicazione: (2024)
di: Xu, Yi
Pubblicazione: (2024)
Exploring the Role of Large Language Models in Cybersecurity: A Systematic Survey
di: Tian, Shuang, et al.
Pubblicazione: (2025)
di: Tian, Shuang, et al.
Pubblicazione: (2025)
MorphMark: Flexible Adaptive Watermarking for Large Language Models
di: Wang, Zongqi, et al.
Pubblicazione: (2025)
di: Wang, Zongqi, et al.
Pubblicazione: (2025)
Character as a Latent Variable in Large Language Models: A Mechanistic Account of Emergent Misalignment and Conditional Safety Failures
di: Su, Yanghao, et al.
Pubblicazione: (2026)
di: Su, Yanghao, et al.
Pubblicazione: (2026)
SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models
di: Chen, Yulong, et al.
Pubblicazione: (2025)
di: Chen, Yulong, et al.
Pubblicazione: (2025)
On Protecting the Data Privacy of Large Language Models (LLMs): A Survey
di: Yan, Biwei, et al.
Pubblicazione: (2024)
di: Yan, Biwei, et al.
Pubblicazione: (2024)
Copyright Protection for Large Language Models: A Survey of Methods, Challenges, and Trends
di: Xu, Zhenhua, et al.
Pubblicazione: (2025)
di: Xu, Zhenhua, et al.
Pubblicazione: (2025)
Token Highlighter: Inspecting and Mitigating Jailbreak Prompts for Large Language Models
di: Hu, Xiaomeng, et al.
Pubblicazione: (2024)
di: Hu, Xiaomeng, et al.
Pubblicazione: (2024)
Safeguarding LLM Embeddings in End-Cloud Collaboration via Entropy-Driven Perturbation
di: Jin, Shuaifan, et al.
Pubblicazione: (2025)
di: Jin, Shuaifan, et al.
Pubblicazione: (2025)
Tit-for-Tat: Safeguarding Large Vision-Language Models Against Jailbreak Attacks via Adversarial Defense
di: Hao, Shuyang, et al.
Pubblicazione: (2025)
di: Hao, Shuyang, et al.
Pubblicazione: (2025)
SARSteer: Safeguarding Large Audio-Language Models via Safe-Ablated Refusal Steering
di: Lin, Weilin, et al.
Pubblicazione: (2025)
di: Lin, Weilin, et al.
Pubblicazione: (2025)
Building Guardrails for Large Language Models
di: Dong, Yi, et al.
Pubblicazione: (2024)
di: Dong, Yi, et al.
Pubblicazione: (2024)
Safeguard: Security Controls at the Software Defined Network Layer
di: Lyu, Yi, et al.
Pubblicazione: (2026)
di: Lyu, Yi, et al.
Pubblicazione: (2026)
Embedding with Large Language Models for Classification of HIPAA Safeguard Compliance Rules
di: Rahman, Md Abdur, et al.
Pubblicazione: (2024)
di: Rahman, Md Abdur, et al.
Pubblicazione: (2024)
BURN: Backdoor Unlearning via Adversarial Boundary Analysis
di: Su, Yanghao, et al.
Pubblicazione: (2025)
di: Su, Yanghao, et al.
Pubblicazione: (2025)
PortGPT: Towards Automated Backporting Using Large Language Models
di: Li, Zhaoyang, et al.
Pubblicazione: (2025)
di: Li, Zhaoyang, et al.
Pubblicazione: (2025)
Cachemir: Fully Homomorphic Encrypted Inference of Generative Large Language Model with KV Cache
di: Yu, Ye, et al.
Pubblicazione: (2026)
di: Yu, Ye, et al.
Pubblicazione: (2026)
One Trigger Token Is Enough: A Defense Strategy for Balancing Safety and Usability in Large Language Models
di: Gu, Haoran, et al.
Pubblicazione: (2025)
di: Gu, Haoran, et al.
Pubblicazione: (2025)
GSPR: Aligning LLM Safeguards as Generalizable Safety Policy Reasoners
di: Li, Haoran, et al.
Pubblicazione: (2025)
di: Li, Haoran, et al.
Pubblicazione: (2025)
PromptKeeper: Safeguarding System Prompts for LLMs
di: Jiang, Zhifeng, et al.
Pubblicazione: (2024)
di: Jiang, Zhifeng, et al.
Pubblicazione: (2024)
Safeguarding Blockchain Ecosystem: Understanding and Detecting Attack Transactions on Cross-chain Bridges
di: Wu, Jiajing, et al.
Pubblicazione: (2024)
di: Wu, Jiajing, et al.
Pubblicazione: (2024)
ExpShield: Safeguarding Web Text from Unauthorized Crawling and LLM Exploitation
di: Liu, Ruixuan, et al.
Pubblicazione: (2024)
di: Liu, Ruixuan, et al.
Pubblicazione: (2024)
MasterKey: Automated Jailbreak Across Multiple Large Language Model Chatbots
di: Deng, Gelei, et al.
Pubblicazione: (2023)
di: Deng, Gelei, et al.
Pubblicazione: (2023)
IRCopilot: Automated Incident Response with Large Language Models
di: Lin, Xihuan, et al.
Pubblicazione: (2025)
di: Lin, Xihuan, et al.
Pubblicazione: (2025)
ObfusBFA: A Holistic Approach to Safeguarding DNNs from Different Types of Bit-Flip Attacks
di: Yan, Xiaobei, et al.
Pubblicazione: (2025)
di: Yan, Xiaobei, et al.
Pubblicazione: (2025)
VOW: Verifiable and Oblivious Watermark Detection for Large Language Models
di: Luan, Xiaokun, et al.
Pubblicazione: (2026)
di: Luan, Xiaokun, et al.
Pubblicazione: (2026)
Safeguarding Skies: Airport Cybersecurity in the Digital Age
di: Sivakorn, Suphannee, et al.
Pubblicazione: (2026)
di: Sivakorn, Suphannee, et al.
Pubblicazione: (2026)
Never Compromise to Vulnerabilities: A Comprehensive Survey on AI Governance
di: Jiang, Yuchu, et al.
Pubblicazione: (2025)
di: Jiang, Yuchu, et al.
Pubblicazione: (2025)
MEraser: An Effective Fingerprint Erasure Approach for Large Language Models
di: Zhang, Jingxuan, et al.
Pubblicazione: (2025)
di: Zhang, Jingxuan, et al.
Pubblicazione: (2025)
Model X-ray:Detecting Backdoored Models via Decision Boundary
di: Su, Yanghao, et al.
Pubblicazione: (2024)
di: Su, Yanghao, et al.
Pubblicazione: (2024)
Documenti analoghi
-
POT: Inducing Overthinking in LLMs via Black-Box Iterative Optimization
di: Li, Xinyu, et al.
Pubblicazione: (2025) -
DDSA: Dual-Domain Strategic Attack for Spatial-Temporal Efficiency in Adversarial Robustness Testing
di: Hu, Jinwei, et al.
Pubblicazione: (2026) -
Counterfactual Explainable Incremental Prompt Attack Analysis on Large Language Models
di: Shu, Dong, et al.
Pubblicazione: (2024) -
Formal Verification of Robustness and Resilience of Learning-Enabled State Estimation Systems
di: Huang, Wei, et al.
Pubblicazione: (2020) -
CTRAP: Embedding Collapse Trap to Safeguard Large Language Models from Harmful Fine-Tuning
di: Yi, Biao, et al.
Pubblicazione: (2025)