Salvato in:
| Autori principali: | Liu, Frank Weizhen, Hu, Chenhui |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2406.00240 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Adversarial Vulnerabilities in Large Language Models for Time Series Forecasting
di: Liu, Fuqiang, et al.
Pubblicazione: (2024)
di: Liu, Fuqiang, et al.
Pubblicazione: (2024)
Detecting and Understanding Vulnerabilities in Language Models via Mechanistic Interpretability
di: García-Carrasco, Jorge, et al.
Pubblicazione: (2024)
di: García-Carrasco, Jorge, et al.
Pubblicazione: (2024)
Instructions as Backdoors: Backdoor Vulnerabilities of Instruction Tuning for Large Language Models
di: Xu, Jiashu, et al.
Pubblicazione: (2023)
di: Xu, Jiashu, et al.
Pubblicazione: (2023)
BadRAG: Identifying Vulnerabilities in Retrieval Augmented Generation of Large Language Models
di: Xue, Jiaqi, et al.
Pubblicazione: (2024)
di: Xue, Jiaqi, et al.
Pubblicazione: (2024)
A Resilient and Accessible Distribution-Preserving Watermark for Large Language Models
di: Wu, Yihan, et al.
Pubblicazione: (2023)
di: Wu, Yihan, et al.
Pubblicazione: (2023)
Copyright-Protected Language Generation via Adaptive Model Fusion
di: Abad, Javier, et al.
Pubblicazione: (2024)
di: Abad, Javier, et al.
Pubblicazione: (2024)
Jailbreak Attacks and Defenses Against Large Language Models: A Survey
di: Yi, Sibo, et al.
Pubblicazione: (2024)
di: Yi, Sibo, et al.
Pubblicazione: (2024)
Watch Out for Your Guidance on Generation! Exploring Conditional Backdoor Attacks against Large Language Models
di: He, Jiaming, et al.
Pubblicazione: (2024)
di: He, Jiaming, et al.
Pubblicazione: (2024)
Protecting Copyrighted Material with Unique Identifiers in Large Language Model Training
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
Obliviate: Efficient Unmemorization for Protecting Intellectual Property in Large Language Models
di: Russinovich, Mark, et al.
Pubblicazione: (2025)
di: Russinovich, Mark, et al.
Pubblicazione: (2025)
A Watermark for Large Language Models
di: Kirchenbauer, John, et al.
Pubblicazione: (2023)
di: Kirchenbauer, John, et al.
Pubblicazione: (2023)
Gradient Cuff: Detecting Jailbreak Attacks on Large Language Models by Exploring Refusal Loss Landscapes
di: Hu, Xiaomeng, et al.
Pubblicazione: (2024)
di: Hu, Xiaomeng, et al.
Pubblicazione: (2024)
Jailbreak-Zero: A Path to Pareto Optimal Red Teaming for Large Language Models
di: Hu, Kai, et al.
Pubblicazione: (2025)
di: Hu, Kai, et al.
Pubblicazione: (2025)
Token-Modification Adversarial Attacks for Natural Language Processing: A Survey
di: Roth, Tom, et al.
Pubblicazione: (2021)
di: Roth, Tom, et al.
Pubblicazione: (2021)
Detecting Pretraining Data from Large Language Models
di: Shi, Weijia, et al.
Pubblicazione: (2023)
di: Shi, Weijia, et al.
Pubblicazione: (2023)
Model Provenance Testing for Large Language Models
di: Nikolic, Ivica, et al.
Pubblicazione: (2025)
di: Nikolic, Ivica, et al.
Pubblicazione: (2025)
Advancing Adversarial Suffix Transfer Learning on Aligned Large Language Models
di: Liu, Hongfu, et al.
Pubblicazione: (2024)
di: Liu, Hongfu, et al.
Pubblicazione: (2024)
JailbreakZoo: Survey, Landscapes, and Horizons in Jailbreaking Large Language and Vision-Language Models
di: Jin, Haibo, et al.
Pubblicazione: (2024)
di: Jin, Haibo, et al.
Pubblicazione: (2024)
Adversarial Attack on Large Language Models using Exponentiated Gradient Descent
di: Biswas, Sajib, et al.
Pubblicazione: (2025)
di: Biswas, Sajib, et al.
Pubblicazione: (2025)
Preserving Privacy in Large Language Models: A Survey on Current Threats and Solutions
di: Miranda, Michele, et al.
Pubblicazione: (2024)
di: Miranda, Michele, et al.
Pubblicazione: (2024)
On the Reliability of Watermarks for Large Language Models
di: Kirchenbauer, John, et al.
Pubblicazione: (2023)
di: Kirchenbauer, John, et al.
Pubblicazione: (2023)
Improved Techniques for Optimization-Based Jailbreaking on Large Language Models
di: Jia, Xiaojun, et al.
Pubblicazione: (2024)
di: Jia, Xiaojun, et al.
Pubblicazione: (2024)
Digger: Detecting Copyright Content Mis-usage in Large Language Model Training
di: Li, Haodong, et al.
Pubblicazione: (2024)
di: Li, Haodong, et al.
Pubblicazione: (2024)
Topic-Based Watermarks for Large Language Models
di: Nemecek, Alexander, et al.
Pubblicazione: (2024)
di: Nemecek, Alexander, et al.
Pubblicazione: (2024)
How Vulnerable Are Edge LLMs?
di: Ding, Ao, et al.
Pubblicazione: (2026)
di: Ding, Ao, et al.
Pubblicazione: (2026)
Representation Bending for Large Language Model Safety
di: Yousefpour, Ashkan, et al.
Pubblicazione: (2025)
di: Yousefpour, Ashkan, et al.
Pubblicazione: (2025)
User Inference Attacks on Large Language Models
di: Kandpal, Nikhil, et al.
Pubblicazione: (2023)
di: Kandpal, Nikhil, et al.
Pubblicazione: (2023)
MIA-Tuner: Adapting Large Language Models as Pre-training Text Detector
di: Fu, Wenjie, et al.
Pubblicazione: (2024)
di: Fu, Wenjie, et al.
Pubblicazione: (2024)
Training Language Model Agents to Find Vulnerabilities with CTF-Dojo
di: Zhuo, Terry Yue, et al.
Pubblicazione: (2025)
di: Zhuo, Terry Yue, et al.
Pubblicazione: (2025)
Confidence Elicitation: A New Attack Vector for Large Language Models
di: Formento, Brian, et al.
Pubblicazione: (2025)
di: Formento, Brian, et al.
Pubblicazione: (2025)
Learning to Poison Large Language Models for Downstream Manipulation
di: Zhou, Xiangyu, et al.
Pubblicazione: (2024)
di: Zhou, Xiangyu, et al.
Pubblicazione: (2024)
Watermarks for Embeddings-as-a-Service Large Language Models
di: Shetty, Anudeex
Pubblicazione: (2025)
di: Shetty, Anudeex
Pubblicazione: (2025)
Composite Backdoor Attacks Against Large Language Models
di: Huang, Hai, et al.
Pubblicazione: (2023)
di: Huang, Hai, et al.
Pubblicazione: (2023)
What Does the Server See? Understanding Privacy Leakage from Large Language Models in Split Inference
di: Fan, Mingyuan, et al.
Pubblicazione: (2026)
di: Fan, Mingyuan, et al.
Pubblicazione: (2026)
An Early Categorization of Prompt Injection Attacks on Large Language Models
di: Rossi, Sippo, et al.
Pubblicazione: (2024)
di: Rossi, Sippo, et al.
Pubblicazione: (2024)
Differentially Private Next-Token Prediction of Large Language Models
di: Flemings, James, et al.
Pubblicazione: (2024)
di: Flemings, James, et al.
Pubblicazione: (2024)
TFL: Targeted Bit-Flip Attack on Large Language Model
di: Guo, Jingkai, et al.
Pubblicazione: (2026)
di: Guo, Jingkai, et al.
Pubblicazione: (2026)
VERA: Variational Inference Framework for Jailbreaking Large Language Models
di: Lochab, Anamika, et al.
Pubblicazione: (2025)
di: Lochab, Anamika, et al.
Pubblicazione: (2025)
Hijacking Large Language Models via Adversarial In-Context Learning
di: Zhou, Xiangyu, et al.
Pubblicazione: (2023)
di: Zhou, Xiangyu, et al.
Pubblicazione: (2023)
Privacy Preserving In-Context-Learning Framework for Large Language Models
di: Bhusal, Bishnu, et al.
Pubblicazione: (2025)
di: Bhusal, Bishnu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Adversarial Vulnerabilities in Large Language Models for Time Series Forecasting
di: Liu, Fuqiang, et al.
Pubblicazione: (2024) -
Detecting and Understanding Vulnerabilities in Language Models via Mechanistic Interpretability
di: García-Carrasco, Jorge, et al.
Pubblicazione: (2024) -
Instructions as Backdoors: Backdoor Vulnerabilities of Instruction Tuning for Large Language Models
di: Xu, Jiashu, et al.
Pubblicazione: (2023) -
BadRAG: Identifying Vulnerabilities in Retrieval Augmented Generation of Large Language Models
di: Xue, Jiaqi, et al.
Pubblicazione: (2024) -
A Resilient and Accessible Distribution-Preserving Watermark for Large Language Models
di: Wu, Yihan, et al.
Pubblicazione: (2023)