Model Provenance Testing for Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Nikolic, Ivica, Baluta, Teodora, Saxena, Prateek |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Private Fine-tuning of Large Language Models with Zeroth-order Optimization
di: Tang, Xinyu, et al.
Pubblicazione: (2024)
di: Tang, Xinyu, et al.
Pubblicazione: (2024)
A Watermark for Large Language Models
di: Kirchenbauer, John, et al.
Pubblicazione: (2023)
di: Kirchenbauer, John, et al.
Pubblicazione: (2023)
On the Reliability of Watermarks for Large Language Models
di: Kirchenbauer, John, et al.
Pubblicazione: (2023)
di: Kirchenbauer, John, et al.
Pubblicazione: (2023)
Representation Bending for Large Language Model Safety
di: Yousefpour, Ashkan, et al.
Pubblicazione: (2025)
di: Yousefpour, Ashkan, et al.
Pubblicazione: (2025)
Topic-Based Watermarks for Large Language Models
di: Nemecek, Alexander, et al.
Pubblicazione: (2024)
di: Nemecek, Alexander, et al.
Pubblicazione: (2024)
User Inference Attacks on Large Language Models
di: Kandpal, Nikhil, et al.
Pubblicazione: (2023)
di: Kandpal, Nikhil, et al.
Pubblicazione: (2023)
Watermarks for Embeddings-as-a-Service Large Language Models
di: Shetty, Anudeex
Pubblicazione: (2025)
di: Shetty, Anudeex
Pubblicazione: (2025)
Detecting Pretraining Data from Large Language Models
di: Shi, Weijia, et al.
Pubblicazione: (2023)
di: Shi, Weijia, et al.
Pubblicazione: (2023)
Learning to Poison Large Language Models for Downstream Manipulation
di: Zhou, Xiangyu, et al.
Pubblicazione: (2024)
di: Zhou, Xiangyu, et al.
Pubblicazione: (2024)
Composite Backdoor Attacks Against Large Language Models
di: Huang, Hai, et al.
Pubblicazione: (2023)
di: Huang, Hai, et al.
Pubblicazione: (2023)
TextSeal: A Localized LLM Watermark for Provenance & Distillation Protection
di: Sander, Tom, et al.
Pubblicazione: (2026)
di: Sander, Tom, et al.
Pubblicazione: (2026)
Model Inversion Attacks Meet Cryptographic Fuzzy Extractors
di: Prabhakar, Mallika, et al.
Pubblicazione: (2025)
di: Prabhakar, Mallika, et al.
Pubblicazione: (2025)
VERA: Variational Inference Framework for Jailbreaking Large Language Models
di: Lochab, Anamika, et al.
Pubblicazione: (2025)
di: Lochab, Anamika, et al.
Pubblicazione: (2025)
Privacy Preserving In-Context-Learning Framework for Large Language Models
di: Bhusal, Bishnu, et al.
Pubblicazione: (2025)
di: Bhusal, Bishnu, et al.
Pubblicazione: (2025)
TFL: Targeted Bit-Flip Attack on Large Language Model
di: Guo, Jingkai, et al.
Pubblicazione: (2026)
di: Guo, Jingkai, et al.
Pubblicazione: (2026)
Improved Techniques for Optimization-Based Jailbreaking on Large Language Models
di: Jia, Xiaojun, et al.
Pubblicazione: (2024)
di: Jia, Xiaojun, et al.
Pubblicazione: (2024)
An Early Categorization of Prompt Injection Attacks on Large Language Models
di: Rossi, Sippo, et al.
Pubblicazione: (2024)
di: Rossi, Sippo, et al.
Pubblicazione: (2024)
Hijacking Large Language Models via Adversarial In-Context Learning
di: Zhou, Xiangyu, et al.
Pubblicazione: (2023)
di: Zhou, Xiangyu, et al.
Pubblicazione: (2023)
Differentially Private Next-Token Prediction of Large Language Models
di: Flemings, James, et al.
Pubblicazione: (2024)
di: Flemings, James, et al.
Pubblicazione: (2024)
Exploring Vulnerabilities and Protections in Large Language Models: A Survey
di: Liu, Frank Weizhen, et al.
Pubblicazione: (2024)
di: Liu, Frank Weizhen, et al.
Pubblicazione: (2024)
Teach LLMs to Phish: Stealing Private Information from Language Models
di: Panda, Ashwinee, et al.
Pubblicazione: (2024)
di: Panda, Ashwinee, et al.
Pubblicazione: (2024)
Adversarial Attack on Large Language Models using Exponentiated Gradient Descent
di: Biswas, Sajib, et al.
Pubblicazione: (2025)
di: Biswas, Sajib, et al.
Pubblicazione: (2025)
Confidence Elicitation: A New Attack Vector for Large Language Models
di: Formento, Brian, et al.
Pubblicazione: (2025)
di: Formento, Brian, et al.
Pubblicazione: (2025)
Auto-Tuning Safety Guardrails for Black-Box Large Language Models
di: Abdulkadir, Perry
Pubblicazione: (2025)
di: Abdulkadir, Perry
Pubblicazione: (2025)
Securing Large Language Models (LLMs) from Prompt Injection Attacks
di: Suri, Omar Farooq Khan, et al.
Pubblicazione: (2025)
di: Suri, Omar Farooq Khan, et al.
Pubblicazione: (2025)
Sanitize Your Responses: Mitigating Privacy Leakage in Large Language Models
di: Fu, Wenjie, et al.
Pubblicazione: (2025)
di: Fu, Wenjie, et al.
Pubblicazione: (2025)
A Resilient and Accessible Distribution-Preserving Watermark for Large Language Models
di: Wu, Yihan, et al.
Pubblicazione: (2023)
di: Wu, Yihan, et al.
Pubblicazione: (2023)
Advancing Adversarial Suffix Transfer Learning on Aligned Large Language Models
di: Liu, Hongfu, et al.
Pubblicazione: (2024)
di: Liu, Hongfu, et al.
Pubblicazione: (2024)
Backdooring Instruction-Tuned Large Language Models with Virtual Prompt Injection
di: Yan, Jun, et al.
Pubblicazione: (2023)
di: Yan, Jun, et al.
Pubblicazione: (2023)
Differentially Private Tabular Data Synthesis using Large Language Models
di: Tran, Toan V., et al.
Pubblicazione: (2024)
di: Tran, Toan V., et al.
Pubblicazione: (2024)
Watermarking Language Models through Language Models
di: Dasgupta, Agnibh, et al.
Pubblicazione: (2024)
di: Dasgupta, Agnibh, et al.
Pubblicazione: (2024)
Network Traffic Classification Using Machine Learning, Transformer, and Large Language Models
di: Antari, Ahmad, et al.
Pubblicazione: (2025)
di: Antari, Ahmad, et al.
Pubblicazione: (2025)
SBFA: Single Sneaky Bit Flip Attack to Break Large Language Models
di: Guo, Jingkai, et al.
Pubblicazione: (2025)
di: Guo, Jingkai, et al.
Pubblicazione: (2025)
On the Effectiveness of Membership Inference in Targeted Data Extraction from Large Language Models
di: Sahili, Ali Al, et al.
Pubblicazione: (2025)
di: Sahili, Ali Al, et al.
Pubblicazione: (2025)
PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts
di: Zhu, Kaijie, et al.
Pubblicazione: (2023)
di: Zhu, Kaijie, et al.
Pubblicazione: (2023)
Prompt Public Large Language Models to Synthesize Data for Private On-device Applications
di: Wu, Shanshan, et al.
Pubblicazione: (2024)
di: Wu, Shanshan, et al.
Pubblicazione: (2024)
Token-Specific Watermarking with Enhanced Detectability and Semantic Coherence for Large Language Models
di: Huo, Mingjia, et al.
Pubblicazione: (2024)
di: Huo, Mingjia, et al.
Pubblicazione: (2024)
Privately Learning from Graphs with Applications in Fine-tuning Large Language Models
di: Yin, Haoteng, et al.
Pubblicazione: (2024)
di: Yin, Haoteng, et al.
Pubblicazione: (2024)
MIA-Tuner: Adapting Large Language Models as Pre-training Text Detector
di: Fu, Wenjie, et al.
Pubblicazione: (2024)
di: Fu, Wenjie, et al.
Pubblicazione: (2024)
Digger: Detecting Copyright Content Mis-usage in Large Language Model Training
di: Li, Haodong, et al.
Pubblicazione: (2024)
di: Li, Haodong, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Private Fine-tuning of Large Language Models with Zeroth-order Optimization
di: Tang, Xinyu, et al.
Pubblicazione: (2024) -
A Watermark for Large Language Models
di: Kirchenbauer, John, et al.
Pubblicazione: (2023) -
On the Reliability of Watermarks for Large Language Models
di: Kirchenbauer, John, et al.
Pubblicazione: (2023) -
Representation Bending for Large Language Model Safety
di: Yousefpour, Ashkan, et al.
Pubblicazione: (2025) -
Topic-Based Watermarks for Large Language Models
di: Nemecek, Alexander, et al.
Pubblicazione: (2024)