MIA-Tuner: Adapting Large Language Models as Pre-training Text Detector
Fuente:
arXiv
Saved in:
| Main Authors: | Fu, Wenjie, Wang, Huandong, Gao, Chen, Liu, Guanghua, Li, Yong, Jiang, Tao |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Practical Membership Inference Attacks against Fine-tuned Large Language Models via Self-prompt Calibration
by: Fu, Wenjie, et al.
Published: (2023)
by: Fu, Wenjie, et al.
Published: (2023)
Sanitize Your Responses: Mitigating Privacy Leakage in Large Language Models
by: Fu, Wenjie, et al.
Published: (2025)
by: Fu, Wenjie, et al.
Published: (2025)
Adaptive Pre-training Data Detection for Large Language Models via Surprising Tokens
by: Zhang, Anqi, et al.
Published: (2024)
by: Zhang, Anqi, et al.
Published: (2024)
Machine Unlearning of Pre-trained Large Language Models
by: Yao, Jin, et al.
Published: (2024)
by: Yao, Jin, et al.
Published: (2024)
A Probabilistic Fluctuation based Membership Inference Attack for Diffusion Models
by: Fu, Wenjie, et al.
Published: (2023)
by: Fu, Wenjie, et al.
Published: (2023)
DocMIA: Document-Level Membership Inference Attacks against DocVQA Models
by: Nguyen, Khanh, et al.
Published: (2025)
by: Nguyen, Khanh, et al.
Published: (2025)
Context-Aware Membership Inference Attacks against Pre-trained Large Language Models
by: Chang, Hongyan, et al.
Published: (2024)
by: Chang, Hongyan, et al.
Published: (2024)
Augmenting Parameter-Efficient Pre-trained Language Models with Large Language Models
by: Anand, Saurabh, et al.
Published: (2026)
by: Anand, Saurabh, et al.
Published: (2026)
Topic-Based Watermarks for Large Language Models
by: Nemecek, Alexander, et al.
Published: (2024)
by: Nemecek, Alexander, et al.
Published: (2024)
CR-UTP: Certified Robustness against Universal Text Perturbations on Large Language Models
by: Lou, Qian, et al.
Published: (2024)
by: Lou, Qian, et al.
Published: (2024)
Humanizing the Machine: Proxy Attacks to Mislead LLM Detectors
by: Wang, Tianchun, et al.
Published: (2024)
by: Wang, Tianchun, et al.
Published: (2024)
Detecting Pretraining Data from Large Language Models
by: Shi, Weijia, et al.
Published: (2023)
by: Shi, Weijia, et al.
Published: (2023)
When the Same Coefficients Reach Different Places: Asymmetric Realizability in Transplanting Tokenizers across Large Language Models
by: Liu, Xiaoze, et al.
Published: (2025)
by: Liu, Xiaoze, et al.
Published: (2025)
Reformulation is All You Need: Addressing Malicious Text Features in DNNs
by: Jiang, Yi, et al.
Published: (2025)
by: Jiang, Yi, et al.
Published: (2025)
Adversarial Text Purification: A Large Language Model Approach for Defense
by: Moraffah, Raha, et al.
Published: (2024)
by: Moraffah, Raha, et al.
Published: (2024)
Exploring Vulnerabilities and Protections in Large Language Models: A Survey
by: Liu, Frank Weizhen, et al.
Published: (2024)
by: Liu, Frank Weizhen, et al.
Published: (2024)
What Does the Server See? Understanding Privacy Leakage from Large Language Models in Split Inference
by: Fan, Mingyuan, et al.
Published: (2026)
by: Fan, Mingyuan, et al.
Published: (2026)
RED QUEEN: Safeguarding Large Language Models against Concealed Multi-Turn Jailbreaking
by: Jiang, Yifan, et al.
Published: (2024)
by: Jiang, Yifan, et al.
Published: (2024)
Model Provenance Testing for Large Language Models
by: Nikolic, Ivica, et al.
Published: (2025)
by: Nikolic, Ivica, et al.
Published: (2025)
Advancing Adversarial Suffix Transfer Learning on Aligned Large Language Models
by: Liu, Hongfu, et al.
Published: (2024)
by: Liu, Hongfu, et al.
Published: (2024)
A Watermark for Large Language Models
by: Kirchenbauer, John, et al.
Published: (2023)
by: Kirchenbauer, John, et al.
Published: (2023)
On the Reliability of Watermarks for Large Language Models
by: Kirchenbauer, John, et al.
Published: (2023)
by: Kirchenbauer, John, et al.
Published: (2023)
Adversarial Attack on Large Language Models using Exponentiated Gradient Descent
by: Biswas, Sajib, et al.
Published: (2025)
by: Biswas, Sajib, et al.
Published: (2025)
Improved Techniques for Optimization-Based Jailbreaking on Large Language Models
by: Jia, Xiaojun, et al.
Published: (2024)
by: Jia, Xiaojun, et al.
Published: (2024)
Digger: Detecting Copyright Content Mis-usage in Large Language Model Training
by: Li, Haodong, et al.
Published: (2024)
by: Li, Haodong, et al.
Published: (2024)
Watch Out for Your Guidance on Generation! Exploring Conditional Backdoor Attacks against Large Language Models
by: He, Jiaming, et al.
Published: (2024)
by: He, Jiaming, et al.
Published: (2024)
Representation Bending for Large Language Model Safety
by: Yousefpour, Ashkan, et al.
Published: (2025)
by: Yousefpour, Ashkan, et al.
Published: (2025)
User Inference Attacks on Large Language Models
by: Kandpal, Nikhil, et al.
Published: (2023)
by: Kandpal, Nikhil, et al.
Published: (2023)
Backdooring Instruction-Tuned Large Language Models with Virtual Prompt Injection
by: Yan, Jun, et al.
Published: (2023)
by: Yan, Jun, et al.
Published: (2023)
DiveR-CT: Diversity-enhanced Red Teaming Large Language Model Assistants with Relaxing Constraints
by: Zhao, Andrew, et al.
Published: (2024)
by: Zhao, Andrew, et al.
Published: (2024)
Learning to Poison Large Language Models for Downstream Manipulation
by: Zhou, Xiangyu, et al.
Published: (2024)
by: Zhou, Xiangyu, et al.
Published: (2024)
Watermarks for Embeddings-as-a-Service Large Language Models
by: Shetty, Anudeex
Published: (2025)
by: Shetty, Anudeex
Published: (2025)
Composite Backdoor Attacks Against Large Language Models
by: Huang, Hai, et al.
Published: (2023)
by: Huang, Hai, et al.
Published: (2023)
PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts
by: Zhu, Kaijie, et al.
Published: (2023)
by: Zhu, Kaijie, et al.
Published: (2023)
Jailbreak-Zero: A Path to Pareto Optimal Red Teaming for Large Language Models
by: Hu, Kai, et al.
Published: (2025)
by: Hu, Kai, et al.
Published: (2025)
TFL: Targeted Bit-Flip Attack on Large Language Model
by: Guo, Jingkai, et al.
Published: (2026)
by: Guo, Jingkai, et al.
Published: (2026)
An Early Categorization of Prompt Injection Attacks on Large Language Models
by: Rossi, Sippo, et al.
Published: (2024)
by: Rossi, Sippo, et al.
Published: (2024)
VERA: Variational Inference Framework for Jailbreaking Large Language Models
by: Lochab, Anamika, et al.
Published: (2025)
by: Lochab, Anamika, et al.
Published: (2025)
Hijacking Large Language Models via Adversarial In-Context Learning
by: Zhou, Xiangyu, et al.
Published: (2023)
by: Zhou, Xiangyu, et al.
Published: (2023)
Differentially Private Next-Token Prediction of Large Language Models
by: Flemings, James, et al.
Published: (2024)
by: Flemings, James, et al.
Published: (2024)
Similar Items
-
Practical Membership Inference Attacks against Fine-tuned Large Language Models via Self-prompt Calibration
by: Fu, Wenjie, et al.
Published: (2023) -
Sanitize Your Responses: Mitigating Privacy Leakage in Large Language Models
by: Fu, Wenjie, et al.
Published: (2025) -
Adaptive Pre-training Data Detection for Large Language Models via Surprising Tokens
by: Zhang, Anqi, et al.
Published: (2024) -
Machine Unlearning of Pre-trained Large Language Models
by: Yao, Jin, et al.
Published: (2024) -
A Probabilistic Fluctuation based Membership Inference Attack for Diffusion Models
by: Fu, Wenjie, et al.
Published: (2023)