Do Membership Inference Attacks Work on Large Language Models?
Fuente:
arXiv
Salvato in:
| Autori principali: | Duan, Michael, Suri, Anshuman, Mireshghallah, Niloofar, Min, Sewon, Shi, Weijia, Zettlemoyer, Luke, Tsvetkov, Yulia, Choi, Yejin, Evans, David, Hajishirzi, Hannaneh |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Infini-gram: Scaling Unbounded n-gram Language Models to a Trillion Tokens
di: Liu, Jiacheng, et al.
Pubblicazione: (2024)
di: Liu, Jiacheng, et al.
Pubblicazione: (2024)
CopyBench: Measuring Literal and Non-Literal Reproduction of Copyright-Protected Text in Language Model Generation
di: Chen, Tong, et al.
Pubblicazione: (2024)
di: Chen, Tong, et al.
Pubblicazione: (2024)
ParaPO: Aligning Language Models to Reduce Verbatim Reproduction of Pre-training Data
di: Chen, Tong, et al.
Pubblicazione: (2025)
di: Chen, Tong, et al.
Pubblicazione: (2025)
SILO Language Models: Isolating Legal Risk In a Nonparametric Datastore
di: Min, Sewon, et al.
Pubblicazione: (2023)
di: Min, Sewon, et al.
Pubblicazione: (2023)
Do Parameters Reveal More than Loss for Membership Inference?
di: Suri, Anshuman, et al.
Pubblicazione: (2024)
di: Suri, Anshuman, et al.
Pubblicazione: (2024)
MentorCollab: Selective Large-to-Small Inference-Time Guidance for Efficient Reasoning
di: Wang, Haojin, et al.
Pubblicazione: (2026)
di: Wang, Haojin, et al.
Pubblicazione: (2026)
ScienceMeter: Tracking Scientific Knowledge Updates in Language Models
di: Wang, Yike, et al.
Pubblicazione: (2025)
di: Wang, Yike, et al.
Pubblicazione: (2025)
Can LLMs Keep a Secret? Testing Privacy Implications of Language Models via Contextual Integrity Theory
di: Mireshghallah, Niloofar, et al.
Pubblicazione: (2023)
di: Mireshghallah, Niloofar, et al.
Pubblicazione: (2023)
Synthetic Data Can Mislead Evaluations: Membership Inference as Machine Text Detection
di: Naseh, Ali, et al.
Pubblicazione: (2025)
di: Naseh, Ali, et al.
Pubblicazione: (2025)
BTR: Binary Token Representations for Efficient Retrieval Augmented Language Models
di: Cao, Qingqing, et al.
Pubblicazione: (2023)
di: Cao, Qingqing, et al.
Pubblicazione: (2023)
Small Reward Models via Backward Inference
di: Wang, Yike, et al.
Pubblicazione: (2026)
di: Wang, Yike, et al.
Pubblicazione: (2026)
Boundary-targeted Membership Inference Attacks on Safety Classifiers
di: Hughes, Anthony, et al.
Pubblicazione: (2026)
di: Hughes, Anthony, et al.
Pubblicazione: (2026)
ComPO: Community Preferences for Language Model Personalization
di: Kumar, Sachin, et al.
Pubblicazione: (2024)
di: Kumar, Sachin, et al.
Pubblicazione: (2024)
Alpaca against Vicuna: Using LLMs to Uncover Memorization of LLMs
di: Kassem, Aly M., et al.
Pubblicazione: (2024)
di: Kassem, Aly M., et al.
Pubblicazione: (2024)
Train for Truth, Keep the Skills: Binary Retrieval-Augmented Reward Mitigates Hallucinations
di: Chen, Tong, et al.
Pubblicazione: (2025)
di: Chen, Tong, et al.
Pubblicazione: (2025)
A False Sense of Privacy: Evaluating Textual Data Sanitization Beyond Surface-level Privacy Leakage
di: Xin, Rui, et al.
Pubblicazione: (2025)
di: Xin, Rui, et al.
Pubblicazione: (2025)
The Surprising Effectiveness of Membership Inference with Simple N-Gram Coverage
di: Hallinan, Skyler, et al.
Pubblicazione: (2025)
di: Hallinan, Skyler, et al.
Pubblicazione: (2025)
Fine-grained Hallucination Detection and Editing for Language Models
di: Mishra, Abhika, et al.
Pubblicazione: (2024)
di: Mishra, Abhika, et al.
Pubblicazione: (2024)
Learning to Detect Language Model Training Data via Active Reconstruction
di: Yin, Junjie Oscar, et al.
Pubblicazione: (2026)
di: Yin, Junjie Oscar, et al.
Pubblicazione: (2026)
Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting
di: Sclar, Melanie, et al.
Pubblicazione: (2023)
di: Sclar, Melanie, et al.
Pubblicazione: (2023)
APT: Adaptive Pruning and Tuning Pretrained Language Models for Efficient Training and Inference
di: Zhao, Bowen, et al.
Pubblicazione: (2024)
di: Zhao, Bowen, et al.
Pubblicazione: (2024)
Spurious Rewards: Rethinking Training Signals in RLVR
di: Shao, Rulin, et al.
Pubblicazione: (2025)
di: Shao, Rulin, et al.
Pubblicazione: (2025)
Trust No Bot: Discovering Personal Disclosures in Human-LLM Conversations in the Wild
di: Mireshghallah, Niloofar, et al.
Pubblicazione: (2024)
di: Mireshghallah, Niloofar, et al.
Pubblicazione: (2024)
Organize the Web: Constructing Domains Enhances Pre-Training Data Curation
di: Wettig, Alexander, et al.
Pubblicazione: (2025)
di: Wettig, Alexander, et al.
Pubblicazione: (2025)
Dissecting Distribution Inference
di: Suri, Anshuman, et al.
Pubblicazione: (2022)
di: Suri, Anshuman, et al.
Pubblicazione: (2022)
Scaling Retrieval-Based Language Models with a Trillion-Token Datastore
di: Shao, Rulin, et al.
Pubblicazione: (2024)
di: Shao, Rulin, et al.
Pubblicazione: (2024)
Infini-gram mini: Exact n-gram Search at the Internet Scale with FM-Index
di: Xu, Hao, et al.
Pubblicazione: (2025)
di: Xu, Hao, et al.
Pubblicazione: (2025)
Riddle Me This! Stealthy Membership Inference for Retrieval-Augmented Generation
di: Naseh, Ali, et al.
Pubblicazione: (2025)
di: Naseh, Ali, et al.
Pubblicazione: (2025)
Reliable, Adaptable, and Attributable Language Models with Retrieval
di: Asai, Akari, et al.
Pubblicazione: (2024)
di: Asai, Akari, et al.
Pubblicazione: (2024)
MatFormer: Nested Transformer for Elastic Inference
di: Devvrit, et al.
Pubblicazione: (2023)
di: Devvrit, et al.
Pubblicazione: (2023)
Data Swarms: Optimizable Generation of Synthetic Evaluation Data
di: Feng, Shangbin, et al.
Pubblicazione: (2025)
di: Feng, Shangbin, et al.
Pubblicazione: (2025)
Don't throw away your value model! Generating more preferable text with Value-Guided Monte-Carlo Tree Search decoding
di: Liu, Jiacheng, et al.
Pubblicazione: (2023)
di: Liu, Jiacheng, et al.
Pubblicazione: (2023)
Resolving Knowledge Conflicts in Large Language Models
di: Wang, Yike, et al.
Pubblicazione: (2023)
di: Wang, Yike, et al.
Pubblicazione: (2023)
s1: Simple test-time scaling
di: Muennighoff, Niklas, et al.
Pubblicazione: (2025)
di: Muennighoff, Niklas, et al.
Pubblicazione: (2025)
The Art of Saying No: Contextual Noncompliance in Language Models
di: Brahman, Faeze, et al.
Pubblicazione: (2024)
di: Brahman, Faeze, et al.
Pubblicazione: (2024)
Position: Privacy Is Not Just Memorization!
di: Mireshghallah, Niloofar, et al.
Pubblicazione: (2025)
di: Mireshghallah, Niloofar, et al.
Pubblicazione: (2025)
Information-Guided Identification of Training Data Imprint in (Proprietary) Large Language Models
di: Ravichander, Abhilasha, et al.
Pubblicazione: (2025)
di: Ravichander, Abhilasha, et al.
Pubblicazione: (2025)
Critical Batch Size Revisited: A Simple Empirical Approach to Large-Batch Language Model Training
di: Merrill, William, et al.
Pubblicazione: (2025)
di: Merrill, William, et al.
Pubblicazione: (2025)
Tuning Language Models by Proxy
di: Liu, Alisa, et al.
Pubblicazione: (2024)
di: Liu, Alisa, et al.
Pubblicazione: (2024)
Membership Inference Attacks on Tokenizers of Large Language Models
di: Teng, Meng
Pubblicazione: (2025)
di: Teng, Meng
Pubblicazione: (2025)
Documenti analoghi
-
Infini-gram: Scaling Unbounded n-gram Language Models to a Trillion Tokens
di: Liu, Jiacheng, et al.
Pubblicazione: (2024) -
CopyBench: Measuring Literal and Non-Literal Reproduction of Copyright-Protected Text in Language Model Generation
di: Chen, Tong, et al.
Pubblicazione: (2024) -
ParaPO: Aligning Language Models to Reduce Verbatim Reproduction of Pre-training Data
di: Chen, Tong, et al.
Pubblicazione: (2025) -
SILO Language Models: Isolating Legal Risk In a Nonparametric Datastore
di: Min, Sewon, et al.
Pubblicazione: (2023) -
Do Parameters Reveal More than Loss for Membership Inference?
di: Suri, Anshuman, et al.
Pubblicazione: (2024)