How much do language models memorize?
Fuente:
arXiv
Guardado en:
| Autores principales: | Morris, John X., Sitawarin, Chawin, Guo, Chuan, Kokhlikyan, Narine, Suh, G. Edward, Rush, Alexander M., Chaudhuri, Kamalika, Mahloujifar, Saeed |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Z0-Inf: Zeroth Order Approximation for Data Influence
por: Kokhlikyan, Narine, et al.
Publicado: (2025)
por: Kokhlikyan, Narine, et al.
Publicado: (2025)
Privacy Blur: Quantifying Privacy and Utility for Image Data Release
por: Mahloujifar, Saeed, et al.
Publicado: (2025)
por: Mahloujifar, Saeed, et al.
Publicado: (2025)
Machine Learning with Privacy for Protected Attributes
por: Mahloujifar, Saeed, et al.
Publicado: (2025)
por: Mahloujifar, Saeed, et al.
Publicado: (2025)
CIMemories: A Compositional Benchmark for Contextual Integrity of Persistent Memory in LLMs
por: Mireshghallah, Niloofar, et al.
Publicado: (2025)
por: Mireshghallah, Niloofar, et al.
Publicado: (2025)
Measuring Déjà vu Memorization Efficiently
por: Kokhlikyan, Narine, et al.
Publicado: (2025)
por: Kokhlikyan, Narine, et al.
Publicado: (2025)
Auditing $f$-Differential Privacy in One Run
por: Mahloujifar, Saeed, et al.
Publicado: (2024)
por: Mahloujifar, Saeed, et al.
Publicado: (2024)
RL Is a Hammer and LLMs Are Nails: A Simple Reinforcement Learning Recipe for Strong Prompt Injection
por: Wen, Yuxin, et al.
Publicado: (2025)
por: Wen, Yuxin, et al.
Publicado: (2025)
Privacy Amplification for the Gaussian Mechanism via Bounded Support
por: Hu, Shengyuan, et al.
Publicado: (2024)
por: Hu, Shengyuan, et al.
Publicado: (2024)
SecAlign: Defending Against Prompt Injection with Preference Optimization
por: Chen, Sizhe, et al.
Publicado: (2024)
por: Chen, Sizhe, et al.
Publicado: (2024)
Guarantees of confidentiality via Hammersley-Chapman-Robbins bounds
por: Chaudhuri, Kamalika, et al.
Publicado: (2024)
por: Chaudhuri, Kamalika, et al.
Publicado: (2024)
PAL: Proxy-Guided Black-Box Attack on Large Language Models
por: Sitawarin, Chawin, et al.
Publicado: (2024)
por: Sitawarin, Chawin, et al.
Publicado: (2024)
Contextual Document Embeddings
por: Morris, John X., et al.
Publicado: (2024)
por: Morris, John X., et al.
Publicado: (2024)
Positional Embedding-Aware Activations
por: Shah, Kathan, et al.
Publicado: (2023)
por: Shah, Kathan, et al.
Publicado: (2023)
Mark My Words: Analyzing and Evaluating Language Model Watermarks
por: Piet, Julien, et al.
Publicado: (2023)
por: Piet, Julien, et al.
Publicado: (2023)
Data Redaction from Conditional Generative Models
por: Kong, Zhifeng, et al.
Publicado: (2023)
por: Kong, Zhifeng, et al.
Publicado: (2023)
Vulnerability Detection with Code Language Models: How Far Are We?
por: Ding, Yangruibo, et al.
Publicado: (2024)
por: Ding, Yangruibo, et al.
Publicado: (2024)
Disentangling generalization and memorization in large language models using chess
por: Pleiss, Leonard S., et al.
Publicado: (2026)
por: Pleiss, Leonard S., et al.
Publicado: (2026)
Do language models plan ahead for future tokens?
por: Wu, Wilson, et al.
Publicado: (2024)
por: Wu, Wilson, et al.
Publicado: (2024)
Learning-Time Encoding Shapes Unlearning in LLMs
por: Wu, Ruihan, et al.
Publicado: (2025)
por: Wu, Ruihan, et al.
Publicado: (2025)
Learning to Reason in 13 Parameters
por: Morris, John X., et al.
Publicado: (2026)
por: Morris, John X., et al.
Publicado: (2026)
Hallucination reduction with CASAL: Contrastive Activation Steering For Amortized Learning
por: Wannan, et al.
Publicado: (2025)
por: Wannan, et al.
Publicado: (2025)
How much speech data is necessary for ASR in African languages? An evaluation of data scaling in Kinyarwanda and Kikuyu
por: Akera, Benjamin, et al.
Publicado: (2025)
por: Akera, Benjamin, et al.
Publicado: (2025)
Approximating Language Model Training Data from Weights
por: Morris, John X., et al.
Publicado: (2025)
por: Morris, John X., et al.
Publicado: (2025)
Evaluating Deep Unlearning in Large Language Models
por: Wu, Ruihan, et al.
Publicado: (2024)
por: Wu, Ruihan, et al.
Publicado: (2024)
Extracting memorized pieces of (copyrighted) books from open-weight language models
por: Cooper, A. Feder, et al.
Publicado: (2025)
por: Cooper, A. Feder, et al.
Publicado: (2025)
Déjà Vu Memorization in Vision-Language Models
por: Jayaraman, Bargav, et al.
Publicado: (2024)
por: Jayaraman, Bargav, et al.
Publicado: (2024)
Exploring prompts to elicit memorization in masked language model-based named entity recognition
por: Xia, Yuxi, et al.
Publicado: (2024)
por: Xia, Yuxi, et al.
Publicado: (2024)
On Symmetries in Convolutional Weights
por: Alsallakh, Bilal, et al.
Publicado: (2025)
por: Alsallakh, Bilal, et al.
Publicado: (2025)
Jatmo: Prompt Injection Defense by Task-Specific Finetuning
por: Piet, Julien, et al.
Publicado: (2023)
por: Piet, Julien, et al.
Publicado: (2023)
Privacy-Preserving Retrieval-Augmented Generation with Differential Privacy
por: Koga, Tatsuki, et al.
Publicado: (2024)
por: Koga, Tatsuki, et al.
Publicado: (2024)
Can We Infer Confidential Properties of Training Data from LLMs?
por: Huang, Pengrun, et al.
Publicado: (2025)
por: Huang, Pengrun, et al.
Publicado: (2025)
OODRobustBench: a Benchmark and Large-Scale Analysis of Adversarial Robustness under Distribution Shift
por: Li, Lin, et al.
Publicado: (2023)
por: Li, Lin, et al.
Publicado: (2023)
StruQ: Defending Against Prompt Injection with Structured Queries
por: Chen, Sizhe, et al.
Publicado: (2024)
por: Chen, Sizhe, et al.
Publicado: (2024)
Private Fine-tuning of Large Language Models with Zeroth-order Optimization
por: Tang, Xinyu, et al.
Publicado: (2024)
por: Tang, Xinyu, et al.
Publicado: (2024)
How much do contextualized representations encode long-range context?
por: Sun, Simeng, et al.
Publicado: (2024)
por: Sun, Simeng, et al.
Publicado: (2024)
Uncertainty-Based Abstention in LLMs Improves Safety and Reduces Hallucinations
por: Tomani, Christian, et al.
Publicado: (2024)
por: Tomani, Christian, et al.
Publicado: (2024)
Publicly-Detectable Watermarking for Language Models
por: Fairoze, Jaiden, et al.
Publicado: (2023)
por: Fairoze, Jaiden, et al.
Publicado: (2023)
Sequence-Level Leakage Risk of Training Data in Large Language Models
por: Tiwari, Trishita, et al.
Publicado: (2024)
por: Tiwari, Trishita, et al.
Publicado: (2024)
Detecting out-of-distribution text using topological features of transformer-based language models
por: Pollano, Andres, et al.
Publicado: (2023)
por: Pollano, Andres, et al.
Publicado: (2023)
Unlocking Visual Secrets: Inverting Features with Diffusion Priors for Image Reconstruction
por: Zhang, Sai Qian, et al.
Publicado: (2024)
por: Zhang, Sai Qian, et al.
Publicado: (2024)
Ejemplares similares
-
Z0-Inf: Zeroth Order Approximation for Data Influence
por: Kokhlikyan, Narine, et al.
Publicado: (2025) -
Privacy Blur: Quantifying Privacy and Utility for Image Data Release
por: Mahloujifar, Saeed, et al.
Publicado: (2025) -
Machine Learning with Privacy for Protected Attributes
por: Mahloujifar, Saeed, et al.
Publicado: (2025) -
CIMemories: A Compositional Benchmark for Contextual Integrity of Persistent Memory in LLMs
por: Mireshghallah, Niloofar, et al.
Publicado: (2025) -
Measuring Déjà vu Memorization Efficiently
por: Kokhlikyan, Narine, et al.
Publicado: (2025)