Demystifying Verbatim Memorization in Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Huang, Jing, Yang, Diyi, Potts, Christopher |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Internal Causal Mechanisms Robustly Predict Language Model Out-of-Distribution Behaviors
von: Huang, Jing, et al.
Veröffentlicht: (2025)
von: Huang, Jing, et al.
Veröffentlicht: (2025)
Blackbox Model Provenance via Palimpsestic Membership Inference
von: Kuditipudi, Rohith, et al.
Veröffentlicht: (2025)
von: Kuditipudi, Rohith, et al.
Veröffentlicht: (2025)
Language Models May Verbatim Complete Text They Were Not Explicitly Trained On
von: Liu, Ken Ziyu, et al.
Veröffentlicht: (2025)
von: Liu, Ken Ziyu, et al.
Veröffentlicht: (2025)
RAVEL: Evaluating Interpretability Methods on Disentangling Language Model Representations
von: Huang, Jing, et al.
Veröffentlicht: (2024)
von: Huang, Jing, et al.
Veröffentlicht: (2024)
Skewed Memorization in Large Language Models: Quantification and Decomposition
von: Li, Hao, et al.
Veröffentlicht: (2025)
von: Li, Hao, et al.
Veröffentlicht: (2025)
Detecting Memorization in Large Language Models
von: Slonski, Eduardo
Veröffentlicht: (2024)
von: Slonski, Eduardo
Veröffentlicht: (2024)
Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models
von: Luo, Feng, et al.
Veröffentlicht: (2026)
von: Luo, Feng, et al.
Veröffentlicht: (2026)
Can Large Language Models Transform Computational Social Science?
von: Ziems, Caleb, et al.
Veröffentlicht: (2023)
von: Ziems, Caleb, et al.
Veröffentlicht: (2023)
ParaPO: Aligning Language Models to Reduce Verbatim Reproduction of Pre-training Data
von: Chen, Tong, et al.
Veröffentlicht: (2025)
von: Chen, Tong, et al.
Veröffentlicht: (2025)
Demystifying Embedding Spaces using Large Language Models
von: Tennenholtz, Guy, et al.
Veröffentlicht: (2023)
von: Tennenholtz, Guy, et al.
Veröffentlicht: (2023)
Revisiting Non-Verbatim Memorization in Large Language Models: The Role of Entity Surface Forms
von: Nishida, Yuto, et al.
Veröffentlicht: (2026)
von: Nishida, Yuto, et al.
Veröffentlicht: (2026)
Mitigating Memorization In Language Models
von: Sakarvadia, Mansi, et al.
Veröffentlicht: (2024)
von: Sakarvadia, Mansi, et al.
Veröffentlicht: (2024)
An Evaluation on Large Language Model Outputs: Discourse and Memorization
von: de Wynter, Adrian, et al.
Veröffentlicht: (2023)
von: de Wynter, Adrian, et al.
Veröffentlicht: (2023)
Exploring Cross-Client Memorization of Training Data in Large Language Models for Federated Learning
von: Udsa, Tinnakit, et al.
Veröffentlicht: (2025)
von: Udsa, Tinnakit, et al.
Veröffentlicht: (2025)
Scaling Reasoning Hop Exposes Weaknesses: Demystifying and Improving Hop Generalization in Large Language Models
von: Li, Zhaoyi, et al.
Veröffentlicht: (2026)
von: Li, Zhaoyi, et al.
Veröffentlicht: (2026)
Pruning as a Defense: Reducing Memorization in Large Language Models
von: Gupta, Mansi, et al.
Veröffentlicht: (2025)
von: Gupta, Mansi, et al.
Veröffentlicht: (2025)
Demystifying Language Model Forgetting with Low-rank Example Associations
von: Jin, Xisen, et al.
Veröffentlicht: (2024)
von: Jin, Xisen, et al.
Veröffentlicht: (2024)
Demystifying Low-Rank Knowledge Distillation in Large Language Models: Convergence, Generalization, and Information-Theoretic Guarantees
von: Soarez, Alberlucia Rafael, et al.
Veröffentlicht: (2026)
von: Soarez, Alberlucia Rafael, et al.
Veröffentlicht: (2026)
Memorize and Rank: Elevating Large Language Models for Clinical Diagnosis Prediction
von: Ma, Mingyu Derek, et al.
Veröffentlicht: (2025)
von: Ma, Mingyu Derek, et al.
Veröffentlicht: (2025)
Demystifying and Enhancing the Efficiency of Large Language Model Based Search Agents
von: Yang, Tiannuo, et al.
Veröffentlicht: (2025)
von: Yang, Tiannuo, et al.
Veröffentlicht: (2025)
DyVal: Dynamic Evaluation of Large Language Models for Reasoning Tasks
von: Zhu, Kaijie, et al.
Veröffentlicht: (2023)
von: Zhu, Kaijie, et al.
Veröffentlicht: (2023)
Localizing Paragraph Memorization in Language Models
von: Stoehr, Niklas, et al.
Veröffentlicht: (2024)
von: Stoehr, Niklas, et al.
Veröffentlicht: (2024)
Elephants Never Forget: Memorization and Learning of Tabular Data in Large Language Models
von: Bordt, Sebastian, et al.
Veröffentlicht: (2024)
von: Bordt, Sebastian, et al.
Veröffentlicht: (2024)
Multi-Level Feedback Generation with Large Language Models for Empowering Novice Peer Counselors
von: Chaszczewicz, Alicja, et al.
Veröffentlicht: (2024)
von: Chaszczewicz, Alicja, et al.
Veröffentlicht: (2024)
Elephants Never Forget: Testing Language Models for Memorization of Tabular Data
von: Bordt, Sebastian, et al.
Veröffentlicht: (2024)
von: Bordt, Sebastian, et al.
Veröffentlicht: (2024)
Understanding Verbatim Memorization in LLMs Through Circuit Discovery
von: Lasy, Ilya, et al.
Veröffentlicht: (2025)
von: Lasy, Ilya, et al.
Veröffentlicht: (2025)
Exploring Memorization in Fine-tuned Language Models
von: Zeng, Shenglai, et al.
Veröffentlicht: (2023)
von: Zeng, Shenglai, et al.
Veröffentlicht: (2023)
Unlocking Memorization in Large Language Models with Dynamic Soft Prompting
von: Wang, Zhepeng, et al.
Veröffentlicht: (2024)
von: Wang, Zhepeng, et al.
Veröffentlicht: (2024)
ScoNe: Benchmarking Negation Reasoning in Language Models With Fine-Tuning and In-Context Learning
von: She, Jingyuan Selena, et al.
Veröffentlicht: (2023)
von: She, Jingyuan Selena, et al.
Veröffentlicht: (2023)
pyvene: A Library for Understanding and Improving PyTorch Models via Interventions
von: Wu, Zhengxuan, et al.
Veröffentlicht: (2024)
von: Wu, Zhengxuan, et al.
Veröffentlicht: (2024)
To Each (Textual Sequence) Its Own: Improving Memorized-Data Unlearning in Large Language Models
von: Barbulescu, George-Octavian, et al.
Veröffentlicht: (2024)
von: Barbulescu, George-Octavian, et al.
Veröffentlicht: (2024)
Mission: Impossible Language Models
von: Kallini, Julie, et al.
Veröffentlicht: (2024)
von: Kallini, Julie, et al.
Veröffentlicht: (2024)
Generalization or Memorization: Data Contamination and Trustworthy Evaluation for Large Language Models
von: Dong, Yihong, et al.
Veröffentlicht: (2024)
von: Dong, Yihong, et al.
Veröffentlicht: (2024)
Generalization v.s. Memorization: Tracing Language Models' Capabilities Back to Pretraining Data
von: Wang, Xinyi, et al.
Veröffentlicht: (2024)
von: Wang, Xinyi, et al.
Veröffentlicht: (2024)
Unintended Memorization of Sensitive Information in Fine-Tuned Language Models
von: Szep, Marton, et al.
Veröffentlicht: (2026)
von: Szep, Marton, et al.
Veröffentlicht: (2026)
A Survey on Mixture of Experts in Large Language Models
von: Cai, Weilin, et al.
Veröffentlicht: (2024)
von: Cai, Weilin, et al.
Veröffentlicht: (2024)
MrT5: Dynamic Token Merging for Efficient Byte-level Language Models
von: Kallini, Julie, et al.
Veröffentlicht: (2024)
von: Kallini, Julie, et al.
Veröffentlicht: (2024)
Hubble: a Model Suite to Advance the Study of LLM Memorization
von: Wei, Johnny Tian-Zheng, et al.
Veröffentlicht: (2025)
von: Wei, Johnny Tian-Zheng, et al.
Veröffentlicht: (2025)
Unintended Impacts of LLM Alignment on Global Representation
von: Ryan, Michael J., et al.
Veröffentlicht: (2024)
von: Ryan, Michael J., et al.
Veröffentlicht: (2024)
Improving Pretraining Data Using Perplexity Correlations
von: Thrush, Tristan, et al.
Veröffentlicht: (2024)
von: Thrush, Tristan, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Internal Causal Mechanisms Robustly Predict Language Model Out-of-Distribution Behaviors
von: Huang, Jing, et al.
Veröffentlicht: (2025) -
Blackbox Model Provenance via Palimpsestic Membership Inference
von: Kuditipudi, Rohith, et al.
Veröffentlicht: (2025) -
Language Models May Verbatim Complete Text They Were Not Explicitly Trained On
von: Liu, Ken Ziyu, et al.
Veröffentlicht: (2025) -
RAVEL: Evaluating Interpretability Methods on Disentangling Language Model Representations
von: Huang, Jing, et al.
Veröffentlicht: (2024) -
Skewed Memorization in Large Language Models: Quantification and Decomposition
von: Li, Hao, et al.
Veröffentlicht: (2025)