Quantifying Memorization and Detecting Training Data of Pre-trained Language Models using Japanese Newspaper
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Ishihara, Shotaro, Takahashi, Hiromu |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Fast-MIA: Efficient and Scalable Membership Inference for LLMs
von: Takahashi, Hiromu, et al.
Veröffentlicht: (2025)
von: Takahashi, Hiromu, et al.
Veröffentlicht: (2025)
PreCog: Exploring the Relation between Memorization and Performance in Pre-trained Language Models
von: Ranaldi, Leonardo, et al.
Veröffentlicht: (2023)
von: Ranaldi, Leonardo, et al.
Veröffentlicht: (2023)
Probing Language Models for Pre-training Data Detection
von: Liu, Zhenhua, et al.
Veröffentlicht: (2024)
von: Liu, Zhenhua, et al.
Veröffentlicht: (2024)
Data Compressibility Quantifies LLM Memorization
von: Huang, Yizhan, et al.
Veröffentlicht: (2025)
von: Huang, Yizhan, et al.
Veröffentlicht: (2025)
Release of Pre-Trained Models for the Japanese Language
von: Sawada, Kei, et al.
Veröffentlicht: (2024)
von: Sawada, Kei, et al.
Veröffentlicht: (2024)
Construction of Domain-specified Japanese Large Language Model for Finance through Continual Pre-training
von: Hirano, Masanori, et al.
Veröffentlicht: (2024)
von: Hirano, Masanori, et al.
Veröffentlicht: (2024)
Large Language Models' Detection of Political Orientation in Newspapers
von: Buscemi, Alessio, et al.
Veröffentlicht: (2024)
von: Buscemi, Alessio, et al.
Veröffentlicht: (2024)
Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data
von: Guo, Xu, et al.
Veröffentlicht: (2026)
von: Guo, Xu, et al.
Veröffentlicht: (2026)
Fine-tuning Pre-trained Language Models for Few-shot Intent Detection: Supervised Pre-training and Isotropization
von: Zhang, Haode, et al.
Veröffentlicht: (2022)
von: Zhang, Haode, et al.
Veröffentlicht: (2022)
Inside the Black Box: Detecting Data Leakage in Pre-trained Language Encoders
von: Xin, Yuan, et al.
Veröffentlicht: (2024)
von: Xin, Yuan, et al.
Veröffentlicht: (2024)
Exploring Cross-Client Memorization of Training Data in Large Language Models for Federated Learning
von: Udsa, Tinnakit, et al.
Veröffentlicht: (2025)
von: Udsa, Tinnakit, et al.
Veröffentlicht: (2025)
Memory Dial: A Training Framework for Controllable Memorization in Language Models
von: Zhang, Xiangbo, et al.
Veröffentlicht: (2026)
von: Zhang, Xiangbo, et al.
Veröffentlicht: (2026)
Evaluating Large Language Models' Ability Using a Psychiatric Screening Tool Based on Metaphor and Sarcasm Scenarios
von: Yakura, Hiromu
Veröffentlicht: (2023)
von: Yakura, Hiromu
Veröffentlicht: (2023)
From Unfamiliar to Familiar: Detecting Pre-training Data via Gradient Deviations in Large Language Models
von: Zhang, Ruiqi, et al.
Veröffentlicht: (2026)
von: Zhang, Ruiqi, et al.
Veröffentlicht: (2026)
Detecting Memorization in Large Language Models
von: Slonski, Eduardo
Veröffentlicht: (2024)
von: Slonski, Eduardo
Veröffentlicht: (2024)
Generalization or Memorization? Brittleness Testing for Chess-Trained Language Models
von: Tang, Ethan
Veröffentlicht: (2026)
von: Tang, Ethan
Veröffentlicht: (2026)
DataMan: Data Manager for Pre-training Large Language Models
von: Peng, Ru, et al.
Veröffentlicht: (2025)
von: Peng, Ru, et al.
Veröffentlicht: (2025)
Automatically Suggesting Diverse Example Sentences for L2 Japanese Learners Using Pre-Trained Language Models
von: Benedetti, Enrico, et al.
Veröffentlicht: (2025)
von: Benedetti, Enrico, et al.
Veröffentlicht: (2025)
Leveraging Digitized Newspapers to Collect Summarization Data in Low-Resource Languages
von: Dahan, Noam, et al.
Veröffentlicht: (2025)
von: Dahan, Noam, et al.
Veröffentlicht: (2025)
Investigating Data Contamination for Pre-training Language Models
von: Jiang, Minhao, et al.
Veröffentlicht: (2024)
von: Jiang, Minhao, et al.
Veröffentlicht: (2024)
Adaptive Pre-training Data Detection for Large Language Models via Surprising Tokens
von: Zhang, Anqi, et al.
Veröffentlicht: (2024)
von: Zhang, Anqi, et al.
Veröffentlicht: (2024)
Exploring Approaches for Detecting Memorization of Recommender System Data in Large Language Models
von: Colacicco, Antonio, et al.
Veröffentlicht: (2026)
von: Colacicco, Antonio, et al.
Veröffentlicht: (2026)
Continual Memorization of Factoids in Language Models
von: Chen, Howard, et al.
Veröffentlicht: (2024)
von: Chen, Howard, et al.
Veröffentlicht: (2024)
RegMix: Data Mixture as Regression for Language Model Pre-training
von: Liu, Qian, et al.
Veröffentlicht: (2024)
von: Liu, Qian, et al.
Veröffentlicht: (2024)
Understanding Data Temporality Impact on Large Language Models Pre-training
von: Pilchen, Hippolyte, et al.
Veröffentlicht: (2026)
von: Pilchen, Hippolyte, et al.
Veröffentlicht: (2026)
Cross-Care: Assessing the Healthcare Implications of Pre-training Data on Language Model Bias
von: Chen, Shan, et al.
Veröffentlicht: (2024)
von: Chen, Shan, et al.
Veröffentlicht: (2024)
On The Origin of Cultural Biases in Language Models: From Pre-training Data to Linguistic Phenomena
von: Naous, Tarek, et al.
Veröffentlicht: (2025)
von: Naous, Tarek, et al.
Veröffentlicht: (2025)
Too Big to Think: Capacity, Memorization, and Generalization in Pre-Trained Transformers
von: Barron, Joshua, et al.
Veröffentlicht: (2025)
von: Barron, Joshua, et al.
Veröffentlicht: (2025)
Development of Cognitive Intelligence in Pre-trained Language Models
von: Shah, Raj Sanjay, et al.
Veröffentlicht: (2024)
von: Shah, Raj Sanjay, et al.
Veröffentlicht: (2024)
Metadata Conditioning Accelerates Language Model Pre-training
von: Gao, Tianyu, et al.
Veröffentlicht: (2025)
von: Gao, Tianyu, et al.
Veröffentlicht: (2025)
Evaluating Discourse Cohesion in Pre-trained Language Models
von: He, Jie, et al.
Veröffentlicht: (2025)
von: He, Jie, et al.
Veröffentlicht: (2025)
Min-K%++: Improved Baseline for Detecting Pre-Training Data from Large Language Models
von: Zhang, Jingyang, et al.
Veröffentlicht: (2024)
von: Zhang, Jingyang, et al.
Veröffentlicht: (2024)
Improving Language Models Trained on Translated Data with Continual Pre-Training and Dictionary Learning Analysis
von: Boughorbel, Sabri, et al.
Veröffentlicht: (2024)
von: Boughorbel, Sabri, et al.
Veröffentlicht: (2024)
Continual Pre-Training for Cross-Lingual LLM Adaptation: Enhancing Japanese Language Capabilities
von: Fujii, Kazuki, et al.
Veröffentlicht: (2024)
von: Fujii, Kazuki, et al.
Veröffentlicht: (2024)
Fine-Tuning Pre-trained Language Models to Detect In-Game Trash Talks
von: Fesalbon, Daniel, et al.
Veröffentlicht: (2024)
von: Fesalbon, Daniel, et al.
Veröffentlicht: (2024)
Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge
von: Zhang, Ying, et al.
Veröffentlicht: (2025)
von: Zhang, Ying, et al.
Veröffentlicht: (2025)
Verifiable by Design: Aligning Language Models to Quote from Pre-Training Data
von: Zhang, Jingyu, et al.
Veröffentlicht: (2024)
von: Zhang, Jingyu, et al.
Veröffentlicht: (2024)
Meta-rater: A Multi-dimensional Data Selection Method for Pre-training Language Models
von: Zhuang, Xinlin, et al.
Veröffentlicht: (2025)
von: Zhuang, Xinlin, et al.
Veröffentlicht: (2025)
Nemotron-CLIMB: CLustering-based Iterative Data Mixture Bootstrapping for Language Model Pre-training
von: Diao, Shizhe, et al.
Veröffentlicht: (2025)
von: Diao, Shizhe, et al.
Veröffentlicht: (2025)
On Memorization of Large Language Models in Logical Reasoning
von: Xie, Chulin, et al.
Veröffentlicht: (2024)
von: Xie, Chulin, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Fast-MIA: Efficient and Scalable Membership Inference for LLMs
von: Takahashi, Hiromu, et al.
Veröffentlicht: (2025) -
PreCog: Exploring the Relation between Memorization and Performance in Pre-trained Language Models
von: Ranaldi, Leonardo, et al.
Veröffentlicht: (2023) -
Probing Language Models for Pre-training Data Detection
von: Liu, Zhenhua, et al.
Veröffentlicht: (2024) -
Data Compressibility Quantifies LLM Memorization
von: Huang, Yizhan, et al.
Veröffentlicht: (2025) -
Release of Pre-Trained Models for the Japanese Language
von: Sawada, Kei, et al.
Veröffentlicht: (2024)