Sequence-Level Leakage Risk of Training Data in Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Tiwari, Trishita, Suh, G. Edward |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Prior Aware Memorization: An Efficient Metric for Distinguishing Memorization from Generalization in Large Language Models
by: Tiwari, Trishita, et al.
Published: (2026)
by: Tiwari, Trishita, et al.
Published: (2026)
Tracing Privacy Leakage of Language Models to Training Data via Adjusted Influence Functions
by: Liu, Jinxin, et al.
Published: (2024)
by: Liu, Jinxin, et al.
Published: (2024)
ISACL: Internal State Analyzer for Copyrighted Training Data Leakage
by: Zhang, Guangwei, et al.
Published: (2025)
by: Zhang, Guangwei, et al.
Published: (2025)
Benchmarking Benchmark Leakage in Large Language Models
by: Xu, Ruijie, et al.
Published: (2024)
by: Xu, Ruijie, et al.
Published: (2024)
Sequence-level Large Language Model Training with Contrastive Preference Optimization
by: Feng, Zhili, et al.
Published: (2025)
by: Feng, Zhili, et al.
Published: (2025)
Objective Metrics for Evaluating Large Language Models Using External Data Sources
by: Du, Haoze, et al.
Published: (2025)
by: Du, Haoze, et al.
Published: (2025)
Measuring Non-Adversarial Reproduction of Training Data in Large Language Models
by: Aerni, Michael, et al.
Published: (2024)
by: Aerni, Michael, et al.
Published: (2024)
Sanitize Your Responses: Mitigating Privacy Leakage in Large Language Models
by: Fu, Wenjie, et al.
Published: (2025)
by: Fu, Wenjie, et al.
Published: (2025)
Training Language Models on Synthetic Edit Sequences Improves Code Synthesis
by: Piterbarg, Ulyana, et al.
Published: (2024)
by: Piterbarg, Ulyana, et al.
Published: (2024)
Extending Input Contexts of Language Models through Training on Segmented Sequences
by: Karypis, Petros, et al.
Published: (2023)
by: Karypis, Petros, et al.
Published: (2023)
Merging Methods for Multilingual Knowledge Editing for Large Language Models: An Empirical Odyssey
by: Lee, Kunil, et al.
Published: (2026)
by: Lee, Kunil, et al.
Published: (2026)
Estimating Privacy Leakage of Augmented Contextual Knowledge in Language Models
by: Flemings, James, et al.
Published: (2024)
by: Flemings, James, et al.
Published: (2024)
DataFlex: A Unified Framework for Data-Centric Dynamic Training of Large Language Models
by: Liang, Hao, et al.
Published: (2026)
by: Liang, Hao, et al.
Published: (2026)
Temporal Tokenization Strategies for Event Sequence Modeling with Large Language Models
by: Liu, Zefang, et al.
Published: (2025)
by: Liu, Zefang, et al.
Published: (2025)
Memories Retrieved from Many Paths: A Multi-Prefix Framework for Robust Detection of Training Data Leakage in Large Language Models
by: Dang, Trung Cuong, et al.
Published: (2025)
by: Dang, Trung Cuong, et al.
Published: (2025)
Regurgitative Training: The Value of Real Data in Training Large Language Models
by: Zhang, Jinghui, et al.
Published: (2024)
by: Zhang, Jinghui, et al.
Published: (2024)
CATS: Contextually-Aware Thresholding for Sparsity in Large Language Models
by: Lee, Donghyun, et al.
Published: (2024)
by: Lee, Donghyun, et al.
Published: (2024)
Exploring Cross-Client Memorization of Training Data in Large Language Models for Federated Learning
by: Udsa, Tinnakit, et al.
Published: (2025)
by: Udsa, Tinnakit, et al.
Published: (2025)
Beyond Next Token Prediction: Patch-Level Training for Large Language Models
by: Shao, Chenze, et al.
Published: (2024)
by: Shao, Chenze, et al.
Published: (2024)
Large Language Models for Document-Level Event-Argument Data Augmentation for Challenging Role Types
by: Gatto, Joseph, et al.
Published: (2024)
by: Gatto, Joseph, et al.
Published: (2024)
Energy Considerations of Large Language Model Inference and Efficiency Optimizations
by: Fernandez, Jared, et al.
Published: (2025)
by: Fernandez, Jared, et al.
Published: (2025)
Neuron-Level Knowledge Attribution in Large Language Models
by: Yu, Zeping, et al.
Published: (2023)
by: Yu, Zeping, et al.
Published: (2023)
Discovering Implicit Large Language Model Alignment Objectives
by: Chen, Edward, et al.
Published: (2026)
by: Chen, Edward, et al.
Published: (2026)
Min-K%++: Improved Baseline for Detecting Pre-Training Data from Large Language Models
by: Zhang, Jingyang, et al.
Published: (2024)
by: Zhang, Jingyang, et al.
Published: (2024)
Self-Training Large Language Models with Confident Reasoning
by: Jang, Hyosoon, et al.
Published: (2025)
by: Jang, Hyosoon, et al.
Published: (2025)
Linear Dynamics in the RLVR Training of Large Language Models
by: Wang, Tianle, et al.
Published: (2026)
by: Wang, Tianle, et al.
Published: (2026)
CLUE: Concept-Level Uncertainty Estimation for Large Language Models
by: Wang, Yu-Hsiang, et al.
Published: (2024)
by: Wang, Yu-Hsiang, et al.
Published: (2024)
DebateBench: A Challenging Long Context Reasoning Benchmark For Large Language Models
by: Tiwari, Utkarsh, et al.
Published: (2025)
by: Tiwari, Utkarsh, et al.
Published: (2025)
Do Large Language Model Benchmarks Test Reliability?
by: Vendrow, Joshua, et al.
Published: (2025)
by: Vendrow, Joshua, et al.
Published: (2025)
How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence
by: Choi, Hyeong Kyu, et al.
Published: (2025)
by: Choi, Hyeong Kyu, et al.
Published: (2025)
Nevermind: Instruction Override and Moderation in Large Language Models
by: Kim, Edward
Published: (2024)
by: Kim, Edward
Published: (2024)
Never Train from Scratch: Fair Comparison of Long-Sequence Models Requires Data-Driven Priors
by: Amos, Ido, et al.
Published: (2023)
by: Amos, Ido, et al.
Published: (2023)
Pointer-Guided Pre-Training: Infusing Large Language Models with Paragraph-Level Contextual Awareness
by: Hillebrand, Lars, et al.
Published: (2024)
by: Hillebrand, Lars, et al.
Published: (2024)
Escaping Collapse: The Strength of Weak Data for Large Language Model Training
by: Amin, Kareem, et al.
Published: (2025)
by: Amin, Kareem, et al.
Published: (2025)
To Each (Textual Sequence) Its Own: Improving Memorized-Data Unlearning in Large Language Models
by: Barbulescu, George-Octavian, et al.
Published: (2024)
by: Barbulescu, George-Octavian, et al.
Published: (2024)
Scaling Laws for Post Training Quantized Large Language Models
by: Xu, Zifei, et al.
Published: (2024)
by: Xu, Zifei, et al.
Published: (2024)
RedPajama: an Open Dataset for Training Large Language Models
by: Weber, Maurice, et al.
Published: (2024)
by: Weber, Maurice, et al.
Published: (2024)
Test-Time Training on Nearest Neighbors for Large Language Models
by: Hardt, Moritz, et al.
Published: (2023)
by: Hardt, Moritz, et al.
Published: (2023)
A Survey on Training-free Alignment of Large Language Models
by: Pan, Birong, et al.
Published: (2025)
by: Pan, Birong, et al.
Published: (2025)
LLMs Plagiarize: Ensuring Responsible Sourcing of Large Language Model Training Data Through Knowledge Graph Comparison
by: Mondal, Devam, et al.
Published: (2024)
by: Mondal, Devam, et al.
Published: (2024)
Similar Items
-
Prior Aware Memorization: An Efficient Metric for Distinguishing Memorization from Generalization in Large Language Models
by: Tiwari, Trishita, et al.
Published: (2026) -
Tracing Privacy Leakage of Language Models to Training Data via Adjusted Influence Functions
by: Liu, Jinxin, et al.
Published: (2024) -
ISACL: Internal State Analyzer for Copyrighted Training Data Leakage
by: Zhang, Guangwei, et al.
Published: (2025) -
Benchmarking Benchmark Leakage in Large Language Models
by: Xu, Ruijie, et al.
Published: (2024) -
Sequence-level Large Language Model Training with Contrastive Preference Optimization
by: Feng, Zhili, et al.
Published: (2025)