A Survey on Data Contamination for Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Cheng, Yuxing, Chang, Yi, Wu, Yuan |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Benchmark Data Contamination of Large Language Models: A Survey
by: Xu, Cheng, et al.
Published: (2024)
by: Xu, Cheng, et al.
Published: (2024)
A Survey on Data Augmentation in Large Model Era
by: Zhou, Yue, et al.
Published: (2024)
by: Zhou, Yue, et al.
Published: (2024)
A Taxonomy for Data Contamination in Large Language Models
by: Palavalli, Medha, et al.
Published: (2024)
by: Palavalli, Medha, et al.
Published: (2024)
A Comprehensive Survey of Contamination Detection Methods in Large Language Models
by: Ravaut, Mathieu, et al.
Published: (2024)
by: Ravaut, Mathieu, et al.
Published: (2024)
MeTA-LoRA: Data-Efficient Multi-Task Fine-Tuning for Large Language Models
by: Cheng, Bo, et al.
Published: (2025)
by: Cheng, Bo, et al.
Published: (2025)
XTRUST: On the Multilingual Trustworthiness of Large Language Models
by: Li, Yahan, et al.
Published: (2024)
by: Li, Yahan, et al.
Published: (2024)
RAG and RAU: A Survey on Retrieval-Augmented Language Model in Natural Language Processing
by: Hu, Yucheng, et al.
Published: (2024)
by: Hu, Yucheng, et al.
Published: (2024)
A Survey on Evaluation of Large Language Models
by: Chang, Yupeng, et al.
Published: (2023)
by: Chang, Yupeng, et al.
Published: (2023)
Transfer-Prompting: Enhancing Cross-Task Adaptation in Large Language Models via Dual-Stage Prompts Optimization
by: Chang, Yupeng, et al.
Published: (2025)
by: Chang, Yupeng, et al.
Published: (2025)
Unveiling the Spectrum of Data Contamination in Language Models: A Survey from Detection to Remediation
by: Deng, Chunyuan, et al.
Published: (2024)
by: Deng, Chunyuan, et al.
Published: (2024)
NLoRA: Nyström-Initiated Low-Rank Adaptation for Large Language Models
by: Guo, Chenlu, et al.
Published: (2025)
by: Guo, Chenlu, et al.
Published: (2025)
CHBench: A Chinese Dataset for Evaluating Health in Large Language Models
by: Guo, Chenlu, et al.
Published: (2024)
by: Guo, Chenlu, et al.
Published: (2024)
NegativePrompt: Leveraging Psychology for Large Language Models Enhancement via Negative Emotional Stimuli
by: Wang, Xu, et al.
Published: (2024)
by: Wang, Xu, et al.
Published: (2024)
Data Contamination Quiz: A Tool to Detect and Estimate Contamination in Large Language Models
by: Golchin, Shahriar, et al.
Published: (2023)
by: Golchin, Shahriar, et al.
Published: (2023)
Pretraining Data Exposure in Large Language Models: A Survey of Membership Inference, Data Contamination, and Security Implications
by: Tong, Ziyi, et al.
Published: (2026)
by: Tong, Ziyi, et al.
Published: (2026)
Large Language Model Evaluation via Matrix Nuclear-Norm
by: Li, Yahan, et al.
Published: (2024)
by: Li, Yahan, et al.
Published: (2024)
A Survey on Efficient Large Language Model Training: From Data-centric Perspectives
by: Luo, Junyu, et al.
Published: (2025)
by: Luo, Junyu, et al.
Published: (2025)
BA-LoRA: Bias-Alleviating Low-Rank Adaptation to Mitigate Catastrophic Inheritance in Large Language Models
by: Chang, Yupeng, et al.
Published: (2024)
by: Chang, Yupeng, et al.
Published: (2024)
An Open Source Data Contamination Report for Large Language Models
by: Li, Yucheng, et al.
Published: (2023)
by: Li, Yucheng, et al.
Published: (2023)
Investigating Data Contamination in Modern Benchmarks for Large Language Models
by: Deng, Chunyuan, et al.
Published: (2023)
by: Deng, Chunyuan, et al.
Published: (2023)
AGGC: Adaptive Group Gradient Clipping for Stabilizing Large Language Model Training
by: Li, Zhiyuan, et al.
Published: (2026)
by: Li, Zhiyuan, et al.
Published: (2026)
Large Language Models for Data Annotation and Synthesis: A Survey
by: Tan, Zhen, et al.
Published: (2024)
by: Tan, Zhen, et al.
Published: (2024)
Don't Take the Premise for Granted: Evaluating the Premise Critique Ability of Large Language Models
by: Li, Jinzhe, et al.
Published: (2025)
by: Li, Jinzhe, et al.
Published: (2025)
A Survey on Data Synthesis and Augmentation for Large Language Models
by: Wang, Ke, et al.
Published: (2024)
by: Wang, Ke, et al.
Published: (2024)
Multi-Persona Thinking for Bias Mitigation in Large Language Models
by: Chen, Yuxing, et al.
Published: (2026)
by: Chen, Yuxing, et al.
Published: (2026)
A Survey of Retentive Network
by: Yang, Haiqi, et al.
Published: (2025)
by: Yang, Haiqi, et al.
Published: (2025)
A Survey on Large Language Models for Mathematical Reasoning
by: Wang, Peng-Yuan, et al.
Published: (2025)
by: Wang, Peng-Yuan, et al.
Published: (2025)
Investigating the Impact of Data Contamination of Large Language Models in Text-to-SQL Translation
by: Ranaldi, Federico, et al.
Published: (2024)
by: Ranaldi, Federico, et al.
Published: (2024)
A Survey on the Honesty of Large Language Models
by: Li, Siheng, et al.
Published: (2024)
by: Li, Siheng, et al.
Published: (2024)
CLEAN-EVAL: Clean Evaluation on Contaminated Large Language Models
by: Zhu, Wenhong, et al.
Published: (2023)
by: Zhu, Wenhong, et al.
Published: (2023)
THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models
by: Li, Zhiyuan, et al.
Published: (2025)
by: Li, Zhiyuan, et al.
Published: (2025)
Preference Heads in Large Language Models: A Mechanistic Framework for Interpretable Personalization
by: Zhang, Weixu, et al.
Published: (2026)
by: Zhang, Weixu, et al.
Published: (2026)
A Survey of RWKV
by: Li, Zhiyuan, et al.
Published: (2024)
by: Li, Zhiyuan, et al.
Published: (2024)
A Survey on Personalized Alignment -- The Missing Piece for Large Language Models in Real-World Applications
by: Guan, Jian, et al.
Published: (2025)
by: Guan, Jian, et al.
Published: (2025)
Continual Learning for Large Language Models: A Survey
by: Wu, Tongtong, et al.
Published: (2024)
by: Wu, Tongtong, et al.
Published: (2024)
Large Language Model Sourcing: A Survey
by: Pang, Liang, et al.
Published: (2025)
by: Pang, Liang, et al.
Published: (2025)
ConStat: Performance-Based Contamination Detection in Large Language Models
by: Dekoninck, Jasper, et al.
Published: (2024)
by: Dekoninck, Jasper, et al.
Published: (2024)
Efficient Prompting Methods for Large Language Models: A Survey
by: Chang, Kaiyan, et al.
Published: (2024)
by: Chang, Kaiyan, et al.
Published: (2024)
A Survey on Knowledge Distillation of Large Language Models
by: Xu, Xiaohan, et al.
Published: (2024)
by: Xu, Xiaohan, et al.
Published: (2024)
AdEval: Alignment-based Dynamic Evaluation to Mitigate Data Contamination in Large Language Models
by: Fan, Yang
Published: (2025)
by: Fan, Yang
Published: (2025)
Similar Items
-
Benchmark Data Contamination of Large Language Models: A Survey
by: Xu, Cheng, et al.
Published: (2024) -
A Survey on Data Augmentation in Large Model Era
by: Zhou, Yue, et al.
Published: (2024) -
A Taxonomy for Data Contamination in Large Language Models
by: Palavalli, Medha, et al.
Published: (2024) -
A Comprehensive Survey of Contamination Detection Methods in Large Language Models
by: Ravaut, Mathieu, et al.
Published: (2024) -
MeTA-LoRA: Data-Efficient Multi-Task Fine-Tuning for Large Language Models
by: Cheng, Bo, et al.
Published: (2025)