DCR: Quantifying Data Contamination in LLMs Evaluation
Fuente:
arXiv
Saved in:
| Main Authors: | Xu, Cheng, Yan, Nan, Guan, Shuhao, Jin, Changhong, Mei, Yuke, Guo, Yibing, Kechadi, M-Tahar |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Benchmark Data Contamination of Large Language Models: A Survey
by: Xu, Cheng, et al.
Published: (2024)
by: Xu, Cheng, et al.
Published: (2024)
LiveFact: A Dynamic, Time-Aware Benchmark for LLM-Driven Fake News Detection
by: Xu, Cheng, et al.
Published: (2026)
by: Xu, Cheng, et al.
Published: (2026)
Quantifying Data Contamination in Psychometric Evaluations of LLMs
by: Han, Jongwook, et al.
Published: (2025)
by: Han, Jongwook, et al.
Published: (2025)
DCR: Divide-and-Conquer Reasoning for Multi-choice Question Answering with LLMs
by: Meng, Zijie, et al.
Published: (2024)
by: Meng, Zijie, et al.
Published: (2024)
Advancing Post-OCR Correction: A Comparative Study of Synthetic Data
by: Guan, Shuhao, et al.
Published: (2024)
by: Guan, Shuhao, et al.
Published: (2024)
Quantifying the Effect of Test Set Contamination on Generative Evaluations
by: Schaeffer, Rylan, et al.
Published: (2026)
by: Schaeffer, Rylan, et al.
Published: (2026)
Healthcare Data Governance, Privacy, and Security -- A Conceptual Framework
by: Faridoon, Amen, et al.
Published: (2024)
by: Faridoon, Amen, et al.
Published: (2024)
DCR-Consistency: Divide-Conquer-Reasoning for Consistency Evaluation and Improvement of Large Language Models
by: Cui, Wendi, et al.
Published: (2024)
by: Cui, Wendi, et al.
Published: (2024)
Machine Learning for Dynamic Management Zone in Smart Farming
by: Kulatunga, Chamil, et al.
Published: (2024)
by: Kulatunga, Chamil, et al.
Published: (2024)
Does Data Contamination Detection Work (Well) for LLMs? A Survey and Evaluation on Detection Assumptions
by: Fu, Yujuan, et al.
Published: (2024)
by: Fu, Yujuan, et al.
Published: (2024)
Leak, Cheat, Repeat: Data Contamination and Evaluation Malpractices in Closed-Source LLMs
by: Balloccu, Simone, et al.
Published: (2024)
by: Balloccu, Simone, et al.
Published: (2024)
Quantifying Contamination in Evaluating Code Generation Capabilities of Language Models
by: Riddell, Martin, et al.
Published: (2024)
by: Riddell, Martin, et al.
Published: (2024)
Trajectory Prediction in Dynamic Object Tracking: A Critical Study
by: Dong, Zhongping, et al.
Published: (2025)
by: Dong, Zhongping, et al.
Published: (2025)
Quantifier Scope Interpretation in Language Learners and LLMs
by: Fang, Shaohua, et al.
Published: (2025)
by: Fang, Shaohua, et al.
Published: (2025)
A Survey on Data Contamination for Large Language Models
by: Cheng, Yuxing, et al.
Published: (2025)
by: Cheng, Yuxing, et al.
Published: (2025)
Cloud Digital Forensic Readiness: An Open Source Approach to Law Enforcement Request Management
by: Akilal, Abdellah, et al.
Published: (2025)
by: Akilal, Abdellah, et al.
Published: (2025)
DyePack: Provably Flagging Test Set Contamination in LLMs Using Backdoors
by: Cheng, Yize, et al.
Published: (2025)
by: Cheng, Yize, et al.
Published: (2025)
TRUCE: Private Benchmarking to Prevent Contamination and Improve Comparative Evaluation of LLMs
by: Rajore, Tanmay, et al.
Published: (2024)
by: Rajore, Tanmay, et al.
Published: (2024)
Detecting Data Contamination in LLMs via In-Context Learning
by: Zawalski, Michał, et al.
Published: (2025)
by: Zawalski, Michał, et al.
Published: (2025)
Format as a Prior: Quantifying and Analyzing Bias in LLMs for Heterogeneous Data
by: Liu, Jiacheng, et al.
Published: (2025)
by: Liu, Jiacheng, et al.
Published: (2025)
Code Needs Comments: Enhancing Code LLMs with Comment Augmentation
by: Song, Demin, et al.
Published: (2024)
by: Song, Demin, et al.
Published: (2024)
Data Contamination Can Cross Language Barriers
by: Yao, Feng, et al.
Published: (2024)
by: Yao, Feng, et al.
Published: (2024)
Healthcare Copilot: Eliciting the Power of General LLMs for Medical Consultation
by: Ren, Zhiyao, et al.
Published: (2024)
by: Ren, Zhiyao, et al.
Published: (2024)
Beyond Known Facts: Generating Unseen Temporal Knowledge to Address Data Contamination in LLM Evaluation
by: Amalvy, Arthur, et al.
Published: (2026)
by: Amalvy, Arthur, et al.
Published: (2026)
Environmental large language model Evaluation (ELLE) dataset: A Benchmark for Evaluating Generative AI applications in Eco-environment Domain
by: Guo, Jing, et al.
Published: (2025)
by: Guo, Jing, et al.
Published: (2025)
PreP-OCR: A Complete Pipeline for Document Image Restoration and Enhanced OCR Accuracy
by: Guan, Shuhao, et al.
Published: (2025)
by: Guan, Shuhao, et al.
Published: (2025)
Relational Probing: LM-to-Graph Adaptation for Financial Prediction
by: Niu, Yingjie, et al.
Published: (2026)
by: Niu, Yingjie, et al.
Published: (2026)
Leveraging Online Olympiad-Level Math Problems for LLMs Training and Contamination-Resistant Evaluation
by: Mahdavi, Sadegh, et al.
Published: (2025)
by: Mahdavi, Sadegh, et al.
Published: (2025)
Generalization or Memorization: Data Contamination and Trustworthy Evaluation for Large Language Models
by: Dong, Yihong, et al.
Published: (2024)
by: Dong, Yihong, et al.
Published: (2024)
Time Travel in LLMs: Tracing Data Contamination in Large Language Models
by: Golchin, Shahriar, et al.
Published: (2023)
by: Golchin, Shahriar, et al.
Published: (2023)
CAP: Data Contamination Detection via Consistency Amplification
by: Zhao, Yi, et al.
Published: (2024)
by: Zhao, Yi, et al.
Published: (2024)
A Taxonomy for Data Contamination in Large Language Models
by: Palavalli, Medha, et al.
Published: (2024)
by: Palavalli, Medha, et al.
Published: (2024)
Social Debiasing for Fair Multi-modal LLMs
by: Cheng, Harry, et al.
Published: (2024)
by: Cheng, Harry, et al.
Published: (2024)
CLEAN-EVAL: Clean Evaluation on Contaminated Large Language Models
by: Zhu, Wenhong, et al.
Published: (2023)
by: Zhu, Wenhong, et al.
Published: (2023)
Beyond Performance: Quantifying and Mitigating Label Bias in LLMs
by: Reif, Yuval, et al.
Published: (2024)
by: Reif, Yuval, et al.
Published: (2024)
Naming, Describing, and Quantifying Visual Objects in Humans and LLMs
by: Testoni, Alberto, et al.
Published: (2024)
by: Testoni, Alberto, et al.
Published: (2024)
Clean Evaluations on Contaminated Visual Language Models
by: Lu, Hongyuan, et al.
Published: (2024)
by: Lu, Hongyuan, et al.
Published: (2024)
EvaLearn: Quantifying the Learning Capability and Efficiency of LLMs via Sequential Problem Solving
by: Dou, Shihan, et al.
Published: (2025)
by: Dou, Shihan, et al.
Published: (2025)
Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition
by: Tseng, Yuan, et al.
Published: (2025)
by: Tseng, Yuan, et al.
Published: (2025)
Continual Pretraining on Encrypted Synthetic Data for Privacy-Preserving LLMs
by: Liu, Honghao, et al.
Published: (2026)
by: Liu, Honghao, et al.
Published: (2026)
Similar Items
-
Benchmark Data Contamination of Large Language Models: A Survey
by: Xu, Cheng, et al.
Published: (2024) -
LiveFact: A Dynamic, Time-Aware Benchmark for LLM-Driven Fake News Detection
by: Xu, Cheng, et al.
Published: (2026) -
Quantifying Data Contamination in Psychometric Evaluations of LLMs
by: Han, Jongwook, et al.
Published: (2025) -
DCR: Divide-and-Conquer Reasoning for Multi-choice Question Answering with LLMs
by: Meng, Zijie, et al.
Published: (2024) -
Advancing Post-OCR Correction: A Comparative Study of Synthetic Data
by: Guan, Shuhao, et al.
Published: (2024)