Towards Contamination Resistant Benchmarks
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Musawi, Rahmatullah, Lu, Sheng |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Contamination Report for Multilingual Benchmarks
par: Ahuja, Sanchit, et autres
Publié: (2024)
par: Ahuja, Sanchit, et autres
Publié: (2024)
Towards Reliable Benchmarking: A Contamination Free, Controllable Evaluation Framework for Multi-step LLM Function Calling
par: Maekawa, Seiji, et autres
Publié: (2025)
par: Maekawa, Seiji, et autres
Publié: (2025)
BeyondBench: Contamination-Resistant Evaluation of Reasoning in Language Models
par: Srivastava, Gaurav, et autres
Publié: (2025)
par: Srivastava, Gaurav, et autres
Publié: (2025)
Benchmark Data Contamination of Large Language Models: A Survey
par: Xu, Cheng, et autres
Publié: (2024)
par: Xu, Cheng, et autres
Publié: (2024)
LogitTrace: Detecting Benchmark Contamination via Layerwise Logit Trajectories
par: He, Zirui, et autres
Publié: (2025)
par: He, Zirui, et autres
Publié: (2025)
Investigating Data Contamination in Modern Benchmarks for Large Language Models
par: Deng, Chunyuan, et autres
Publié: (2023)
par: Deng, Chunyuan, et autres
Publié: (2023)
Cross-Context Verification: Hierarchical Detection of Benchmark Contamination through Session-Isolated Analysis
par: Song, Tae-Eun
Publié: (2026)
par: Song, Tae-Eun
Publié: (2026)
C$^2$LEVA: Toward Comprehensive and Contamination-Free Language Model Evaluation
par: Li, Yanyang, et autres
Publié: (2024)
par: Li, Yanyang, et autres
Publié: (2024)
TRUCE: Private Benchmarking to Prevent Contamination and Improve Comparative Evaluation of LLMs
par: Rajore, Tanmay, et autres
Publié: (2024)
par: Rajore, Tanmay, et autres
Publié: (2024)
Clean Evaluations on Contaminated Visual Language Models
par: Lu, Hongyuan, et autres
Publié: (2024)
par: Lu, Hongyuan, et autres
Publié: (2024)
LiveBench: A Challenging, Contamination-Limited LLM Benchmark
par: White, Colin, et autres
Publié: (2024)
par: White, Colin, et autres
Publié: (2024)
CLEAN-EVAL: Clean Evaluation on Contaminated Large Language Models
par: Zhu, Wenhong, et autres
Publié: (2023)
par: Zhu, Wenhong, et autres
Publié: (2023)
Leveraging Online Olympiad-Level Math Problems for LLMs Training and Contamination-Resistant Evaluation
par: Mahdavi, Sadegh, et autres
Publié: (2025)
par: Mahdavi, Sadegh, et autres
Publié: (2025)
SPENCE: A Syntactic Probe for Detecting Contamination in NL2SQL Benchmarks
par: Safarzadeh, Mohammadtaher, et autres
Publié: (2026)
par: Safarzadeh, Mohammadtaher, et autres
Publié: (2026)
Silicon Bureaucracy and AI Test-Oriented Education: Contamination Sensitivity and Score Confidence in LLM Benchmarks
par: Song, Yiliang, et autres
Publié: (2026)
par: Song, Yiliang, et autres
Publié: (2026)
The Emperor's New Clothes in Benchmarking? A Rigorous Examination of Mitigation Strategies for LLM Benchmark Data Contamination
par: Sun, Yifan, et autres
Publié: (2025)
par: Sun, Yifan, et autres
Publié: (2025)
LNE-Blocking: An Efficient Framework for Contamination Mitigation Evaluation on Large Language Models
par: Hou, Ruijie, et autres
Publié: (2025)
par: Hou, Ruijie, et autres
Publié: (2025)
LLM-as-a-Reviewer: Benchmarking Their Ability, Divergence, and Prompt Injection Resistance as Paper Reviewers
par: Li, Lingyao, et autres
Publié: (2026)
par: Li, Lingyao, et autres
Publié: (2026)
AntiLeakBench: Preventing Data Contamination by Automatically Constructing Benchmarks with Updated Real-World Knowledge
par: Wu, Xiaobao, et autres
Publié: (2024)
par: Wu, Xiaobao, et autres
Publié: (2024)
PaCoST: Paired Confidence Significance Testing for Benchmark Contamination Detection in Large Language Models
par: Zhang, Huixuan, et autres
Publié: (2024)
par: Zhang, Huixuan, et autres
Publié: (2024)
DCR: Quantifying Data Contamination in LLMs Evaluation
par: Xu, Cheng, et autres
Publié: (2025)
par: Xu, Cheng, et autres
Publié: (2025)
Towards Data Contamination Detection for Modern Large Language Models: Limitations, Inconsistencies, and Oracle Challenges
par: Samuel, Vinay, et autres
Publié: (2024)
par: Samuel, Vinay, et autres
Publié: (2024)
Dynamic Benchmarking of Reasoning Capabilities in Code Large Language Models Under Data Contamination
par: Chen, Simin, et autres
Publié: (2025)
par: Chen, Simin, et autres
Publié: (2025)
MMLU-CF: A Contamination-free Multi-task Language Understanding Benchmark
par: Zhao, Qihao, et autres
Publié: (2024)
par: Zhao, Qihao, et autres
Publié: (2024)
A Survey on Data Contamination for Large Language Models
par: Cheng, Yuxing, et autres
Publié: (2025)
par: Cheng, Yuxing, et autres
Publié: (2025)
CAP: Data Contamination Detection via Consistency Amplification
par: Zhao, Yi, et autres
Publié: (2024)
par: Zhao, Yi, et autres
Publié: (2024)
A Taxonomy for Data Contamination in Large Language Models
par: Palavalli, Medha, et autres
Publié: (2024)
par: Palavalli, Medha, et autres
Publié: (2024)
"Mirror" Language AI Models of Depression are Criterion-Contaminated
par: Li, Tong, et autres
Publié: (2025)
par: Li, Tong, et autres
Publié: (2025)
Towards Distillation-Resistant Large Language Models: An Information-Theoretic Perspective
par: Fang, Hao, et autres
Publié: (2026)
par: Fang, Hao, et autres
Publié: (2026)
How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence
par: Choi, Hyeong Kyu, et autres
Publié: (2025)
par: Choi, Hyeong Kyu, et autres
Publié: (2025)
Data Contamination in Neural Hieroglyphic Translation: A Reproducibility Study
par: Toutou, Ammar, et autres
Publié: (2026)
par: Toutou, Ammar, et autres
Publié: (2026)
Emergent Inference-Time Semantic Contamination via In-Context Priming
par: Abram, Marcin
Publié: (2026)
par: Abram, Marcin
Publié: (2026)
Recent Advances in Large Langauge Model Benchmarks against Data Contamination: From Static to Dynamic Evaluation
par: Chen, Simin, et autres
Publié: (2025)
par: Chen, Simin, et autres
Publié: (2025)
ConStat: Performance-Based Contamination Detection in Large Language Models
par: Dekoninck, Jasper, et autres
Publié: (2024)
par: Dekoninck, Jasper, et autres
Publié: (2024)
A Comprehensive Survey of Contamination Detection Methods in Large Language Models
par: Ravaut, Mathieu, et autres
Publié: (2024)
par: Ravaut, Mathieu, et autres
Publié: (2024)
SummExecEdit: A Factual Consistency Benchmark in Summarization with Executable Edits
par: Thorat, Onkar, et autres
Publié: (2024)
par: Thorat, Onkar, et autres
Publié: (2024)
Data Contamination Quiz: A Tool to Detect and Estimate Contamination in Large Language Models
par: Golchin, Shahriar, et autres
Publié: (2023)
par: Golchin, Shahriar, et autres
Publié: (2023)
Quantifying Data Contamination in Psychometric Evaluations of LLMs
par: Han, Jongwook, et autres
Publié: (2025)
par: Han, Jongwook, et autres
Publié: (2025)
StreamBench: Towards Benchmarking Continuous Improvement of Language Agents
par: Wu, Cheng-Kuang, et autres
Publié: (2024)
par: Wu, Cheng-Kuang, et autres
Publié: (2024)
Data Contamination Can Cross Language Barriers
par: Yao, Feng, et autres
Publié: (2024)
par: Yao, Feng, et autres
Publié: (2024)
Documents similaires
-
Contamination Report for Multilingual Benchmarks
par: Ahuja, Sanchit, et autres
Publié: (2024) -
Towards Reliable Benchmarking: A Contamination Free, Controllable Evaluation Framework for Multi-step LLM Function Calling
par: Maekawa, Seiji, et autres
Publié: (2025) -
BeyondBench: Contamination-Resistant Evaluation of Reasoning in Language Models
par: Srivastava, Gaurav, et autres
Publié: (2025) -
Benchmark Data Contamination of Large Language Models: A Survey
par: Xu, Cheng, et autres
Publié: (2024) -
LogitTrace: Detecting Benchmark Contamination via Layerwise Logit Trajectories
par: He, Zirui, et autres
Publié: (2025)