ConStat: Performance-Based Contamination Detection in Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Dekoninck, Jasper, Müller, Mark Niklas, Vechev, Martin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Evading Data Contamination Detection for Language Models is (too) Easy
por: Dekoninck, Jasper, et al.
Publicado: (2024)
por: Dekoninck, Jasper, et al.
Publicado: (2024)
A Unified Approach to Routing and Cascading for LLMs
por: Dekoninck, Jasper, et al.
Publicado: (2024)
por: Dekoninck, Jasper, et al.
Publicado: (2024)
Learning from Saturated Data: Signals Beyond Correctness for LLM Training
por: Hiss, Hanno, et al.
Publicado: (2026)
por: Hiss, Hanno, et al.
Publicado: (2026)
Controlled Text Generation via Language Model Arithmetic
por: Dekoninck, Jasper, et al.
Publicado: (2023)
por: Dekoninck, Jasper, et al.
Publicado: (2023)
Polyrating: A Cost-Effective and Bias-Aware Rating System for LLM Evaluation
por: Dekoninck, Jasper, et al.
Publicado: (2024)
por: Dekoninck, Jasper, et al.
Publicado: (2024)
BrokenMath: A Benchmark for Sycophancy in Theorem Proving with LLMs
por: Petrov, Ivo, et al.
Publicado: (2025)
por: Petrov, Ivo, et al.
Publicado: (2025)
Not All Proofs Are Equal: Evaluating LLM Proof Quality Beyond Correctness
por: Petrov, Ivo, et al.
Publicado: (2026)
por: Petrov, Ivo, et al.
Publicado: (2026)
Constrained Decoding of Diffusion LLMs with Context-Free Grammars
por: Mündler, Niels, et al.
Publicado: (2025)
por: Mündler, Niels, et al.
Publicado: (2025)
MathArena: Evaluating LLMs on Uncontaminated Math Competitions
por: Balunović, Mislav, et al.
Publicado: (2025)
por: Balunović, Mislav, et al.
Publicado: (2025)
Beyond Benchmarks: MathArena as an Evaluation Platform for Mathematics with LLMs
por: Dekoninck, Jasper, et al.
Publicado: (2026)
por: Dekoninck, Jasper, et al.
Publicado: (2026)
Proof or Bluff? Evaluating LLMs on 2025 USA Math Olympiad
por: Petrov, Ivo, et al.
Publicado: (2025)
por: Petrov, Ivo, et al.
Publicado: (2025)
Large Language Models are Advanced Anonymizers
por: Staab, Robin, et al.
Publicado: (2024)
por: Staab, Robin, et al.
Publicado: (2024)
Self-contradictory Hallucinations of Large Language Models: Evaluation, Detection and Mitigation
por: Mündler, Niels, et al.
Publicado: (2023)
por: Mündler, Niels, et al.
Publicado: (2023)
Adaptive Generation of Bias-Eliciting Questions for LLMs
por: Staab, Robin, et al.
Publicado: (2025)
por: Staab, Robin, et al.
Publicado: (2025)
StatEval: A Comprehensive Benchmark for Large Language Models in Statistics
por: Lu, Yuchen, et al.
Publicado: (2025)
por: Lu, Yuchen, et al.
Publicado: (2025)
A Comprehensive Survey of Contamination Detection Methods in Large Language Models
por: Ravaut, Mathieu, et al.
Publicado: (2024)
por: Ravaut, Mathieu, et al.
Publicado: (2024)
Investigating Data Contamination in Modern Benchmarks for Large Language Models
por: Deng, Chunyuan, et al.
Publicado: (2023)
por: Deng, Chunyuan, et al.
Publicado: (2023)
Data Contamination Quiz: A Tool to Detect and Estimate Contamination in Large Language Models
por: Golchin, Shahriar, et al.
Publicado: (2023)
por: Golchin, Shahriar, et al.
Publicado: (2023)
ConInstruct: Evaluating Large Language Models on Conflict Detection and Resolution in Instructions
por: He, Xingwei, et al.
Publicado: (2025)
por: He, Xingwei, et al.
Publicado: (2025)
A Taxonomy for Data Contamination in Large Language Models
por: Palavalli, Medha, et al.
Publicado: (2024)
por: Palavalli, Medha, et al.
Publicado: (2024)
A Survey on Data Contamination for Large Language Models
por: Cheng, Yuxing, et al.
Publicado: (2025)
por: Cheng, Yuxing, et al.
Publicado: (2025)
Facts in Stats: Impacts of Pretraining Diversity on Language Model Generalization
por: Behnia, Tina, et al.
Publicado: (2025)
por: Behnia, Tina, et al.
Publicado: (2025)
DAGER: Exact Gradient Inversion for Large Language Models
por: Petrov, Ivo, et al.
Publicado: (2024)
por: Petrov, Ivo, et al.
Publicado: (2024)
Large Language Models for Code: Security Hardening and Adversarial Testing
por: He, Jingxuan, et al.
Publicado: (2023)
por: He, Jingxuan, et al.
Publicado: (2023)
Benchmark Data Contamination of Large Language Models: A Survey
por: Xu, Cheng, et al.
Publicado: (2024)
por: Xu, Cheng, et al.
Publicado: (2024)
CLEAN-EVAL: Clean Evaluation on Contaminated Large Language Models
por: Zhu, Wenhong, et al.
Publicado: (2023)
por: Zhu, Wenhong, et al.
Publicado: (2023)
Diagnosing Robotics Systems Issues with Large Language Models
por: Herrmann, Jordis Emilia, et al.
Publicado: (2024)
por: Herrmann, Jordis Emilia, et al.
Publicado: (2024)
The Open Proof Corpus: A Large-Scale Study of LLM-Generated Mathematical Proofs
por: Dekoninck, Jasper, et al.
Publicado: (2025)
por: Dekoninck, Jasper, et al.
Publicado: (2025)
StatBot.Swiss: Bilingual Open Data Exploration in Natural Language
por: Nooralahzadeh, Farhad, et al.
Publicado: (2024)
por: Nooralahzadeh, Farhad, et al.
Publicado: (2024)
ConExion: Concept Extraction with Large Language Models
por: Norouzi, Ebrahim, et al.
Publicado: (2025)
por: Norouzi, Ebrahim, et al.
Publicado: (2025)
Towards Data Contamination Detection for Modern Large Language Models: Limitations, Inconsistencies, and Oracle Challenges
por: Samuel, Vinay, et al.
Publicado: (2024)
por: Samuel, Vinay, et al.
Publicado: (2024)
LNE-Blocking: An Efficient Framework for Contamination Mitigation Evaluation on Large Language Models
por: Hou, Ruijie, et al.
Publicado: (2025)
por: Hou, Ruijie, et al.
Publicado: (2025)
An Open Source Data Contamination Report for Large Language Models
por: Li, Yucheng, et al.
Publicado: (2023)
por: Li, Yucheng, et al.
Publicado: (2023)
Detecting Data Contamination from Reinforcement Learning Post-training for Large Language Models
por: Tao, Yongding, et al.
Publicado: (2025)
por: Tao, Yongding, et al.
Publicado: (2025)
PaCoST: Paired Confidence Significance Testing for Benchmark Contamination Detection in Large Language Models
por: Zhang, Huixuan, et al.
Publicado: (2024)
por: Zhang, Huixuan, et al.
Publicado: (2024)
Automated Classification of Model Errors on ImageNet
por: Peychev, Momchil, et al.
Publicado: (2023)
por: Peychev, Momchil, et al.
Publicado: (2023)
A Synthetic Dataset for Personal Attribute Inference
por: Yukhymenko, Hanna, et al.
Publicado: (2024)
por: Yukhymenko, Hanna, et al.
Publicado: (2024)
Unveiling the Spectrum of Data Contamination in Language Models: A Survey from Detection to Remediation
por: Deng, Chunyuan, et al.
Publicado: (2024)
por: Deng, Chunyuan, et al.
Publicado: (2024)
ConKE: Conceptualization-Augmented Knowledge Editing in Large Language Models for Commonsense Reasoning
por: Zhang, Liyu, et al.
Publicado: (2024)
por: Zhang, Liyu, et al.
Publicado: (2024)
Investigating the Impact of Data Contamination of Large Language Models in Text-to-SQL Translation
por: Ranaldi, Federico, et al.
Publicado: (2024)
por: Ranaldi, Federico, et al.
Publicado: (2024)
Ejemplares similares
-
Evading Data Contamination Detection for Language Models is (too) Easy
por: Dekoninck, Jasper, et al.
Publicado: (2024) -
A Unified Approach to Routing and Cascading for LLMs
por: Dekoninck, Jasper, et al.
Publicado: (2024) -
Learning from Saturated Data: Signals Beyond Correctness for LLM Training
por: Hiss, Hanno, et al.
Publicado: (2026) -
Controlled Text Generation via Language Model Arithmetic
por: Dekoninck, Jasper, et al.
Publicado: (2023) -
Polyrating: A Cost-Effective and Bias-Aware Rating System for LLM Evaluation
por: Dekoninck, Jasper, et al.
Publicado: (2024)