Investigating Data Contamination in Modern Benchmarks for Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Deng, Chunyuan, Zhao, Yilun, Tang, Xiangru, Gerstein, Mark, Cohan, Arman |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MIMIR: A Streamlined Platform for Personalized Agent Tuning in Domain Expertise
por: Deng, Chunyuan, et al.
Publicado: (2024)
por: Deng, Chunyuan, et al.
Publicado: (2024)
MedAgents: Large Language Models as Collaborators for Zero-shot Medical Reasoning
por: Tang, Xiangru, et al.
Publicado: (2023)
por: Tang, Xiangru, et al.
Publicado: (2023)
Unveiling the Spectrum of Data Contamination in Language Models: A Survey from Detection to Remediation
por: Deng, Chunyuan, et al.
Publicado: (2024)
por: Deng, Chunyuan, et al.
Publicado: (2024)
ChemAgent: Self-updating Library in Large Language Models Improves Chemical Reasoning
por: Tang, Xiangru, et al.
Publicado: (2025)
por: Tang, Xiangru, et al.
Publicado: (2025)
Step-Back Profiling: Distilling User History for Personalized Scientific Writing
por: Tang, Xiangru, et al.
Publicado: (2024)
por: Tang, Xiangru, et al.
Publicado: (2024)
Struc-Bench: Are Large Language Models Really Good at Generating Complex Structured Data?
por: Tang, Xiangru, et al.
Publicado: (2023)
por: Tang, Xiangru, et al.
Publicado: (2023)
MedAgentsBench: Benchmarking Thinking Models and Agent Frameworks for Complex Medical Reasoning
por: Tang, Xiangru, et al.
Publicado: (2025)
por: Tang, Xiangru, et al.
Publicado: (2025)
ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain
por: Zhao, Haochen, et al.
Publicado: (2024)
por: Zhao, Haochen, et al.
Publicado: (2024)
BioCoder: A Benchmark for Bioinformatics Code Generation with Large Language Models
por: Tang, Xiangru, et al.
Publicado: (2023)
por: Tang, Xiangru, et al.
Publicado: (2023)
SUCEA: Reasoning-Intensive Retrieval for Adversarial Fact-checking through Claim Decomposition and Editing
por: Liu, Hongjun, et al.
Publicado: (2025)
por: Liu, Hongjun, et al.
Publicado: (2025)
M3SciQA: A Multi-Modal Multi-Document Scientific QA Benchmark for Evaluating Foundation Models
por: Li, Chuhan, et al.
Publicado: (2024)
por: Li, Chuhan, et al.
Publicado: (2024)
ML-Bench: Evaluating Large Language Models and Agents for Machine Learning Tasks on Repository-Level Code
por: Tang, Xiangru, et al.
Publicado: (2023)
por: Tang, Xiangru, et al.
Publicado: (2023)
Risks of AI Scientists: Prioritizing Safeguarding Over Autonomy
por: Tang, Xiangru, et al.
Publicado: (2024)
por: Tang, Xiangru, et al.
Publicado: (2024)
AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research
por: Zhao, Yilun, et al.
Publicado: (2025)
por: Zhao, Yilun, et al.
Publicado: (2025)
PuzzlePlex: Benchmarking Foundation Models on Reasoning and Planning with Puzzles
por: Long, Yitao, et al.
Publicado: (2025)
por: Long, Yitao, et al.
Publicado: (2025)
Towards Data Contamination Detection for Modern Large Language Models: Limitations, Inconsistencies, and Oracle Challenges
por: Samuel, Vinay, et al.
Publicado: (2024)
por: Samuel, Vinay, et al.
Publicado: (2024)
Generalizable Chain-of-Thought Prompting in Mixed-task Scenarios with Large Language Models
por: Zou, Anni, et al.
Publicado: (2023)
por: Zou, Anni, et al.
Publicado: (2023)
Calibrating Long-form Generations from Large Language Models
por: Huang, Yukun, et al.
Publicado: (2024)
por: Huang, Yukun, et al.
Publicado: (2024)
RbtAct: Rebuttal as Supervision for Actionable Review Feedback Generation
por: Wu, Sihong, et al.
Publicado: (2026)
por: Wu, Sihong, et al.
Publicado: (2026)
Evaluating Modern Large Language Models on Low-Resource and Morphologically Rich Languages:A Cross-Lingual Benchmark Across Cantonese, Japanese, and Turkish
por: Xia, Chengxuan, et al.
Publicado: (2025)
por: Xia, Chengxuan, et al.
Publicado: (2025)
On the Benefits of Fine-Grained Loss Truncation: A Case Study on Factuality in Summarization
por: Flores, Lorenzo Jaime Yu, et al.
Publicado: (2024)
por: Flores, Lorenzo Jaime Yu, et al.
Publicado: (2024)
LocAgent: Graph-Guided LLM Agents for Code Localization
por: Chen, Zhaoling, et al.
Publicado: (2025)
por: Chen, Zhaoling, et al.
Publicado: (2025)
SciMDR: Advancing Scientific Multimodal Document Reasoning
por: Chen, Ziyu, et al.
Publicado: (2026)
por: Chen, Ziyu, et al.
Publicado: (2026)
TOMATO: Assessing Visual Temporal Reasoning Capabilities in Multimodal Foundation Models
por: Shangguan, Ziyao, et al.
Publicado: (2024)
por: Shangguan, Ziyao, et al.
Publicado: (2024)
Investigating Data Contamination for Pre-training Language Models
por: Jiang, Minhao, et al.
Publicado: (2024)
por: Jiang, Minhao, et al.
Publicado: (2024)
An Open Source Data Contamination Report for Large Language Models
por: Li, Yucheng, et al.
Publicado: (2023)
por: Li, Yucheng, et al.
Publicado: (2023)
Can AI Be a Good Peer Reviewer? A Survey of Peer Review Process, Evaluation, and the Future
por: Wu, Sihong, et al.
Publicado: (2026)
por: Wu, Sihong, et al.
Publicado: (2026)
Dynamic Benchmarking of Reasoning Capabilities in Code Large Language Models Under Data Contamination
por: Chen, Simin, et al.
Publicado: (2025)
por: Chen, Simin, et al.
Publicado: (2025)
CellForge: Agentic Design of Virtual Cell Models
por: Tang, Xiangru, et al.
Publicado: (2025)
por: Tang, Xiangru, et al.
Publicado: (2025)
Data Contamination Quiz: A Tool to Detect and Estimate Contamination in Large Language Models
por: Golchin, Shahriar, et al.
Publicado: (2023)
por: Golchin, Shahriar, et al.
Publicado: (2023)
Bayesian Calibration of Win Rate Estimation with LLM Evaluators
por: Gao, Yicheng, et al.
Publicado: (2024)
por: Gao, Yicheng, et al.
Publicado: (2024)
On Evaluating LLM Alignment by Evaluating LLMs as Judges
por: Liu, Yixin, et al.
Publicado: (2025)
por: Liu, Yixin, et al.
Publicado: (2025)
PaCoST: Paired Confidence Significance Testing for Benchmark Contamination Detection in Large Language Models
por: Zhang, Huixuan, et al.
Publicado: (2024)
por: Zhang, Huixuan, et al.
Publicado: (2024)
Measuring what Matters: Construct Validity in Large Language Model Benchmarks
por: Bean, Andrew M., et al.
Publicado: (2025)
por: Bean, Andrew M., et al.
Publicado: (2025)
AdEval: Alignment-based Dynamic Evaluation to Mitigate Data Contamination in Large Language Models
por: Fan, Yang
Publicado: (2025)
por: Fan, Yang
Publicado: (2025)
Sensitivity of Small Language Models to Fine-tuning Data Contamination
por: Scaria, Nicy, et al.
Publicado: (2025)
por: Scaria, Nicy, et al.
Publicado: (2025)
ChatCell: Facilitating Single-Cell Analysis with Natural Language
por: Fang, Yin, et al.
Publicado: (2024)
por: Fang, Yin, et al.
Publicado: (2024)
Evaluating Legal Reasoning Traces with Legal Issue Tree Rubrics
por: Lee, Jinu, et al.
Publicado: (2025)
por: Lee, Jinu, et al.
Publicado: (2025)
IRIS: Interactive Research Ideation System for Accelerating Scientific Discovery
por: Garikaparthi, Aniketh, et al.
Publicado: (2025)
por: Garikaparthi, Aniketh, et al.
Publicado: (2025)
HumanEval Pro and MBPP Pro: Evaluating Large Language Models on Self-invoking Code Generation
por: Yu, Zhaojian, et al.
Publicado: (2024)
por: Yu, Zhaojian, et al.
Publicado: (2024)
Ejemplares similares
-
MIMIR: A Streamlined Platform for Personalized Agent Tuning in Domain Expertise
por: Deng, Chunyuan, et al.
Publicado: (2024) -
MedAgents: Large Language Models as Collaborators for Zero-shot Medical Reasoning
por: Tang, Xiangru, et al.
Publicado: (2023) -
Unveiling the Spectrum of Data Contamination in Language Models: A Survey from Detection to Remediation
por: Deng, Chunyuan, et al.
Publicado: (2024) -
ChemAgent: Self-updating Library in Large Language Models Improves Chemical Reasoning
por: Tang, Xiangru, et al.
Publicado: (2025) -
Step-Back Profiling: Distilling User History for Personalized Scientific Writing
por: Tang, Xiangru, et al.
Publicado: (2024)