PaCoST: Paired Confidence Significance Testing for Benchmark Contamination Detection in Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Huixuan, Lin, Yun, Wan, Xiaojun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Exploring and Evaluating Multimodal Knowledge Reasoning Consistency of Multimodal Large Language Models
por: Jia, Boyu, et al.
Publicado: (2025)
por: Jia, Boyu, et al.
Publicado: (2025)
Image Matters: A New Dataset and Empirical Study for Multimodal Hyperbole Detection
por: Zhang, Huixuan, et al.
Publicado: (2023)
por: Zhang, Huixuan, et al.
Publicado: (2023)
Re-Thinking the Automatic Evaluation of Image-Text Alignment in Text-to-Image Models
por: Zhang, Huixuan, et al.
Publicado: (2025)
por: Zhang, Huixuan, et al.
Publicado: (2025)
How Much To Guide: Revisiting Adaptive Guidance in Classifier-Free Guidance Text-to-Vision Diffusion Models
por: Zhang, Huixuan, et al.
Publicado: (2025)
por: Zhang, Huixuan, et al.
Publicado: (2025)
ICR Probe: Tracking Hidden State Dynamics for Reliable Hallucination Detection in LLMs
por: Zhang, Zhenliang, et al.
Publicado: (2025)
por: Zhang, Zhenliang, et al.
Publicado: (2025)
C-FAITH: A Chinese Fine-Grained Benchmark for Automated Hallucination Evaluation
por: Zhang, Xu, et al.
Publicado: (2025)
por: Zhang, Xu, et al.
Publicado: (2025)
Silicon Bureaucracy and AI Test-Oriented Education: Contamination Sensitivity and Score Confidence in LLM Benchmarks
por: Song, Yiliang, et al.
Publicado: (2026)
por: Song, Yiliang, et al.
Publicado: (2026)
UniAIDet: A Unified and Universal Benchmark for AI-Generated Image Content Detection and Localization
por: Zhang, Huixuan, et al.
Publicado: (2025)
por: Zhang, Huixuan, et al.
Publicado: (2025)
Investigating Data Contamination in Modern Benchmarks for Large Language Models
por: Deng, Chunyuan, et al.
Publicado: (2023)
por: Deng, Chunyuan, et al.
Publicado: (2023)
M$^{3}$T2IBench: A Large-Scale Multi-Category, Multi-Instance, Multi-Relation Text-to-Image Benchmark
por: Zhang, Huixuan, et al.
Publicado: (2025)
por: Zhang, Huixuan, et al.
Publicado: (2025)
MINOS: A Multimodal Evaluation Model for Bidirectional Generation Between Image and Text
por: Zhang, Junzhe, et al.
Publicado: (2025)
por: Zhang, Junzhe, et al.
Publicado: (2025)
Quantity Matters: Towards Assessing and Mitigating Number Hallucination in Large Vision-Language Models
por: Zhang, Huixuan, et al.
Publicado: (2024)
por: Zhang, Huixuan, et al.
Publicado: (2024)
An Open Source Data Contamination Report for Large Language Models
por: Li, Yucheng, et al.
Publicado: (2023)
por: Li, Yucheng, et al.
Publicado: (2023)
Data Contamination Quiz: A Tool to Detect and Estimate Contamination in Large Language Models
por: Golchin, Shahriar, et al.
Publicado: (2023)
por: Golchin, Shahriar, et al.
Publicado: (2023)
DSGram: Dynamic Weighting Sub-Metrics for Grammatical Error Correction in the Era of Large Language Models
por: Xie, Jinxiang, et al.
Publicado: (2024)
por: Xie, Jinxiang, et al.
Publicado: (2024)
Towards Data Contamination Detection for Modern Large Language Models: Limitations, Inconsistencies, and Oracle Challenges
por: Samuel, Vinay, et al.
Publicado: (2024)
por: Samuel, Vinay, et al.
Publicado: (2024)
LatestEval: Addressing Data Contamination in Language Model Evaluation through Dynamic and Time-Sensitive Test Construction
por: Li, Yucheng, et al.
Publicado: (2023)
por: Li, Yucheng, et al.
Publicado: (2023)
Analyzing Cognitive Differences Among Large Language Models through the Lens of Social Worldview
por: Li, Jiatao, et al.
Publicado: (2025)
por: Li, Jiatao, et al.
Publicado: (2025)
Dynamic Benchmarking of Reasoning Capabilities in Code Large Language Models Under Data Contamination
por: Chen, Simin, et al.
Publicado: (2025)
por: Chen, Simin, et al.
Publicado: (2025)
Detecting Data Contamination from Reinforcement Learning Post-training for Large Language Models
por: Tao, Yongding, et al.
Publicado: (2025)
por: Tao, Yongding, et al.
Publicado: (2025)
When Quantization Affects Confidence of Large Language Models?
por: Proskurina, Irina, et al.
Publicado: (2024)
por: Proskurina, Irina, et al.
Publicado: (2024)
Closing the Confidence-Faithfulness Gap in Large Language Models
por: Miao, Miranda Muqing, et al.
Publicado: (2026)
por: Miao, Miranda Muqing, et al.
Publicado: (2026)
PaDeLLM-NER: Parallel Decoding in Large Language Models for Named Entity Recognition
por: Lu, Jinghui, et al.
Publicado: (2024)
por: Lu, Jinghui, et al.
Publicado: (2024)
Confidence Matters: Revisiting Intrinsic Self-Correction Capabilities of Large Language Models
por: Li, Loka, et al.
Publicado: (2024)
por: Li, Loka, et al.
Publicado: (2024)
ProFuser: Progressive Fusion of Large Language Models
por: Shi, Tianyuan, et al.
Publicado: (2024)
por: Shi, Tianyuan, et al.
Publicado: (2024)
How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence
por: Choi, Hyeong Kyu, et al.
Publicado: (2025)
por: Choi, Hyeong Kyu, et al.
Publicado: (2025)
A Survey of Confidence Estimation and Calibration in Large Language Models
por: Geng, Jiahui, et al.
Publicado: (2023)
por: Geng, Jiahui, et al.
Publicado: (2023)
SQL-PaLM: Improved Large Language Model Adaptation for Text-to-SQL (extended)
por: Sun, Ruoxi, et al.
Publicado: (2023)
por: Sun, Ruoxi, et al.
Publicado: (2023)
AD-LLM: Benchmarking Large Language Models for Anomaly Detection
por: Yang, Tiankai, et al.
Publicado: (2024)
por: Yang, Tiankai, et al.
Publicado: (2024)
KBE-DME: Dynamic Multimodal Evaluation via Knowledge Enhanced Benchmark Evolution
por: Zhang, Junzhe, et al.
Publicado: (2025)
por: Zhang, Junzhe, et al.
Publicado: (2025)
Confidence-Calibrated Small-Large Language Model Collaboration for Cost-Efficient Reasoning
por: Zhang, Chuang, et al.
Publicado: (2026)
por: Zhang, Chuang, et al.
Publicado: (2026)
CoRefine: Confidence-Guided Self-Refinement for Adaptive Test-Time Compute
por: Jin, Chen, et al.
Publicado: (2026)
por: Jin, Chen, et al.
Publicado: (2026)
Clickbait Detection via Large Language Models
por: Wang, Han, et al.
Publicado: (2023)
por: Wang, Han, et al.
Publicado: (2023)
Recent Advances in Large Langauge Model Benchmarks against Data Contamination: From Static to Dynamic Evaluation
por: Chen, Simin, et al.
Publicado: (2025)
por: Chen, Simin, et al.
Publicado: (2025)
MoZIP: A Multilingual Benchmark to Evaluate Large Language Models in Intellectual Property
por: Ni, Shiwen, et al.
Publicado: (2024)
por: Ni, Shiwen, et al.
Publicado: (2024)
Beyond Facts: Benchmarking Distributional Reading Comprehension in Large Language Models
por: Guo, Pei-Fu, et al.
Publicado: (2026)
por: Guo, Pei-Fu, et al.
Publicado: (2026)
STOP! Benchmarking Large Language Models with Sensitivity Testing on Offensive Progressions
por: Morabito, Robert, et al.
Publicado: (2024)
por: Morabito, Robert, et al.
Publicado: (2024)
LACIE: Listener-Aware Finetuning for Confidence Calibration in Large Language Models
por: Stengel-Eskin, Elias, et al.
Publicado: (2024)
por: Stengel-Eskin, Elias, et al.
Publicado: (2024)
Multi-Perspective Consistency Enhances Confidence Estimation in Large Language Models
por: Wang, Pei, et al.
Publicado: (2024)
por: Wang, Pei, et al.
Publicado: (2024)
ConfTuner: Training Large Language Models to Express Their Confidence Verbally
por: Li, Yibo, et al.
Publicado: (2025)
por: Li, Yibo, et al.
Publicado: (2025)
Ejemplares similares
-
Exploring and Evaluating Multimodal Knowledge Reasoning Consistency of Multimodal Large Language Models
por: Jia, Boyu, et al.
Publicado: (2025) -
Image Matters: A New Dataset and Empirical Study for Multimodal Hyperbole Detection
por: Zhang, Huixuan, et al.
Publicado: (2023) -
Re-Thinking the Automatic Evaluation of Image-Text Alignment in Text-to-Image Models
por: Zhang, Huixuan, et al.
Publicado: (2025) -
How Much To Guide: Revisiting Adaptive Guidance in Classifier-Free Guidance Text-to-Vision Diffusion Models
por: Zhang, Huixuan, et al.
Publicado: (2025) -
ICR Probe: Tracking Hidden State Dynamics for Reliable Hallucination Detection in LLMs
por: Zhang, Zhenliang, et al.
Publicado: (2025)