AdEval: Alignment-based Dynamic Evaluation to Mitigate Data Contamination in Large Language Models
Fuente:
arXiv
Salvato in:
| Autore principale: | Fan, Yang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LatestEval: Addressing Data Contamination in Language Model Evaluation through Dynamic and Time-Sensitive Test Construction
di: Li, Yucheng, et al.
Pubblicazione: (2023)
di: Li, Yucheng, et al.
Pubblicazione: (2023)
EvalMORAAL: Interpretable Chain-of-Thought and LLM-as-Judge Evaluation for Moral Alignment in Large Language Models
di: Mohammadi, Hadi, et al.
Pubblicazione: (2025)
di: Mohammadi, Hadi, et al.
Pubblicazione: (2025)
CriticEval: Evaluating Large Language Model as Critic
di: Lan, Tian, et al.
Pubblicazione: (2024)
di: Lan, Tian, et al.
Pubblicazione: (2024)
TreeEval: Benchmark-Free Evaluation of Large Language Models through Tree Planning
di: Li, Xiang, et al.
Pubblicazione: (2024)
di: Li, Xiang, et al.
Pubblicazione: (2024)
FedEval-LLM: Federated Evaluation of Large Language Models on Downstream Tasks with Collective Wisdom
di: He, Yuanqin, et al.
Pubblicazione: (2024)
di: He, Yuanqin, et al.
Pubblicazione: (2024)
An Open Source Data Contamination Report for Large Language Models
di: Li, Yucheng, et al.
Pubblicazione: (2023)
di: Li, Yucheng, et al.
Pubblicazione: (2023)
Investigating Data Contamination in Modern Benchmarks for Large Language Models
di: Deng, Chunyuan, et al.
Pubblicazione: (2023)
di: Deng, Chunyuan, et al.
Pubblicazione: (2023)
Likelihood-based Mitigation of Evaluation Bias in Large Language Models
di: Oi, Masanari, et al.
Pubblicazione: (2024)
di: Oi, Masanari, et al.
Pubblicazione: (2024)
LexInstructEval: Lexical Instruction Following Evaluation for Large Language Models
di: Ren, Huimin, et al.
Pubblicazione: (2025)
di: Ren, Huimin, et al.
Pubblicazione: (2025)
WalledEval: A Comprehensive Safety Evaluation Toolkit for Large Language Models
di: Gupta, Prannaya, et al.
Pubblicazione: (2024)
di: Gupta, Prannaya, et al.
Pubblicazione: (2024)
CMoralEval: A Moral Evaluation Benchmark for Chinese Large Language Models
di: Yu, Linhao, et al.
Pubblicazione: (2024)
di: Yu, Linhao, et al.
Pubblicazione: (2024)
Data Contamination Quiz: A Tool to Detect and Estimate Contamination in Large Language Models
di: Golchin, Shahriar, et al.
Pubblicazione: (2023)
di: Golchin, Shahriar, et al.
Pubblicazione: (2023)
Dynamic Benchmarking of Reasoning Capabilities in Code Large Language Models Under Data Contamination
di: Chen, Simin, et al.
Pubblicazione: (2025)
di: Chen, Simin, et al.
Pubblicazione: (2025)
FreeEval: A Modular Framework for Trustworthy and Efficient Evaluation of Large Language Models
di: Yu, Zhuohao, et al.
Pubblicazione: (2024)
di: Yu, Zhuohao, et al.
Pubblicazione: (2024)
IndicEval: A Bilingual Indian Educational Evaluation Framework for Large Language Models
di: Bharti, Saurabh, et al.
Pubblicazione: (2026)
di: Bharti, Saurabh, et al.
Pubblicazione: (2026)
ViLLM-Eval: A Comprehensive Evaluation Suite for Vietnamese Large Language Models
di: Nguyen, Trong-Hieu, et al.
Pubblicazione: (2024)
di: Nguyen, Trong-Hieu, et al.
Pubblicazione: (2024)
The Heap: A Contamination-Free Multilingual Code Dataset for Evaluating Large Language Models
di: Katzy, Jonathan, et al.
Pubblicazione: (2025)
di: Katzy, Jonathan, et al.
Pubblicazione: (2025)
GenderAlign: An Alignment Dataset for Mitigating Gender Bias in Large Language Models
di: Zhang, Tao, et al.
Pubblicazione: (2024)
di: Zhang, Tao, et al.
Pubblicazione: (2024)
EpiK-Eval: Evaluation for Language Models as Epistemic Models
di: Prato, Gabriele, et al.
Pubblicazione: (2023)
di: Prato, Gabriele, et al.
Pubblicazione: (2023)
Generalization or Memorization: Data Contamination and Trustworthy Evaluation for Large Language Models
di: Dong, Yihong, et al.
Pubblicazione: (2024)
di: Dong, Yihong, et al.
Pubblicazione: (2024)
EduEval: A Hierarchical Cognitive Benchmark for Evaluating Large Language Models in Chinese Education
di: Ma, Guoqing, et al.
Pubblicazione: (2025)
di: Ma, Guoqing, et al.
Pubblicazione: (2025)
StrucText-Eval: Evaluating Large Language Model's Reasoning Ability in Structure-Rich Text
di: Gu, Zhouhong, et al.
Pubblicazione: (2024)
di: Gu, Zhouhong, et al.
Pubblicazione: (2024)
Unveiling Trust in Multimodal Large Language Models: Evaluation, Analysis, and Mitigation
di: Zhang, Yichi, et al.
Pubblicazione: (2025)
di: Zhang, Yichi, et al.
Pubblicazione: (2025)
Recent Advances in Large Langauge Model Benchmarks against Data Contamination: From Static to Dynamic Evaluation
di: Chen, Simin, et al.
Pubblicazione: (2025)
di: Chen, Simin, et al.
Pubblicazione: (2025)
NPHardEval: Dynamic Benchmark on Reasoning Ability of Large Language Models via Complexity Classes
di: Fan, Lizhou, et al.
Pubblicazione: (2023)
di: Fan, Lizhou, et al.
Pubblicazione: (2023)
Towards Data Contamination Detection for Modern Large Language Models: Limitations, Inconsistencies, and Oracle Challenges
di: Samuel, Vinay, et al.
Pubblicazione: (2024)
di: Samuel, Vinay, et al.
Pubblicazione: (2024)
MTQ-Eval: Multilingual Text Quality Evaluation for Language Models
di: Pokharel, Rhitabrat, et al.
Pubblicazione: (2025)
di: Pokharel, Rhitabrat, et al.
Pubblicazione: (2025)
Alignment Tuning for Large Language Models: A Data-Centric Lens on Alignment Data Pipelines
di: Song, Hwanjun
Pubblicazione: (2026)
di: Song, Hwanjun
Pubblicazione: (2026)
CoreEval: Automatically Building Contamination-Resilient Datasets with Real-World Knowledge toward Reliable LLM Evaluation
di: Zhao, Jingqian, et al.
Pubblicazione: (2025)
di: Zhao, Jingqian, et al.
Pubblicazione: (2025)
Data Advisor: Dynamic Data Curation for Safety Alignment of Large Language Models
di: Wang, Fei, et al.
Pubblicazione: (2024)
di: Wang, Fei, et al.
Pubblicazione: (2024)
BenHalluEval: A Multi-Task Hallucination Evaluation Framework for Large Language Models on Bengali
di: Adib, Shefayat E Shams, et al.
Pubblicazione: (2026)
di: Adib, Shefayat E Shams, et al.
Pubblicazione: (2026)
R-Eval: A Unified Toolkit for Evaluating Domain Knowledge of Retrieval Augmented Large Language Models
di: Tu, Shangqing, et al.
Pubblicazione: (2024)
di: Tu, Shangqing, et al.
Pubblicazione: (2024)
Multi-LogiEval: Towards Evaluating Multi-Step Logical Reasoning Ability of Large Language Models
di: Patel, Nisarg, et al.
Pubblicazione: (2024)
di: Patel, Nisarg, et al.
Pubblicazione: (2024)
Hal-Eval: A Universal and Fine-grained Hallucination Evaluation Framework for Large Vision Language Models
di: Jiang, Chaoya, et al.
Pubblicazione: (2024)
di: Jiang, Chaoya, et al.
Pubblicazione: (2024)
Sensitivity of Small Language Models to Fine-tuning Data Contamination
di: Scaria, Nicy, et al.
Pubblicazione: (2025)
di: Scaria, Nicy, et al.
Pubblicazione: (2025)
ArxEval: Evaluating Retrieval and Generation in Language Models for Scientific Literature
di: Sinha, Aarush, et al.
Pubblicazione: (2025)
di: Sinha, Aarush, et al.
Pubblicazione: (2025)
SciSafeEval: A Comprehensive Benchmark for Safety Alignment of Large Language Models in Scientific Tasks
di: Li, Tianhao, et al.
Pubblicazione: (2024)
di: Li, Tianhao, et al.
Pubblicazione: (2024)
MHSafeEval: Role-Aware Interaction-Level Evaluation of Mental Health Safety in Large Language Models
di: Lee, Suhyun, et al.
Pubblicazione: (2026)
di: Lee, Suhyun, et al.
Pubblicazione: (2026)
Moral Persuasion in Large Language Models: Evaluating Susceptibility and Ethical Alignment
di: Huang, Allison, et al.
Pubblicazione: (2024)
di: Huang, Allison, et al.
Pubblicazione: (2024)
Data Contamination Can Cross Language Barriers
di: Yao, Feng, et al.
Pubblicazione: (2024)
di: Yao, Feng, et al.
Pubblicazione: (2024)
Documenti analoghi
-
LatestEval: Addressing Data Contamination in Language Model Evaluation through Dynamic and Time-Sensitive Test Construction
di: Li, Yucheng, et al.
Pubblicazione: (2023) -
EvalMORAAL: Interpretable Chain-of-Thought and LLM-as-Judge Evaluation for Moral Alignment in Large Language Models
di: Mohammadi, Hadi, et al.
Pubblicazione: (2025) -
CriticEval: Evaluating Large Language Model as Critic
di: Lan, Tian, et al.
Pubblicazione: (2024) -
TreeEval: Benchmark-Free Evaluation of Large Language Models through Tree Planning
di: Li, Xiang, et al.
Pubblicazione: (2024) -
FedEval-LLM: Federated Evaluation of Large Language Models on Downstream Tasks with Collective Wisdom
di: He, Yuanqin, et al.
Pubblicazione: (2024)