CLEAN-EVAL: Clean Evaluation on Contaminated Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Zhu, Wenhong, Hao, Hongkun, He, Zhiwei, Song, Yunze, Zhang, Yumeng, Hu, Hanxu, Wei, Yiran, Wang, Rui, Lu, Hongyuan |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Clean Evaluations on Contaminated Visual Language Models
by: Lu, Hongyuan, et al.
Published: (2024)
by: Lu, Hongyuan, et al.
Published: (2024)
LNE-Blocking: An Efficient Framework for Contamination Mitigation Evaluation on Large Language Models
by: Hou, Ruijie, et al.
Published: (2025)
by: Hou, Ruijie, et al.
Published: (2025)
Improving Open-Ended Text Generation via Adaptive Decoding
by: Zhu, Wenhong, et al.
Published: (2024)
by: Zhu, Wenhong, et al.
Published: (2024)
Is Self-knowledge and Action Consistent or Not: Investigating Large Language Model's Personality
by: Ai, Yiming, et al.
Published: (2024)
by: Ai, Yiming, et al.
Published: (2024)
AC-EVAL: Evaluating Ancient Chinese Language Understanding in Large Language Models
by: Wei, Yuting, et al.
Published: (2024)
by: Wei, Yuting, et al.
Published: (2024)
Chain-of-Symbol Prompting Elicits Planning in Large Langauge Models
by: Hu, Hanxu, et al.
Published: (2023)
by: Hu, Hanxu, et al.
Published: (2023)
VALOR-EVAL: Holistic Coverage and Faithfulness Evaluation of Large Vision-Language Models
by: Qiu, Haoyi, et al.
Published: (2024)
by: Qiu, Haoyi, et al.
Published: (2024)
BenchMAX: A Comprehensive Multilingual Evaluation Suite for Large Language Models
by: Huang, Xu, et al.
Published: (2025)
by: Huang, Xu, et al.
Published: (2025)
E-EVAL: A Comprehensive Chinese K-12 Education Evaluation Benchmark for Large Language Models
by: Hou, Jinchang, et al.
Published: (2024)
by: Hou, Jinchang, et al.
Published: (2024)
WTU-EVAL: A Whether-or-Not Tool Usage Evaluation Benchmark for Large Language Models
by: Ning, Kangyun, et al.
Published: (2024)
by: Ning, Kangyun, et al.
Published: (2024)
Weak-to-Strong Preference Optimization: Stealing Reward from Weak Aligned Model
by: Zhu, Wenhong, et al.
Published: (2024)
by: Zhu, Wenhong, et al.
Published: (2024)
Do Large Language Models Truly Understand Geometric Structures?
by: Wang, Xiaofeng, et al.
Published: (2025)
by: Wang, Xiaofeng, et al.
Published: (2025)
Adding Alignment Control to Language Models
by: Zhu, Wenhong, et al.
Published: (2025)
by: Zhu, Wenhong, et al.
Published: (2025)
Can Watermarks Survive Translation? On the Cross-lingual Consistency of Text Watermark for Large Language Models
by: He, Zhiwei, et al.
Published: (2024)
by: He, Zhiwei, et al.
Published: (2024)
Source-primed Multi-turn Conversation Helps Large Language Models Translate Documents
by: Hu, Hanxu, et al.
Published: (2025)
by: Hu, Hanxu, et al.
Published: (2025)
Unveiling the Generalization Power of Fine-Tuned Large Language Models
by: Yang, Haoran, et al.
Published: (2024)
by: Yang, Haoran, et al.
Published: (2024)
Boosting Large Language Model for Speech Synthesis: An Empirical Study
by: Hao, Hongkun, et al.
Published: (2023)
by: Hao, Hongkun, et al.
Published: (2023)
Fine-tuning Large Language Models with Sequential Instructions
by: Hu, Hanxu, et al.
Published: (2024)
by: Hu, Hanxu, et al.
Published: (2024)
IQA-EVAL: Automatic Evaluation of Human-Model Interactive Question Answering
by: Li, Ruosen, et al.
Published: (2024)
by: Li, Ruosen, et al.
Published: (2024)
Flexible Realignment of Language Models
by: Zhu, Wenhong, et al.
Published: (2025)
by: Zhu, Wenhong, et al.
Published: (2025)
Evaluating Knowledge-based Cross-lingual Inconsistency in Large Language Models
by: Xing, Xiaolin, et al.
Published: (2024)
by: Xing, Xiaolin, et al.
Published: (2024)
Dictionary Insertion Prompting for Multilingual Reasoning on Multilingual Large Language Models
by: Lu, Hongyuan, et al.
Published: (2024)
by: Lu, Hongyuan, et al.
Published: (2024)
Saving the legacy of Hero Ibash: Evaluating Four Language Models for Aminoacian
by: Xiao, Yunze, et al.
Published: (2024)
by: Xiao, Yunze, et al.
Published: (2024)
Disentangling Language and Culture for Evaluating Multilingual Large Language Models
by: Ying, Jiahao, et al.
Published: (2025)
by: Ying, Jiahao, et al.
Published: (2025)
CPG-EVAL: A Multi-Tiered Benchmark for Evaluating the Chinese Pedagogical Grammar Competence of Large Language Models
by: Wang, Dong
Published: (2025)
by: Wang, Dong
Published: (2025)
Stephanie: Step-by-Step Dialogues for Mimicking Human Interactions in Social Conversations
by: Yang, Hao, et al.
Published: (2024)
by: Yang, Hao, et al.
Published: (2024)
Chain-of-Dictionary Prompting Elicits Translation in Large Language Models
by: Lu, Hongyuan, et al.
Published: (2023)
by: Lu, Hongyuan, et al.
Published: (2023)
RALLRec: Improving Retrieval Augmented Large Language Model Recommendation with Representation Learning
by: Xu, Jian, et al.
Published: (2025)
by: Xu, Jian, et al.
Published: (2025)
Multiple-Choice Questions are Efficient and Robust LLM Evaluators
by: Zhang, Ziyin, et al.
Published: (2024)
by: Zhang, Ziyin, et al.
Published: (2024)
Lossless Acceleration of Large Language Model via Adaptive N-gram Parallel Decoding
by: Ou, Jie, et al.
Published: (2024)
by: Ou, Jie, et al.
Published: (2024)
Distribution Corrected Offline Data Distillation for Large Language Models
by: Zhang, Yumeng, et al.
Published: (2026)
by: Zhang, Yumeng, et al.
Published: (2026)
Large Language Model as Token Compressor and Decompressor
by: Li, Wenbing, et al.
Published: (2026)
by: Li, Wenbing, et al.
Published: (2026)
SLoW: Select Low-frequency Words! Automatic Dictionary Selection for Translation on Large Language Models
by: Lu, Hongyuan, et al.
Published: (2025)
by: Lu, Hongyuan, et al.
Published: (2025)
Optimizing Psychological Counseling with Instruction-Tuned Large Language Models
by: Li, Wenjie, et al.
Published: (2024)
by: Li, Wenjie, et al.
Published: (2024)
MathClean: A Benchmark for Synthetic Mathematical Data Cleaning
by: Liang, Hao, et al.
Published: (2025)
by: Liang, Hao, et al.
Published: (2025)
Interweaving Memories of a Siamese Large Language Model
by: Song, Xin, et al.
Published: (2024)
by: Song, Xin, et al.
Published: (2024)
A Taxonomy for Data Contamination in Large Language Models
by: Palavalli, Medha, et al.
Published: (2024)
by: Palavalli, Medha, et al.
Published: (2024)
A Survey on Data Contamination for Large Language Models
by: Cheng, Yuxing, et al.
Published: (2025)
by: Cheng, Yuxing, et al.
Published: (2025)
Adaptable and Reliable Text Classification using Large Language Models
by: Wang, Zhiqiang, et al.
Published: (2024)
by: Wang, Zhiqiang, et al.
Published: (2024)
TCMD: A Traditional Chinese Medicine QA Dataset for Evaluating Large Language Models
by: Yu, Ping, et al.
Published: (2024)
by: Yu, Ping, et al.
Published: (2024)
Similar Items
-
Clean Evaluations on Contaminated Visual Language Models
by: Lu, Hongyuan, et al.
Published: (2024) -
LNE-Blocking: An Efficient Framework for Contamination Mitigation Evaluation on Large Language Models
by: Hou, Ruijie, et al.
Published: (2025) -
Improving Open-Ended Text Generation via Adaptive Decoding
by: Zhu, Wenhong, et al.
Published: (2024) -
Is Self-knowledge and Action Consistent or Not: Investigating Large Language Model's Personality
by: Ai, Yiming, et al.
Published: (2024) -
AC-EVAL: Evaluating Ancient Chinese Language Understanding in Large Language Models
by: Wei, Yuting, et al.
Published: (2024)