Automating Dataset Updates Towards Reliable and Timely Evaluation of Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Ying, Jiahao, Cao, Yixin, Bai, Yushi, Sun, Qianru, Wang, Bo, Tang, Wei, Ding, Zhaojun, Yang, Yizhe, Huang, Xuanjing, Yan, Shuicheng |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
LLMs-as-Instructors: Learning from Errors Toward Automating Model Improvement
by: Ying, Jiahao, et al.
Published: (2024)
by: Ying, Jiahao, et al.
Published: (2024)
Beyond Benchmarks: Understanding Mixture-of-Experts Models through Internal Mechanisms
by: Ying, Jiahao, et al.
Published: (2025)
by: Ying, Jiahao, et al.
Published: (2025)
EvoWiki: Evaluating LLMs on Evolving Knowledge
by: Tang, Wei, et al.
Published: (2024)
by: Tang, Wei, et al.
Published: (2024)
Disentangling Language and Culture for Evaluating Multilingual Large Language Models
by: Ying, Jiahao, et al.
Published: (2025)
by: Ying, Jiahao, et al.
Published: (2025)
xFinder: Large Language Models as Automated Evaluators for Reliable Evaluation
by: Yu, Qingchen, et al.
Published: (2024)
by: Yu, Qingchen, et al.
Published: (2024)
Model Utility Law: Evaluating LLMs beyond Performance through Mechanism Interpretable Metric
by: Cao, Yixin, et al.
Published: (2025)
by: Cao, Yixin, et al.
Published: (2025)
WaterBench: Towards Holistic Evaluation of Watermarks for Large Language Models
by: Tu, Shangqing, et al.
Published: (2023)
by: Tu, Shangqing, et al.
Published: (2023)
Video Anomaly Detection and Explanation via Large Language Models
by: Lv, Hui, et al.
Published: (2024)
by: Lv, Hui, et al.
Published: (2024)
Are Large Language Models Useful for Time Series Data Analysis?
by: Tang, Francis, et al.
Published: (2024)
by: Tang, Francis, et al.
Published: (2024)
AutoSCORE: Enhancing Automated Scoring with Multi-Agent Large Language Models via Structured Component Recognition
by: Wang, Yun, et al.
Published: (2025)
by: Wang, Yun, et al.
Published: (2025)
ReleaseEval: A Benchmark for Evaluating Language Models in Automated Release Note Generation
by: Meng, Qianru, et al.
Published: (2025)
by: Meng, Qianru, et al.
Published: (2025)
QRMeM: Unleash the Length Limitation through Question then Reflection Memory Mechanism
by: Wang, Bo, et al.
Published: (2024)
by: Wang, Bo, et al.
Published: (2024)
Optimization Hyper-parameter Laws for Large Language Models
by: Xie, Xingyu, et al.
Published: (2024)
by: Xie, Xingyu, et al.
Published: (2024)
EffiEval: Efficient and Generalizable Model Evaluation via Capability Coverage Maximization
by: Wang, Yaoning, et al.
Published: (2025)
by: Wang, Yaoning, et al.
Published: (2025)
Do They Understand Them? An Updated Evaluation on Nonbinary Pronoun Handling in Large Language Models
by: Tang, Xushuo, et al.
Published: (2025)
by: Tang, Xushuo, et al.
Published: (2025)
MedBench: A Comprehensive, Standardized, and Reliable Benchmarking System for Evaluating Chinese Medical Large Language Models
by: Liu, Mianxin, et al.
Published: (2024)
by: Liu, Mianxin, et al.
Published: (2024)
Evaluating the Reliability and Fidelity of Automated Judgment Systems of Large Language Models
by: Biskupski, Tom, et al.
Published: (2026)
by: Biskupski, Tom, et al.
Published: (2026)
ColorGPT: Leveraging Large Language Models for Multimodal Color Recommendation
by: Xia, Ding, et al.
Published: (2025)
by: Xia, Ding, et al.
Published: (2025)
KGLens: Towards Efficient and Effective Knowledge Probing of Large Language Models with Knowledge Graphs
by: Zheng, Shangshang, et al.
Published: (2023)
by: Zheng, Shangshang, et al.
Published: (2023)
A + B: A General Generator-Reader Framework for Optimizing LLMs to Unleash Synergy Potential
by: Tang, Wei, et al.
Published: (2024)
by: Tang, Wei, et al.
Published: (2024)
Watermarking Text Data on Large Language Models for Dataset Copyright
by: Liu, Yixin, et al.
Published: (2023)
by: Liu, Yixin, et al.
Published: (2023)
Toward Generalizable Evaluation in the LLM Era: A Survey Beyond Benchmarks
by: Cao, Yixin, et al.
Published: (2025)
by: Cao, Yixin, et al.
Published: (2025)
Electron Tunneling Enhances Thermal Conductance through Metal-Insulator-Semiconductor Junctions
by: Liu, Yizhe, et al.
Published: (2025)
by: Liu, Yizhe, et al.
Published: (2025)
Advancing Reliable Test-Time Adaptation of Vision-Language Models under Visual Variations
by: Liang, Yiwen, et al.
Published: (2025)
by: Liang, Yiwen, et al.
Published: (2025)
AutoLogi: Automated Generation of Logic Puzzles for Evaluating Reasoning Abilities of Large Language Models
by: Zhu, Qin, et al.
Published: (2025)
by: Zhu, Qin, et al.
Published: (2025)
Inference-Time Decontamination: Reusing Leaked Benchmarks for Large Language Model Evaluation
by: Zhu, Qin, et al.
Published: (2024)
by: Zhu, Qin, et al.
Published: (2024)
Benchmarking Automated Clinical Language Simplification: Dataset, Algorithm, and Evaluation
by: Luo, Junyu, et al.
Published: (2020)
by: Luo, Junyu, et al.
Published: (2020)
REVAL: A Comprehension Evaluation on Reliability and Values of Large Vision-Language Models
by: Zhang, Jie, et al.
Published: (2025)
by: Zhang, Jie, et al.
Published: (2025)
OntoURL: A Benchmark for Evaluating Large Language Models on Symbolic Ontological Understanding, Reasoning and Learning
by: Zhang, Xiao, et al.
Published: (2025)
by: Zhang, Xiao, et al.
Published: (2025)
Towards Reliable Retrieval in RAG Systems for Large Legal Datasets
by: Reuter, Markus, et al.
Published: (2025)
by: Reuter, Markus, et al.
Published: (2025)
MM-MATH: Advancing Multimodal Math Evaluation with Process Evaluation and Fine-grained Classification
by: Sun, Kai, et al.
Published: (2024)
by: Sun, Kai, et al.
Published: (2024)
Quantifying and Mitigating Unimodal Biases in Multimodal Large Language Models: A Causal Perspective
by: Chen, Meiqi, et al.
Published: (2024)
by: Chen, Meiqi, et al.
Published: (2024)
AutoHall: Automated Factuality Hallucination Dataset Generation for Large Language Models
by: Cao, Zouying, et al.
Published: (2023)
by: Cao, Zouying, et al.
Published: (2023)
Reinforcement Learning from Diverse Human Preferences
by: Xue, Wanqi, et al.
Published: (2023)
by: Xue, Wanqi, et al.
Published: (2023)
FRABench and UFEval: Unified Fine-grained Evaluation with Task and Aspect Generalization
by: Hong, Shibo, et al.
Published: (2025)
by: Hong, Shibo, et al.
Published: (2025)
KnowledgeBerg: Evaluating Systematic Knowledge Coverage and Compositional Reasoning in Large Language Models
by: Zhang, Xiao, et al.
Published: (2026)
by: Zhang, Xiao, et al.
Published: (2026)
Towards Better Answers: Automated Stack Overflow Post Updating
by: Mai, Yubo, et al.
Published: (2024)
by: Mai, Yubo, et al.
Published: (2024)
ARISE: An Adaptive Resolution-Aware Metric for Test-Time Scaling Evaluation in Large Reasoning Models
by: Yin, Zhangyue, et al.
Published: (2025)
by: Yin, Zhangyue, et al.
Published: (2025)
S-Eval: Towards Automated and Comprehensive Safety Evaluation for Large Language Models
by: Yuan, Xiaohan, et al.
Published: (2024)
by: Yuan, Xiaohan, et al.
Published: (2024)
Towards Reliable Large Audio Language Model
by: Ma, Ziyang, et al.
Published: (2025)
by: Ma, Ziyang, et al.
Published: (2025)
Similar Items
-
LLMs-as-Instructors: Learning from Errors Toward Automating Model Improvement
by: Ying, Jiahao, et al.
Published: (2024) -
Beyond Benchmarks: Understanding Mixture-of-Experts Models through Internal Mechanisms
by: Ying, Jiahao, et al.
Published: (2025) -
EvoWiki: Evaluating LLMs on Evolving Knowledge
by: Tang, Wei, et al.
Published: (2024) -
Disentangling Language and Culture for Evaluating Multilingual Large Language Models
by: Ying, Jiahao, et al.
Published: (2025) -
xFinder: Large Language Models as Automated Evaluators for Reliable Evaluation
by: Yu, Qingchen, et al.
Published: (2024)