Automating Dataset Updates Towards Reliable and Timely Evaluation of Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Ying, Jiahao, Cao, Yixin, Bai, Yushi, Sun, Qianru, Wang, Bo, Tang, Wei, Ding, Zhaojun, Yang, Yizhe, Huang, Xuanjing, Yan, Shuicheng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LLMs-as-Instructors: Learning from Errors Toward Automating Model Improvement
por: Ying, Jiahao, et al.
Publicado: (2024)
por: Ying, Jiahao, et al.
Publicado: (2024)
Beyond Benchmarks: Understanding Mixture-of-Experts Models through Internal Mechanisms
por: Ying, Jiahao, et al.
Publicado: (2025)
por: Ying, Jiahao, et al.
Publicado: (2025)
EvoWiki: Evaluating LLMs on Evolving Knowledge
por: Tang, Wei, et al.
Publicado: (2024)
por: Tang, Wei, et al.
Publicado: (2024)
Disentangling Language and Culture for Evaluating Multilingual Large Language Models
por: Ying, Jiahao, et al.
Publicado: (2025)
por: Ying, Jiahao, et al.
Publicado: (2025)
xFinder: Large Language Models as Automated Evaluators for Reliable Evaluation
por: Yu, Qingchen, et al.
Publicado: (2024)
por: Yu, Qingchen, et al.
Publicado: (2024)
Model Utility Law: Evaluating LLMs beyond Performance through Mechanism Interpretable Metric
por: Cao, Yixin, et al.
Publicado: (2025)
por: Cao, Yixin, et al.
Publicado: (2025)
WaterBench: Towards Holistic Evaluation of Watermarks for Large Language Models
por: Tu, Shangqing, et al.
Publicado: (2023)
por: Tu, Shangqing, et al.
Publicado: (2023)
Video Anomaly Detection and Explanation via Large Language Models
por: Lv, Hui, et al.
Publicado: (2024)
por: Lv, Hui, et al.
Publicado: (2024)
Are Large Language Models Useful for Time Series Data Analysis?
por: Tang, Francis, et al.
Publicado: (2024)
por: Tang, Francis, et al.
Publicado: (2024)
AutoSCORE: Enhancing Automated Scoring with Multi-Agent Large Language Models via Structured Component Recognition
por: Wang, Yun, et al.
Publicado: (2025)
por: Wang, Yun, et al.
Publicado: (2025)
ReleaseEval: A Benchmark for Evaluating Language Models in Automated Release Note Generation
por: Meng, Qianru, et al.
Publicado: (2025)
por: Meng, Qianru, et al.
Publicado: (2025)
QRMeM: Unleash the Length Limitation through Question then Reflection Memory Mechanism
por: Wang, Bo, et al.
Publicado: (2024)
por: Wang, Bo, et al.
Publicado: (2024)
Optimization Hyper-parameter Laws for Large Language Models
por: Xie, Xingyu, et al.
Publicado: (2024)
por: Xie, Xingyu, et al.
Publicado: (2024)
EffiEval: Efficient and Generalizable Model Evaluation via Capability Coverage Maximization
por: Wang, Yaoning, et al.
Publicado: (2025)
por: Wang, Yaoning, et al.
Publicado: (2025)
Do They Understand Them? An Updated Evaluation on Nonbinary Pronoun Handling in Large Language Models
por: Tang, Xushuo, et al.
Publicado: (2025)
por: Tang, Xushuo, et al.
Publicado: (2025)
MedBench: A Comprehensive, Standardized, and Reliable Benchmarking System for Evaluating Chinese Medical Large Language Models
por: Liu, Mianxin, et al.
Publicado: (2024)
por: Liu, Mianxin, et al.
Publicado: (2024)
Evaluating the Reliability and Fidelity of Automated Judgment Systems of Large Language Models
por: Biskupski, Tom, et al.
Publicado: (2026)
por: Biskupski, Tom, et al.
Publicado: (2026)
ColorGPT: Leveraging Large Language Models for Multimodal Color Recommendation
por: Xia, Ding, et al.
Publicado: (2025)
por: Xia, Ding, et al.
Publicado: (2025)
KGLens: Towards Efficient and Effective Knowledge Probing of Large Language Models with Knowledge Graphs
por: Zheng, Shangshang, et al.
Publicado: (2023)
por: Zheng, Shangshang, et al.
Publicado: (2023)
A + B: A General Generator-Reader Framework for Optimizing LLMs to Unleash Synergy Potential
por: Tang, Wei, et al.
Publicado: (2024)
por: Tang, Wei, et al.
Publicado: (2024)
Watermarking Text Data on Large Language Models for Dataset Copyright
por: Liu, Yixin, et al.
Publicado: (2023)
por: Liu, Yixin, et al.
Publicado: (2023)
Toward Generalizable Evaluation in the LLM Era: A Survey Beyond Benchmarks
por: Cao, Yixin, et al.
Publicado: (2025)
por: Cao, Yixin, et al.
Publicado: (2025)
Electron Tunneling Enhances Thermal Conductance through Metal-Insulator-Semiconductor Junctions
por: Liu, Yizhe, et al.
Publicado: (2025)
por: Liu, Yizhe, et al.
Publicado: (2025)
Advancing Reliable Test-Time Adaptation of Vision-Language Models under Visual Variations
por: Liang, Yiwen, et al.
Publicado: (2025)
por: Liang, Yiwen, et al.
Publicado: (2025)
AutoLogi: Automated Generation of Logic Puzzles for Evaluating Reasoning Abilities of Large Language Models
por: Zhu, Qin, et al.
Publicado: (2025)
por: Zhu, Qin, et al.
Publicado: (2025)
Inference-Time Decontamination: Reusing Leaked Benchmarks for Large Language Model Evaluation
por: Zhu, Qin, et al.
Publicado: (2024)
por: Zhu, Qin, et al.
Publicado: (2024)
Benchmarking Automated Clinical Language Simplification: Dataset, Algorithm, and Evaluation
por: Luo, Junyu, et al.
Publicado: (2020)
por: Luo, Junyu, et al.
Publicado: (2020)
REVAL: A Comprehension Evaluation on Reliability and Values of Large Vision-Language Models
por: Zhang, Jie, et al.
Publicado: (2025)
por: Zhang, Jie, et al.
Publicado: (2025)
OntoURL: A Benchmark for Evaluating Large Language Models on Symbolic Ontological Understanding, Reasoning and Learning
por: Zhang, Xiao, et al.
Publicado: (2025)
por: Zhang, Xiao, et al.
Publicado: (2025)
Towards Reliable Retrieval in RAG Systems for Large Legal Datasets
por: Reuter, Markus, et al.
Publicado: (2025)
por: Reuter, Markus, et al.
Publicado: (2025)
MM-MATH: Advancing Multimodal Math Evaluation with Process Evaluation and Fine-grained Classification
por: Sun, Kai, et al.
Publicado: (2024)
por: Sun, Kai, et al.
Publicado: (2024)
Quantifying and Mitigating Unimodal Biases in Multimodal Large Language Models: A Causal Perspective
por: Chen, Meiqi, et al.
Publicado: (2024)
por: Chen, Meiqi, et al.
Publicado: (2024)
AutoHall: Automated Factuality Hallucination Dataset Generation for Large Language Models
por: Cao, Zouying, et al.
Publicado: (2023)
por: Cao, Zouying, et al.
Publicado: (2023)
Reinforcement Learning from Diverse Human Preferences
por: Xue, Wanqi, et al.
Publicado: (2023)
por: Xue, Wanqi, et al.
Publicado: (2023)
FRABench and UFEval: Unified Fine-grained Evaluation with Task and Aspect Generalization
por: Hong, Shibo, et al.
Publicado: (2025)
por: Hong, Shibo, et al.
Publicado: (2025)
KnowledgeBerg: Evaluating Systematic Knowledge Coverage and Compositional Reasoning in Large Language Models
por: Zhang, Xiao, et al.
Publicado: (2026)
por: Zhang, Xiao, et al.
Publicado: (2026)
Towards Better Answers: Automated Stack Overflow Post Updating
por: Mai, Yubo, et al.
Publicado: (2024)
por: Mai, Yubo, et al.
Publicado: (2024)
ARISE: An Adaptive Resolution-Aware Metric for Test-Time Scaling Evaluation in Large Reasoning Models
por: Yin, Zhangyue, et al.
Publicado: (2025)
por: Yin, Zhangyue, et al.
Publicado: (2025)
S-Eval: Towards Automated and Comprehensive Safety Evaluation for Large Language Models
por: Yuan, Xiaohan, et al.
Publicado: (2024)
por: Yuan, Xiaohan, et al.
Publicado: (2024)
Towards Reliable Large Audio Language Model
por: Ma, Ziyang, et al.
Publicado: (2025)
por: Ma, Ziyang, et al.
Publicado: (2025)
Ejemplares similares
-
LLMs-as-Instructors: Learning from Errors Toward Automating Model Improvement
por: Ying, Jiahao, et al.
Publicado: (2024) -
Beyond Benchmarks: Understanding Mixture-of-Experts Models through Internal Mechanisms
por: Ying, Jiahao, et al.
Publicado: (2025) -
EvoWiki: Evaluating LLMs on Evolving Knowledge
por: Tang, Wei, et al.
Publicado: (2024) -
Disentangling Language and Culture for Evaluating Multilingual Large Language Models
por: Ying, Jiahao, et al.
Publicado: (2025) -
xFinder: Large Language Models as Automated Evaluators for Reliable Evaluation
por: Yu, Qingchen, et al.
Publicado: (2024)