Beyond Benchmarking: A New Paradigm for Evaluation and Assessment of Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Jin, Li, Qingquan, Du, Wenlong |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
League of LLMs: A Benchmark-Free Paradigm for Mutual Evaluation of Large Language Models
par: Guo, Qianhong, et autres
Publié: (2025)
par: Guo, Qianhong, et autres
Publié: (2025)
OOP: Object-Oriented Programming Evaluation Benchmark for Large Language Models
par: Wang, Shuai, et autres
Publié: (2024)
par: Wang, Shuai, et autres
Publié: (2024)
LHMKE: A Large-scale Holistic Multi-subject Knowledge Evaluation Benchmark for Chinese Large Language Models
par: Liu, Chuang, et autres
Publié: (2024)
par: Liu, Chuang, et autres
Publié: (2024)
Ethical Considerations of Large Language Models in Game Playing
par: Zhang, Qingquan, et autres
Publié: (2025)
par: Zhang, Qingquan, et autres
Publié: (2025)
From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation
par: Sibaee, Serry, et autres
Publié: (2025)
par: Sibaee, Serry, et autres
Publié: (2025)
A Paradigm Shift: The Future of Machine Translation Lies with Large Language Models
par: Lyu, Chenyang, et autres
Publié: (2023)
par: Lyu, Chenyang, et autres
Publié: (2023)
JMedEthicBench: A Multi-Turn Conversational Benchmark for Evaluating Medical Safety in Japanese Large Language Models
par: Liu, Junyu, et autres
Publié: (2026)
par: Liu, Junyu, et autres
Publié: (2026)
FinDABench: Benchmarking Financial Data Analysis Ability of Large Language Models
par: Liu, Shu, et autres
Publié: (2024)
par: Liu, Shu, et autres
Publié: (2024)
UrbanPlanBench: A Comprehensive Urban Planning Benchmark for Evaluating Large Language Models
par: Zheng, Yu, et autres
Publié: (2025)
par: Zheng, Yu, et autres
Publié: (2025)
The GaoYao Benchmark: A Comprehensive Framework for Evaluating Multilingual and Multicultural Abilities of Large Language Models
par: Liu, Yilun, et autres
Publié: (2026)
par: Liu, Yilun, et autres
Publié: (2026)
LexEval: A Comprehensive Chinese Legal Benchmark for Evaluating Large Language Models
par: Li, Haitao, et autres
Publié: (2024)
par: Li, Haitao, et autres
Publié: (2024)
A Paradigm Shift in Machine Translation: Boosting Translation Performance of Large Language Models
par: Xu, Haoran, et autres
Publié: (2023)
par: Xu, Haoran, et autres
Publié: (2023)
Evaluating Large Language Models on Spatial Tasks: A Multi-Task Benchmarking Study
par: Xu, Liuchang, et autres
Publié: (2024)
par: Xu, Liuchang, et autres
Publié: (2024)
Thinking with Nothinking Calibration: A New In-Context Learning Paradigm in Reasoning Large Language Models
par: Wu, Haotian, et autres
Publié: (2025)
par: Wu, Haotian, et autres
Publié: (2025)
FineMath: A Fine-Grained Mathematical Evaluation Benchmark for Chinese Large Language Models
par: Liu, Yan, et autres
Publié: (2024)
par: Liu, Yan, et autres
Publié: (2024)
McBE: A Multi-task Chinese Bias Evaluation Benchmark for Large Language Models
par: Lan, Tian, et autres
Publié: (2025)
par: Lan, Tian, et autres
Publié: (2025)
Risk Taxonomy, Mitigation, and Assessment Benchmarks of Large Language Model Systems
par: Cui, Tianyu, et autres
Publié: (2024)
par: Cui, Tianyu, et autres
Publié: (2024)
OMGEval: An Open Multilingual Generative Evaluation Benchmark for Large Language Models
par: Liu, Yang, et autres
Publié: (2024)
par: Liu, Yang, et autres
Publié: (2024)
CMQCIC-Bench: A Chinese Benchmark for Evaluating Large Language Models in Medical Quality Control Indicator Calculation
par: Yu, Guangya, et autres
Publié: (2025)
par: Yu, Guangya, et autres
Publié: (2025)
EmotionQueen: A Benchmark for Evaluating Empathy of Large Language Models
par: Chen, Yuyan, et autres
Publié: (2024)
par: Chen, Yuyan, et autres
Publié: (2024)
A Comprehensive Evaluation of Quantization Strategies for Large Language Models
par: Jin, Renren, et autres
Publié: (2024)
par: Jin, Renren, et autres
Publié: (2024)
WorldValuesBench: A Large-Scale Benchmark Dataset for Multi-Cultural Value Awareness of Language Models
par: Zhao, Wenlong, et autres
Publié: (2024)
par: Zhao, Wenlong, et autres
Publié: (2024)
Beyond Social Pressure: Benchmarking Epistemic Attack in Large Language Models
par: Au, Steven, et autres
Publié: (2026)
par: Au, Steven, et autres
Publié: (2026)
A Novel Paradigm Boosting Translation Capabilities of Large Language Models
par: Guo, Jiaxin, et autres
Publié: (2024)
par: Guo, Jiaxin, et autres
Publié: (2024)
RoleEval: A Bilingual Role Evaluation Benchmark for Large Language Models
par: Shen, Tianhao, et autres
Publié: (2023)
par: Shen, Tianhao, et autres
Publié: (2023)
Exploring Accuracy-Fairness Trade-off in Large Language Models
par: Zhang, Qingquan, et autres
Publié: (2024)
par: Zhang, Qingquan, et autres
Publié: (2024)
Inference-Time Decontamination: Reusing Leaked Benchmarks for Large Language Model Evaluation
par: Zhu, Qin, et autres
Publié: (2024)
par: Zhu, Qin, et autres
Publié: (2024)
MT-Eval: A Multi-Turn Capabilities Evaluation Benchmark for Large Language Models
par: Kwan, Wai-Chung, et autres
Publié: (2024)
par: Kwan, Wai-Chung, et autres
Publié: (2024)
MMLU-ProX: A Multilingual Benchmark for Advanced Large Language Model Evaluation
par: Xuan, Weihao, et autres
Publié: (2025)
par: Xuan, Weihao, et autres
Publié: (2025)
Beyond Instrumental and Substitutive Paradigms: Introducing Machine Culture as an Emergent Phenomenon in Large Language Models
par: Hu, Yueqing, et autres
Publié: (2026)
par: Hu, Yueqing, et autres
Publié: (2026)
A Survey of State of the Art Large Vision Language Models: Alignment, Benchmark, Evaluations and Challenges
par: Li, Zongxia, et autres
Publié: (2025)
par: Li, Zongxia, et autres
Publié: (2025)
CodeApex: A Bilingual Programming Evaluation Benchmark for Large Language Models
par: Fu, Lingyue, et autres
Publié: (2023)
par: Fu, Lingyue, et autres
Publié: (2023)
NewTerm: Benchmarking Real-Time New Terms for Large Language Models with Annual Updates
par: Deng, Hexuan, et autres
Publié: (2024)
par: Deng, Hexuan, et autres
Publié: (2024)
Evaluating the Performance of Large Language Models on GAOKAO Benchmark
par: Zhang, Xiaotian, et autres
Publié: (2023)
par: Zhang, Xiaotian, et autres
Publié: (2023)
New Evaluation Paradigm for Lexical Simplification
par: Qiang, Jipeng, et autres
Publié: (2025)
par: Qiang, Jipeng, et autres
Publié: (2025)
Beyond Probabilities: Unveiling the Misalignment in Evaluating Large Language Models
par: Lyu, Chenyang, et autres
Publié: (2024)
par: Lyu, Chenyang, et autres
Publié: (2024)
Beyond Prompts: Dynamic Conversational Benchmarking of Large Language Models
par: Castillo-Bolado, David, et autres
Publié: (2024)
par: Castillo-Bolado, David, et autres
Publié: (2024)
Pedestrian Attribute Recognition: A New Benchmark Dataset and A Large Language Model Augmented Framework
par: Jin, Jiandong, et autres
Publié: (2024)
par: Jin, Jiandong, et autres
Publié: (2024)
BAMBOO: A Comprehensive Benchmark for Evaluating Long Text Modeling Capacities of Large Language Models
par: Dong, Zican, et autres
Publié: (2023)
par: Dong, Zican, et autres
Publié: (2023)
STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Models
par: Chen, Kai, et autres
Publié: (2025)
par: Chen, Kai, et autres
Publié: (2025)
Documents similaires
-
League of LLMs: A Benchmark-Free Paradigm for Mutual Evaluation of Large Language Models
par: Guo, Qianhong, et autres
Publié: (2025) -
OOP: Object-Oriented Programming Evaluation Benchmark for Large Language Models
par: Wang, Shuai, et autres
Publié: (2024) -
LHMKE: A Large-scale Holistic Multi-subject Knowledge Evaluation Benchmark for Chinese Large Language Models
par: Liu, Chuang, et autres
Publié: (2024) -
Ethical Considerations of Large Language Models in Game Playing
par: Zhang, Qingquan, et autres
Publié: (2025) -
From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation
par: Sibaee, Serry, et autres
Publié: (2025)