An Empirical Analysis of Uncertainty in Large Language Model Evaluations
Fuente:
arXiv
Salvato in:
| Autori principali: | Xie, Qiujie, Li, Qingqiu, Yu, Zhuohao, Zhang, Yuejie, Zhang, Yue, Yang, Linyi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Supervised Knowledge Makes Large Language Models Better In-context Learners
di: Yang, Linyi, et al.
Pubblicazione: (2023)
di: Yang, Linyi, et al.
Pubblicazione: (2023)
KIEval: A Knowledge-grounded Interactive Evaluation Framework for Large Language Models
di: Yu, Zhuohao, et al.
Pubblicazione: (2024)
di: Yu, Zhuohao, et al.
Pubblicazione: (2024)
FreeEval: A Modular Framework for Trustworthy and Efficient Evaluation of Large Language Models
di: Yu, Zhuohao, et al.
Pubblicazione: (2024)
di: Yu, Zhuohao, et al.
Pubblicazione: (2024)
AI Scientists Fail Without Strong Implementation Capability
di: Zhu, Minjun, et al.
Pubblicazione: (2025)
di: Zhu, Minjun, et al.
Pubblicazione: (2025)
PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization
di: Wang, Yidong, et al.
Pubblicazione: (2023)
di: Wang, Yidong, et al.
Pubblicazione: (2023)
A Survey on Evaluation of Large Language Models
di: Chang, Yupeng, et al.
Pubblicazione: (2023)
di: Chang, Yupeng, et al.
Pubblicazione: (2023)
An Empirical Analysis on Large Language Models in Debate Evaluation
di: Liu, Xinyi, et al.
Pubblicazione: (2024)
di: Liu, Xinyi, et al.
Pubblicazione: (2024)
Induction Head Toxicity Mechanistically Explains Repetition Curse in Large Language Models
di: Wang, Shuxun, et al.
Pubblicazione: (2025)
di: Wang, Shuxun, et al.
Pubblicazione: (2025)
CulturePark: Boosting Cross-cultural Understanding in Large Language Models
di: Li, Cheng, et al.
Pubblicazione: (2024)
di: Li, Cheng, et al.
Pubblicazione: (2024)
An Empirical Study on Prompt Compression for Large Language Models
di: Zhang, Zheng, et al.
Pubblicazione: (2025)
di: Zhang, Zheng, et al.
Pubblicazione: (2025)
Evaluating Large Language Models on Financial Report Summarization: An Empirical Study
di: Yang, Xinqi, et al.
Pubblicazione: (2024)
di: Yang, Xinqi, et al.
Pubblicazione: (2024)
Empirical Analysis of Dialogue Relation Extraction with Large Language Models
di: Li, Guozheng, et al.
Pubblicazione: (2024)
di: Li, Guozheng, et al.
Pubblicazione: (2024)
Evaluating Large Language Models for Abstract Evaluation Tasks: An Empirical Study
di: Liu, Yinuo, et al.
Pubblicazione: (2026)
di: Liu, Yinuo, et al.
Pubblicazione: (2026)
RefuteBench: Evaluating Refuting Instruction-Following for Large Language Models
di: Yan, Jianhao, et al.
Pubblicazione: (2024)
di: Yan, Jianhao, et al.
Pubblicazione: (2024)
An Empirical Evaluation of Large Language Models on Consumer Health Questions
di: Abrar, Moaiz, et al.
Pubblicazione: (2024)
di: Abrar, Moaiz, et al.
Pubblicazione: (2024)
A Comprehensive Evaluation of Large Language Models on Aspect-Based Sentiment Analysis
di: Zhou, Changzhi, et al.
Pubblicazione: (2024)
di: Zhou, Changzhi, et al.
Pubblicazione: (2024)
GLoRE: Evaluating Logical Reasoning of Large Language Models
di: liu, Hanmeng, et al.
Pubblicazione: (2023)
di: liu, Hanmeng, et al.
Pubblicazione: (2023)
Evaluating Uncertainty Quantification Methods in Argumentative Large Language Models
di: Zhou, Kevin, et al.
Pubblicazione: (2025)
di: Zhou, Kevin, et al.
Pubblicazione: (2025)
Latent Trajectory Dynamics in Large Language Models: A Manifold Evolution Framework with Empirical Validation
di: Zhang, Yukun, et al.
Pubblicazione: (2025)
di: Zhang, Yukun, et al.
Pubblicazione: (2025)
Gradients with Respect to Semantics Preserving Embeddings Tell the Uncertainty of Large Language Models
di: Li, Mingda, et al.
Pubblicazione: (2026)
di: Li, Mingda, et al.
Pubblicazione: (2026)
Direct Value Optimization: Improving Chain-of-Thought Reasoning in LLMs with Refined Values
di: Zhang, Hongbo, et al.
Pubblicazione: (2025)
di: Zhang, Hongbo, et al.
Pubblicazione: (2025)
An Evaluation of Estimative Uncertainty in Large Language Models
di: Tang, Zhisheng, et al.
Pubblicazione: (2024)
di: Tang, Zhisheng, et al.
Pubblicazione: (2024)
Uncertainty Estimation of Large Language Models in Medical Question Answering
di: Wu, Jiaxin, et al.
Pubblicazione: (2024)
di: Wu, Jiaxin, et al.
Pubblicazione: (2024)
LIFEBench: Evaluating Length Instruction Following in Large Language Models
di: Zhang, Wei, et al.
Pubblicazione: (2025)
di: Zhang, Wei, et al.
Pubblicazione: (2025)
SPUQ: Perturbation-Based Uncertainty Quantification for Large Language Models
di: Gao, Xiang, et al.
Pubblicazione: (2024)
di: Gao, Xiang, et al.
Pubblicazione: (2024)
DynaCode: A Dynamic Complexity-Aware Code Benchmark for Evaluating Large Language Models in Code Generation
di: Hu, Wenhao, et al.
Pubblicazione: (2025)
di: Hu, Wenhao, et al.
Pubblicazione: (2025)
Evaluating Quantized Large Language Models
di: Li, Shiyao, et al.
Pubblicazione: (2024)
di: Li, Shiyao, et al.
Pubblicazione: (2024)
SConU: Selective Conformal Uncertainty in Large Language Models
di: Wang, Zhiyuan, et al.
Pubblicazione: (2025)
di: Wang, Zhiyuan, et al.
Pubblicazione: (2025)
Unveiling Trust in Multimodal Large Language Models: Evaluation, Analysis, and Mitigation
di: Zhang, Yichi, et al.
Pubblicazione: (2025)
di: Zhang, Yichi, et al.
Pubblicazione: (2025)
Uncertainty Quantification in Large Language Models Through Convex Hull Analysis
di: Catak, Ferhat Ozgur, et al.
Pubblicazione: (2024)
di: Catak, Ferhat Ozgur, et al.
Pubblicazione: (2024)
Evaluating and Improving Robustness in Large Language Models: A Survey and Future Directions
di: Zhang, Kun, et al.
Pubblicazione: (2025)
di: Zhang, Kun, et al.
Pubblicazione: (2025)
Break the Chain: Large Language Models Can be Shortcut Reasoners
di: Ding, Mengru, et al.
Pubblicazione: (2024)
di: Ding, Mengru, et al.
Pubblicazione: (2024)
Probing the "Psyche'' of Large Reasoning Models: Understanding Through a Human Lens
di: Chen, Yuxiang, et al.
Pubblicazione: (2025)
di: Chen, Yuxiang, et al.
Pubblicazione: (2025)
Dissecting Failure Dynamics in Large Language Model Reasoning
di: Zhu, Wei, et al.
Pubblicazione: (2026)
di: Zhu, Wei, et al.
Pubblicazione: (2026)
How Likely Do LLMs with CoT Mimic Human Reasoning?
di: Bao, Guangsheng, et al.
Pubblicazione: (2024)
di: Bao, Guangsheng, et al.
Pubblicazione: (2024)
Harnessing the Power of Large Language Models for Empathetic Response Generation: Empirical Investigations and Improvements
di: Qian, Yushan, et al.
Pubblicazione: (2023)
di: Qian, Yushan, et al.
Pubblicazione: (2023)
Sentient Agent as a Judge: Evaluating Higher-Order Social Cognition in Large Language Models
di: Zhang, Bang, et al.
Pubblicazione: (2025)
di: Zhang, Bang, et al.
Pubblicazione: (2025)
R-Eval: A Unified Toolkit for Evaluating Domain Knowledge of Retrieval Augmented Large Language Models
di: Tu, Shangqing, et al.
Pubblicazione: (2024)
di: Tu, Shangqing, et al.
Pubblicazione: (2024)
Quantized Large Language Models in Biomedical Natural Language Processing: Evaluation and Recommendation
di: Zhan, Zaifu, et al.
Pubblicazione: (2025)
di: Zhan, Zaifu, et al.
Pubblicazione: (2025)
Evaluating the Performance of Large Language Models on GAOKAO Benchmark
di: Zhang, Xiaotian, et al.
Pubblicazione: (2023)
di: Zhang, Xiaotian, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Supervised Knowledge Makes Large Language Models Better In-context Learners
di: Yang, Linyi, et al.
Pubblicazione: (2023) -
KIEval: A Knowledge-grounded Interactive Evaluation Framework for Large Language Models
di: Yu, Zhuohao, et al.
Pubblicazione: (2024) -
FreeEval: A Modular Framework for Trustworthy and Efficient Evaluation of Large Language Models
di: Yu, Zhuohao, et al.
Pubblicazione: (2024) -
AI Scientists Fail Without Strong Implementation Capability
di: Zhu, Minjun, et al.
Pubblicazione: (2025) -
PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization
di: Wang, Yidong, et al.
Pubblicazione: (2023)