Can LLMs Express Their Uncertainty? An Empirical Evaluation of Confidence Elicitation in LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xiong, Miao, Hu, Zhiyuan, Lu, Xinyang, Li, Yifei, Fu, Jie, He, Junxian, Hooi, Bryan |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ConfTuner: Training Large Language Models to Express Their Confidence Verbally
par: Li, Yibo, et autres
Publié: (2025)
par: Li, Yibo, et autres
Publié: (2025)
Conversation for Non-verifiable Learning: Self-Evolving LLMs through Meta-Evaluation
par: Sui, Yuan, et autres
Publié: (2026)
par: Sui, Yuan, et autres
Publié: (2026)
SteerConf: Steering LLMs for Confidence Elicitation
par: Zhou, Ziang, et autres
Publié: (2025)
par: Zhou, Ziang, et autres
Publié: (2025)
Enhancing Multi-Agent Debate System Performance via Confidence Expression
par: Lin, Zijie, et autres
Publié: (2025)
par: Lin, Zijie, et autres
Publié: (2025)
Evaluating Prompt Engineering Techniques for Accuracy and Confidence Elicitation in Medical LLMs
par: Naderi, Nariman, et autres
Publié: (2025)
par: Naderi, Nariman, et autres
Publié: (2025)
LLMs Should Express Uncertainty Explicitly
par: Guo, Junyu, et autres
Publié: (2026)
par: Guo, Junyu, et autres
Publié: (2026)
Can Knowledge Graphs Make Large Language Models More Trustworthy? An Empirical Study Over Open-ended Question Answering
par: Sui, Yuan, et autres
Publié: (2024)
par: Sui, Yuan, et autres
Publié: (2024)
Uncertainty of Thoughts: Uncertainty-Aware Planning Enhances Information Seeking in Large Language Models
par: Hu, Zhiyuan, et autres
Publié: (2024)
par: Hu, Zhiyuan, et autres
Publié: (2024)
Vulnerability of LLMs to Vertically Aligned Text Manipulations
par: Li, Zhecheng, et autres
Publié: (2024)
par: Li, Zhecheng, et autres
Publié: (2024)
Can LLMs Express Personality Across Cultures? Introducing CulturalPersonas for Evaluating Trait Alignment
par: Dey, Priyanka, et autres
Publié: (2025)
par: Dey, Priyanka, et autres
Publié: (2025)
SaySelf: Teaching LLMs to Express Confidence with Self-Reflective Rationales
par: Xu, Tianyang, et autres
Publié: (2024)
par: Xu, Tianyang, et autres
Publié: (2024)
Measuring Aleatoric and Epistemic Uncertainty in LLMs: Empirical Evaluation on ID and OOD QA Tasks
par: Wang, Kevin, et autres
Publié: (2025)
par: Wang, Kevin, et autres
Publié: (2025)
Eliciting Better Multilingual Structured Reasoning from LLMs through Code
par: Li, Bryan, et autres
Publié: (2024)
par: Li, Bryan, et autres
Publié: (2024)
On the Universal Truthfulness Hyperplane Inside LLMs
par: Liu, Junteng, et autres
Publié: (2024)
par: Liu, Junteng, et autres
Publié: (2024)
Uncertainty Distillation: Teaching Language Models to Express Semantic Confidence
par: Hager, Sophia, et autres
Publié: (2025)
par: Hager, Sophia, et autres
Publié: (2025)
Rewarding the Rare: Uniqueness-Aware RL for Creative Problem Solving in LLMs
par: Hu, Zhiyuan, et autres
Publié: (2026)
par: Hu, Zhiyuan, et autres
Publié: (2026)
TRACE: TRansformer-based Attribution using Contrastive Embeddings in LLMs
par: Wang, Cheng, et autres
Publié: (2024)
par: Wang, Cheng, et autres
Publié: (2024)
From Long to Short: LLMs Excel at Trimming Own Reasoning Chains
par: Han, Wei, et autres
Publié: (2025)
par: Han, Wei, et autres
Publié: (2025)
Teaching Language Models to Faithfully Express their Uncertainty
par: Eikema, Bryan, et autres
Publié: (2025)
par: Eikema, Bryan, et autres
Publié: (2025)
Can Confidence Estimates Decide When Chain-of-Thought Is Necessary for LLMs?
par: Lewis-Lim, Samuel, et autres
Publié: (2025)
par: Lewis-Lim, Samuel, et autres
Publié: (2025)
CHiP: Cross-modal Hierarchical Direct Preference Optimization for Multimodal LLMs
par: Fu, Jinlan, et autres
Publié: (2025)
par: Fu, Jinlan, et autres
Publié: (2025)
Confidence Estimation for LLMs in Multi-turn Interactions
par: Zhang, Caiqi, et autres
Publié: (2026)
par: Zhang, Caiqi, et autres
Publié: (2026)
Can LLMs Perceive Time? An Empirical Investigation
par: Garikaparthi, Aniketh
Publié: (2026)
par: Garikaparthi, Aniketh
Publié: (2026)
How Confident are Video Models? Empowering Video Models to Express their Uncertainty
par: Mei, Zhiting, et autres
Publié: (2025)
par: Mei, Zhiting, et autres
Publié: (2025)
Uncertainty Quantification for LLMs through Minimum Bayes Risk: Bridging Confidence and Consistency
par: Vashurin, Roman, et autres
Publié: (2025)
par: Vashurin, Roman, et autres
Publié: (2025)
Con-ReCall: Detecting Pre-training Data in LLMs via Contrastive Decoding
par: Wang, Cheng, et autres
Publié: (2024)
par: Wang, Cheng, et autres
Publié: (2024)
Can Many-Shot In-Context Learning Help LLMs as Evaluators? A Preliminary Empirical Study
par: Song, Mingyang, et autres
Publié: (2024)
par: Song, Mingyang, et autres
Publié: (2024)
UltraEval: A Lightweight Platform for Flexible and Comprehensive Evaluation for LLMs
par: He, Chaoqun, et autres
Publié: (2024)
par: He, Chaoqun, et autres
Publié: (2024)
Beyond 'Aha!': Toward Systematic Meta-Abilities Alignment in Large Reasoning Models
par: Hu, Zhiyuan, et autres
Publié: (2025)
par: Hu, Zhiyuan, et autres
Publié: (2025)
Can We Further Elicit Reasoning in LLMs? Critic-Guided Planning with Retrieval-Augmentation for Solving Challenging Tasks
par: Li, Xingxuan, et autres
Publié: (2024)
par: Li, Xingxuan, et autres
Publié: (2024)
Can Large Language Models Faithfully Express Their Intrinsic Uncertainty in Words?
par: Yona, Gal, et autres
Publié: (2024)
par: Yona, Gal, et autres
Publié: (2024)
On Verbalized Confidence Scores for LLMs
par: Yang, Daniel, et autres
Publié: (2024)
par: Yang, Daniel, et autres
Publié: (2024)
An Empirical Study on Eliciting and Improving R1-like Reasoning Models
par: Chen, Zhipeng, et autres
Publié: (2025)
par: Chen, Zhipeng, et autres
Publié: (2025)
Double-Calibration: Towards Reliable LLMs via Calibrating Knowledge and Reasoning Confidence
par: Lu, Yuyin, et autres
Publié: (2026)
par: Lu, Yuyin, et autres
Publié: (2026)
Can LLMs Reason in the Wild with Programs?
par: Yang, Yuan, et autres
Publié: (2024)
par: Yang, Yuan, et autres
Publié: (2024)
Combining Confidence Elicitation and Sample-based Methods for Uncertainty Quantification in Misinformation Mitigation
par: Rivera, Mauricio, et autres
Publié: (2024)
par: Rivera, Mauricio, et autres
Publié: (2024)
Tears or Cheers? Benchmarking LLMs via Culturally Elicited Distinct Affective Responses
par: Dai, Chongyuan, et autres
Publié: (2026)
par: Dai, Chongyuan, et autres
Publié: (2026)
Can Large Language Models Express Uncertainty Like Human?
par: Tao, Linwei, et autres
Publié: (2025)
par: Tao, Linwei, et autres
Publié: (2025)
Can LLMs Outshine Conventional Recommenders? A Comparative Evaluation
par: Liu, Qijiong, et autres
Publié: (2025)
par: Liu, Qijiong, et autres
Publié: (2025)
How Much Do LLMs Know About Chinese Zero Pronouns?
par: Li, Yifei, et autres
Publié: (2026)
par: Li, Yifei, et autres
Publié: (2026)
Documents similaires
-
ConfTuner: Training Large Language Models to Express Their Confidence Verbally
par: Li, Yibo, et autres
Publié: (2025) -
Conversation for Non-verifiable Learning: Self-Evolving LLMs through Meta-Evaluation
par: Sui, Yuan, et autres
Publié: (2026) -
SteerConf: Steering LLMs for Confidence Elicitation
par: Zhou, Ziang, et autres
Publié: (2025) -
Enhancing Multi-Agent Debate System Performance via Confidence Expression
par: Lin, Zijie, et autres
Publié: (2025) -
Evaluating Prompt Engineering Techniques for Accuracy and Confidence Elicitation in Medical LLMs
par: Naderi, Nariman, et autres
Publié: (2025)