An Evaluation of Estimative Uncertainty in Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Tang, Zhisheng, Shen, Ke, Kejriwal, Mayank |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Humanlike Cognitive Patterns as Emergent Phenomena in Large Language Models
by: Tang, Zhisheng, et al.
Published: (2024)
by: Tang, Zhisheng, et al.
Published: (2024)
GRASP: A Grid-Based Benchmark for Evaluating Commonsense Spatial Reasoning
by: Tang, Zhisheng, et al.
Published: (2024)
by: Tang, Zhisheng, et al.
Published: (2024)
Accounting for Sycophancy in Language Model Uncertainty Estimation
by: Sicilia, Anthony, et al.
Published: (2024)
by: Sicilia, Anthony, et al.
Published: (2024)
Defining and Evaluating Decision and Composite Risk in Language Models Applied to Natural Language Inference
by: Shen, Ke, et al.
Published: (2024)
by: Shen, Ke, et al.
Published: (2024)
Epistemic Integrity in Large Language Models
by: Ghafouri, Bijean, et al.
Published: (2024)
by: Ghafouri, Bijean, et al.
Published: (2024)
Evaluating the Prompt Steerability of Large Language Models
by: Miehling, Erik, et al.
Published: (2024)
by: Miehling, Erik, et al.
Published: (2024)
Evaluating Large Language Models in Analysing Classroom Dialogue
by: Long, Yun, et al.
Published: (2024)
by: Long, Yun, et al.
Published: (2024)
ChatSUMO: Large Language Model for Automating Traffic Scenario Generation in Simulation of Urban MObility
by: Li, Shuyang, et al.
Published: (2024)
by: Li, Shuyang, et al.
Published: (2024)
Evalet: Evaluating Large Language Models through Functional Fragmentation
by: Kim, Tae Soo, et al.
Published: (2025)
by: Kim, Tae Soo, et al.
Published: (2025)
Helmsman of the Masses? Evaluate the Opinion Leadership of Large Language Models in the Werewolf Game
by: Du, Silin, et al.
Published: (2024)
by: Du, Silin, et al.
Published: (2024)
Large Language Model Psychometrics: A Systematic Review of Evaluation, Validation, and Enhancement
by: Ye, Haoran, et al.
Published: (2025)
by: Ye, Haoran, et al.
Published: (2025)
The Effectiveness of Style Vectors for Steering Large Language Models: A Human Evaluation
by: Diallo, Diaoulé, et al.
Published: (2026)
by: Diallo, Diaoulé, et al.
Published: (2026)
Relying on the Unreliable: The Impact of Language Models' Reluctance to Express Uncertainty
by: Zhou, Kaitlyn, et al.
Published: (2024)
by: Zhou, Kaitlyn, et al.
Published: (2024)
Human Evaluation of Procedural Knowledge Graph Extraction from Text with Large Language Models
by: Carriero, Valentina Anita, et al.
Published: (2024)
by: Carriero, Valentina Anita, et al.
Published: (2024)
EvalLM: Interactive Evaluation of Large Language Model Prompts on User-Defined Criteria
by: Kim, Tae Soo, et al.
Published: (2023)
by: Kim, Tae Soo, et al.
Published: (2023)
StressPrompt: Does Stress Impact Large Language Models and Human Performance Similarly?
by: Shen, Guobin, et al.
Published: (2024)
by: Shen, Guobin, et al.
Published: (2024)
LalaEval: A Holistic Human Evaluation Framework for Domain-Specific Large Language Models
by: Sun, Chongyan, et al.
Published: (2024)
by: Sun, Chongyan, et al.
Published: (2024)
MHSafeEval: Role-Aware Interaction-Level Evaluation of Mental Health Safety in Large Language Models
by: Lee, Suhyun, et al.
Published: (2026)
by: Lee, Suhyun, et al.
Published: (2026)
Evaluating Large Language Models' Ability Using a Psychiatric Screening Tool Based on Metaphor and Sarcasm Scenarios
by: Yakura, Hiromu
Published: (2023)
by: Yakura, Hiromu
Published: (2023)
Autonomous Prompt Engineering in Large Language Models
by: Kepel, Daan, et al.
Published: (2024)
by: Kepel, Daan, et al.
Published: (2024)
A Scalable Framework for Evaluating Health Language Models
by: Mallinar, Neil, et al.
Published: (2025)
by: Mallinar, Neil, et al.
Published: (2025)
Inertia in Moral and Value Judgments of Large Language Models
by: Lee, Bruce W., et al.
Published: (2024)
by: Lee, Bruce W., et al.
Published: (2024)
Large Language Models and Games: A Survey and Roadmap
by: Gallotta, Roberto, et al.
Published: (2024)
by: Gallotta, Roberto, et al.
Published: (2024)
(Ir)rationality and Cognitive Biases in Large Language Models
by: Macmillan-Scott, Olivia, et al.
Published: (2024)
by: Macmillan-Scott, Olivia, et al.
Published: (2024)
Large Language Model Use Impact Locus of Control
by: Fu, Jenny Xiyu, et al.
Published: (2025)
by: Fu, Jenny Xiyu, et al.
Published: (2025)
Empowering Private Tutoring by Chaining Large Language Models
by: Chen, Yulin, et al.
Published: (2023)
by: Chen, Yulin, et al.
Published: (2023)
Evaluating the Application of Large Language Models to Generate Feedback in Programming Education
by: Jacobs, Sven, et al.
Published: (2024)
by: Jacobs, Sven, et al.
Published: (2024)
Multi-agent KTO: Reinforcing Strategic Interactions of Large Language Model in Language Game
by: Ye, Rong, et al.
Published: (2025)
by: Ye, Rong, et al.
Published: (2025)
RNR: Teaching Large Language Models to Follow Roles and Rules
by: Wang, Kuan, et al.
Published: (2024)
by: Wang, Kuan, et al.
Published: (2024)
Large Language Models for Automatic Milestone Detection in Group Discussions
by: Duan, Zhuoxu, et al.
Published: (2024)
by: Duan, Zhuoxu, et al.
Published: (2024)
Large Language Model-Brained GUI Agents: A Survey
by: Zhang, Chaoyun, et al.
Published: (2024)
by: Zhang, Chaoyun, et al.
Published: (2024)
Understanding the Dataset Practitioners Behind Large Language Model Development
by: Qian, Crystal, et al.
Published: (2024)
by: Qian, Crystal, et al.
Published: (2024)
Captioning Visualizations with Large Language Models (CVLLM): A Tutorial
by: Carenini, Giuseppe, et al.
Published: (2024)
by: Carenini, Giuseppe, et al.
Published: (2024)
Art or Artifice? Large Language Models and the False Promise of Creativity
by: Chakrabarty, Tuhin, et al.
Published: (2023)
by: Chakrabarty, Tuhin, et al.
Published: (2023)
A Survey of Large Language Model Agents for Question Answering
by: Yue, Murong
Published: (2025)
by: Yue, Murong
Published: (2025)
Is persona enough for personality? Using ChatGPT to reconstruct an agent's latent personality from simple descriptions
by: Ji, Yongyi, et al.
Published: (2024)
by: Ji, Yongyi, et al.
Published: (2024)
How Controllable Are Large Language Models? A Unified Evaluation across Behavioral Granularities
by: Xu, Ziwen, et al.
Published: (2026)
by: Xu, Ziwen, et al.
Published: (2026)
A Survey on Human-AI Collaboration with Large Foundation Models
by: Vats, Vanshika, et al.
Published: (2024)
by: Vats, Vanshika, et al.
Published: (2024)
Chain of Empathy: Enhancing Empathetic Response of Large Language Models Based on Psychotherapy Models
by: Lee, Yoon Kyung, et al.
Published: (2023)
by: Lee, Yoon Kyung, et al.
Published: (2023)
Decoding the Mind of Large Language Models: A Quantitative Evaluation of Ideology and Biases
by: Hirose, Manari, et al.
Published: (2025)
by: Hirose, Manari, et al.
Published: (2025)
Similar Items
-
Humanlike Cognitive Patterns as Emergent Phenomena in Large Language Models
by: Tang, Zhisheng, et al.
Published: (2024) -
GRASP: A Grid-Based Benchmark for Evaluating Commonsense Spatial Reasoning
by: Tang, Zhisheng, et al.
Published: (2024) -
Accounting for Sycophancy in Language Model Uncertainty Estimation
by: Sicilia, Anthony, et al.
Published: (2024) -
Defining and Evaluating Decision and Composite Risk in Language Models Applied to Natural Language Inference
by: Shen, Ke, et al.
Published: (2024) -
Epistemic Integrity in Large Language Models
by: Ghafouri, Bijean, et al.
Published: (2024)