Do Language Models Mirror Human Confidence? Exploring Psychological Insights to Address Overconfidence in LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xu, Chenjun, Wen, Bingbing, Han, Bin, Wolfe, Robert, Wang, Lucy Lu, Howe, Bill |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LLMs are Overconfident: Evaluating Confidence Interval Calibration with FermiEval
par: Epstein, Elliot L., et autres
Publié: (2025)
par: Epstein, Elliot L., et autres
Publié: (2025)
Do We Always Need Query-Level Workflows? Rethinking Agentic Workflow Generation for Multi-Agent Systems
par: Wang, Zixu, et autres
Publié: (2026)
par: Wang, Zixu, et autres
Publié: (2026)
RomanLens: The Role Of Latent Romanization In Multilinguality In LLMs
par: Saji, Alan, et autres
Publié: (2025)
par: Saji, Alan, et autres
Publié: (2025)
How Well Do LLMs Imitate Human Writing Style?
par: Jemama, Rebira, et autres
Publié: (2025)
par: Jemama, Rebira, et autres
Publié: (2025)
LLMs and the Human Condition
par: Wallis, Peter
Publié: (2024)
par: Wallis, Peter
Publié: (2024)
Can LLMs Do Rocket Science? Exploring the Limits of Complex Reasoning with GTOC 12
par: del Campo, Iñaki, et autres
Publié: (2026)
par: del Campo, Iñaki, et autres
Publié: (2026)
Temporal Referential Consistency: Do LLMs Favor Sequences Over Absolute Time References?
par: Bajpai, Ashutosh, et autres
Publié: (2025)
par: Bajpai, Ashutosh, et autres
Publié: (2025)
Fine-Tuning LLMs with Fine-Grained Human Feedback on Text Spans
par: CH-Wang, Sky, et autres
Publié: (2025)
par: CH-Wang, Sky, et autres
Publié: (2025)
CRISP: Persistent Concept Unlearning via Sparse Autoencoders
par: Ashuach, Tomer, et autres
Publié: (2025)
par: Ashuach, Tomer, et autres
Publié: (2025)
Text-Based Approaches to Item Difficulty Modeling in Large-Scale Assessments: A Systematic Review
par: Peters, Sydney, et autres
Publié: (2025)
par: Peters, Sydney, et autres
Publié: (2025)
Calibrated Confidence Estimation for Tabular Question Answering
par: Voss, Lukas
Publié: (2026)
par: Voss, Lukas
Publié: (2026)
Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs
par: Ahmadian, Arash, et autres
Publié: (2024)
par: Ahmadian, Arash, et autres
Publié: (2024)
AI Predicts AGI: Leveraging AGI Forecasting and Peer Review to Explore LLMs' Complex Reasoning Capabilities
par: Davide, Fabrizio, et autres
Publié: (2024)
par: Davide, Fabrizio, et autres
Publié: (2024)
How Do Large Language Models Acquire Factual Knowledge During Pretraining?
par: Chang, Hoyeon, et autres
Publié: (2024)
par: Chang, Hoyeon, et autres
Publié: (2024)
Merge-Bench: Resolve Merge Conflicts with Large Language Models
par: Schesch, Benedikt, et autres
Publié: (2026)
par: Schesch, Benedikt, et autres
Publié: (2026)
Automated Bug Triaging using Instruction-Tuned Large Language Models
par: Kiashemshaki, Kiana, et autres
Publié: (2025)
par: Kiashemshaki, Kiana, et autres
Publié: (2025)
Towards Fundamental Language Models: Does Linguistic Competence Scale with Model Size?
par: Collado-Montañez, Jaime, et autres
Publié: (2025)
par: Collado-Montañez, Jaime, et autres
Publié: (2025)
Surprisingly Fragile: Assessing and Addressing Prompt Instability in Multimodal Foundation Models
par: Stewart, Ian, et autres
Publié: (2024)
par: Stewart, Ian, et autres
Publié: (2024)
Towards Human Understanding of Paraphrase Types in Large Language Models
par: Meier, Dominik, et autres
Publié: (2024)
par: Meier, Dominik, et autres
Publié: (2024)
Evaluating Personality Traits in Large Language Models: Insights from Psychological Questionnaires
par: Bhandari, Pranav, et autres
Publié: (2025)
par: Bhandari, Pranav, et autres
Publié: (2025)
MALT: Mechanistic Ablation of Lossy Translation in LLMs for a Low-Resource Language: Urdu
par: Bajwa, Taaha Saleem
Publié: (2025)
par: Bajwa, Taaha Saleem
Publié: (2025)
A Case Study of Cross-Lingual Zero-Shot Generalization for Classical Languages in LLMs
par: Akavarapu, V. S. D. S. Mahesh, et autres
Publié: (2025)
par: Akavarapu, V. S. D. S. Mahesh, et autres
Publié: (2025)
Named Entity Recognition for Address Extraction in Speech-to-Text Transcriptions Using Synthetic Data
par: Lajčinová, Bibiána, et autres
Publié: (2024)
par: Lajčinová, Bibiána, et autres
Publié: (2024)
Searching for the Most Human-like Emergent Language
par: Boldt, Brendon, et autres
Publié: (2025)
par: Boldt, Brendon, et autres
Publié: (2025)
WHoW: A Cross-domain Approach for Analysing Conversation Moderation
par: Chen, Ming-Bin, et autres
Publié: (2024)
par: Chen, Ming-Bin, et autres
Publié: (2024)
Rethinking Addressing in Language Models via Contexualized Equivariant Positional Encoding
par: Zhu, Jiajun, et autres
Publié: (2025)
par: Zhu, Jiajun, et autres
Publié: (2025)
Auditing Meta-Cognitive Hallucinations in Reasoning Large Language Models
par: Lu, Haolang, et autres
Publié: (2025)
par: Lu, Haolang, et autres
Publié: (2025)
Evaluating the Clinical Safety of LLMs in Response to High-Risk Mental Health Disclosures
par: Shah, Siddharth, et autres
Publié: (2025)
par: Shah, Siddharth, et autres
Publié: (2025)
AI-Powered Annotation Pipelines for Stabilizing Large Language Models: A Human-AI Synergy Approach
par: Pathak, Gangesh, et autres
Publié: (2025)
par: Pathak, Gangesh, et autres
Publié: (2025)
SciEx: Benchmarking Large Language Models on Scientific Exams with Human Expert Grading and Automatic Grading
par: Dinh, Tu Anh, et autres
Publié: (2024)
par: Dinh, Tu Anh, et autres
Publié: (2024)
KisMATH: Do LLMs Have Knowledge of Implicit Structures in Mathematical Reasoning?
par: Saha, Soumadeep, et autres
Publié: (2025)
par: Saha, Soumadeep, et autres
Publié: (2025)
EduGuardBench: A Holistic Benchmark for Evaluating the Pedagogical Fidelity and Adversarial Safety of LLMs as Simulated Teachers
par: Jiang, Yilin, et autres
Publié: (2025)
par: Jiang, Yilin, et autres
Publié: (2025)
Trusted Uncertainty in Large Language Models: A Unified Framework for Confidence Calibration and Risk-Controlled Refusal
par: Oehri, Markus, et autres
Publié: (2025)
par: Oehri, Markus, et autres
Publié: (2025)
Effective and Efficient Schema-aware Information Extraction Using On-Device Large Language Models
par: Wen, Zhihao, et autres
Publié: (2025)
par: Wen, Zhihao, et autres
Publié: (2025)
Exploring the Maze of Multilingual Modeling
par: Nezhad, Sina Bagheri, et autres
Publié: (2023)
par: Nezhad, Sina Bagheri, et autres
Publié: (2023)
Evaluating Relational Reasoning in LLMs with REL
par: Fesser, Lukas, et autres
Publié: (2026)
par: Fesser, Lukas, et autres
Publié: (2026)
Do LLMs Know What They Know? Measuring Metacognitive Efficiency with Signal Detection Theory
par: Cacioli, Jon-Paul
Publié: (2026)
par: Cacioli, Jon-Paul
Publié: (2026)
MedFuzz: Exploring the Robustness of Large Language Models in Medical Question Answering
par: Ness, Robert Osazuwa, et autres
Publié: (2024)
par: Ness, Robert Osazuwa, et autres
Publié: (2024)
Constructing Benchmarks and Interventions for Combating Hallucinations in LLMs
par: Simhi, Adi, et autres
Publié: (2024)
par: Simhi, Adi, et autres
Publié: (2024)
Semantic Delta: An Interpretable Signal Differentiating Human and LLMs Dialogue
par: Scantamburlo, Riccardo, et autres
Publié: (2026)
par: Scantamburlo, Riccardo, et autres
Publié: (2026)
Documents similaires
-
LLMs are Overconfident: Evaluating Confidence Interval Calibration with FermiEval
par: Epstein, Elliot L., et autres
Publié: (2025) -
Do We Always Need Query-Level Workflows? Rethinking Agentic Workflow Generation for Multi-Agent Systems
par: Wang, Zixu, et autres
Publié: (2026) -
RomanLens: The Role Of Latent Romanization In Multilinguality In LLMs
par: Saji, Alan, et autres
Publié: (2025) -
How Well Do LLMs Imitate Human Writing Style?
par: Jemama, Rebira, et autres
Publié: (2025) -
LLMs and the Human Condition
par: Wallis, Peter
Publié: (2024)