Improving the Calibration of Confidence Scores in Text Generation Using the Output Distribution's Characteristics
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Flores, Lorenzo Jaime Yu, Ernst, Ori, Cheung, Jackie Chi Kit |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
PreSumm: Predicting Summarization Performance Without Summarizing
par: Koniaev, Steven, et autres
Publié: (2025)
par: Koniaev, Steven, et autres
Publié: (2025)
Confident in a Confidence Score: Investigating the Sensitivity of Confidence Scores to Supervised Fine-Tuning
par: Flores, Lorenzo Jaime Yu, et autres
Publié: (2026)
par: Flores, Lorenzo Jaime Yu, et autres
Publié: (2026)
Mechanistic Understanding and Mitigation of Language Model Non-Factual Hallucinations
par: Yu, Lei, et autres
Publié: (2024)
par: Yu, Lei, et autres
Publié: (2024)
$\texttt{COSMIC}$: Mutual Information for Task-Agnostic Summarization Evaluation
par: Darrin, Maxime, et autres
Publié: (2024)
par: Darrin, Maxime, et autres
Publié: (2024)
Testing the Assumptions of Active Learning for Translation Tasks with Few Samples
par: Flores, Lorenzo Jaime Yu, et autres
Publié: (2026)
par: Flores, Lorenzo Jaime Yu, et autres
Publié: (2026)
$(RSA)^2$: A Rhetorical-Strategy-Aware Rational Speech Act Framework for Figurative Language Understanding
par: Piano, Cesare Spinoso-Di, et autres
Publié: (2025)
par: Piano, Cesare Spinoso-Di, et autres
Publié: (2025)
Can Vision Language Models Be Adaptive in Mathematics Education? A Learner Model-based Rubric Study
par: Gao, Jie, et autres
Publié: (2026)
par: Gao, Jie, et autres
Publié: (2026)
Error Diversity Matters: An Error-Resistant Ensemble Method for Unsupervised Dependency Parsing
par: Shayegh, Behzad, et autres
Publié: (2024)
par: Shayegh, Behzad, et autres
Publié: (2024)
Calibrating Verbalized Confidence with Self-Generated Distractors
par: Wang, Victor, et autres
Publié: (2025)
par: Wang, Victor, et autres
Publié: (2025)
Agentic Confidence Calibration
par: Zhang, Jiaxin, et autres
Publié: (2026)
par: Zhang, Jiaxin, et autres
Publié: (2026)
Unsupervised Layer-wise Score Aggregation for Textual OOD Detection
par: Darrin, Maxime, et autres
Publié: (2023)
par: Darrin, Maxime, et autres
Publié: (2023)
From Thinking to Output: Chain-of-Thought and Text Generation Characteristics in Reasoning Language Models
par: Liu, Junhao, et autres
Publié: (2025)
par: Liu, Junhao, et autres
Publié: (2025)
Contextualized Sequence Likelihood: Enhanced Confidence Scores for Natural Language Generation
par: Lin, Zhen, et autres
Publié: (2024)
par: Lin, Zhen, et autres
Publié: (2024)
On the Benefits of Fine-Grained Loss Truncation: A Case Study on Factuality in Summarization
par: Flores, Lorenzo Jaime Yu, et autres
Publié: (2024)
par: Flores, Lorenzo Jaime Yu, et autres
Publié: (2024)
Fact-Level Confidence Calibration and Self-Correction
par: Yuan, Yige, et autres
Publié: (2024)
par: Yuan, Yige, et autres
Publié: (2024)
Double-Calibration: Towards Reliable LLMs via Calibrating Knowledge and Reasoning Confidence
par: Lu, Yuyin, et autres
Publié: (2026)
par: Lu, Yuyin, et autres
Publié: (2026)
Solving the Challenge Set without Solving the Task: On Winograd Schemas as a Test of Pronominal Coreference Resolution
par: Porada, Ian, et autres
Publié: (2024)
par: Porada, Ian, et autres
Publié: (2024)
Towards Trustworthy Report Generation: A Deep Research Agent with Progressive Confidence Estimation and Calibration
par: Yuan, Yi, et autres
Publié: (2026)
par: Yuan, Yi, et autres
Publié: (2026)
STED and Consistency Scoring: A Framework for Evaluating LLM Structured Output Reliability
par: Wang, Guanghui, et autres
Publié: (2025)
par: Wang, Guanghui, et autres
Publié: (2025)
Confident RAG: Enhancing the Performance of LLMs for Mathematics Question Answering through Multi-Embedding and Confidence Scoring
par: Chen, Shiting, et autres
Publié: (2025)
par: Chen, Shiting, et autres
Publié: (2025)
Don't Think Twice! Over-Reasoning Impairs Confidence Calibration
par: Lacombe, Romain, et autres
Publié: (2025)
par: Lacombe, Romain, et autres
Publié: (2025)
A Survey of Confidence Estimation and Calibration in Large Language Models
par: Geng, Jiahui, et autres
Publié: (2023)
par: Geng, Jiahui, et autres
Publié: (2023)
How Teachers Can Use Large Language Models and Bloom's Taxonomy to Create Educational Quizzes
par: Elkins, Sabina, et autres
Publié: (2024)
par: Elkins, Sabina, et autres
Publié: (2024)
LACIE: Listener-Aware Finetuning for Confidence Calibration in Large Language Models
par: Stengel-Eskin, Elias, et autres
Publié: (2024)
par: Stengel-Eskin, Elias, et autres
Publié: (2024)
Confidence and Calibration of Activation Oracles for Reliable Interpretation of Language Model Internals
par: Torrielli, Federico, et autres
Publié: (2026)
par: Torrielli, Federico, et autres
Publié: (2026)
Confidence Improves Self-Consistency in LLMs
par: Taubenfeld, Amir, et autres
Publié: (2025)
par: Taubenfeld, Amir, et autres
Publié: (2025)
Confident Rankings with Fewer Items: Adaptive LLM Evaluation with Continuous Scores
par: Balkır, Esma, et autres
Publié: (2026)
par: Balkır, Esma, et autres
Publié: (2026)
Linguistic Characteristics of AI-Generated Text: A Survey
par: Terčon, Luka, et autres
Publié: (2025)
par: Terčon, Luka, et autres
Publié: (2025)
Mind the Confidence Gap: Overconfidence, Calibration, and Distractor Effects in Large Language Models
par: Chhikara, Prateek
Publié: (2025)
par: Chhikara, Prateek
Publié: (2025)
The Dunning-Kruger Effect in Large Language Models: An Empirical Study of Confidence Calibration
par: Ghosh, Sudipta, et autres
Publié: (2026)
par: Ghosh, Sudipta, et autres
Publié: (2026)
Confidence-Calibrated Small-Large Language Model Collaboration for Cost-Efficient Reasoning
par: Zhang, Chuang, et autres
Publié: (2026)
par: Zhang, Chuang, et autres
Publié: (2026)
Making Retrieval-Augmented Language Models Robust to Irrelevant Context
par: Yoran, Ori, et autres
Publié: (2023)
par: Yoran, Ori, et autres
Publié: (2023)
DecMetrics: Structured Claim Decomposition Scoring for Factually Consistent LLM Outputs
par: Huang, Minghui
Publié: (2025)
par: Huang, Minghui
Publié: (2025)
Calibrating Verbalized Probabilities for Large Language Models
par: Wang, Cheng, et autres
Publié: (2024)
par: Wang, Cheng, et autres
Publié: (2024)
MICE for CATs: Model-Internal Confidence Estimation for Calibrating Agents with Tools
par: Subramani, Nishant, et autres
Publié: (2025)
par: Subramani, Nishant, et autres
Publié: (2025)
Detoxification of Large Language Models through Output-layer Fusion with a Calibration Model
par: Tian, Yuanhe, et autres
Publié: (2025)
par: Tian, Yuanhe, et autres
Publié: (2025)
Filtered Reasoning Score: Evaluating Reasoning Quality on a Model's Most-Confident Traces
par: Pathak, Manas, et autres
Publié: (2026)
par: Pathak, Manas, et autres
Publié: (2026)
DivScore: Zero-Shot Detection of LLM-Generated Text in Specialized Domains
par: Chen, Zhihui, et autres
Publié: (2025)
par: Chen, Zhihui, et autres
Publié: (2025)
OpenFActScore: Open-Source Atomic Evaluation of Factuality in Text Generation
par: Lage, Lucas Fonseca, et autres
Publié: (2025)
par: Lage, Lucas Fonseca, et autres
Publié: (2025)
Generative Ontology: When Structured Knowledge Learns to Create
par: Cheung, Benny
Publié: (2026)
par: Cheung, Benny
Publié: (2026)
Documents similaires
-
PreSumm: Predicting Summarization Performance Without Summarizing
par: Koniaev, Steven, et autres
Publié: (2025) -
Confident in a Confidence Score: Investigating the Sensitivity of Confidence Scores to Supervised Fine-Tuning
par: Flores, Lorenzo Jaime Yu, et autres
Publié: (2026) -
Mechanistic Understanding and Mitigation of Language Model Non-Factual Hallucinations
par: Yu, Lei, et autres
Publié: (2024) -
$\texttt{COSMIC}$: Mutual Information for Task-Agnostic Summarization Evaluation
par: Darrin, Maxime, et autres
Publié: (2024) -
Testing the Assumptions of Active Learning for Translation Tasks with Few Samples
par: Flores, Lorenzo Jaime Yu, et autres
Publié: (2026)