QA-Calibration of Language Model Confidence Scores
Fuente:
arXiv
Saved in:
| Main Authors: | Manggala, Putra, Mastakouri, Atalanti, Kirschbaum, Elke, Kasiviswanathan, Shiva Prasad, Ramdas, Aaditya |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Differentially Private Conditional Independence Testing
by: Kalemaj, Iden, et al.
Published: (2023)
by: Kalemaj, Iden, et al.
Published: (2023)
Training Large Language Models To Reason In Parallel With Global Forking Tokens
by: Jia, Sheng, et al.
Published: (2025)
by: Jia, Sheng, et al.
Published: (2025)
Sequential Kernelized Independence Testing
by: Podkopaev, Aleksandr, et al.
Published: (2022)
by: Podkopaev, Aleksandr, et al.
Published: (2022)
Estimating Joint Interventional Distributions from Marginal Interventional Data
by: Mejia, Sergio Hernan Garrido, et al.
Published: (2024)
by: Mejia, Sergio Hernan Garrido, et al.
Published: (2024)
Anytime-Valid Inference for Double/Debiased Machine Learning of Causal Parameters
by: Dalal, Abhinandan, et al.
Published: (2024)
by: Dalal, Abhinandan, et al.
Published: (2024)
Optimal Transportation and Alignment Between Gaussian Measures
by: Dandapanthula, Sanjit, et al.
Published: (2025)
by: Dandapanthula, Sanjit, et al.
Published: (2025)
The PetShop Dataset -- Finding Causes of Performance Issues across Microservices
by: Hardt, Michaela, et al.
Published: (2023)
by: Hardt, Michaela, et al.
Published: (2023)
Confidence over Time: Confidence Calibration with Temporal Logic for Large Language Model Reasoning
by: Mao, Zhenjiang, et al.
Published: (2026)
by: Mao, Zhenjiang, et al.
Published: (2026)
Confidence Calibration in Large Language Model-Based Entity Matching
by: Kamsteeg, Iris, et al.
Published: (2025)
by: Kamsteeg, Iris, et al.
Published: (2025)
From Guess2Graph: When and How Can Unreliable Experts Safely Boost Causal Discovery in Finite Samples?
by: Hiremath, Sujai, et al.
Published: (2025)
by: Hiremath, Sujai, et al.
Published: (2025)
Multicalibration for Confidence Scoring in LLMs
by: Detommaso, Gianluca, et al.
Published: (2024)
by: Detommaso, Gianluca, et al.
Published: (2024)
Efficacy of Large Language Models in Systematic Reviews
by: Shah, Aaditya, et al.
Published: (2024)
by: Shah, Aaditya, et al.
Published: (2024)
A Quantitative Characterization of Forgetting in Post-Training
by: Balasubramanian, Krishnakumar, et al.
Published: (2026)
by: Balasubramanian, Krishnakumar, et al.
Published: (2026)
Graph-based Confidence Calibration for Large Language Models
by: Li, Yukun, et al.
Published: (2024)
by: Li, Yukun, et al.
Published: (2024)
Dependence-Aware Label Aggregation for LLM-as-a-Judge via Ising Models
by: Balasubramanian, Krishnakumar, et al.
Published: (2026)
by: Balasubramanian, Krishnakumar, et al.
Published: (2026)
Process Supervision of Confidence Margin for Calibrated LLM Reasoning
by: Wang, Liaoyaqi, et al.
Published: (2026)
by: Wang, Liaoyaqi, et al.
Published: (2026)
Confidence in the Reasoning of Large Language Models
by: Pawitan, Yudi, et al.
Published: (2024)
by: Pawitan, Yudi, et al.
Published: (2024)
From the Inside Out: Progressive Distribution Refinement for Confidence Calibration
by: Yang, Xizhong, et al.
Published: (2026)
by: Yang, Xizhong, et al.
Published: (2026)
Foundations of Global Consistency Checking with Noisy LLM Oracles
by: He, Paul, et al.
Published: (2026)
by: He, Paul, et al.
Published: (2026)
Translation or Recitation? Calibrating Evaluation Scores for Machine Translation of Extremely Low-Resource Languages
by: Chen, Danlu, et al.
Published: (2026)
by: Chen, Danlu, et al.
Published: (2026)
PCS: Perceived Confidence Scoring of Black Box LLMs with Metamorphic Relations
by: Salimian, Sina, et al.
Published: (2025)
by: Salimian, Sina, et al.
Published: (2025)
Toward Falsifying Causal Graphs Using a Permutation-Based Test
by: Eulig, Elias, et al.
Published: (2023)
by: Eulig, Elias, et al.
Published: (2023)
MICE for CATs: Model-Internal Confidence Estimation for Calibrating Agents with Tools
by: Subramani, Nishant, et al.
Published: (2025)
by: Subramani, Nishant, et al.
Published: (2025)
Self-Training Large Language Models with Confident Reasoning
by: Jang, Hyosoon, et al.
Published: (2025)
by: Jang, Hyosoon, et al.
Published: (2025)
Modeling Causal Mechanisms with Diffusion Models for Interventional and Counterfactual Queries
by: Chao, Patrick, et al.
Published: (2023)
by: Chao, Patrick, et al.
Published: (2023)
Benign Overfitting for Regression with Trained Two-Layer ReLU Networks
by: Park, Junhyung, et al.
Published: (2024)
by: Park, Junhyung, et al.
Published: (2024)
A Classical View on Benign Overfitting: The Role of Sample Size
by: Park, Junhyung, et al.
Published: (2025)
by: Park, Junhyung, et al.
Published: (2025)
Beyond the Score: Uncertainty-Calibrated LLMs for Automated Essay Assessment
by: Karim, Ahmed, et al.
Published: (2025)
by: Karim, Ahmed, et al.
Published: (2025)
Enhancing Marker Scoring Accuracy through Ordinal Confidence Modelling in Educational Assessments
by: Chakravarty, Abhirup, et al.
Published: (2025)
by: Chakravarty, Abhirup, et al.
Published: (2025)
Uncertainty Distillation: Teaching Language Models to Express Semantic Confidence
by: Hager, Sophia, et al.
Published: (2025)
by: Hager, Sophia, et al.
Published: (2025)
Time-Uniform Confidence Spheres for Means of Random Vectors
by: Chugg, Ben, et al.
Published: (2023)
by: Chugg, Ben, et al.
Published: (2023)
FinanceQA: A Benchmark for Evaluating Financial Analysis Capabilities of Large Language Models
by: Mateega, Spencer, et al.
Published: (2025)
by: Mateega, Spencer, et al.
Published: (2025)
Confidence Regulation Neurons in Language Models
by: Stolfo, Alessandro, et al.
Published: (2024)
by: Stolfo, Alessandro, et al.
Published: (2024)
Geometry-Calibrated Conformal Abstention for Language Models
by: Xu, Rui, et al.
Published: (2026)
by: Xu, Rui, et al.
Published: (2026)
Generating with Confidence: Uncertainty Quantification for Black-box Large Language Models
by: Lin, Zhen, et al.
Published: (2023)
by: Lin, Zhen, et al.
Published: (2023)
ORCE: Order-Aware Alignment of Verbalized Confidence in Large Language Models
by: Li, Chen, et al.
Published: (2026)
by: Li, Chen, et al.
Published: (2026)
Self-ensemble: Mitigating Confidence Mis-calibration for Large Language Models
by: Xu, Zicheng, et al.
Published: (2025)
by: Xu, Zicheng, et al.
Published: (2025)
Confidence Under the Hood: An Investigation into the Confidence-Probability Alignment in Large Language Models
by: Kumar, Abhishek, et al.
Published: (2024)
by: Kumar, Abhishek, et al.
Published: (2024)
Confidence Geometry Reveals Trace-Level Correctness in Large Language Model Reasoning
by: Liu, Shuo, et al.
Published: (2026)
by: Liu, Shuo, et al.
Published: (2026)
Recurrent Confidence Chain: Temporal-Aware Uncertainty Quantification in Large Language Models
by: Mao, Zhenjiang, et al.
Published: (2026)
by: Mao, Zhenjiang, et al.
Published: (2026)
Similar Items
-
Differentially Private Conditional Independence Testing
by: Kalemaj, Iden, et al.
Published: (2023) -
Training Large Language Models To Reason In Parallel With Global Forking Tokens
by: Jia, Sheng, et al.
Published: (2025) -
Sequential Kernelized Independence Testing
by: Podkopaev, Aleksandr, et al.
Published: (2022) -
Estimating Joint Interventional Distributions from Marginal Interventional Data
by: Mejia, Sergio Hernan Garrido, et al.
Published: (2024) -
Anytime-Valid Inference for Double/Debiased Machine Learning of Causal Parameters
by: Dalal, Abhinandan, et al.
Published: (2024)