Calibrating Expressions of Certainty
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Peiqi, Lam, Barbara D., Liu, Yingcheng, Asgari-Targhi, Ameneh, Panda, Rameswar, Wells, William M., Kapur, Tina, Golland, Polina |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Diversity Measurement and Subset Selection for Instruction Tuning Datasets
par: Wang, Peiqi, et autres
Publié: (2024)
par: Wang, Peiqi, et autres
Publié: (2024)
Connecting Jensen-Shannon and Kullback-Leibler Divergences: A New Bound for Representation Learning
par: Dorent, Reuben, et autres
Publié: (2025)
par: Dorent, Reuben, et autres
Publié: (2025)
Reducing Transformer Key-Value Cache Size with Cross-Layer Attention
par: Brandon, William, et autres
Publié: (2024)
par: Brandon, William, et autres
Publié: (2024)
Gated Linear Attention Transformers with Hardware-Efficient Training
par: Yang, Songlin, et autres
Publié: (2023)
par: Yang, Songlin, et autres
Publié: (2023)
Mitigating the Impact of Outlier Channels for Language Model Quantization with Activation Regularization
par: Nrusimha, Aniruddha, et autres
Publié: (2024)
par: Nrusimha, Aniruddha, et autres
Publié: (2024)
FlashFormer: Whole-Model Kernels for Efficient Low-Batch Inference
par: Nrusimha, Aniruddha, et autres
Publié: (2025)
par: Nrusimha, Aniruddha, et autres
Publié: (2025)
Scaling Stick-Breaking Attention: An Efficient Implementation and In-depth Study
par: Tan, Shawn, et autres
Publié: (2024)
par: Tan, Shawn, et autres
Publié: (2024)
API Pack: A Massive Multi-Programming Language Dataset for API Call Generation
par: Guo, Zhen, et autres
Publié: (2024)
par: Guo, Zhen, et autres
Publié: (2024)
The Confidence Trap: Gender Bias and Predictive Certainty in LLMs
par: Sabir, Ahmed, et autres
Publié: (2026)
par: Sabir, Ahmed, et autres
Publié: (2026)
PaTH Attention: Position Encoding via Accumulating Householder Transformations
par: Yang, Songlin, et autres
Publié: (2025)
par: Yang, Songlin, et autres
Publié: (2025)
The Illusion of Certainty: Uncertainty Quantification for LLMs Fails under Ambiguity
par: Tomov, Tim, et autres
Publié: (2025)
par: Tomov, Tim, et autres
Publié: (2025)
Dense Training, Sparse Inference: Rethinking Training of Mixture-of-Experts Language Models
par: Pan, Bowen, et autres
Publié: (2024)
par: Pan, Bowen, et autres
Publié: (2024)
Self-MoE: Towards Compositional Large Language Models with Self-Specialized Experts
par: Kang, Junmo, et autres
Publié: (2024)
par: Kang, Junmo, et autres
Publié: (2024)
TOUCAN: Synthesizing 1.5M Tool-Agentic Data from Real-World MCP Environments
par: Xu, Zhangchen, et autres
Publié: (2025)
par: Xu, Zhangchen, et autres
Publié: (2025)
Causality and Scientific Inquiry: Lessons from Space Physics and Medical Sciences
par: Asgari-Targhi, Marzieh, et autres
Publié: (2026)
par: Asgari-Targhi, Marzieh, et autres
Publié: (2026)
Explain-Query-Test: Self-Evaluating LLMs Via Explanation and Comprehension Discrepancy
par: Taghanaki, Saeid Asgari, et autres
Publié: (2025)
par: Taghanaki, Saeid Asgari, et autres
Publié: (2025)
Refusal Tokens: A Simple Way to Calibrate Refusals in Large Language Models
par: Jain, Neel, et autres
Publié: (2024)
par: Jain, Neel, et autres
Publié: (2024)
Process Supervision of Confidence Margin for Calibrated LLM Reasoning
par: Wang, Liaoyaqi, et autres
Publié: (2026)
par: Wang, Liaoyaqi, et autres
Publié: (2026)
Power Scheduler: A Batch Size and Token Number Agnostic Learning Rate Scheduler
par: Shen, Yikang, et autres
Publié: (2024)
par: Shen, Yikang, et autres
Publié: (2024)
Beyond Simple Averaging: Improving NLP Ensemble Performance with Topological-Data-Analysis-Based Weighting
par: Proskura, Polina, et autres
Publié: (2024)
par: Proskura, Polina, et autres
Publié: (2024)
Scalable Best-of-N Selection for Large Language Models via Self-Certainty
par: Kang, Zhewei, et autres
Publié: (2025)
par: Kang, Zhewei, et autres
Publié: (2025)
Efficient Post-Training Pruning of Large Language Models with Statistical Correction
par: Yu, Peiqi, et autres
Publié: (2026)
par: Yu, Peiqi, et autres
Publié: (2026)
MMLU-Pro+: Evaluating Higher-Order Reasoning and Shortcut Learning in LLMs
par: Taghanaki, Saeid Asgari, et autres
Publié: (2024)
par: Taghanaki, Saeid Asgari, et autres
Publié: (2024)
PRISM: Demystifying Retention and Interaction in Mid-Training
par: Runwal, Bharat, et autres
Publié: (2026)
par: Runwal, Bharat, et autres
Publié: (2026)
Less is More: Rethinking Few-Shot Learning and Recurrent Neural Nets
par: Pereg, Deborah, et autres
Publié: (2022)
par: Pereg, Deborah, et autres
Publié: (2022)
Unified Cross-Modal Medical Image Synthesis with Hierarchical Mixture of Product-of-Experts
par: Dorent, Reuben, et autres
Publié: (2024)
par: Dorent, Reuben, et autres
Publié: (2024)
Efficient Reasoning for Large Reasoning Language Models via Certainty-Guided Reflection Suppression
par: Huang, Jiameng, et autres
Publié: (2025)
par: Huang, Jiameng, et autres
Publié: (2025)
The Illusion of Certainty: Decoupling Capability and Calibration in On-Policy Distillation
par: Zhang, Jiaxin, et autres
Publié: (2026)
par: Zhang, Jiaxin, et autres
Publié: (2026)
Trained on Tokens, Calibrated on Concepts: The Emergence of Semantic Calibration in LLMs
par: Nakkiran, Preetum, et autres
Publié: (2025)
par: Nakkiran, Preetum, et autres
Publié: (2025)
Stepwise Verification and Remediation of Student Reasoning Errors with Large Language Model Tutors
par: Daheim, Nico, et autres
Publié: (2024)
par: Daheim, Nico, et autres
Publié: (2024)
Scattered Mixture-of-Experts Implementation
par: Tan, Shawn, et autres
Publié: (2024)
par: Tan, Shawn, et autres
Publié: (2024)
Calibrated Speculative Decoding: Frequency-Guided Candidate Selection for Efficient Inference
par: Zhou, Xuwen, et autres
Publié: (2026)
par: Zhou, Xuwen, et autres
Publié: (2026)
Conformal Linguistic Calibration: Trading-off between Factuality and Specificity
par: Jiang, Zhengping, et autres
Publié: (2025)
par: Jiang, Zhengping, et autres
Publié: (2025)
Beyond the Score: Uncertainty-Calibrated LLMs for Automated Essay Assessment
par: Karim, Ahmed, et autres
Publié: (2025)
par: Karim, Ahmed, et autres
Publié: (2025)
Contrastive Learning and Mixture of Experts Enables Precise Vector Embeddings
par: Hallee, Logan, et autres
Publié: (2024)
par: Hallee, Logan, et autres
Publié: (2024)
Fetuses Made Simple: Modeling and Tracking of Fetal Shape and Pose
par: Liu, Yingcheng, et autres
Publié: (2025)
par: Liu, Yingcheng, et autres
Publié: (2025)
From the Inside Out: Progressive Distribution Refinement for Confidence Calibration
par: Yang, Xizhong, et autres
Publié: (2026)
par: Yang, Xizhong, et autres
Publié: (2026)
On Calibration of LLM-based Guard Models for Reliable Content Moderation
par: Liu, Hongfu, et autres
Publié: (2024)
par: Liu, Hongfu, et autres
Publié: (2024)
Facts in Stats: Impacts of Pretraining Diversity on Language Model Generalization
par: Behnia, Tina, et autres
Publié: (2025)
par: Behnia, Tina, et autres
Publié: (2025)
MetaFaith: Faithful Natural Language Uncertainty Expression in LLMs
par: Liu, Gabrielle Kaili-May, et autres
Publié: (2025)
par: Liu, Gabrielle Kaili-May, et autres
Publié: (2025)
Documents similaires
-
Diversity Measurement and Subset Selection for Instruction Tuning Datasets
par: Wang, Peiqi, et autres
Publié: (2024) -
Connecting Jensen-Shannon and Kullback-Leibler Divergences: A New Bound for Representation Learning
par: Dorent, Reuben, et autres
Publié: (2025) -
Reducing Transformer Key-Value Cache Size with Cross-Layer Attention
par: Brandon, William, et autres
Publié: (2024) -
Gated Linear Attention Transformers with Hardware-Efficient Training
par: Yang, Songlin, et autres
Publié: (2023) -
Mitigating the Impact of Outlier Channels for Language Model Quantization with Activation Regularization
par: Nrusimha, Aniruddha, et autres
Publié: (2024)