LLMs Should Express Uncertainty Explicitly
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Guo, Junyu, Gu, Shangding, Jin, Ming, Spanos, Costas, Lavaei, Javad |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
StyleBench: Evaluating thinking styles in Large Language Models
par: Guo, Junyu, et autres
Publié: (2025)
par: Guo, Junyu, et autres
Publié: (2025)
Don't Trade Off Safety: Diffusion Regularization for Constrained Offline RL
par: Guo, Junyu, et autres
Publié: (2025)
par: Guo, Junyu, et autres
Publié: (2025)
Few-Shot Test-Time Optimization Without Retraining for Semiconductor Recipe Generation and Beyond
par: Gu, Shangding, et autres
Publié: (2025)
par: Gu, Shangding, et autres
Publié: (2025)
Robust Gymnasium: A Unified Modular Benchmark for Robust Reinforcement Learning
par: Gu, Shangding, et autres
Publié: (2025)
par: Gu, Shangding, et autres
Publié: (2025)
Long Context, Less Focus: A Scaling Gap in LLMs Revealed through Privacy and Personalization
par: Gu, Shangding
Publié: (2026)
par: Gu, Shangding
Publié: (2026)
Estimation of Concept Explanations Should be Uncertainty Aware
par: Piratla, Vihari, et autres
Publié: (2023)
par: Piratla, Vihari, et autres
Publié: (2023)
SaySelf: Teaching LLMs to Express Confidence with Self-Reflective Rationales
par: Xu, Tianyang, et autres
Publié: (2024)
par: Xu, Tianyang, et autres
Publié: (2024)
Retrieval Augmented Question Answering: When Should LLMs Admit Ignorance?
par: Wang, Dingmin, et autres
Publié: (2025)
par: Wang, Dingmin, et autres
Publié: (2025)
GNN-RAG: Graph Neural Retrieval for Large Language Model Reasoning
par: Mavromatis, Costas, et autres
Publié: (2024)
par: Mavromatis, Costas, et autres
Publié: (2024)
When Should LLMs Be Less Specific? Selective Abstraction for Reliable Long-Form Text Generation
par: Goren, Shani, et autres
Publié: (2026)
par: Goren, Shani, et autres
Publié: (2026)
ABBEL: LLM Agents Acting through Belief Bottlenecks Expressed in Language
par: Lidayan, Aly, et autres
Publié: (2025)
par: Lidayan, Aly, et autres
Publié: (2025)
Explicit Diversity Conditions for Effective Question Answer Generation with Large Language Models
par: Yadav, Vikas, et autres
Publié: (2024)
par: Yadav, Vikas, et autres
Publié: (2024)
Is Your Model Fairly Certain? Uncertainty-Aware Fairness Evaluation for LLMs
par: Wang, Yinong Oliver, et autres
Publié: (2025)
par: Wang, Yinong Oliver, et autres
Publié: (2025)
Uncertainty quantification in fine-tuned LLMs using LoRA ensembles
par: Balabanov, Oleksandr, et autres
Publié: (2024)
par: Balabanov, Oleksandr, et autres
Publié: (2024)
Examining LLMs' Uncertainty Expression Towards Questions Outside Parametric Knowledge
par: Liu, Genglin, et autres
Publié: (2023)
par: Liu, Genglin, et autres
Publié: (2023)
Skin-in-the-Game: Decision Making via Multi-Stakeholder Alignment in LLMs
par: Sel, Bilgehan, et autres
Publié: (2024)
par: Sel, Bilgehan, et autres
Publié: (2024)
When Should Models Change Their Minds? Contextual Belief Management in Large Language Models
par: Xu, Haoming, et autres
Publié: (2026)
par: Xu, Haoming, et autres
Publié: (2026)
Flaw or Artifact? Rethinking Prompt Sensitivity in Evaluating LLMs
par: Hua, Andong, et autres
Publié: (2025)
par: Hua, Andong, et autres
Publié: (2025)
Aligning LLMs with Human Uncertainty: A Beta-Bernoulli Calibrator for LLM Forecasting
par: Dai, Hui, et autres
Publié: (2026)
par: Dai, Hui, et autres
Publié: (2026)
The Alignment Tax: Response Homogenization in Aligned LLMs and Its Implications for Uncertainty Estimation
par: Liu, Mingyi
Publié: (2026)
par: Liu, Mingyi
Publié: (2026)
SelectIT: Selective Instruction Tuning for LLMs via Uncertainty-Aware Self-Reflection
par: Liu, Liangxin, et autres
Publié: (2024)
par: Liu, Liangxin, et autres
Publié: (2024)
UProp: Investigating the Uncertainty Propagation of LLMs in Multi-Step Agentic Decision-Making
par: Duan, Jinhao, et autres
Publié: (2025)
par: Duan, Jinhao, et autres
Publié: (2025)
Time-Aware Feature Selection: Adaptive Temporal Masking for Stable Sparse Autoencoder Training
par: Li, T. Ed, et autres
Publié: (2025)
par: Li, T. Ed, et autres
Publié: (2025)
LLMs Should Incorporate Explicit Mechanisms for Human Empathy
par: You, Xiaoxing, et autres
Publié: (2026)
par: You, Xiaoxing, et autres
Publié: (2026)
Explicit Multi-head Attention for Inter-head Interaction in Large Language Models
par: Peng, Runyu, et autres
Publié: (2026)
par: Peng, Runyu, et autres
Publié: (2026)
Kernel Language Entropy: Fine-grained Uncertainty Quantification for LLMs from Semantic Similarities
par: Nikitin, Alexander, et autres
Publié: (2024)
par: Nikitin, Alexander, et autres
Publié: (2024)
Can LLMs Speak For Diverse People? Tuning LLMs via Debate to Generate Controllable Controversial Statements
par: Li, Ming, et autres
Publié: (2024)
par: Li, Ming, et autres
Publié: (2024)
Constrained Sampling for Language Models Should Be Easy: An MCMC Perspective
par: Gonzalez, Emmanuel Anaya, et autres
Publié: (2025)
par: Gonzalez, Emmanuel Anaya, et autres
Publié: (2025)
Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs
par: Song, Xiangchen, et autres
Publié: (2025)
par: Song, Xiangchen, et autres
Publié: (2025)
MATH-Perturb: Benchmarking LLMs' Math Reasoning Abilities against Hard Perturbations
par: Huang, Kaixuan, et autres
Publié: (2025)
par: Huang, Kaixuan, et autres
Publié: (2025)
Explicit Word Density Estimation for Language Modelling
par: Andonov, Jovan, et autres
Publié: (2024)
par: Andonov, Jovan, et autres
Publié: (2024)
Remembering More, Risking More: Longitudinal Safety Risks in Memory-Equipped LLM Agents
par: Al-Tawaha, Ahmad, et autres
Publié: (2026)
par: Al-Tawaha, Ahmad, et autres
Publié: (2026)
Calibration Collapse Under Sycophancy Fine-Tuning: How Reward Hacking Breaks Uncertainty Quantification in LLMs
par: Sahoo, Subramanyam
Publié: (2026)
par: Sahoo, Subramanyam
Publié: (2026)
Jet-Nemotron: Efficient Language Model with Post Neural Architecture Search
par: Gu, Yuxian, et autres
Publié: (2025)
par: Gu, Yuxian, et autres
Publié: (2025)
Toxicity Detection Should Measure Contextual Harm, Not Text-Intrinsic Badness
par: Berezin, Sergei, et autres
Publié: (2025)
par: Berezin, Sergei, et autres
Publié: (2025)
Should You Use Your Large Language Model to Explore or Exploit?
par: Harris, Keegan, et autres
Publié: (2025)
par: Harris, Keegan, et autres
Publié: (2025)
The Remarkable Robustness of LLMs: Stages of Inference?
par: Lad, Vedang, et autres
Publié: (2024)
par: Lad, Vedang, et autres
Publié: (2024)
OUTLINEFORGE: Hierarchical Reinforcement Learning with Explicit States for Scientific Writing
par: Bao, Yilin, et autres
Publié: (2026)
par: Bao, Yilin, et autres
Publié: (2026)
Enhancing LLM Reliability via Explicit Knowledge Boundary Modeling
par: Zheng, Hang, et autres
Publié: (2025)
par: Zheng, Hang, et autres
Publié: (2025)
Visualizing Uncertainty in Translation Tasks: An Evaluation of LLM Performance and Confidence Metrics
par: Park, Jin Hyun, et autres
Publié: (2025)
par: Park, Jin Hyun, et autres
Publié: (2025)
Documents similaires
-
StyleBench: Evaluating thinking styles in Large Language Models
par: Guo, Junyu, et autres
Publié: (2025) -
Don't Trade Off Safety: Diffusion Regularization for Constrained Offline RL
par: Guo, Junyu, et autres
Publié: (2025) -
Few-Shot Test-Time Optimization Without Retraining for Semiconductor Recipe Generation and Beyond
par: Gu, Shangding, et autres
Publié: (2025) -
Robust Gymnasium: A Unified Modular Benchmark for Robust Reinforcement Learning
par: Gu, Shangding, et autres
Publié: (2025) -
Long Context, Less Focus: A Scaling Gap in LLMs Revealed through Privacy and Personalization
par: Gu, Shangding
Publié: (2026)