Testing Uncertainty of Large Language Models for Physics Knowledge and Reasoning
Fuente:
arXiv
Guardado en:
| Autores principales: | Reganova, Elizaveta, Steinbach, Peter |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Benchmarking Uncertainty Calibration in Large Language Model Long-Form Question Answering
por: Müller, Philip, et al.
Publicado: (2026)
por: Müller, Philip, et al.
Publicado: (2026)
FERA: Uncertainty-Aware Federated Reasoning for Large Language Models
por: Wang, Ruhan, et al.
Publicado: (2026)
por: Wang, Ruhan, et al.
Publicado: (2026)
Procedural Knowledge in Pretraining Drives Reasoning in Large Language Models
por: Ruis, Laura, et al.
Publicado: (2024)
por: Ruis, Laura, et al.
Publicado: (2024)
metabench -- A Sparse Benchmark of Reasoning and Knowledge in Large Language Models
por: Kipnis, Alex, et al.
Publicado: (2024)
por: Kipnis, Alex, et al.
Publicado: (2024)
Knowledge-based Consistency Testing of Large Language Models
por: Rajan, Sai Sathiesh, et al.
Publicado: (2024)
por: Rajan, Sai Sathiesh, et al.
Publicado: (2024)
Tracing Uncertainty in Language Model "Reasoning"
por: Grünefeld, Nils, et al.
Publicado: (2026)
por: Grünefeld, Nils, et al.
Publicado: (2026)
RFG: Test-Time Scaling for Diffusion Large Language Model Reasoning with Reward-Free Guidance
por: Chen, Tianlang, et al.
Publicado: (2025)
por: Chen, Tianlang, et al.
Publicado: (2025)
Decoding Uncertainty: The Impact of Decoding Strategies for Uncertainty Estimation in Large Language Models
por: Hashimoto, Wataru, et al.
Publicado: (2025)
por: Hashimoto, Wataru, et al.
Publicado: (2025)
TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning
por: Zhang, Tunyu, et al.
Publicado: (2025)
por: Zhang, Tunyu, et al.
Publicado: (2025)
Uncertainty Quantification for In-Context Learning of Large Language Models
por: Ling, Chen, et al.
Publicado: (2024)
por: Ling, Chen, et al.
Publicado: (2024)
Benchmarking Large Language Model Uncertainty for Prompt Optimization
por: Guo, Pei-Fu, et al.
Publicado: (2024)
por: Guo, Pei-Fu, et al.
Publicado: (2024)
Confidence in the Reasoning of Large Language Models
por: Pawitan, Yudi, et al.
Publicado: (2024)
por: Pawitan, Yudi, et al.
Publicado: (2024)
CLUE: Concept-Level Uncertainty Estimation for Large Language Models
por: Wang, Yu-Hsiang, et al.
Publicado: (2024)
por: Wang, Yu-Hsiang, et al.
Publicado: (2024)
Prompt-Dependent Ranking of Large Language Models with Uncertainty Quantification
por: Menendez, Angel Rodrigo Avelar, et al.
Publicado: (2026)
por: Menendez, Angel Rodrigo Avelar, et al.
Publicado: (2026)
Out-of-Context Reasoning in Large Language Models
por: Shaki, Jonathan, et al.
Publicado: (2025)
por: Shaki, Jonathan, et al.
Publicado: (2025)
Quantifying Uncertainty in Natural Language Explanations of Large Language Models for Question Answering
por: Li, Yangyi, et al.
Publicado: (2025)
por: Li, Yangyi, et al.
Publicado: (2025)
Self-guided Knowledgeable Network of Thoughts: Amplifying Reasoning with Large Language Models
por: Chen, Chao-Chi, et al.
Publicado: (2024)
por: Chen, Chao-Chi, et al.
Publicado: (2024)
Understanding the Relationship between Prompts and Response Uncertainty in Large Language Models
por: Zhang, Ze Yu, et al.
Publicado: (2024)
por: Zhang, Ze Yu, et al.
Publicado: (2024)
Benchmarking Uncertainty Quantification Methods for Large Language Models with LM-Polygraph
por: Vashurin, Roman, et al.
Publicado: (2024)
por: Vashurin, Roman, et al.
Publicado: (2024)
Harnessing the Power of Large Language Model for Uncertainty Aware Graph Processing
por: Qian, Zhenyu, et al.
Publicado: (2024)
por: Qian, Zhenyu, et al.
Publicado: (2024)
Generating with Confidence: Uncertainty Quantification for Black-box Large Language Models
por: Lin, Zhen, et al.
Publicado: (2023)
por: Lin, Zhen, et al.
Publicado: (2023)
Neuron-Level Knowledge Attribution in Large Language Models
por: Yu, Zeping, et al.
Publicado: (2023)
por: Yu, Zeping, et al.
Publicado: (2023)
Do Large Language Model Benchmarks Test Reliability?
por: Vendrow, Joshua, et al.
Publicado: (2025)
por: Vendrow, Joshua, et al.
Publicado: (2025)
Benchmarking Large Language Models for Math Reasoning Tasks
por: Seßler, Kathrin, et al.
Publicado: (2024)
por: Seßler, Kathrin, et al.
Publicado: (2024)
Self-Training Large Language Models with Confident Reasoning
por: Jang, Hyosoon, et al.
Publicado: (2025)
por: Jang, Hyosoon, et al.
Publicado: (2025)
Beyond Language: Format-Agnostic Reasoning Subspaces in Large Language Models
por: Yuan, Aojie, et al.
Publicado: (2026)
por: Yuan, Aojie, et al.
Publicado: (2026)
MMLU-SR: A Benchmark for Stress-Testing Reasoning Capability of Large Language Models
por: Wang, Wentian, et al.
Publicado: (2024)
por: Wang, Wentian, et al.
Publicado: (2024)
Back to Basics: Revisiting Exploration in Reinforcement Learning for LLM Reasoning via Generative Probabilities
por: Li, Pengyi, et al.
Publicado: (2026)
por: Li, Pengyi, et al.
Publicado: (2026)
Knowledge Distillation from Large Language Models for Household Energy Modeling
por: Takrouri, Mohannad, et al.
Publicado: (2025)
por: Takrouri, Mohannad, et al.
Publicado: (2025)
Recurrent Confidence Chain: Temporal-Aware Uncertainty Quantification in Large Language Models
por: Mao, Zhenjiang, et al.
Publicado: (2026)
por: Mao, Zhenjiang, et al.
Publicado: (2026)
A Formal Framework for Uncertainty Analysis of Text Generation with Large Language Models
por: Herbold, Steffen, et al.
Publicado: (2026)
por: Herbold, Steffen, et al.
Publicado: (2026)
A Survey on Symbolic Knowledge Distillation of Large Language Models
por: Acharya, Kamal, et al.
Publicado: (2024)
por: Acharya, Kamal, et al.
Publicado: (2024)
Crosslingual Capabilities and Knowledge Barriers in Multilingual Large Language Models
por: Chua, Lynn, et al.
Publicado: (2024)
por: Chua, Lynn, et al.
Publicado: (2024)
Large Language Models Lack Temporal Awareness of Medical Knowledge
por: Guan, Zihan, et al.
Publicado: (2026)
por: Guan, Zihan, et al.
Publicado: (2026)
Test-Time Training on Nearest Neighbors for Large Language Models
por: Hardt, Moritz, et al.
Publicado: (2023)
por: Hardt, Moritz, et al.
Publicado: (2023)
Graph Linearization Methods for Reasoning on Graphs with Large Language Models
por: Xypolopoulos, Christos, et al.
Publicado: (2024)
por: Xypolopoulos, Christos, et al.
Publicado: (2024)
Progressive-Hint Prompting Improves Reasoning in Large Language Models
por: Zheng, Chuanyang, et al.
Publicado: (2023)
por: Zheng, Chuanyang, et al.
Publicado: (2023)
GENUINE: Graph Enhanced Multi-level Uncertainty Estimation for Large Language Models
por: Wang, Tuo, et al.
Publicado: (2025)
por: Wang, Tuo, et al.
Publicado: (2025)
Optimizing Case-Based Reasoning System for Functional Test Script Generation with Large Language Models
por: Guo, Siyuan, et al.
Publicado: (2025)
por: Guo, Siyuan, et al.
Publicado: (2025)
Large Language and Reasoning Models are Shallow Disjunctive Reasoners
por: Khalid, Irtaza, et al.
Publicado: (2025)
por: Khalid, Irtaza, et al.
Publicado: (2025)
Ejemplares similares
-
Benchmarking Uncertainty Calibration in Large Language Model Long-Form Question Answering
por: Müller, Philip, et al.
Publicado: (2026) -
FERA: Uncertainty-Aware Federated Reasoning for Large Language Models
por: Wang, Ruhan, et al.
Publicado: (2026) -
Procedural Knowledge in Pretraining Drives Reasoning in Large Language Models
por: Ruis, Laura, et al.
Publicado: (2024) -
metabench -- A Sparse Benchmark of Reasoning and Knowledge in Large Language Models
por: Kipnis, Alex, et al.
Publicado: (2024) -
Knowledge-based Consistency Testing of Large Language Models
por: Rajan, Sai Sathiesh, et al.
Publicado: (2024)