All Roads Lead to Rome: Graph-Based Confidence Estimation for Large Language Model Reasoning
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Caiqi, Shu, Chang, Shareghi, Ehsan, Collier, Nigel |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ReasonGraph: Visualisation of Reasoning Paths
por: Li, Zongqian, et al.
Publicado: (2025)
por: Li, Zongqian, et al.
Publicado: (2025)
Conformity in Large Language Models
por: Zhu, Xiaochen, et al.
Publicado: (2024)
por: Zhu, Xiaochen, et al.
Publicado: (2024)
LoVeC: Reinforcement Learning for Better Verbalized Confidence in Long-Form Generations
por: Zhang, Caiqi, et al.
Publicado: (2025)
por: Zhang, Caiqi, et al.
Publicado: (2025)
Aligning with Logic: Measuring, Evaluating and Improving Logical Preference Consistency in Large Language Models
por: Liu, Yinhong, et al.
Publicado: (2024)
por: Liu, Yinhong, et al.
Publicado: (2024)
Aligning with Human Judgement: The Role of Pairwise Preference in Large Language Model Evaluators
por: Liu, Yinhong, et al.
Publicado: (2024)
por: Liu, Yinhong, et al.
Publicado: (2024)
VerifiAgent: a Unified Verification Agent in Language Model Reasoning
por: Han, Jiuzhou, et al.
Publicado: (2025)
por: Han, Jiuzhou, et al.
Publicado: (2025)
Improving Symbolic Translation of Language Models for Logical Reasoning
por: Thatikonda, Ramya Keerthy, et al.
Publicado: (2026)
por: Thatikonda, Ramya Keerthy, et al.
Publicado: (2026)
Uncertainty-Based Methods for Automated Process Reward Data Construction and Output Aggregation in Mathematical Reasoning
por: Han, Jiuzhou, et al.
Publicado: (2025)
por: Han, Jiuzhou, et al.
Publicado: (2025)
Logical Reasoning with Outcome Reward Models for Test-Time Scaling
por: Thatikonda, Ramya Keerthy, et al.
Publicado: (2025)
por: Thatikonda, Ramya Keerthy, et al.
Publicado: (2025)
Cube Bench: A Benchmark for Spatial Visual Reasoning in MLLMs
por: Anand, Dhruv, et al.
Publicado: (2025)
por: Anand, Dhruv, et al.
Publicado: (2025)
One STEP at a time: Language Agents are Stepwise Planners
por: Nguyen, Minh, et al.
Publicado: (2024)
por: Nguyen, Minh, et al.
Publicado: (2024)
Atomic Calibration of LLMs in Long-Form Generations
por: Zhang, Caiqi, et al.
Publicado: (2024)
por: Zhang, Caiqi, et al.
Publicado: (2024)
PiVe: Prompting with Iterative Verification Improving Graph-based Generative Capability of LLMs
por: Han, Jiuzhou, et al.
Publicado: (2023)
por: Han, Jiuzhou, et al.
Publicado: (2023)
Language is All a Graph Needs
por: Ye, Ruosong, et al.
Publicado: (2023)
por: Ye, Ruosong, et al.
Publicado: (2023)
LoGU: Long-form Generation with Uncertainty Expressions
por: Yang, Ruihan, et al.
Publicado: (2024)
por: Yang, Ruihan, et al.
Publicado: (2024)
Confident Rankings with Fewer Items: Adaptive LLM Evaluation with Continuous Scores
por: Balkır, Esma, et al.
Publicado: (2026)
por: Balkır, Esma, et al.
Publicado: (2026)
Unlocking Structure Measuring: Introducing PDD, an Automatic Metric for Positional Discourse Coherence
por: Liu, Yinhong, et al.
Publicado: (2024)
por: Liu, Yinhong, et al.
Publicado: (2024)
Evaluating LLM-based Approaches to Legal Citation Prediction: Domain-specific Pre-training, Fine-tuning, or RAG? A Benchmark and an Australian Law Case Study
por: Han, Jiuzhou, et al.
Publicado: (2024)
por: Han, Jiuzhou, et al.
Publicado: (2024)
A Survey of Confidence Estimation and Calibration in Large Language Models
por: Geng, Jiahui, et al.
Publicado: (2023)
por: Geng, Jiahui, et al.
Publicado: (2023)
Confidence-Calibrated Small-Large Language Model Collaboration for Cost-Efficient Reasoning
por: Zhang, Chuang, et al.
Publicado: (2026)
por: Zhang, Chuang, et al.
Publicado: (2026)
Multi-Perspective Consistency Enhances Confidence Estimation in Large Language Models
por: Wang, Pei, et al.
Publicado: (2024)
por: Wang, Pei, et al.
Publicado: (2024)
Confidence Estimation for LLMs in Multi-turn Interactions
por: Zhang, Caiqi, et al.
Publicado: (2026)
por: Zhang, Caiqi, et al.
Publicado: (2026)
SimBench: Benchmarking the Ability of Large Language Models to Simulate Human Behaviors
por: Hu, Tiancheng, et al.
Publicado: (2025)
por: Hu, Tiancheng, et al.
Publicado: (2025)
Fairer Preferences Elicit Improved Human-Aligned Large Language Model Judgments
por: Zhou, Han, et al.
Publicado: (2024)
por: Zhou, Han, et al.
Publicado: (2024)
Navigating the Alignment-Calibration Trade-off: A Pareto-Superior Frontier via Model Merging
por: Hu, Tiancheng, et al.
Publicado: (2025)
por: Hu, Tiancheng, et al.
Publicado: (2025)
Reasoning on Graphs: Faithful and Interpretable Large Language Model Reasoning
por: Luo, Linhao, et al.
Publicado: (2023)
por: Luo, Linhao, et al.
Publicado: (2023)
TRIDENT: Benchmarking LLM Safety in Finance, Medicine, and Law
por: Hui, Zheng, et al.
Publicado: (2025)
por: Hui, Zheng, et al.
Publicado: (2025)
GraphInstruct: Empowering Large Language Models with Graph Understanding and Reasoning Capability
por: Luo, Zihan, et al.
Publicado: (2024)
por: Luo, Zihan, et al.
Publicado: (2024)
Large Language Model Confidence Estimation via Black-Box Access
por: Pedapati, Tejaswini, et al.
Publicado: (2024)
por: Pedapati, Tejaswini, et al.
Publicado: (2024)
All Languages Matter: On the Multilingual Safety of Large Language Models
por: Wang, Wenxuan, et al.
Publicado: (2023)
por: Wang, Wenxuan, et al.
Publicado: (2023)
CARE-RFT: Confidence-Anchored Reinforcement Finetuning for Reliable Reasoning in Large Language Models
por: Li, Shuozhe, et al.
Publicado: (2026)
por: Li, Shuozhe, et al.
Publicado: (2026)
The Impact of Reasoning Step Length on Large Language Models
por: Jin, Mingyu, et al.
Publicado: (2024)
por: Jin, Mingyu, et al.
Publicado: (2024)
Closing the Confidence-Faithfulness Gap in Large Language Models
por: Miao, Miranda Muqing, et al.
Publicado: (2026)
por: Miao, Miranda Muqing, et al.
Publicado: (2026)
When Quantization Affects Confidence of Large Language Models?
por: Proskurina, Irina, et al.
Publicado: (2024)
por: Proskurina, Irina, et al.
Publicado: (2024)
GRIP: In-Parameter Graph Reasoning through Fine-Tuning Large Language Models
por: Feng, Jiarui, et al.
Publicado: (2025)
por: Feng, Jiarui, et al.
Publicado: (2025)
Graph-based Confidence Calibration for Large Language Models
por: Li, Yukun, et al.
Publicado: (2024)
por: Li, Yukun, et al.
Publicado: (2024)
Explaining the Reasoning of Large Language Models Using Attribution Graphs
por: Walker, Chase, et al.
Publicado: (2025)
por: Walker, Chase, et al.
Publicado: (2025)
Confidence Matters: Revisiting Intrinsic Self-Correction Capabilities of Large Language Models
por: Li, Loka, et al.
Publicado: (2024)
por: Li, Loka, et al.
Publicado: (2024)
Reasoning Models Better Express Their Confidence
por: Yoon, Dongkeun, et al.
Publicado: (2025)
por: Yoon, Dongkeun, et al.
Publicado: (2025)
TopViewRS: Vision-Language Models as Top-View Spatial Reasoners
por: Li, Chengzu, et al.
Publicado: (2024)
por: Li, Chengzu, et al.
Publicado: (2024)
Ejemplares similares
-
ReasonGraph: Visualisation of Reasoning Paths
por: Li, Zongqian, et al.
Publicado: (2025) -
Conformity in Large Language Models
por: Zhu, Xiaochen, et al.
Publicado: (2024) -
LoVeC: Reinforcement Learning for Better Verbalized Confidence in Long-Form Generations
por: Zhang, Caiqi, et al.
Publicado: (2025) -
Aligning with Logic: Measuring, Evaluating and Improving Logical Preference Consistency in Large Language Models
por: Liu, Yinhong, et al.
Publicado: (2024) -
Aligning with Human Judgement: The Role of Pairwise Preference in Large Language Model Evaluators
por: Liu, Yinhong, et al.
Publicado: (2024)