Confidence Matters: Revisiting Intrinsic Self-Correction Capabilities of Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Loka, Chen, Zhenhao, Chen, Guangyi, Zhang, Yixuan, Su, Yusheng, Xing, Eric, Zhang, Kun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Reflection-Window Decoding: Text Generation with Selective Refinement
di: Tang, Zeyu, et al.
Pubblicazione: (2025)
di: Tang, Zeyu, et al.
Pubblicazione: (2025)
Large Language Models have Intrinsic Self-Correction Ability
di: Liu, Dancheng, et al.
Pubblicazione: (2024)
di: Liu, Dancheng, et al.
Pubblicazione: (2024)
Evaluating and Improving Robustness in Large Language Models: A Survey and Future Directions
di: Zhang, Kun, et al.
Pubblicazione: (2025)
di: Zhang, Kun, et al.
Pubblicazione: (2025)
Causality for Large Language Models
di: Wu, Anpeng, et al.
Pubblicazione: (2024)
di: Wu, Anpeng, et al.
Pubblicazione: (2024)
MedCritical: Enhancing Medical Reasoning in Small Language Models via Self-Collaborative Correction
di: Su, Xinchun, et al.
Pubblicazione: (2025)
di: Su, Xinchun, et al.
Pubblicazione: (2025)
Common 7B Language Models Already Possess Strong Math Capabilities
di: Li, Chen, et al.
Pubblicazione: (2024)
di: Li, Chen, et al.
Pubblicazione: (2024)
Bi-directional Bias Attribution: Debiasing Large Language Models without Modifying Prompts
di: Lin, Yujie, et al.
Pubblicazione: (2026)
di: Lin, Yujie, et al.
Pubblicazione: (2026)
DiffuGuard: How Intrinsic Safety is Lost and Found in Diffusion Large Language Models
di: Li, Zherui, et al.
Pubblicazione: (2025)
di: Li, Zherui, et al.
Pubblicazione: (2025)
Adapting Large Language Models for Education: Foundational Capabilities, Potentials, and Challenges
di: Li, Qingyao, et al.
Pubblicazione: (2023)
di: Li, Qingyao, et al.
Pubblicazione: (2023)
Fact-Level Confidence Calibration and Self-Correction
di: Yuan, Yige, et al.
Pubblicazione: (2024)
di: Yuan, Yige, et al.
Pubblicazione: (2024)
Large Language Models Cannot Self-Correct Reasoning Yet
di: Huang, Jie, et al.
Pubblicazione: (2023)
di: Huang, Jie, et al.
Pubblicazione: (2023)
Revisiting Compositional Generalization Capability of Large Language Models Considering Instruction Following Ability
di: Sakai, Yusuke, et al.
Pubblicazione: (2025)
di: Sakai, Yusuke, et al.
Pubblicazione: (2025)
Learning to Check: Unleashing Potentials for Self-Correction in Large Language Models
di: Zhang, Che, et al.
Pubblicazione: (2024)
di: Zhang, Che, et al.
Pubblicazione: (2024)
MuBench: Assessment of Multilingual Capabilities of Large Language Models Across 61 Languages
di: Han, Wenhan, et al.
Pubblicazione: (2025)
di: Han, Wenhan, et al.
Pubblicazione: (2025)
Finding Answers in Thought Matters: Revisiting Evaluation on Large Language Models with Reasoning
di: Jo, Hwiyeol, et al.
Pubblicazione: (2025)
di: Jo, Hwiyeol, et al.
Pubblicazione: (2025)
GraphInstruct: Empowering Large Language Models with Graph Understanding and Reasoning Capability
di: Luo, Zihan, et al.
Pubblicazione: (2024)
di: Luo, Zihan, et al.
Pubblicazione: (2024)
The Self-Improvement Paradox: Can Language Models Bootstrap Reasoning Capabilities without External Scaffolding?
di: Sun, Yutao, et al.
Pubblicazione: (2025)
di: Sun, Yutao, et al.
Pubblicazione: (2025)
CRITIC: Large Language Models Can Self-Correct with Tool-Interactive Critiquing
di: Gou, Zhibin, et al.
Pubblicazione: (2023)
di: Gou, Zhibin, et al.
Pubblicazione: (2023)
A Layered Architecture for Developing and Enhancing Capabilities in Large Language Model-based Software Systems
di: Zhang, Dawen, et al.
Pubblicazione: (2024)
di: Zhang, Dawen, et al.
Pubblicazione: (2024)
GRATH: Gradual Self-Truthifying for Large Language Models
di: Chen, Weixin, et al.
Pubblicazione: (2024)
di: Chen, Weixin, et al.
Pubblicazione: (2024)
ProgCo: Program Helps Self-Correction of Large Language Models
di: Song, Xiaoshuai, et al.
Pubblicazione: (2025)
di: Song, Xiaoshuai, et al.
Pubblicazione: (2025)
TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models
di: Li, Ce, et al.
Pubblicazione: (2025)
di: Li, Ce, et al.
Pubblicazione: (2025)
LARFT: Closing the Cognition-Action Gap for Length Instruction Following in Large Language Models
di: Zhang, Wei, et al.
Pubblicazione: (2026)
di: Zhang, Wei, et al.
Pubblicazione: (2026)
IIMedGPT: Promoting Large Language Model Capabilities of Medical Tasks by Efficient Human Preference Alignment
di: Zhang, Yiming, et al.
Pubblicazione: (2025)
di: Zhang, Yiming, et al.
Pubblicazione: (2025)
Premise Order Matters in Reasoning with Large Language Models
di: Chen, Xinyun, et al.
Pubblicazione: (2024)
di: Chen, Xinyun, et al.
Pubblicazione: (2024)
Towards Tracing Trustworthiness Dynamics: Revisiting Pre-training Period of Large Language Models
di: Qian, Chen, et al.
Pubblicazione: (2024)
di: Qian, Chen, et al.
Pubblicazione: (2024)
Enhancing Emotional Generation Capability of Large Language Models via Emotional Chain-of-Thought
di: Li, Zaijing, et al.
Pubblicazione: (2024)
di: Li, Zaijing, et al.
Pubblicazione: (2024)
Exploring the Capabilities of Large Multimodal Models on Dense Text
di: Zhang, Shuo, et al.
Pubblicazione: (2024)
di: Zhang, Shuo, et al.
Pubblicazione: (2024)
What is an "Abstract Reasoner"? Revisiting Experiments and Arguments about Large Language Models
di: Yun, Tian, et al.
Pubblicazione: (2025)
di: Yun, Tian, et al.
Pubblicazione: (2025)
Closing the Confidence-Faithfulness Gap in Large Language Models
di: Miao, Miranda Muqing, et al.
Pubblicazione: (2026)
di: Miao, Miranda Muqing, et al.
Pubblicazione: (2026)
When Quantization Affects Confidence of Large Language Models?
di: Proskurina, Irina, et al.
Pubblicazione: (2024)
di: Proskurina, Irina, et al.
Pubblicazione: (2024)
ConfTuner: Training Large Language Models to Express Their Confidence Verbally
di: Li, Yibo, et al.
Pubblicazione: (2025)
di: Li, Yibo, et al.
Pubblicazione: (2025)
Confidence-Calibrated Small-Large Language Model Collaboration for Cost-Efficient Reasoning
di: Zhang, Chuang, et al.
Pubblicazione: (2026)
di: Zhang, Chuang, et al.
Pubblicazione: (2026)
Self-Anchoring Calibration Drift in Large Language Models: How Multi-Turn Conversations Reshape Model Confidence
di: Harshavardhan
Pubblicazione: (2026)
di: Harshavardhan
Pubblicazione: (2026)
All Languages Matter: On the Multilingual Safety of Large Language Models
di: Wang, Wenxuan, et al.
Pubblicazione: (2023)
di: Wang, Wenxuan, et al.
Pubblicazione: (2023)
Safety-Aware Fine-Tuning of Large Language Models
di: Choi, Hyeong Kyu, et al.
Pubblicazione: (2024)
di: Choi, Hyeong Kyu, et al.
Pubblicazione: (2024)
Second-Order Information Matters: Revisiting Machine Unlearning for Large Language Models
di: Gu, Kang, et al.
Pubblicazione: (2024)
di: Gu, Kang, et al.
Pubblicazione: (2024)
Decision-Level Ordinal Modeling for Multimodal Essay Scoring with Large Language Models
di: Zhang, Han, et al.
Pubblicazione: (2026)
di: Zhang, Han, et al.
Pubblicazione: (2026)
Revisiting Rule-Based Stuttering Detection: A Comprehensive Analysis of Interpretable Models for Clinical Applications
di: Zhang, Eric
Pubblicazione: (2025)
di: Zhang, Eric
Pubblicazione: (2025)
All Roads Lead to Rome: Graph-Based Confidence Estimation for Large Language Model Reasoning
di: Zhang, Caiqi, et al.
Pubblicazione: (2025)
di: Zhang, Caiqi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Reflection-Window Decoding: Text Generation with Selective Refinement
di: Tang, Zeyu, et al.
Pubblicazione: (2025) -
Large Language Models have Intrinsic Self-Correction Ability
di: Liu, Dancheng, et al.
Pubblicazione: (2024) -
Evaluating and Improving Robustness in Large Language Models: A Survey and Future Directions
di: Zhang, Kun, et al.
Pubblicazione: (2025) -
Causality for Large Language Models
di: Wu, Anpeng, et al.
Pubblicazione: (2024) -
MedCritical: Enhancing Medical Reasoning in Small Language Models via Self-Collaborative Correction
di: Su, Xinchun, et al.
Pubblicazione: (2025)