Reinforcement Inference: Leveraging Uncertainty for Self-Correcting Language Model Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Sun, Xinhai |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
From Entropy to Calibrated Uncertainty: Training Language Models to Reason About Uncertainty
par: Jenane, Azza, et autres
Publié: (2026)
par: Jenane, Azza, et autres
Publié: (2026)
Leveraging Self-Consistency for Data-Efficient Amortized Bayesian Inference
par: Schmitt, Marvin, et autres
Publié: (2023)
par: Schmitt, Marvin, et autres
Publié: (2023)
Tracing Uncertainty in Language Model "Reasoning"
par: Grünefeld, Nils, et autres
Publié: (2026)
par: Grünefeld, Nils, et autres
Publié: (2026)
Reasoning Language Model Inference Serving Unveiled: An Empirical Study
par: Li, Qi, et autres
Publié: (2025)
par: Li, Qi, et autres
Publié: (2025)
Meta-Reasoner: Dynamic Guidance for Optimized Inference-time Reasoning in Large Language Models
par: Sui, Yuan, et autres
Publié: (2025)
par: Sui, Yuan, et autres
Publié: (2025)
Accelerating Large-Scale Reasoning Model Inference with Sparse Self-Speculative Decoding
par: Zhao, Yilong, et autres
Publié: (2025)
par: Zhao, Yilong, et autres
Publié: (2025)
Reinforcement Learning for Sequence Design Leveraging Protein Language Models
par: Subramanian, Jithendaraa, et autres
Publié: (2024)
par: Subramanian, Jithendaraa, et autres
Publié: (2024)
Memory Injections: Correcting Multi-Hop Reasoning Failures during Inference in Transformer-Based Language Models
par: Sakarvadia, Mansi, et autres
Publié: (2023)
par: Sakarvadia, Mansi, et autres
Publié: (2023)
Online Preference-based Reinforcement Learning with Self-augmented Feedback from Large Language Model
par: Tu, Songjun, et autres
Publié: (2024)
par: Tu, Songjun, et autres
Publié: (2024)
Beyond Correctness: Confidence-Aware Reward Modeling for Enhancing Large Language Model Reasoning
par: He, Qianxi, et autres
Publié: (2025)
par: He, Qianxi, et autres
Publié: (2025)
Reinforcing Chain-of-Thought Reasoning with Self-Evolving Rubrics
par: Sheng, Leheng, et autres
Publié: (2026)
par: Sheng, Leheng, et autres
Publié: (2026)
Synthetic Error Injection Fails to Elicit Self-Correction In Language Models
par: Wu, David X., et autres
Publié: (2025)
par: Wu, David X., et autres
Publié: (2025)
Optimal Self-Consistency for Efficient Reasoning with Large Language Models
par: Feng, Austin, et autres
Publié: (2025)
par: Feng, Austin, et autres
Publié: (2025)
Quantifying and Understanding Uncertainty in Large Reasoning Models
par: Li, Yangyi, et autres
Publié: (2026)
par: Li, Yangyi, et autres
Publié: (2026)
PAHQ: Accelerating Automated Circuit Discovery through Mixed-Precision Inference Optimization
par: Wang, Xinhai, et autres
Publié: (2025)
par: Wang, Xinhai, et autres
Publié: (2025)
When to ASK: Uncertainty-Gated Language Assistance for Reinforcement Learning
par: Monteiro, Juarez, et autres
Publié: (2026)
par: Monteiro, Juarez, et autres
Publié: (2026)
Adaptive Negative Reinforcement for LLM Reasoning:Dynamically Balancing Correction and Diversity in RLVR
par: Ingle, Yash, et autres
Publié: (2026)
par: Ingle, Yash, et autres
Publié: (2026)
FastVLM: Self-Speculative Decoding for Fast Vision-Language Model Inference
par: Bajpai, Divya Jyoti, et autres
Publié: (2025)
par: Bajpai, Divya Jyoti, et autres
Publié: (2025)
PALADIN: Self-Correcting Language Model Agents to Cure Tool-Failure Cases
par: Vuddanti, Sri Vatsa, et autres
Publié: (2025)
par: Vuddanti, Sri Vatsa, et autres
Publié: (2025)
Reasoning on the Manifold: Bidirectional Consistency for Self-Verification in Diffusion Language Models
par: Ruan, Jiaoyang, et autres
Publié: (2026)
par: Ruan, Jiaoyang, et autres
Publié: (2026)
Self-Correction Bench: Uncovering and Addressing the Self-Correction Blind Spot in Large Language Models
par: Tsui, Ken
Publié: (2025)
par: Tsui, Ken
Publié: (2025)
Can Large Reasoning Models do Analogical Reasoning under Perceptual Uncertainty?
par: Camposampiero, Giacomo, et autres
Publié: (2025)
par: Camposampiero, Giacomo, et autres
Publié: (2025)
The Geometry of Self-Verification in a Task-Specific Reasoning Model
par: Lee, Andrew, et autres
Publié: (2025)
par: Lee, Andrew, et autres
Publié: (2025)
Robust Uncertainty Quantification for Self-Evolving Large Language Models via Continual Domain Pretraining
par: Zhou, Xiaofan, et autres
Publié: (2025)
par: Zhou, Xiaofan, et autres
Publié: (2025)
GDSD: Reinforcement Learning as Guided Denoiser Self-Distillation for Diffusion Language Models
par: Tang, Xiaohang, et autres
Publié: (2026)
par: Tang, Xiaohang, et autres
Publié: (2026)
VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning
par: Wang, Haozhe, et autres
Publié: (2025)
par: Wang, Haozhe, et autres
Publié: (2025)
Mitigating Overthinking in Large Reasoning Models via Difficulty-aware Reinforcement Learning
par: Wan, Qian, et autres
Publié: (2026)
par: Wan, Qian, et autres
Publié: (2026)
PLADIS: Pushing the Limits of Attention in Diffusion Models at Inference Time by Leveraging Sparsity
par: Kim, Kwanyoung, et autres
Publié: (2025)
par: Kim, Kwanyoung, et autres
Publié: (2025)
Active Preference Inference using Language Models and Probabilistic Reasoning
par: Piriyakulkij, Wasu Top, et autres
Publié: (2023)
par: Piriyakulkij, Wasu Top, et autres
Publié: (2023)
ConU: Conformal Uncertainty in Large Language Models with Correctness Coverage Guarantees
par: Wang, Zhiyuan, et autres
Publié: (2024)
par: Wang, Zhiyuan, et autres
Publié: (2024)
The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models
par: Cui, Ganqu, et autres
Publié: (2025)
par: Cui, Ganqu, et autres
Publié: (2025)
A Simple Unified Uncertainty-Guided Framework for Offline-to-Online Reinforcement Learning
par: Guo, Siyuan, et autres
Publié: (2023)
par: Guo, Siyuan, et autres
Publié: (2023)
Stabilizing Reinforcement Learning for Diffusion Language Models
par: Zhong, Jianyuan, et autres
Publié: (2026)
par: Zhong, Jianyuan, et autres
Publié: (2026)
Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning
par: Manchingal, Shireen Kudukkil, et autres
Publié: (2026)
par: Manchingal, Shireen Kudukkil, et autres
Publié: (2026)
Self-Hinting Language Models Enhance Reinforcement Learning
par: Liao, Baohao, et autres
Publié: (2026)
par: Liao, Baohao, et autres
Publié: (2026)
Reasoning Circuits in Language Models: A Mechanistic Interpretation of Syllogistic Inference
par: Kim, Geonhee, et autres
Publié: (2024)
par: Kim, Geonhee, et autres
Publié: (2024)
TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning
par: Zhang, Tunyu, et autres
Publié: (2025)
par: Zhang, Tunyu, et autres
Publié: (2025)
RL-STaR: Theoretical Analysis of Reinforcement Learning Frameworks for Self-Taught Reasoner
par: Chang, Fu-Chieh, et autres
Publié: (2024)
par: Chang, Fu-Chieh, et autres
Publié: (2024)
Leveraging Language Models for Automated Patient Record Linkage
par: Beheshti, Mohammad, et autres
Publié: (2025)
par: Beheshti, Mohammad, et autres
Publié: (2025)
Efficient Reinforcement Learning for Large Language Models with Intrinsic Exploration
par: Sun, Yan, et autres
Publié: (2025)
par: Sun, Yan, et autres
Publié: (2025)
Documents similaires
-
From Entropy to Calibrated Uncertainty: Training Language Models to Reason About Uncertainty
par: Jenane, Azza, et autres
Publié: (2026) -
Leveraging Self-Consistency for Data-Efficient Amortized Bayesian Inference
par: Schmitt, Marvin, et autres
Publié: (2023) -
Tracing Uncertainty in Language Model "Reasoning"
par: Grünefeld, Nils, et autres
Publié: (2026) -
Reasoning Language Model Inference Serving Unveiled: An Empirical Study
par: Li, Qi, et autres
Publié: (2025) -
Meta-Reasoner: Dynamic Guidance for Optimized Inference-time Reasoning in Large Language Models
par: Sui, Yuan, et autres
Publié: (2025)