Decoupling Reasoning and Confidence: Resurrecting Calibration in Reinforcement Learning from Verifiable Rewards
Fuente:
arXiv
Salvato in:
| Autori principali: | Ma, Zhengzhao, Wen, Xueru, Cao, Boxi, Lu, Yaojie, Lin, Hongyu, Yang, Jinglin, He, Min, Han, Xianpei, Sun, Le |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Learning from Failures: Correction-Oriented Policy Optimization with Verifiable Rewards
di: Ren, Mengjie, et al.
Pubblicazione: (2026)
di: Ren, Mengjie, et al.
Pubblicazione: (2026)
Beyond Correctness: Benchmarking Multi-dimensional Code Generation for Large Language Models
di: Zheng, Jiasheng, et al.
Pubblicazione: (2024)
di: Zheng, Jiasheng, et al.
Pubblicazione: (2024)
P^2O: Joint Policy and Prompt Optimization
di: Lu, Xinyu, et al.
Pubblicazione: (2026)
di: Lu, Xinyu, et al.
Pubblicazione: (2026)
Coupled Variational Reinforcement Learning for Language Model General Reasoning
di: Wen, Xueru, et al.
Pubblicazione: (2025)
di: Wen, Xueru, et al.
Pubblicazione: (2025)
Search, Verify and Feedback: Towards Next Generation Post-training Paradigm of Foundation Models via Verifier Engineering
di: Guan, Xinyan, et al.
Pubblicazione: (2024)
di: Guan, Xinyan, et al.
Pubblicazione: (2024)
Rethinking Reward Model Evaluation: Are We Barking up the Wrong Tree?
di: Wen, Xueru, et al.
Pubblicazione: (2024)
di: Wen, Xueru, et al.
Pubblicazione: (2024)
Critic-CoT: Boosting the reasoning abilities of large language model via Chain-of-thoughts Critic
di: Zheng, Xin, et al.
Pubblicazione: (2024)
di: Zheng, Xin, et al.
Pubblicazione: (2024)
The Life Cycle of Knowledge in Big Language Models: A Survey
di: Cao, Boxi, et al.
Pubblicazione: (2023)
di: Cao, Boxi, et al.
Pubblicazione: (2023)
Multi-Facet Counterfactual Learning for Content Quality Evaluation
di: Zheng, Jiasheng, et al.
Pubblicazione: (2024)
di: Zheng, Jiasheng, et al.
Pubblicazione: (2024)
Beyond Text-Dominance: Understanding Modality Preference of Omni-modal Large Language Models
di: Yan, Xinru, et al.
Pubblicazione: (2026)
di: Yan, Xinru, et al.
Pubblicazione: (2026)
ScaleBox: Enabling High-Fidelity and Scalable Code Verification for Large Language Models
di: Zheng, Jiasheng, et al.
Pubblicazione: (2026)
di: Zheng, Jiasheng, et al.
Pubblicazione: (2026)
Combinatorial Synthesis: Scaling Code RLVR via Atomic Decomposition and Recombination
di: Zheng, Jiasheng, et al.
Pubblicazione: (2026)
di: Zheng, Jiasheng, et al.
Pubblicazione: (2026)
Memorizing is Not Enough: Deep Knowledge Injection Through Reasoning
di: Xu, Ruoxi, et al.
Pubblicazione: (2025)
di: Xu, Ruoxi, et al.
Pubblicazione: (2025)
When Models Outthink Their Safety: Unveiling and Mitigating Self-Jailbreak in Large Reasoning Models
di: Mao, Yingzhi, et al.
Pubblicazione: (2025)
di: Mao, Yingzhi, et al.
Pubblicazione: (2025)
LiteCoder-Terminal: Scaling Long-Horizon Terminal Environments for Learning Language Agents
di: Peng, Xiaoxuan, et al.
Pubblicazione: (2026)
di: Peng, Xiaoxuan, et al.
Pubblicazione: (2026)
The Devil Is in the Details: Tackling Unimodal Spurious Correlations for Generalizable Multimodal Reward Models
di: Li, Zichao, et al.
Pubblicazione: (2025)
di: Li, Zichao, et al.
Pubblicazione: (2025)
Cheems: A Practical Guidance for Building and Evaluating Chinese Reward Models from Scratch
di: Wen, Xueru, et al.
Pubblicazione: (2025)
di: Wen, Xueru, et al.
Pubblicazione: (2025)
Transferable Post-training via Inverse Value Learning
di: Lu, Xinyu, et al.
Pubblicazione: (2024)
di: Lu, Xinyu, et al.
Pubblicazione: (2024)
Rule or Story, Which is a Better Commonsense Expression for Talking with Large Language Models?
di: Bian, Ning, et al.
Pubblicazione: (2024)
di: Bian, Ning, et al.
Pubblicazione: (2024)
CRUXEval-X: A Benchmark for Multilingual Code Reasoning, Understanding and Execution
di: Xu, Ruiyang, et al.
Pubblicazione: (2024)
di: Xu, Ruiyang, et al.
Pubblicazione: (2024)
Towards Universal Dense Blocking for Entity Resolution
di: Wang, Tianshu, et al.
Pubblicazione: (2024)
di: Wang, Tianshu, et al.
Pubblicazione: (2024)
REInstruct: Building Instruction Data from Unlabeled Corpus
di: Chen, Shu, et al.
Pubblicazione: (2024)
di: Chen, Shu, et al.
Pubblicazione: (2024)
Executing Natural Language-Described Algorithms with Large Language Models: An Investigation
di: Zheng, Xin, et al.
Pubblicazione: (2024)
di: Zheng, Xin, et al.
Pubblicazione: (2024)
Meta-Cognitive Analysis: Evaluating Declarative and Procedural Knowledge in Datasets and Large Language Models
di: Li, Zhuoqun, et al.
Pubblicazione: (2024)
di: Li, Zhuoqun, et al.
Pubblicazione: (2024)
Open Grounded Planning: Challenges and Benchmark Construction
di: Guo, Shiguang, et al.
Pubblicazione: (2024)
di: Guo, Shiguang, et al.
Pubblicazione: (2024)
MemSearcher: Training LLMs to Reason, Search and Manage Memory via End-to-End Reinforcement Learning
di: Yuan, Qianhao, et al.
Pubblicazione: (2025)
di: Yuan, Qianhao, et al.
Pubblicazione: (2025)
On-Policy Self-Alignment with Fine-grained Knowledge Feedback for Hallucination Mitigation
di: Wen, Xueru, et al.
Pubblicazione: (2024)
di: Wen, Xueru, et al.
Pubblicazione: (2024)
URL: Universal Referential Knowledge Linking via Task-instructed Representation Compression
di: Li, Zhuoqun, et al.
Pubblicazione: (2024)
di: Li, Zhuoqun, et al.
Pubblicazione: (2024)
SAISA: Towards Multimodal Large Language Models with Both Training and Inference Efficiency
di: Yuan, Qianhao, et al.
Pubblicazione: (2025)
di: Yuan, Qianhao, et al.
Pubblicazione: (2025)
Tackling Length Inflation Without Trade-offs: Group Relative Reward Rescaling for Reinforcement Learning
di: Li, Zichao, et al.
Pubblicazione: (2026)
di: Li, Zichao, et al.
Pubblicazione: (2026)
DOMAINEVAL: An Auto-Constructed Benchmark for Multi-Domain Code Generation
di: Zhu, Qiming, et al.
Pubblicazione: (2024)
di: Zhu, Qiming, et al.
Pubblicazione: (2024)
Spiral of Silence: How is Large Language Model Killing Information Retrieval? -- A Case Study on Open Domain Question Answering
di: Chen, Xiaoyang, et al.
Pubblicazione: (2024)
di: Chen, Xiaoyang, et al.
Pubblicazione: (2024)
StructEval: Deepen and Broaden Large Language Model Assessment via Structured Evaluation
di: Cao, Boxi, et al.
Pubblicazione: (2024)
di: Cao, Boxi, et al.
Pubblicazione: (2024)
All Languages Matter: Understanding and Mitigating Language Bias in Multilingual RAG
di: Wang, Dan, et al.
Pubblicazione: (2026)
di: Wang, Dan, et al.
Pubblicazione: (2026)
Few-shot Named Entity Recognition via Superposition Concept Discrimination
di: Chen, Jiawei, et al.
Pubblicazione: (2024)
di: Chen, Jiawei, et al.
Pubblicazione: (2024)
Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation
di: Yuan, Qianhao, et al.
Pubblicazione: (2026)
di: Yuan, Qianhao, et al.
Pubblicazione: (2026)
A Unified View of Delta Parameter Editing in Post-Trained Large-Scale Models
di: Tang, Qiaoyu, et al.
Pubblicazione: (2024)
di: Tang, Qiaoyu, et al.
Pubblicazione: (2024)
Towards Scalable Automated Alignment of LLMs: A Survey
di: Cao, Boxi, et al.
Pubblicazione: (2024)
di: Cao, Boxi, et al.
Pubblicazione: (2024)
ChatGPT is a Knowledgeable but Inexperienced Solver: An Investigation of Commonsense Problem in Large Language Models
di: Bian, Ning, et al.
Pubblicazione: (2023)
di: Bian, Ning, et al.
Pubblicazione: (2023)
SoFA: Shielded On-the-fly Alignment via Priority Rule Following
di: Lu, Xinyu, et al.
Pubblicazione: (2024)
di: Lu, Xinyu, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Learning from Failures: Correction-Oriented Policy Optimization with Verifiable Rewards
di: Ren, Mengjie, et al.
Pubblicazione: (2026) -
Beyond Correctness: Benchmarking Multi-dimensional Code Generation for Large Language Models
di: Zheng, Jiasheng, et al.
Pubblicazione: (2024) -
P^2O: Joint Policy and Prompt Optimization
di: Lu, Xinyu, et al.
Pubblicazione: (2026) -
Coupled Variational Reinforcement Learning for Language Model General Reasoning
di: Wen, Xueru, et al.
Pubblicazione: (2025) -
Search, Verify and Feedback: Towards Next Generation Post-training Paradigm of Foundation Models via Verifier Engineering
di: Guan, Xinyan, et al.
Pubblicazione: (2024)