Decoupling Reasoning and Confidence: Resurrecting Calibration in Reinforcement Learning from Verifiable Rewards

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Ma, Zhengzhao, Wen, Xueru, Cao, Boxi, Lu, Yaojie, Lin, Hongyu, Yang, Jinglin, He, Min, Han, Xianpei, Sun, Le
Natura: Preprint
Pubblicazione: 2026
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!