Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Cai, Xin-Qiang, Wang, Wei, Liu, Feng, Liu, Tongliang, Niu, Gang, Sugiyama, Masashi
Format: Preprint
Published: 2025
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!