Learning from Failures: Correction-Oriented Policy Optimization with Verifiable Rewards

Fuente: arXiv
Gespeichert in:
Bibliographische Detailangaben
Hauptverfasser: Ren, Mengjie, Lou, Jie, Cao, Boxi, Wen, Xueru, Lin, Hongyu, Han, Xianpei, Sun, Le, Yu, Xing, Lu, Yaojie
Format: Preprint
Veröffentlicht: 2026
Schlagworte:
Online-Zugang:
Tags: Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!

Ähnliche Einträge