Critique-RL: Training Language Models for Critiquing through Two-Stage Reinforcement Learning

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Xi, Zhiheng, Huang, Jixuan, Guo, Xin, Hong, Boyang, Yang, Dingwen, Fan, Xiaoran, Li, Shuo, Chen, Zehui, Ye, Junjie, Yuan, Siyu, Du, Zhengyin, Yao, Xuesong, Xu, Yufei, Chen, Jiecao, Zheng, Rui, Gui, Tao, Zhang, Qi, Huang, Xuanjing
Format: Preprint
Published: 2025
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!