Critique-RL: Training Language Models for Critiquing through Two-Stage Reinforcement Learning

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Xi, Zhiheng, Huang, Jixuan, Guo, Xin, Hong, Boyang, Yang, Dingwen, Fan, Xiaoran, Li, Shuo, Chen, Zehui, Ye, Junjie, Yuan, Siyu, Du, Zhengyin, Yao, Xuesong, Xu, Yufei, Chen, Jiecao, Zheng, Rui, Gui, Tao, Zhang, Qi, Huang, Xuanjing
Natura: Preprint
Pubblicazione: 2025
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!