TL-GRPO: Turn-Level RL for Reasoning-Guided Iterative Optimization

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Li, Peiji, Li, Linyang, Sun, Handa, Mai, Wenjin, Chen, Yongkang, Li, Xiaozhe, Shen, Yue, Ma, Yichuan, Sun, Yiliu, Cao, Jiaxi, He, Zhishu, Wang, Bo, Zheng, Xiaoqing, Bi, Zhaori, Qiu, Xipeng, Guo, Qipeng, Chen, Kai, Lin, Dahua
Natura: Preprint
Pubblicazione: 2026
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!