VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Yue, Yu, Yuan, Yufeng, Yu, Qiying, Zuo, Xiaochen, Zhu, Ruofei, Xu, Wenyuan, Chen, Jiaze, Wang, Chengyi, Fan, TianTian, Du, Zhengyin, Wei, Xiangpeng, Yu, Xiangyu, Liu, Gaohong, Liu, Juncai, Liu, Lingjun, Lin, Haibin, Lin, Zhiqi, Ma, Bole, Zhang, Chi, Zhang, Mofan, Zhang, Wang, Zhu, Hang, Zhang, Ru, Liu, Xin, Wang, Mingxuan, Wu, Yonghui, Yan, Lin
Natura: Preprint
Pubblicazione: 2025
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!