Ring-lite: Scalable Reasoning via C3PO-Stabilized Reinforcement Learning for LLMs

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Ling Team, Hu, Bin, Chen, Cai, Zhao, Deng, Liu, Ding, Jin, Dingnan, Zhu, Feng, Dai, Hao, Luan, Hongzhi, Guo, Jia, Liu, Jiaming, Wu, Jiewei, Mei, Jun, Zhou, Jun, Zhao, Junbo, Xiong, Junwu, Zhang, Kaihong, Xu, Kuan, Liang, Lei, Jiang, Liang, Fu, Liangcheng, Zheng, Longfei, Gao, Qiang, Cui, Qing, Wan, Quan, Zheng, Shaomian, Li, Shuaicheng, Yang, Tongkai, Ren, Wang, Yan, Xiaodong, Wan, Xiaopei, Feng, Xiaoyun, Zhao, Xin, Yang, Xinxing, Kong, Xinyu, Yang, Xuemin, Li, Yang, Wu, Yingting, Liu, Yongkang, Xu, Zhankai, Zhang, Zhenduo, Zhou, Zhenglei, Huang, Zhenyu, Zhang, Zhiqiang, Wang, Zihao, Wen, Zujie
Natura: Preprint
Pubblicazione: 2025
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!

Documenti analoghi