TraPO: A Semi-Supervised Reinforcement Learning Framework for Boosting LLM Reasoning

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Yang, Shenzhi, Zhu, Guangcheng, Zheng, Xing, MA, Yingfan, Chen, Zhongqi, Song, Bowen, Wang, Weiqiang, Zhao, Junbo, Chen, Gang, Wang, Haobo
Natura: Preprint
Pubblicazione: 2025
Soggetti:
Accesso online:
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!