Reinforcement Learning for Reasoning in Large Language Models with One Training Example

Fuente: arXiv
Gespeichert in:
Bibliographische Detailangaben
Hauptverfasser: Wang, Yiping, Yang, Qing, Zeng, Zhiyuan, Ren, Liliang, Liu, Liyuan, Peng, Baolin, Cheng, Hao, He, Xuehai, Wang, Kuan, Gao, Jianfeng, Chen, Weizhu, Wang, Shuohang, Du, Simon Shaolei, Shen, Yelong
Format: Preprint
Veröffentlicht: 2025
Schlagworte:
Online-Zugang:
Tags: Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!