SeRL: Self-Play Reinforcement Learning for Large Language Models with Limited Data

Fuente: arXiv
Enregistré dans:
Détails bibliographiques
Auteurs principaux: Fang, Wenkai, Liu, Shunyu, Zhou, Yang, Zhang, Kongcheng, Zheng, Tongya, Chen, Kaixuan, Song, Mingli, Tao, Dacheng
Format: Preprint
Publié: 2025
Sujets:
Accès en ligne:
Tags: Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!

Documents similaires