DeepSeek-Prover-V1.5: Harnessing Proof Assistant Feedback for Reinforcement Learning and Monte-Carlo Tree Search

Fuente: arXiv
Gespeichert in:
Bibliographische Detailangaben
Hauptverfasser: Xin, Huajian, Ren, Z. Z., Song, Junxiao, Shao, Zhihong, Zhao, Wanjia, Wang, Haocheng, Liu, Bo, Zhang, Liyue, Lu, Xuan, Du, Qiushi, Gao, Wenjun, Zhu, Qihao, Yang, Dejian, Gou, Zhibin, Wu, Z. F., Luo, Fuli, Ruan, Chong
Format: Preprint
Veröffentlicht: 2024
Schlagworte:
Online-Zugang:
Tags: Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!

Ähnliche Einträge