DeepSeek-Prover-V1.5: Harnessing Proof Assistant Feedback for Reinforcement Learning and Monte-Carlo Tree Search

Fuente: arXiv
Guardado en:
Detalles Bibliográficos
Autores principales: Xin, Huajian, Ren, Z. Z., Song, Junxiao, Shao, Zhihong, Zhao, Wanjia, Wang, Haocheng, Liu, Bo, Zhang, Liyue, Lu, Xuan, Du, Qiushi, Gao, Wenjun, Zhu, Qihao, Yang, Dejian, Gou, Zhibin, Wu, Z. F., Luo, Fuli, Ruan, Chong
Formato: Preprint
Publicado: 2024
Materias:
Acceso en línea:
Etiquetas: Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!