How to Train Your Deep Research Agent? Prompt, Reward, and Policy Optimization in Search-R1

Fuente: arXiv
Guardado en:
Detalles Bibliográficos
Autores principales: Xu, Yinuo, Lu, Shuo, Cheng, Jianjie, Wang, Meng, Xie, Qianlong, Wang, Xingxing, He, Ran, Liang, Jian
Formato: Preprint
Publicado: 2026
Materias:
Acceso en línea:
Etiquetas: Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!