How to Train Your Deep Research Agent? Prompt, Reward, and Policy Optimization in Search-R1

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Xu, Yinuo, Lu, Shuo, Cheng, Jianjie, Wang, Meng, Xie, Qianlong, Wang, Xingxing, He, Ran, Liang, Jian
Format: Preprint
Published: 2026
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!

Similar Items