_version_ 1866918265038569472
author Hu, Chen
Du, Haikuo
Wang, Heng
Lin, Lin
Chen, Mingrui
Liu, Peng
Miao, Ruihang
Yue, Tianchi
You, Wang
Ji, Wei
Yuan, Wei
Deng, Wenjin
Yuan, Xiaojian
Zhang, Xiaoyun
Liu, Xiangyu
Liu, Xikai
Xu, Yanming
Cao, Yicheng
Zhang, Yifei
Wang, Yongyao
Shu, Yubo
Zhang, Yurong
Zhang, Yuxiang
Gong, Zheng
Chang, Zhichao
Li, Binyan
Ma, Dan
Jia, Furong
Wang, Hongyuan
Liu, Jiayu
Bai, Jing
Liu, Junlan
Liu, Manjiao
Wang, Na
Wu, Qiuping
Du, Qinxin
Li, Shiwei
Sun, Wen
Gong, Yifeng
Chen, Yonglin
Zhao, Yuling
Lin, Yuxuan
Ren, Ziqi
Wang, Zixuan
Zhang, Aihu
Li, Brian
Ma, Buyun
An, Kang
Xie, Li
Li, Mingliang
Li, Pan
Yang, Shidong
Chen, Xi
Liu, Xiaojia
Luo, Yuchu
Song, Yuan
Ding, YuanHao
Liang, Yuanwei
Li, Zexi
Zhang, Zhaoning
Zhang, Zixin
Jiao, Binxing
Jiang, Daxin
Chen, Jiansheng
Li, Jing
Zhang, Xiangyu
Zhu, Yibo
author_facet Hu, Chen
Du, Haikuo
Wang, Heng
Lin, Lin
Chen, Mingrui
Liu, Peng
Miao, Ruihang
Yue, Tianchi
You, Wang
Ji, Wei
Yuan, Wei
Deng, Wenjin
Yuan, Xiaojian
Zhang, Xiaoyun
Liu, Xiangyu
Liu, Xikai
Xu, Yanming
Cao, Yicheng
Zhang, Yifei
Wang, Yongyao
Shu, Yubo
Zhang, Yurong
Zhang, Yuxiang
Gong, Zheng
Chang, Zhichao
Li, Binyan
Ma, Dan
Jia, Furong
Wang, Hongyuan
Liu, Jiayu
Bai, Jing
Liu, Junlan
Liu, Manjiao
Wang, Na
Wu, Qiuping
Du, Qinxin
Li, Shiwei
Sun, Wen
Gong, Yifeng
Chen, Yonglin
Zhao, Yuling
Lin, Yuxuan
Ren, Ziqi
Wang, Zixuan
Zhang, Aihu
Li, Brian
Ma, Buyun
An, Kang
Xie, Li
Li, Mingliang
Li, Pan
Yang, Shidong
Chen, Xi
Liu, Xiaojia
Luo, Yuchu
Song, Yuan
Ding, YuanHao
Liang, Yuanwei
Li, Zexi
Zhang, Zhaoning
Zhang, Zixin
Jiao, Binxing
Jiang, Daxin
Chen, Jiansheng
Li, Jing
Zhang, Xiangyu
Zhu, Yibo
contents As LLMs shift toward autonomous agents, Deep Research has emerged as a pivotal metric. However, existing academic benchmarks like BrowseComp often fail to meet real-world demands for open-ended research, which requires robust skills in intent recognition, long-horizon decision-making, and cross-source verification. To address this, we introduce Step-DeepResearch, a cost-effective, end-to-end agent. We propose a Data Synthesis Strategy Based on Atomic Capabilities to reinforce planning and report writing, combined with a progressive training path from agentic mid-training to SFT and RL. Enhanced by a Checklist-style Judger, this approach significantly improves robustness. Furthermore, to bridge the evaluation gap in the Chinese domain, we establish ADR-Bench for realistic deep research scenarios. Experimental results show that Step-DeepResearch (32B) scores 61.4% on Scale AI Research Rubrics. On ADR-Bench, it significantly outperforms comparable models and rivals SOTA closed-source models like OpenAI and Gemini DeepResearch. These findings prove that refined training enables medium-sized models to achieve expert-level capabilities at industry-leading cost-efficiency.
format Preprint
id arxiv_https___arxiv_org_abs_2512_20491
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle Step-DeepResearch Technical Report
Hu, Chen
Du, Haikuo
Wang, Heng
Lin, Lin
Chen, Mingrui
Liu, Peng
Miao, Ruihang
Yue, Tianchi
You, Wang
Ji, Wei
Yuan, Wei
Deng, Wenjin
Yuan, Xiaojian
Zhang, Xiaoyun
Liu, Xiangyu
Liu, Xikai
Xu, Yanming
Cao, Yicheng
Zhang, Yifei
Wang, Yongyao
Shu, Yubo
Zhang, Yurong
Zhang, Yuxiang
Gong, Zheng
Chang, Zhichao
Li, Binyan
Ma, Dan
Jia, Furong
Wang, Hongyuan
Liu, Jiayu
Bai, Jing
Liu, Junlan
Liu, Manjiao
Wang, Na
Wu, Qiuping
Du, Qinxin
Li, Shiwei
Sun, Wen
Gong, Yifeng
Chen, Yonglin
Zhao, Yuling
Lin, Yuxuan
Ren, Ziqi
Wang, Zixuan
Zhang, Aihu
Li, Brian
Ma, Buyun
An, Kang
Xie, Li
Li, Mingliang
Li, Pan
Yang, Shidong
Chen, Xi
Liu, Xiaojia
Luo, Yuchu
Song, Yuan
Ding, YuanHao
Liang, Yuanwei
Li, Zexi
Zhang, Zhaoning
Zhang, Zixin
Jiao, Binxing
Jiang, Daxin
Chen, Jiansheng
Li, Jing
Zhang, Xiangyu
Zhu, Yibo
Computation and Language
As LLMs shift toward autonomous agents, Deep Research has emerged as a pivotal metric. However, existing academic benchmarks like BrowseComp often fail to meet real-world demands for open-ended research, which requires robust skills in intent recognition, long-horizon decision-making, and cross-source verification. To address this, we introduce Step-DeepResearch, a cost-effective, end-to-end agent. We propose a Data Synthesis Strategy Based on Atomic Capabilities to reinforce planning and report writing, combined with a progressive training path from agentic mid-training to SFT and RL. Enhanced by a Checklist-style Judger, this approach significantly improves robustness. Furthermore, to bridge the evaluation gap in the Chinese domain, we establish ADR-Bench for realistic deep research scenarios. Experimental results show that Step-DeepResearch (32B) scores 61.4% on Scale AI Research Rubrics. On ADR-Bench, it significantly outperforms comparable models and rivals SOTA closed-source models like OpenAI and Gemini DeepResearch. These findings prove that refined training enables medium-sized models to achieve expert-level capabilities at industry-leading cost-efficiency.
title Step-DeepResearch Technical Report
topic Computation and Language
url https://arxiv.org/abs/2512.20491