DeepResearchEval: An Automated Framework for Deep Research Task Construction and Agentic Evaluation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Yibo, Wang, Lei, Deng, Yue, Wu, Keming, Xiao, Yao, Yao, Huanjin, Kang, Liwei, Ye, Hai, Jing, Yongcheng, Bing, Lidong |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MiroEval: Benchmarking Multimodal Deep Research Agents in Process and Outcome
par: Ye, Fangda, et autres
Publié: (2026)
par: Ye, Fangda, et autres
Publié: (2026)
MM-DeepResearch: A Simple and Effective Multimodal Agentic Search Baseline
par: Yao, Huanjin, et autres
Publié: (2026)
par: Yao, Huanjin, et autres
Publié: (2026)
A Survey on Agentic Multimodal Large Language Models
par: Yao, Huanjin, et autres
Publié: (2025)
par: Yao, Huanjin, et autres
Publié: (2025)
First Try Matters: Revisiting the Role of Reflection in Reasoning Models
par: Kang, Liwei, et autres
Publié: (2025)
par: Kang, Liwei, et autres
Publié: (2025)
MiroFlow: Towards High-Performance and Robust Open-Source Agent Framework for General Deep Research Tasks
par: Su, Shiqian, et autres
Publié: (2026)
par: Su, Shiqian, et autres
Publié: (2026)
100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models
par: Zhang, Chong, et autres
Publié: (2025)
par: Zhang, Chong, et autres
Publié: (2025)
DR-Arena: an Automated Evaluation Framework for Deep Research Agents
par: Gao, Yiwen, et autres
Publié: (2026)
par: Gao, Yiwen, et autres
Publié: (2026)
Argus: Evidence Assembly for Scalable Deep Research Agents
par: Zhang, Zhen, et autres
Publié: (2026)
par: Zhang, Zhen, et autres
Publié: (2026)
Enterprise Deep Research: Steerable Multi-Agent Deep Research for Enterprise Analytics
par: Prabhakar, Akshara, et autres
Publié: (2025)
par: Prabhakar, Akshara, et autres
Publié: (2025)
O-Researcher: An Open Ended Deep Research Model via Multi-Agent Distillation and Agentic RL
par: Yao, Yi, et autres
Publié: (2026)
par: Yao, Yi, et autres
Publié: (2026)
FinDeepResearch: Evaluating Deep Research Agents in Rigorous Financial Analysis
par: Zhu, Fengbin, et autres
Publié: (2025)
par: Zhu, Fengbin, et autres
Publié: (2025)
DeepPlanner: Scaling Planning Capability for Deep Research Agents via Advantage Shaping
par: Fan, Wei, et autres
Publié: (2025)
par: Fan, Wei, et autres
Publié: (2025)
Dr. Bench: A Multidimensional Evaluation for Deep Research Agents, from Answers to Reports
par: Yao, Yang, et autres
Publié: (2025)
par: Yao, Yang, et autres
Publié: (2025)
DR$^{3}$-Eval: Towards Realistic and Reproducible Deep Research Evaluation
par: Xie, Qianqian, et autres
Publié: (2026)
par: Xie, Qianqian, et autres
Publié: (2026)
Finding the Sweet Spot: Preference Data Construction for Scaling Preference Optimization
par: Xiao, Yao, et autres
Publié: (2025)
par: Xiao, Yao, et autres
Publié: (2025)
AgenticEval: Toward Agentic and Self-Evolving Safety Evaluation of Large Language Models
par: Wang, Yixu, et autres
Publié: (2025)
par: Wang, Yixu, et autres
Publié: (2025)
LiteResearcher: A Scalable Agentic RL Training Framework for Deep Research Agent
par: Li, Wanli, et autres
Publié: (2026)
par: Li, Wanli, et autres
Publié: (2026)
Multimodal DeepResearcher: Generating Text-Chart Interleaved Reports From Scratch with Agentic Framework
par: Yang, Zhaorui, et autres
Publié: (2025)
par: Yang, Zhaorui, et autres
Publié: (2025)
QUEST: Training Frontier Deep Research Agents with Fully Synthetic Tasks
par: Xie, Jian, et autres
Publié: (2026)
par: Xie, Jian, et autres
Publié: (2026)
General Agentic Memory Via Deep Research
par: Yan, B. Y., et autres
Publié: (2025)
par: Yan, B. Y., et autres
Publié: (2025)
DREAM: Deep Research Evaluation with Agentic Metrics
par: Avraham, Elad Ben, et autres
Publié: (2026)
par: Avraham, Elad Ben, et autres
Publié: (2026)
OPTIAGENT: A Physics-Driven Agentic Framework for Automated Optical Design
par: Geng, Yuyu, et autres
Publié: (2026)
par: Geng, Yuyu, et autres
Publié: (2026)
MedResearcher-R1: Expert-Level Medical Deep Researcher via A Knowledge-Informed Trajectory Synthesis Framework
par: Yu, Ailing, et autres
Publié: (2025)
par: Yu, Ailing, et autres
Publié: (2025)
RoboClaw: An Agentic Framework for Scalable Long-Horizon Robotic Tasks
par: Li, Ruiying, et autres
Publié: (2026)
par: Li, Ruiying, et autres
Publié: (2026)
FreeEval: A Modular Framework for Trustworthy and Efficient Evaluation of Large Language Models
par: Yu, Zhuohao, et autres
Publié: (2024)
par: Yu, Zhuohao, et autres
Publié: (2024)
ParaVT: Taming the Tool Prior Paradox for Parallel Tool Use in Agentic Video Reinforcement Learning
par: Yang, Zuhao, et autres
Publié: (2026)
par: Yang, Zuhao, et autres
Publié: (2026)
Atom-Searcher: Enhancing Agentic Deep Research via Fine-Grained Atomic Thought Reward
par: Deng, Yong, et autres
Publié: (2025)
par: Deng, Yong, et autres
Publié: (2025)
DeepSynth-Eval: Objectively Evaluating Information Consolidation in Deep Survey Writing
par: Zhang, Hongzhi, et autres
Publié: (2026)
par: Zhang, Hongzhi, et autres
Publié: (2026)
Automated Multi-level Preference for MLLMs
par: Zhang, Mengxi, et autres
Publié: (2024)
par: Zhang, Mengxi, et autres
Publié: (2024)
Quantifying Knee Cartilage Shape and Lesion: From Image to Metrics
par: Yao, Yongcheng, et autres
Publié: (2024)
par: Yao, Yongcheng, et autres
Publié: (2024)
Rethinking Low-Rank Adaptation in Vision: Exploring Head-Level Responsiveness across Diverse Tasks
par: Zhong, Yibo, et autres
Publié: (2024)
par: Zhong, Yibo, et autres
Publié: (2024)
Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation
par: Chen, Zeyu, et autres
Publié: (2026)
par: Chen, Zeyu, et autres
Publié: (2026)
Auto-Eval Judge: Towards a General Agentic Framework for Task Completion Evaluation
par: Bhonsle, Roshita, et autres
Publié: (2025)
par: Bhonsle, Roshita, et autres
Publié: (2025)
DeepER-Med: Advancing Deep Evidence-Based Research in Medicine Through Agentic AI
par: Wang, Zhizheng, et autres
Publié: (2026)
par: Wang, Zhizheng, et autres
Publié: (2026)
Vision-DeepResearch: Incentivizing DeepResearch Capability in Multimodal Large Language Models
par: Huang, Wenxuan, et autres
Publié: (2026)
par: Huang, Wenxuan, et autres
Publié: (2026)
DeepEval/DeepEval: Artifacts Associated with the Paper Under Review in TOSEM
par: Xiangyue, Ma, et autres
Publié: (2026)
par: Xiangyue, Ma, et autres
Publié: (2026)
Step-DeepResearch Technical Report
par: Hu, Chen, et autres
Publié: (2025)
par: Hu, Chen, et autres
Publié: (2025)
A2Eval: Agentic and Automated Evaluation for Embodied Brain
par: Zhang, Shuai, et autres
Publié: (2026)
par: Zhang, Shuai, et autres
Publié: (2026)
One-Eval: An Agentic System for Automated and Traceable LLM Evaluation
par: Shen, Chengyu, et autres
Publié: (2026)
par: Shen, Chengyu, et autres
Publié: (2026)
TaskCraft: Automated Generation of Agentic Tasks
par: Shi, Dingfeng, et autres
Publié: (2025)
par: Shi, Dingfeng, et autres
Publié: (2025)
Documents similaires
-
MiroEval: Benchmarking Multimodal Deep Research Agents in Process and Outcome
par: Ye, Fangda, et autres
Publié: (2026) -
MM-DeepResearch: A Simple and Effective Multimodal Agentic Search Baseline
par: Yao, Huanjin, et autres
Publié: (2026) -
A Survey on Agentic Multimodal Large Language Models
par: Yao, Huanjin, et autres
Publié: (2025) -
First Try Matters: Revisiting the Role of Reflection in Reasoning Models
par: Kang, Liwei, et autres
Publié: (2025) -
MiroFlow: Towards High-Performance and Robust Open-Source Agent Framework for General Deep Research Tasks
par: Su, Shiqian, et autres
Publié: (2026)