DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent
Fuente:
arXiv
Salvato in:
| Autori principali: | Wu, Tongzhou, Wang, Yuhao, Ma, Xinyu, He, Xiuqiang, Wang, Shuaiqiang, Yin, Dawei, Zhao, Xiangyu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Vision-DeepResearch: Incentivizing DeepResearch Capability in Multimodal Large Language Models
di: Huang, Wenxuan, et al.
Pubblicazione: (2026)
di: Huang, Wenxuan, et al.
Pubblicazione: (2026)
Marco DeepResearch: Unlocking Efficient Deep Research Agents via Verification-Centric Design
di: Zhu, Bin, et al.
Pubblicazione: (2026)
di: Zhu, Bin, et al.
Pubblicazione: (2026)
Tongyi DeepResearch Technical Report
di: Tongyi DeepResearch Team, et al.
Pubblicazione: (2025)
di: Tongyi DeepResearch Team, et al.
Pubblicazione: (2025)
Mind DeepResearch Technical Report
di: MindDR Team, et al.
Pubblicazione: (2026)
di: MindDR Team, et al.
Pubblicazione: (2026)
Understanding DeepResearch via Reports
di: Fan, Tianyu, et al.
Pubblicazione: (2025)
di: Fan, Tianyu, et al.
Pubblicazione: (2025)
MM-DeepResearch: A Simple and Effective Multimodal Agentic Search Baseline
di: Yao, Huanjin, et al.
Pubblicazione: (2026)
di: Yao, Huanjin, et al.
Pubblicazione: (2026)
DeepResearch-Slice: Bridging the Retrieval-Utilization Gap via Explicit Text Slicing
di: Lu, Shuo, et al.
Pubblicazione: (2025)
di: Lu, Shuo, et al.
Pubblicazione: (2025)
DeepResearch Arena: The First Exam of LLMs' Research Abilities via Seminar-Grounded Tasks
di: Wan, Haiyuan, et al.
Pubblicazione: (2025)
di: Wan, Haiyuan, et al.
Pubblicazione: (2025)
SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents
di: Nguyen, Xuan-Phi, et al.
Pubblicazione: (2025)
di: Nguyen, Xuan-Phi, et al.
Pubblicazione: (2025)
DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real-world Environments
di: Zheng, Yuxiang, et al.
Pubblicazione: (2025)
di: Zheng, Yuxiang, et al.
Pubblicazione: (2025)
Vision-DeepResearch Benchmark: Rethinking Visual and Textual Search for Multimodal Large Language Models
di: Zeng, Yu, et al.
Pubblicazione: (2026)
di: Zeng, Yu, et al.
Pubblicazione: (2026)
Dingtalk DeepResearch: A Unified Multi Agent Framework for Adaptive Intelligence in Enterprise Environments
di: Chen, Mengyuan, et al.
Pubblicazione: (2025)
di: Chen, Mengyuan, et al.
Pubblicazione: (2025)
Empowering Denoising Sequential Recommendation with Large Language Model Embeddings
di: Wu, Tongzhou, et al.
Pubblicazione: (2025)
di: Wu, Tongzhou, et al.
Pubblicazione: (2025)
DEEPMED: Building a Medical DeepResearch Agent via Multi-hop Med-Search Data and Turn-Controlled Agentic Training & Inference
di: Wang, Zihan, et al.
Pubblicazione: (2026)
di: Wang, Zihan, et al.
Pubblicazione: (2026)
Multimodal DeepResearcher: Generating Text-Chart Interleaved Reports From Scratch with Agentic Framework
di: Yang, Zhaorui, et al.
Pubblicazione: (2025)
di: Yang, Zhaorui, et al.
Pubblicazione: (2025)
Fathom-DeepResearch: Unlocking Long Horizon Information Retrieval and Synthesis for SLMs
di: Singh, Shreyas, et al.
Pubblicazione: (2025)
di: Singh, Shreyas, et al.
Pubblicazione: (2025)
MiroEval: Benchmarking Multimodal Deep Research Agents in Process and Outcome
di: Ye, Fangda, et al.
Pubblicazione: (2026)
di: Ye, Fangda, et al.
Pubblicazione: (2026)
DeepResearch Bench: A Comprehensive Benchmark for Deep Research Agents
di: Du, Mingxuan, et al.
Pubblicazione: (2025)
di: Du, Mingxuan, et al.
Pubblicazione: (2025)
DeepFact: Co-Evolving Benchmarks and Agents for Deep Research Factuality
di: Huang, Yukun, et al.
Pubblicazione: (2026)
di: Huang, Yukun, et al.
Pubblicazione: (2026)
DeepShop: A Benchmark for Deep Research Shopping Agents
di: Lyu, Yougang, et al.
Pubblicazione: (2025)
di: Lyu, Yougang, et al.
Pubblicazione: (2025)
DeepResearch$^{\text{Eco}}$: A Recursive Agentic Workflow for Complex Scientific Question Answering in Ecology
di: D'Souza, Jennifer, et al.
Pubblicazione: (2025)
di: D'Souza, Jennifer, et al.
Pubblicazione: (2025)
Enterprise Deep Research: Steerable Multi-Agent Deep Research for Enterprise Analytics
di: Prabhakar, Akshara, et al.
Pubblicazione: (2025)
di: Prabhakar, Akshara, et al.
Pubblicazione: (2025)
DatasetResearch: Benchmarking Agent Systems for Demand-Driven Dataset Discovery
di: Li, Keyu, et al.
Pubblicazione: (2025)
di: Li, Keyu, et al.
Pubblicazione: (2025)
Proof-of-Use: Mitigating Tool-Call Hacking in Deep Research Agents
di: Ma, SHengjie, et al.
Pubblicazione: (2025)
di: Ma, SHengjie, et al.
Pubblicazione: (2025)
ProductResearch: Training E-Commerce Deep Research Agents via Multi-Agent Synthetic Trajectory Distillation
di: Wang, Jiangyuan, et al.
Pubblicazione: (2026)
di: Wang, Jiangyuan, et al.
Pubblicazione: (2026)
LawThinker: A Deep Research Legal Agent in Dynamic Environments
di: Yang, Xinyu, et al.
Pubblicazione: (2026)
di: Yang, Xinyu, et al.
Pubblicazione: (2026)
AdaSwitch: Balancing Exploration and Guidance in Knowledge Distillation via Adaptive Switching
di: Peng, Jingyu, et al.
Pubblicazione: (2025)
di: Peng, Jingyu, et al.
Pubblicazione: (2025)
Beyond Monolithic Architectures: A Multi-Agent Search and Knowledge Optimization Framework for Agentic Search
di: Chen, Yiqun, et al.
Pubblicazione: (2026)
di: Chen, Yiqun, et al.
Pubblicazione: (2026)
G3: An Effective and Adaptive Framework for Worldwide Geolocalization Using Large Multi-Modality Models
di: Jia, Pengyue, et al.
Pubblicazione: (2024)
di: Jia, Pengyue, et al.
Pubblicazione: (2024)
MILL: Mutual Verification with Large Language Models for Zero-Shot Query Expansion
di: Jia, Pengyue, et al.
Pubblicazione: (2023)
di: Jia, Pengyue, et al.
Pubblicazione: (2023)
ResearchRubrics: A Benchmark of Prompts and Rubrics For Evaluating Deep Research Agents
di: Sharma, Manasi, et al.
Pubblicazione: (2025)
di: Sharma, Manasi, et al.
Pubblicazione: (2025)
Deep Research Comparator: A Platform For Fine-grained Human Annotations of Deep Research Agents
di: Chandrahasan, Prahaladh, et al.
Pubblicazione: (2025)
di: Chandrahasan, Prahaladh, et al.
Pubblicazione: (2025)
Towards Knowledgeable Deep Research: Framework and Benchmark
di: Liu, Wenxuan, et al.
Pubblicazione: (2026)
di: Liu, Wenxuan, et al.
Pubblicazione: (2026)
Step-DeepResearch Technical Report
di: Hu, Chen, et al.
Pubblicazione: (2025)
di: Hu, Chen, et al.
Pubblicazione: (2025)
Towards Personalized Deep Research: Benchmarks and Evaluations
di: Liang, Yuan, et al.
Pubblicazione: (2025)
di: Liang, Yuan, et al.
Pubblicazione: (2025)
JAILJUDGE: A Comprehensive Jailbreak Judge Benchmark with Multi-Agent Enhanced Explanation Evaluation Framework
di: Liu, Fan, et al.
Pubblicazione: (2024)
di: Liu, Fan, et al.
Pubblicazione: (2024)
Towards Next-Generation Recommender Systems: A Benchmark for Personalized Recommendation Assistant with LLMs
di: Huang, Jiani, et al.
Pubblicazione: (2025)
di: Huang, Jiani, et al.
Pubblicazione: (2025)
Argus: Evidence Assembly for Scalable Deep Research Agents
di: Zhang, Zhen, et al.
Pubblicazione: (2026)
di: Zhang, Zhen, et al.
Pubblicazione: (2026)
DeepPlanner: Scaling Planning Capability for Deep Research Agents via Advantage Shaping
di: Fan, Wei, et al.
Pubblicazione: (2025)
di: Fan, Wei, et al.
Pubblicazione: (2025)
Evaluating Stochasticity in Deep Research Agents
di: Zhai, Haotian, et al.
Pubblicazione: (2026)
di: Zhai, Haotian, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Vision-DeepResearch: Incentivizing DeepResearch Capability in Multimodal Large Language Models
di: Huang, Wenxuan, et al.
Pubblicazione: (2026) -
Marco DeepResearch: Unlocking Efficient Deep Research Agents via Verification-Centric Design
di: Zhu, Bin, et al.
Pubblicazione: (2026) -
Tongyi DeepResearch Technical Report
di: Tongyi DeepResearch Team, et al.
Pubblicazione: (2025) -
Mind DeepResearch Technical Report
di: MindDR Team, et al.
Pubblicazione: (2026) -
Understanding DeepResearch via Reports
di: Fan, Tianyu, et al.
Pubblicazione: (2025)