DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation
Fuente:
arXiv
Saved in:
| Main Authors: | Xie, Sixiong, Shi, Zhuofan, Shen, Haiyang, Wang, Jiuzheng, Zhong, Siqi, Liu, Mugeng, Pan, Chongyang, Jia, Peilun, Sun, Baoqing, Jing, Xiang, Ma, Yun |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
ViDR: Grounding Multimodal Deep Research Reports in Source Visual Evidence
by: Shi, Zhuofan, et al.
Published: (2026)
by: Shi, Zhuofan, et al.
Published: (2026)
SGR-Bench: Benchmarking Search Agents on State-Gated Retrieval
by: Li, Ningyuan, et al.
Published: (2026)
by: Li, Ningyuan, et al.
Published: (2026)
Teaching AI Through Benchmark Construction: QuestBench as a Course-Based Practice for Accountable Knowledge Work
by: Shen, Haiyang, et al.
Published: (2026)
by: Shen, Haiyang, et al.
Published: (2026)
M3-BENCH: Process-Aware Evaluation of LLM Agents' Social Behaviors in Mixed-Motive Games
by: Xie, Sixiong, et al.
Published: (2026)
by: Xie, Sixiong, et al.
Published: (2026)
MindLoom: Composing Thought Modes for Frontier-Level Reasoning Data Synthesis
by: Shen, Haiyang, et al.
Published: (2026)
by: Shen, Haiyang, et al.
Published: (2026)
WebANNS: Fast and Efficient Approximate Nearest Neighbor Search in Web Browsers
by: Liu, Mugeng, et al.
Published: (2025)
by: Liu, Mugeng, et al.
Published: (2025)
DRAGON: Domain-specific Robust Automatic Data Generation for RAG Optimization
by: Shen, Haiyang, et al.
Published: (2025)
by: Shen, Haiyang, et al.
Published: (2025)
LifeBench: A Benchmark for Long-Horizon Multi-Source Memory
by: Cheng, Zihao, et al.
Published: (2026)
by: Cheng, Zihao, et al.
Published: (2026)
RealWebAssist: A Benchmark for Long-Horizon Web Assistance with Real-World Users
by: Ye, Suyu, et al.
Published: (2025)
by: Ye, Suyu, et al.
Published: (2025)
DeepPlanning: Benchmarking Long-Horizon Agentic Planning with Verifiable Constraints
by: Zhang, Yinger, et al.
Published: (2026)
by: Zhang, Yinger, et al.
Published: (2026)
AgentWebBench: Benchmarking Multi-Agent Coordination in Agentic Web
by: Zhong, Shanshan, et al.
Published: (2026)
by: Zhong, Shanshan, et al.
Published: (2026)
MedProbeBench: Systematic Benchmarking at Deep Evidence Integration for Expert-level Medical Guideline
by: Liu, Jiyao, et al.
Published: (2026)
by: Liu, Jiyao, et al.
Published: (2026)
Research on WebAssembly Runtimes: A Survey
by: Zhang, Yixuan, et al.
Published: (2024)
by: Zhang, Yixuan, et al.
Published: (2024)
Odysseys: Benchmarking Web Agents on Realistic Long Horizon Tasks
by: Jang, Lawrence Keunho, et al.
Published: (2026)
by: Jang, Lawrence Keunho, et al.
Published: (2026)
IoDResearch: Deep Research on Private Heterogeneous Data via the Internet of Data
by: Shi, Zhuofan, et al.
Published: (2025)
by: Shi, Zhuofan, et al.
Published: (2025)
KellyBench: A Benchmark for Long-Horizon Sequential Decision Making
by: Grady, Thomas, et al.
Published: (2026)
by: Grady, Thomas, et al.
Published: (2026)
HorizonBench: Long-Horizon Personalization with Evolving Preferences
by: Li, Shuyue Stella, et al.
Published: (2026)
by: Li, Shuyue Stella, et al.
Published: (2026)
SlopCodeBench: Benchmarking How Coding Agents Degrade Over Long-Horizon Iterative Tasks
by: Orlanski, Gabriel, et al.
Published: (2026)
by: Orlanski, Gabriel, et al.
Published: (2026)
Deep-Bench: Deep Learning Benchmark Dataset for Code Generation
by: Daghighfarsoodeh, Alireza, et al.
Published: (2025)
by: Daghighfarsoodeh, Alireza, et al.
Published: (2025)
DecisionBench: A Benchmark for Emergent Delegation in Long-Horizon Agentic Workflows
by: Gao, Yuxuan, et al.
Published: (2026)
by: Gao, Yuxuan, et al.
Published: (2026)
ALE-Bench: A Benchmark for Long-Horizon Objective-Driven Algorithm Engineering
by: Imajuku, Yuki, et al.
Published: (2025)
by: Imajuku, Yuki, et al.
Published: (2025)
LongGenBench: Long-context Generation Benchmark
by: Liu, Xiang, et al.
Published: (2024)
by: Liu, Xiang, et al.
Published: (2024)
DeepResearch Bench: A Comprehensive Benchmark for Deep Research Agents
by: Du, Mingxuan, et al.
Published: (2025)
by: Du, Mingxuan, et al.
Published: (2025)
Deep Light Pollution Removal in Night Cityscape Photographs
by: Wang, Hao, et al.
Published: (2026)
by: Wang, Hao, et al.
Published: (2026)
WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation
by: Ding, Shuangrui, et al.
Published: (2026)
by: Ding, Shuangrui, et al.
Published: (2026)
HeroBench: A Benchmark for Long-Horizon Planning and Structured Reasoning in Virtual Worlds
by: Anokhin, Petr, et al.
Published: (2025)
by: Anokhin, Petr, et al.
Published: (2025)
TRIP-Bench: A Benchmark for Long-Horizon Interactive Agents in Real-World Scenarios
by: Shen, Yuanzhe, et al.
Published: (2026)
by: Shen, Yuanzhe, et al.
Published: (2026)
CookBench: A Long-Horizon Embodied Planning Benchmark for Complex Cooking Scenarios
by: Cai, Muzhen, et al.
Published: (2025)
by: Cai, Muzhen, et al.
Published: (2025)
A First Look at Bugs in LLM Inference Engines
by: Liu, Mugeng, et al.
Published: (2025)
by: Liu, Mugeng, et al.
Published: (2025)
Deep Research Bench: Evaluating AI Web Research Agents
by: FutureSearch, et al.
Published: (2025)
by: FutureSearch, et al.
Published: (2025)
ESG-Bench: Benchmarking Long-Context ESG Reports for Hallucination Mitigation
by: Sun, Siqi, et al.
Published: (2026)
by: Sun, Siqi, et al.
Published: (2026)
Deep Horizons
Published: (2024)
Published: (2024)
MMDeepResearch-Bench: A Benchmark for Multimodal Deep Research Agents
by: Huang, Peizhou, et al.
Published: (2026)
by: Huang, Peizhou, et al.
Published: (2026)
Source-Free Domain Adaptive Object Detection with Semantics Compensation
by: Tang, Song, et al.
Published: (2024)
by: Tang, Song, et al.
Published: (2024)
Rethinking Explainable Disease Prediction: Synergizing Accuracy and Reliability via Reflective Cognitive Architecture
by: Shao, Zijian, et al.
Published: (2025)
by: Shao, Zijian, et al.
Published: (2025)
MileBench: Benchmarking MLLMs in Long Context
by: Song, Dingjie, et al.
Published: (2024)
by: Song, Dingjie, et al.
Published: (2024)
ColorBench: Benchmarking Mobile Agents with Graph-Structured Framework for Complex Long-Horizon Tasks
by: Song, Yuanyi, et al.
Published: (2025)
by: Song, Yuanyi, et al.
Published: (2025)
RoadmapBench: Evaluating Long-Horizon Agentic Software Development Across Version Upgrades
by: Xu, Xinbo, et al.
Published: (2026)
by: Xu, Xinbo, et al.
Published: (2026)
Deep Active Inference Agents for Delayed and Long-Horizon Environments
by: Yeganeh, Yavar Taheri, et al.
Published: (2025)
by: Yeganeh, Yavar Taheri, et al.
Published: (2025)
QuarkMedSearch: A Long-Horizon Deep Search Agent for Exploring Medical Intelligence
by: Lin, Zhichao, et al.
Published: (2026)
by: Lin, Zhichao, et al.
Published: (2026)
Similar Items
-
ViDR: Grounding Multimodal Deep Research Reports in Source Visual Evidence
by: Shi, Zhuofan, et al.
Published: (2026) -
SGR-Bench: Benchmarking Search Agents on State-Gated Retrieval
by: Li, Ningyuan, et al.
Published: (2026) -
Teaching AI Through Benchmark Construction: QuestBench as a Course-Based Practice for Accountable Knowledge Work
by: Shen, Haiyang, et al.
Published: (2026) -
M3-BENCH: Process-Aware Evaluation of LLM Agents' Social Behaviors in Mixed-Motive Games
by: Xie, Sixiong, et al.
Published: (2026) -
MindLoom: Composing Thought Modes for Frontier-Level Reasoning Data Synthesis
by: Shen, Haiyang, et al.
Published: (2026)