DR-Arena: an Automated Evaluation Framework for Deep Research Agents
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Gao, Yiwen, Zhao, Ruochen, Deng, Yang, Zhang, Wenxuan |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Auto-Arena: Automating LLM Evaluations with Agent Peer Battles and Committee Discussions
par: Zhao, Ruochen, et autres
Publié: (2024)
par: Zhao, Ruochen, et autres
Publié: (2024)
DeepResearchEval: An Automated Framework for Deep Research Task Construction and Agentic Evaluation
par: Wang, Yibo, et autres
Publié: (2026)
par: Wang, Yibo, et autres
Publié: (2026)
FACT-AUDIT: An Adaptive Multi-Agent Framework for Dynamic Fact-Checking Evaluation of Large Language Models
par: Lin, Hongzhan, et autres
Publié: (2025)
par: Lin, Hongzhan, et autres
Publié: (2025)
FinDeepResearch: Evaluating Deep Research Agents in Rigorous Financial Analysis
par: Zhu, Fengbin, et autres
Publié: (2025)
par: Zhu, Fengbin, et autres
Publié: (2025)
MemeArena: Automating Context-Aware Unbiased Evaluation of Harmfulness Understanding for Multimodal Large Language Models
par: Chen, Zixin, et autres
Publié: (2025)
par: Chen, Zixin, et autres
Publié: (2025)
FinResearchBench: A Logic Tree based Agent-as-a-Judge Evaluation Framework for Financial Research Agents
par: Sun, Rui, et autres
Publié: (2025)
par: Sun, Rui, et autres
Publié: (2025)
A Multi-Agent LLM Framework for Multi-Domain Low-Resource In-Context NER via Knowledge Retrieval, Disambiguation and Reflective Analysis
par: Mu, Wenxuan, et autres
Publié: (2025)
par: Mu, Wenxuan, et autres
Publié: (2025)
ASTRA: Automated Synthesis of agentic Trajectories and Reinforcement Arenas
par: Tian, Xiaoyu, et autres
Publié: (2026)
par: Tian, Xiaoyu, et autres
Publié: (2026)
Can Deep Research Agents Retrieve and Organize? Evaluating the Synthesis Gap with Expert Taxonomies
par: Zhang, Ming, et autres
Publié: (2026)
par: Zhang, Ming, et autres
Publié: (2026)
TRACE: Trajectory-Aware Comprehensive Evaluation for Deep Research Agents
par: Chen, Yanyu, et autres
Publié: (2026)
par: Chen, Yanyu, et autres
Publié: (2026)
DR-Venus: Towards Frontier Edge-Scale Deep Research Agents with Only 10K Open Data
par: Venus Team, et autres
Publié: (2026)
par: Venus Team, et autres
Publié: (2026)
Dynamic Evaluation of Large Language Models by Meta Probing Agents
par: Zhu, Kaijie, et autres
Publié: (2024)
par: Zhu, Kaijie, et autres
Publié: (2024)
Unifying Language Agent Algorithms with Graph-based Orchestration Engine for Reproducible Agent Research
par: Zhang, Qianqian, et autres
Publié: (2025)
par: Zhang, Qianqian, et autres
Publié: (2025)
VideoAutoArena: An Automated Arena for Evaluating Large Multimodal Models in Video Analysis through User Simulation
par: Luo, Ziyang, et autres
Publié: (2024)
par: Luo, Ziyang, et autres
Publié: (2024)
SafeArena: Evaluating the Safety of Autonomous Web Agents
par: Tur, Ada Defne, et autres
Publié: (2025)
par: Tur, Ada Defne, et autres
Publié: (2025)
Dr. Bench: A Multidimensional Evaluation for Deep Research Agents, from Answers to Reports
par: Yao, Yang, et autres
Publié: (2025)
par: Yao, Yang, et autres
Publié: (2025)
WorldMemArena: Evaluating Multimodal Agent Memory Through Action-World Interaction
par: Liu, Chengzhi, et autres
Publié: (2026)
par: Liu, Chengzhi, et autres
Publié: (2026)
SAGE: Benchmarking and Improving Retrieval for Deep Research Agents
par: Hu, Tiansheng, et autres
Publié: (2026)
par: Hu, Tiansheng, et autres
Publié: (2026)
An Empirical Study of Automating Agent Evaluation
par: Zhou, Kang, et autres
Publié: (2026)
par: Zhou, Kang, et autres
Publié: (2026)
Cultivating Game Sense for Yourself: Making VLMs Gaming Experts
par: Lu, Wenxuan, et autres
Publié: (2025)
par: Lu, Wenxuan, et autres
Publié: (2025)
On the Multi-turn Instruction Following for Conversational Web Agents
par: Deng, Yang, et autres
Publié: (2024)
par: Deng, Yang, et autres
Publié: (2024)
Plug-and-Play Policy Planner for Large Language Model Powered Dialogue Agents
par: Deng, Yang, et autres
Publié: (2023)
par: Deng, Yang, et autres
Publié: (2023)
SI-Bench: Benchmarking Social Intelligence of Large Language Models in Human-to-Human Conversations
par: Huang, Shuai, et autres
Publié: (2025)
par: Huang, Shuai, et autres
Publié: (2025)
Cognitive Kernel-Pro: A Framework for Deep Research Agents and Agent Foundation Models Training
par: Fang, Tianqing, et autres
Publié: (2025)
par: Fang, Tianqing, et autres
Publié: (2025)
WebChoreArena: Evaluating Web Browsing Agents on Realistic Tedious Web Tasks
par: Miyai, Atsuyuki, et autres
Publié: (2025)
par: Miyai, Atsuyuki, et autres
Publié: (2025)
GEMA-Score: Granular Explainable Multi-Agent Scoring Framework for Radiology Report Evaluation
par: Zhang, Zhenxuan, et autres
Publié: (2025)
par: Zhang, Zhenxuan, et autres
Publié: (2025)
MASim: Multilingual Agent-Based Simulation for Social Science
par: Zhang, Xuan, et autres
Publié: (2025)
par: Zhang, Xuan, et autres
Publié: (2025)
CoCo-Agent: A Comprehensive Cognitive MLLM Agent for Smartphone GUI Automation
par: Ma, Xinbei, et autres
Publié: (2024)
par: Ma, Xinbei, et autres
Publié: (2024)
CroCoSum: A Benchmark Dataset for Cross-Lingual Code-Switched Summarization
par: Zhang, Ruochen, et autres
Publié: (2023)
par: Zhang, Ruochen, et autres
Publié: (2023)
Cited but Not Verified: Parsing and Evaluating Source Attribution in LLM Deep Research Agents
par: Onweller, Hailey, et autres
Publié: (2026)
par: Onweller, Hailey, et autres
Publié: (2026)
LABELING COPILOT: A Deep Research Agent for Automated Data Curation in Computer Vision
par: Ganguly, Debargha, et autres
Publié: (2025)
par: Ganguly, Debargha, et autres
Publié: (2025)
DEER: A Benchmark for Evaluating Deep Research Agents on Expert Report Generation
par: Han, Janghoon, et autres
Publié: (2025)
par: Han, Janghoon, et autres
Publié: (2025)
FreeChunker: A Cross-Granularity Chunking Framework
par: Zhang, Wenxuan, et autres
Publié: (2025)
par: Zhang, Wenxuan, et autres
Publié: (2025)
The Rise of Parameter Specialization for Knowledge Storage in Large Language Models
par: Hong, Yihuai, et autres
Publié: (2025)
par: Hong, Yihuai, et autres
Publié: (2025)
VisualWebArena: Evaluating Multimodal Agents on Realistic Visual Web Tasks
par: Koh, Jing Yu, et autres
Publié: (2024)
par: Koh, Jing Yu, et autres
Publié: (2024)
DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research
par: Shao, Rulin, et autres
Publié: (2025)
par: Shao, Rulin, et autres
Publié: (2025)
MLR-Copilot: Autonomous Machine Learning Research based on Large Language Models Agents
par: Li, Ruochen, et autres
Publié: (2024)
par: Li, Ruochen, et autres
Publié: (2024)
SimulatorArena: Are User Simulators Reliable Proxies for Multi-Turn Evaluation of AI Assistants?
par: Dou, Yao, et autres
Publié: (2025)
par: Dou, Yao, et autres
Publié: (2025)
TimeArena: Shaping Efficient Multitasking Language Agents in a Time-Aware Simulation
par: Zhang, Yikai, et autres
Publié: (2024)
par: Zhang, Yikai, et autres
Publié: (2024)
UNO Arena for Evaluating Sequential Decision-Making Capability of Large Language Models
par: Qin, Zhanyue, et autres
Publié: (2024)
par: Qin, Zhanyue, et autres
Publié: (2024)
Documents similaires
-
Auto-Arena: Automating LLM Evaluations with Agent Peer Battles and Committee Discussions
par: Zhao, Ruochen, et autres
Publié: (2024) -
DeepResearchEval: An Automated Framework for Deep Research Task Construction and Agentic Evaluation
par: Wang, Yibo, et autres
Publié: (2026) -
FACT-AUDIT: An Adaptive Multi-Agent Framework for Dynamic Fact-Checking Evaluation of Large Language Models
par: Lin, Hongzhan, et autres
Publié: (2025) -
FinDeepResearch: Evaluating Deep Research Agents in Rigorous Financial Analysis
par: Zhu, Fengbin, et autres
Publié: (2025) -
MemeArena: Automating Context-Aware Unbiased Evaluation of Harmfulness Understanding for Multimodal Large Language Models
par: Chen, Zixin, et autres
Publié: (2025)