FinResearchBench: A Logic Tree based Agent-as-a-Judge Evaluation Framework for Financial Research Agents
Fuente:
arXiv
Guardado en:
| Autores principales: | Sun, Rui, Bai, Zuo, Zhang, Wentao, Zhang, Yuxiang, Zhao, Li, Sun, Shan, Qiu, Zhengwen |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
FinDeepResearch: Evaluating Deep Research Agents in Rigorous Financial Analysis
por: Zhu, Fengbin, et al.
Publicado: (2025)
por: Zhu, Fengbin, et al.
Publicado: (2025)
FinRpt: Dataset, Evaluation System and LLM-based Multi-agent Framework for Equity Research Report Generation
por: Jin, Song, et al.
Publicado: (2025)
por: Jin, Song, et al.
Publicado: (2025)
FinMCP-Bench: Benchmarking LLM Agents for Real-World Financial Tool Use under the Model Context Protocol
por: Zhu, Jie, et al.
Publicado: (2026)
por: Zhu, Jie, et al.
Publicado: (2026)
DR-Arena: an Automated Evaluation Framework for Deep Research Agents
por: Gao, Yiwen, et al.
Publicado: (2026)
por: Gao, Yiwen, et al.
Publicado: (2026)
FinSafetyBench: Evaluating LLM Safety in Real-World Financial Scenarios
por: Hou, Yutao, et al.
Publicado: (2026)
por: Hou, Yutao, et al.
Publicado: (2026)
FinDebate: Multi-Agent Collaborative Intelligence for Financial Analysis
por: Cai, Tianshi, et al.
Publicado: (2025)
por: Cai, Tianshi, et al.
Publicado: (2025)
FinAgentBench: A Benchmark Dataset for Agentic Retrieval in Financial Question Answering
por: Choi, Chanyeol, et al.
Publicado: (2025)
por: Choi, Chanyeol, et al.
Publicado: (2025)
AgentBench: Evaluating LLMs as Agents
por: Liu, Xiao, et al.
Publicado: (2023)
por: Liu, Xiao, et al.
Publicado: (2023)
Mobile-Bench: An Evaluation Benchmark for LLM-based Mobile Agents
por: Deng, Shihan, et al.
Publicado: (2024)
por: Deng, Shihan, et al.
Publicado: (2024)
Dr. Bench: A Multidimensional Evaluation for Deep Research Agents, from Answers to Reports
por: Yao, Yang, et al.
Publicado: (2025)
por: Yao, Yang, et al.
Publicado: (2025)
FinGAIA: A Chinese Benchmark for AI Agents in Real-World Financial Domain
por: Zeng, Lingfeng, et al.
Publicado: (2025)
por: Zeng, Lingfeng, et al.
Publicado: (2025)
dzFinNlp at AraFinNLP: Improving Intent Detection in Financial Conversational Agents
por: Lichouri, Mohamed, et al.
Publicado: (2024)
por: Lichouri, Mohamed, et al.
Publicado: (2024)
Agent-SafetyBench: Evaluating the Safety of LLM Agents
por: Zhang, Zhexin, et al.
Publicado: (2024)
por: Zhang, Zhexin, et al.
Publicado: (2024)
ReportBench: Evaluating Deep Research Agents via Academic Survey Tasks
por: Li, Minghao, et al.
Publicado: (2025)
por: Li, Minghao, et al.
Publicado: (2025)
FlowBench: Revisiting and Benchmarking Workflow-Guided Planning for LLM-based Agents
por: Xiao, Ruixuan, et al.
Publicado: (2024)
por: Xiao, Ruixuan, et al.
Publicado: (2024)
BizFinBench: A Business-Driven Real-World Financial Benchmark for Evaluating LLMs
por: Lu, Guilong, et al.
Publicado: (2025)
por: Lu, Guilong, et al.
Publicado: (2025)
Agent-as-a-Judge
por: You, Runyang, et al.
Publicado: (2026)
por: You, Runyang, et al.
Publicado: (2026)
FinSight: Towards Real-World Financial Deep Research
por: Jin, Jiajie, et al.
Publicado: (2025)
por: Jin, Jiajie, et al.
Publicado: (2025)
Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?
por: Wang, Leyao, et al.
Publicado: (2026)
por: Wang, Leyao, et al.
Publicado: (2026)
ShoppingBench: A Real-World Intent-Grounded Shopping Benchmark for LLM-based Agents
por: Wang, Jiangyuan, et al.
Publicado: (2025)
por: Wang, Jiangyuan, et al.
Publicado: (2025)
Unifying Language Agent Algorithms with Graph-based Orchestration Engine for Reproducible Agent Research
por: Zhang, Qianqian, et al.
Publicado: (2025)
por: Zhang, Qianqian, et al.
Publicado: (2025)
MLR-Bench: Evaluating AI Agents on Open-Ended Machine Learning Research
por: Chen, Hui, et al.
Publicado: (2025)
por: Chen, Hui, et al.
Publicado: (2025)
MCP-AgentBench: Evaluating Real-World Language Agent Performance with MCP-Mediated Tools
por: Guo, Zikang, et al.
Publicado: (2025)
por: Guo, Zikang, et al.
Publicado: (2025)
EpiBench: Benchmarking Multi-turn Research Workflows for Multimodal Agents
por: Dong, Xuan, et al.
Publicado: (2026)
por: Dong, Xuan, et al.
Publicado: (2026)
DeepResearch Bench: A Comprehensive Benchmark for Deep Research Agents
por: Du, Mingxuan, et al.
Publicado: (2025)
por: Du, Mingxuan, et al.
Publicado: (2025)
JudgeBench: A Benchmark for Evaluating LLM-based Judges
por: Tan, Sijun, et al.
Publicado: (2024)
por: Tan, Sijun, et al.
Publicado: (2024)
SpecBench: Measuring Reward Hacking in Long-Horizon Coding Agents
por: Zhao, Bingchen, et al.
Publicado: (2026)
por: Zhao, Bingchen, et al.
Publicado: (2026)
FinReasoning: A Hierarchical Benchmark for Reliable Financial Research Reporting
por: Zhu, Yiyun, et al.
Publicado: (2026)
por: Zhu, Yiyun, et al.
Publicado: (2026)
FinRetrieval: A Benchmark for Financial Data Retrieval by AI Agents
por: Kim, Eric Y., et al.
Publicado: (2026)
por: Kim, Eric Y., et al.
Publicado: (2026)
Cognitive Kernel-Pro: A Framework for Deep Research Agents and Agent Foundation Models Training
por: Fang, Tianqing, et al.
Publicado: (2025)
por: Fang, Tianqing, et al.
Publicado: (2025)
RuozhiBench: Evaluating LLMs with Logical Fallacies and Misleading Premises
por: Zhai, Zenan, et al.
Publicado: (2025)
por: Zhai, Zenan, et al.
Publicado: (2025)
FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use
por: Lu, Jiaxuan, et al.
Publicado: (2026)
por: Lu, Jiaxuan, et al.
Publicado: (2026)
ReportLogic: Evaluating Logical Quality in Deep Research Reports
por: Zhao, Jujia, et al.
Publicado: (2026)
por: Zhao, Jujia, et al.
Publicado: (2026)
ContestTrade: A Multi-Agent Trading System Based on Internal Contest Mechanism
por: Zhao, Li, et al.
Publicado: (2025)
por: Zhao, Li, et al.
Publicado: (2025)
GuideBench: Benchmarking Domain-Oriented Guideline Following for LLM Agents
por: Diao, Lingxiao, et al.
Publicado: (2025)
por: Diao, Lingxiao, et al.
Publicado: (2025)
FinVet: A Collaborative Framework of RAG and External Fact-Checking Agents for Financial Misinformation Detection
por: Araya, Daniel Berhane, et al.
Publicado: (2025)
por: Araya, Daniel Berhane, et al.
Publicado: (2025)
ENPMR-Bench: Benchmarking Proactive Memory Retrieval for Emotional Support Agents
por: Fu, Xing, et al.
Publicado: (2026)
por: Fu, Xing, et al.
Publicado: (2026)
DeepResearch Bench II: Diagnosing Deep Research Agents via Rubrics from Expert Report
por: Li, Ruizhe, et al.
Publicado: (2026)
por: Li, Ruizhe, et al.
Publicado: (2026)
FinLLM-B: When Large Language Models Meet Financial Breakout Trading
por: Zhang, Kang, et al.
Publicado: (2024)
por: Zhang, Kang, et al.
Publicado: (2024)
MedAgentsBench: Benchmarking Thinking Models and Agent Frameworks for Complex Medical Reasoning
por: Tang, Xiangru, et al.
Publicado: (2025)
por: Tang, Xiangru, et al.
Publicado: (2025)
Ejemplares similares
-
FinDeepResearch: Evaluating Deep Research Agents in Rigorous Financial Analysis
por: Zhu, Fengbin, et al.
Publicado: (2025) -
FinRpt: Dataset, Evaluation System and LLM-based Multi-agent Framework for Equity Research Report Generation
por: Jin, Song, et al.
Publicado: (2025) -
FinMCP-Bench: Benchmarking LLM Agents for Real-World Financial Tool Use under the Model Context Protocol
por: Zhu, Jie, et al.
Publicado: (2026) -
DR-Arena: an Automated Evaluation Framework for Deep Research Agents
por: Gao, Yiwen, et al.
Publicado: (2026) -
FinSafetyBench: Evaluating LLM Safety in Real-World Financial Scenarios
por: Hou, Yutao, et al.
Publicado: (2026)