FinResearchBench: A Logic Tree based Agent-as-a-Judge Evaluation Framework for Financial Research Agents
Fuente:
arXiv
Salvato in:
| Autori principali: | Sun, Rui, Bai, Zuo, Zhang, Wentao, Zhang, Yuxiang, Zhao, Li, Sun, Shan, Qiu, Zhengwen |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
FinDeepResearch: Evaluating Deep Research Agents in Rigorous Financial Analysis
di: Zhu, Fengbin, et al.
Pubblicazione: (2025)
di: Zhu, Fengbin, et al.
Pubblicazione: (2025)
FinRpt: Dataset, Evaluation System and LLM-based Multi-agent Framework for Equity Research Report Generation
di: Jin, Song, et al.
Pubblicazione: (2025)
di: Jin, Song, et al.
Pubblicazione: (2025)
FinMCP-Bench: Benchmarking LLM Agents for Real-World Financial Tool Use under the Model Context Protocol
di: Zhu, Jie, et al.
Pubblicazione: (2026)
di: Zhu, Jie, et al.
Pubblicazione: (2026)
DR-Arena: an Automated Evaluation Framework for Deep Research Agents
di: Gao, Yiwen, et al.
Pubblicazione: (2026)
di: Gao, Yiwen, et al.
Pubblicazione: (2026)
FinSafetyBench: Evaluating LLM Safety in Real-World Financial Scenarios
di: Hou, Yutao, et al.
Pubblicazione: (2026)
di: Hou, Yutao, et al.
Pubblicazione: (2026)
FinDebate: Multi-Agent Collaborative Intelligence for Financial Analysis
di: Cai, Tianshi, et al.
Pubblicazione: (2025)
di: Cai, Tianshi, et al.
Pubblicazione: (2025)
FinAgentBench: A Benchmark Dataset for Agentic Retrieval in Financial Question Answering
di: Choi, Chanyeol, et al.
Pubblicazione: (2025)
di: Choi, Chanyeol, et al.
Pubblicazione: (2025)
AgentBench: Evaluating LLMs as Agents
di: Liu, Xiao, et al.
Pubblicazione: (2023)
di: Liu, Xiao, et al.
Pubblicazione: (2023)
Mobile-Bench: An Evaluation Benchmark for LLM-based Mobile Agents
di: Deng, Shihan, et al.
Pubblicazione: (2024)
di: Deng, Shihan, et al.
Pubblicazione: (2024)
Dr. Bench: A Multidimensional Evaluation for Deep Research Agents, from Answers to Reports
di: Yao, Yang, et al.
Pubblicazione: (2025)
di: Yao, Yang, et al.
Pubblicazione: (2025)
FinGAIA: A Chinese Benchmark for AI Agents in Real-World Financial Domain
di: Zeng, Lingfeng, et al.
Pubblicazione: (2025)
di: Zeng, Lingfeng, et al.
Pubblicazione: (2025)
dzFinNlp at AraFinNLP: Improving Intent Detection in Financial Conversational Agents
di: Lichouri, Mohamed, et al.
Pubblicazione: (2024)
di: Lichouri, Mohamed, et al.
Pubblicazione: (2024)
Agent-SafetyBench: Evaluating the Safety of LLM Agents
di: Zhang, Zhexin, et al.
Pubblicazione: (2024)
di: Zhang, Zhexin, et al.
Pubblicazione: (2024)
ReportBench: Evaluating Deep Research Agents via Academic Survey Tasks
di: Li, Minghao, et al.
Pubblicazione: (2025)
di: Li, Minghao, et al.
Pubblicazione: (2025)
FlowBench: Revisiting and Benchmarking Workflow-Guided Planning for LLM-based Agents
di: Xiao, Ruixuan, et al.
Pubblicazione: (2024)
di: Xiao, Ruixuan, et al.
Pubblicazione: (2024)
BizFinBench: A Business-Driven Real-World Financial Benchmark for Evaluating LLMs
di: Lu, Guilong, et al.
Pubblicazione: (2025)
di: Lu, Guilong, et al.
Pubblicazione: (2025)
Agent-as-a-Judge
di: You, Runyang, et al.
Pubblicazione: (2026)
di: You, Runyang, et al.
Pubblicazione: (2026)
FinSight: Towards Real-World Financial Deep Research
di: Jin, Jiajie, et al.
Pubblicazione: (2025)
di: Jin, Jiajie, et al.
Pubblicazione: (2025)
Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?
di: Wang, Leyao, et al.
Pubblicazione: (2026)
di: Wang, Leyao, et al.
Pubblicazione: (2026)
ShoppingBench: A Real-World Intent-Grounded Shopping Benchmark for LLM-based Agents
di: Wang, Jiangyuan, et al.
Pubblicazione: (2025)
di: Wang, Jiangyuan, et al.
Pubblicazione: (2025)
Unifying Language Agent Algorithms with Graph-based Orchestration Engine for Reproducible Agent Research
di: Zhang, Qianqian, et al.
Pubblicazione: (2025)
di: Zhang, Qianqian, et al.
Pubblicazione: (2025)
MLR-Bench: Evaluating AI Agents on Open-Ended Machine Learning Research
di: Chen, Hui, et al.
Pubblicazione: (2025)
di: Chen, Hui, et al.
Pubblicazione: (2025)
MCP-AgentBench: Evaluating Real-World Language Agent Performance with MCP-Mediated Tools
di: Guo, Zikang, et al.
Pubblicazione: (2025)
di: Guo, Zikang, et al.
Pubblicazione: (2025)
EpiBench: Benchmarking Multi-turn Research Workflows for Multimodal Agents
di: Dong, Xuan, et al.
Pubblicazione: (2026)
di: Dong, Xuan, et al.
Pubblicazione: (2026)
DeepResearch Bench: A Comprehensive Benchmark for Deep Research Agents
di: Du, Mingxuan, et al.
Pubblicazione: (2025)
di: Du, Mingxuan, et al.
Pubblicazione: (2025)
JudgeBench: A Benchmark for Evaluating LLM-based Judges
di: Tan, Sijun, et al.
Pubblicazione: (2024)
di: Tan, Sijun, et al.
Pubblicazione: (2024)
SpecBench: Measuring Reward Hacking in Long-Horizon Coding Agents
di: Zhao, Bingchen, et al.
Pubblicazione: (2026)
di: Zhao, Bingchen, et al.
Pubblicazione: (2026)
FinReasoning: A Hierarchical Benchmark for Reliable Financial Research Reporting
di: Zhu, Yiyun, et al.
Pubblicazione: (2026)
di: Zhu, Yiyun, et al.
Pubblicazione: (2026)
FinRetrieval: A Benchmark for Financial Data Retrieval by AI Agents
di: Kim, Eric Y., et al.
Pubblicazione: (2026)
di: Kim, Eric Y., et al.
Pubblicazione: (2026)
Cognitive Kernel-Pro: A Framework for Deep Research Agents and Agent Foundation Models Training
di: Fang, Tianqing, et al.
Pubblicazione: (2025)
di: Fang, Tianqing, et al.
Pubblicazione: (2025)
RuozhiBench: Evaluating LLMs with Logical Fallacies and Misleading Premises
di: Zhai, Zenan, et al.
Pubblicazione: (2025)
di: Zhai, Zenan, et al.
Pubblicazione: (2025)
FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use
di: Lu, Jiaxuan, et al.
Pubblicazione: (2026)
di: Lu, Jiaxuan, et al.
Pubblicazione: (2026)
ReportLogic: Evaluating Logical Quality in Deep Research Reports
di: Zhao, Jujia, et al.
Pubblicazione: (2026)
di: Zhao, Jujia, et al.
Pubblicazione: (2026)
ContestTrade: A Multi-Agent Trading System Based on Internal Contest Mechanism
di: Zhao, Li, et al.
Pubblicazione: (2025)
di: Zhao, Li, et al.
Pubblicazione: (2025)
GuideBench: Benchmarking Domain-Oriented Guideline Following for LLM Agents
di: Diao, Lingxiao, et al.
Pubblicazione: (2025)
di: Diao, Lingxiao, et al.
Pubblicazione: (2025)
FinVet: A Collaborative Framework of RAG and External Fact-Checking Agents for Financial Misinformation Detection
di: Araya, Daniel Berhane, et al.
Pubblicazione: (2025)
di: Araya, Daniel Berhane, et al.
Pubblicazione: (2025)
ENPMR-Bench: Benchmarking Proactive Memory Retrieval for Emotional Support Agents
di: Fu, Xing, et al.
Pubblicazione: (2026)
di: Fu, Xing, et al.
Pubblicazione: (2026)
DeepResearch Bench II: Diagnosing Deep Research Agents via Rubrics from Expert Report
di: Li, Ruizhe, et al.
Pubblicazione: (2026)
di: Li, Ruizhe, et al.
Pubblicazione: (2026)
FinLLM-B: When Large Language Models Meet Financial Breakout Trading
di: Zhang, Kang, et al.
Pubblicazione: (2024)
di: Zhang, Kang, et al.
Pubblicazione: (2024)
MedAgentsBench: Benchmarking Thinking Models and Agent Frameworks for Complex Medical Reasoning
di: Tang, Xiangru, et al.
Pubblicazione: (2025)
di: Tang, Xiangru, et al.
Pubblicazione: (2025)
Documenti analoghi
-
FinDeepResearch: Evaluating Deep Research Agents in Rigorous Financial Analysis
di: Zhu, Fengbin, et al.
Pubblicazione: (2025) -
FinRpt: Dataset, Evaluation System and LLM-based Multi-agent Framework for Equity Research Report Generation
di: Jin, Song, et al.
Pubblicazione: (2025) -
FinMCP-Bench: Benchmarking LLM Agents for Real-World Financial Tool Use under the Model Context Protocol
di: Zhu, Jie, et al.
Pubblicazione: (2026) -
DR-Arena: an Automated Evaluation Framework for Deep Research Agents
di: Gao, Yiwen, et al.
Pubblicazione: (2026) -
FinSafetyBench: Evaluating LLM Safety in Real-World Financial Scenarios
di: Hou, Yutao, et al.
Pubblicazione: (2026)