FinReflectKG -- EvalBench: Benchmarking Financial KG with Multi-Dimensional Evaluation
Fuente:
arXiv
Saved in:
| Main Authors: | Dimino, Fabrizio, Arun, Abhinav, Sarmah, Bhaskarjit, Pasquali, Stefano |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
FinReflectKG: Agentic Construction and Evaluation of Financial Knowledge Graphs
by: Arun, Abhinav, et al.
Published: (2025)
by: Arun, Abhinav, et al.
Published: (2025)
FinReflectKG -- MultiHop: Financial QA Benchmark for Reasoning with Knowledge Graph Evidence
by: Arun, Abhinav, et al.
Published: (2025)
by: Arun, Abhinav, et al.
Published: (2025)
FinReflectKG -- HalluBench: GraphRAG Hallucination Benchmark for Financial Question Answering Systems
by: Kumar, Mahesh, et al.
Published: (2026)
by: Kumar, Mahesh, et al.
Published: (2026)
Risk-Adjusted Harm Scoring for Automated Red Teaming for LLMs in Financial Services
by: Dimino, Fabrizio, et al.
Published: (2026)
by: Dimino, Fabrizio, et al.
Published: (2026)
FinCARE: Financial Causal Analysis with Reasoning and Evidence
by: Michel, Alejandro, et al.
Published: (2025)
by: Michel, Alejandro, et al.
Published: (2025)
Uncovering Representation Bias for Investment Decisions in Open-Source Large Language Models
by: Dimino, Fabrizio, et al.
Published: (2025)
by: Dimino, Fabrizio, et al.
Published: (2025)
Tracing Positional Bias in Financial Decision-Making: Mechanistic Insights from Qwen2.5
by: Dimino, Fabrizio, et al.
Published: (2025)
by: Dimino, Fabrizio, et al.
Published: (2025)
FINCH: Financial Intelligence using Natural language for Contextualized SQL Handling
by: Singh, Avinash Kumar, et al.
Published: (2025)
by: Singh, Avinash Kumar, et al.
Published: (2025)
A Comparative Study of DSPy Teleprompter Algorithms for Aligning Large Language Models Evaluation Metrics to Human Evaluation
by: Sarmah, Bhaskarjit, et al.
Published: (2024)
by: Sarmah, Bhaskarjit, et al.
Published: (2024)
Benchmarking Open-Source Safety Guard Models: A Comprehensive Evaluation
by: Harsh, Reetu Raj, et al.
Published: (2026)
by: Harsh, Reetu Raj, et al.
Published: (2026)
FinAudio: A Benchmark for Audio Large Language Models in Financial Applications
by: Cao, Yupeng, et al.
Published: (2025)
by: Cao, Yupeng, et al.
Published: (2025)
FinRule-Bench: A Benchmark for Joint Reasoning over Financial Tables and Principles
by: Malarkkan, Arun Vignesh, et al.
Published: (2026)
by: Malarkkan, Arun Vignesh, et al.
Published: (2026)
BizFinBench: A Business-Driven Real-World Financial Benchmark for Evaluating LLMs
by: Lu, Guilong, et al.
Published: (2025)
by: Lu, Guilong, et al.
Published: (2025)
Enhanced Local Explainability and Trust Scores with Random Forest Proximities
by: Rosaler, Joshua, et al.
Published: (2023)
by: Rosaler, Joshua, et al.
Published: (2023)
UniFinEval: Towards Unified Evaluation of Financial Multimodal Models across Text, Images and Videos
by: Yang, Zhi, et al.
Published: (2026)
by: Yang, Zhi, et al.
Published: (2026)
FinTradeBench: A Financial Reasoning Benchmark for LLMs
by: Agrawal, Yogesh, et al.
Published: (2026)
by: Agrawal, Yogesh, et al.
Published: (2026)
Fin-RATE: A Real-world Financial Analytics and Tracking Evaluation Benchmark for LLMs on SEC Filings
by: Jiang, Yidong, et al.
Published: (2026)
by: Jiang, Yidong, et al.
Published: (2026)
FinTagging: Benchmarking LLMs for Extracting and Structuring Financial Information
by: Wang, Yan, et al.
Published: (2025)
by: Wang, Yan, et al.
Published: (2025)
FinZero: Launching Multi-modal Financial Time Series Forecast with Large Reasoning Model
by: Wang, Yanlong, et al.
Published: (2025)
by: Wang, Yanlong, et al.
Published: (2025)
FinBen: A Holistic Financial Benchmark for Large Language Models
by: Xie, Qianqian, et al.
Published: (2024)
by: Xie, Qianqian, et al.
Published: (2024)
Conv-FinRe: A Conversational and Longitudinal Benchmark for Utility-Grounded Financial Recommendation
by: Wang, Yan, et al.
Published: (2026)
by: Wang, Yan, et al.
Published: (2026)
How to Choose a Threshold for an Evaluation Metric for Large Language Models
by: Sarmah, Bhaskarjit, et al.
Published: (2024)
by: Sarmah, Bhaskarjit, et al.
Published: (2024)
FinLoRA: Benchmarking LoRA Methods for Fine-Tuning LLMs on Financial Datasets
by: Wang, Dannong, et al.
Published: (2025)
by: Wang, Dannong, et al.
Published: (2025)
HybridRAG: Integrating Knowledge Graphs and Vector Retrieval Augmented Generation for Efficient Information Extraction
by: Sarmah, Bhaskarjit, et al.
Published: (2024)
by: Sarmah, Bhaskarjit, et al.
Published: (2024)
RNA-KG: An ontology-based knowledge graph for representing interactions involving RNA molecules
by: Cavalleri, Emanuele, et al.
Published: (2023)
by: Cavalleri, Emanuele, et al.
Published: (2023)
The CLEF-2026 FinMMEval Lab: Multilingual and Multimodal Evaluation of Financial AI Systems
by: Xie, Zhuohan, et al.
Published: (2026)
by: Xie, Zhuohan, et al.
Published: (2026)
QuantBench: Benchmarking AI Methods for Quantitative Investment
by: Wang, Saizhuo, et al.
Published: (2025)
by: Wang, Saizhuo, et al.
Published: (2025)
FinCast: A Foundation Model for Financial Time-Series Forecasting
by: Zhu, Zhuohang, et al.
Published: (2025)
by: Zhu, Zhuohang, et al.
Published: (2025)
FinSight: Towards Real-World Financial Deep Research
by: Jin, Jiajie, et al.
Published: (2025)
by: Jin, Jiajie, et al.
Published: (2025)
INVESTORBENCH: A Benchmark for Financial Decision-Making Tasks with LLM-based Agent
by: Li, Haohang, et al.
Published: (2024)
by: Li, Haohang, et al.
Published: (2024)
FinHEAR: Human Expertise and Adaptive Risk-Aware Temporal Reasoning for Financial Decision-Making
by: Chen, Jiaxiang, et al.
Published: (2025)
by: Chen, Jiaxiang, et al.
Published: (2025)
RiskLabs: Predicting Financial Risk Using Large Language Model based on Multimodal and Multi-Sources Data
by: Cao, Yupeng, et al.
Published: (2024)
by: Cao, Yupeng, et al.
Published: (2024)
FinTrace: Holistic Trajectory-Level Evaluation of LLM Tool Calling for Long-Horizon Financial Tasks
by: Cao, Yupeng, et al.
Published: (2026)
by: Cao, Yupeng, et al.
Published: (2026)
CatMemo at the FinLLM Challenge Task: Fine-Tuning Large Language Models using Data Fusion in Financial Applications
by: Cao, Yupeng, et al.
Published: (2024)
by: Cao, Yupeng, et al.
Published: (2024)
MetaBench: A Multi-task Benchmark for Assessing LLMs in Metabolomics
by: Lu, Yuxing, et al.
Published: (2025)
by: Lu, Yuxing, et al.
Published: (2025)
FinMaster: A Holistic Benchmark for Mastering Full-Pipeline Financial Workflows with LLMs
by: Jiang, Junzhe, et al.
Published: (2025)
by: Jiang, Junzhe, et al.
Published: (2025)
SECQUE: A Benchmark for Evaluating Real-World Financial Analysis Capabilities
by: Yoash, Noga Ben, et al.
Published: (2025)
by: Yoash, Noga Ben, et al.
Published: (2025)
SmartEval: A Benchmark for Evaluating LLM-Generated Smart Contracts from Natural Language Specifications
by: Goel, Abhinav, et al.
Published: (2026)
by: Goel, Abhinav, et al.
Published: (2026)
AlphaAgents: Large Language Model based Multi-Agents for Equity Portfolio Constructions
by: Zhao, Tianjiao, et al.
Published: (2025)
by: Zhao, Tianjiao, et al.
Published: (2025)
RealFin: How Well Do LLMs Reason About Finance When Users Leave Things Unsaid?
by: Dai, Yuyang, et al.
Published: (2026)
by: Dai, Yuyang, et al.
Published: (2026)
Similar Items
-
FinReflectKG: Agentic Construction and Evaluation of Financial Knowledge Graphs
by: Arun, Abhinav, et al.
Published: (2025) -
FinReflectKG -- MultiHop: Financial QA Benchmark for Reasoning with Knowledge Graph Evidence
by: Arun, Abhinav, et al.
Published: (2025) -
FinReflectKG -- HalluBench: GraphRAG Hallucination Benchmark for Financial Question Answering Systems
by: Kumar, Mahesh, et al.
Published: (2026) -
Risk-Adjusted Harm Scoring for Automated Red Teaming for LLMs in Financial Services
by: Dimino, Fabrizio, et al.
Published: (2026) -
FinCARE: Financial Causal Analysis with Reasoning and Evidence
by: Michel, Alejandro, et al.
Published: (2025)