FinReflectKG -- MultiHop: Financial QA Benchmark for Reasoning with Knowledge Graph Evidence
Fuente:
arXiv
Saved in:
| Main Authors: | Arun, Abhinav, Harsh, Reetu Raj, Sarmah, Bhaskarjit, Pasquali, Stefano |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
FinReflectKG -- EvalBench: Benchmarking Financial KG with Multi-Dimensional Evaluation
by: Dimino, Fabrizio, et al.
Published: (2025)
by: Dimino, Fabrizio, et al.
Published: (2025)
FinReflectKG: Agentic Construction and Evaluation of Financial Knowledge Graphs
by: Arun, Abhinav, et al.
Published: (2025)
by: Arun, Abhinav, et al.
Published: (2025)
FinReflectKG -- HalluBench: GraphRAG Hallucination Benchmark for Financial Question Answering Systems
by: Kumar, Mahesh, et al.
Published: (2026)
by: Kumar, Mahesh, et al.
Published: (2026)
FinCARE: Financial Causal Analysis with Reasoning and Evidence
by: Michel, Alejandro, et al.
Published: (2025)
by: Michel, Alejandro, et al.
Published: (2025)
Benchmarking Open-Source Safety Guard Models: A Comprehensive Evaluation
by: Harsh, Reetu Raj, et al.
Published: (2026)
by: Harsh, Reetu Raj, et al.
Published: (2026)
Risk-Adjusted Harm Scoring for Automated Red Teaming for LLMs in Financial Services
by: Dimino, Fabrizio, et al.
Published: (2026)
by: Dimino, Fabrizio, et al.
Published: (2026)
FINCH: Financial Intelligence using Natural language for Contextualized SQL Handling
by: Singh, Avinash Kumar, et al.
Published: (2025)
by: Singh, Avinash Kumar, et al.
Published: (2025)
Uncovering Representation Bias for Investment Decisions in Open-Source Large Language Models
by: Dimino, Fabrizio, et al.
Published: (2025)
by: Dimino, Fabrizio, et al.
Published: (2025)
Tracing Positional Bias in Financial Decision-Making: Mechanistic Insights from Qwen2.5
by: Dimino, Fabrizio, et al.
Published: (2025)
by: Dimino, Fabrizio, et al.
Published: (2025)
HybridRAG: Integrating Knowledge Graphs and Vector Retrieval Augmented Generation for Efficient Information Extraction
by: Sarmah, Bhaskarjit, et al.
Published: (2024)
by: Sarmah, Bhaskarjit, et al.
Published: (2024)
A Comparative Study of DSPy Teleprompter Algorithms for Aligning Large Language Models Evaluation Metrics to Human Evaluation
by: Sarmah, Bhaskarjit, et al.
Published: (2024)
by: Sarmah, Bhaskarjit, et al.
Published: (2024)
Enhanced Local Explainability and Trust Scores with Random Forest Proximities
by: Rosaler, Joshua, et al.
Published: (2023)
by: Rosaler, Joshua, et al.
Published: (2023)
FinRule-Bench: A Benchmark for Joint Reasoning over Financial Tables and Principles
by: Malarkkan, Arun Vignesh, et al.
Published: (2026)
by: Malarkkan, Arun Vignesh, et al.
Published: (2026)
How to Choose a Threshold for an Evaluation Metric for Large Language Models
by: Sarmah, Bhaskarjit, et al.
Published: (2024)
by: Sarmah, Bhaskarjit, et al.
Published: (2024)
FinZero: Launching Multi-modal Financial Time Series Forecast with Large Reasoning Model
by: Wang, Yanlong, et al.
Published: (2025)
by: Wang, Yanlong, et al.
Published: (2025)
FinTradeBench: A Financial Reasoning Benchmark for LLMs
by: Agrawal, Yogesh, et al.
Published: (2026)
by: Agrawal, Yogesh, et al.
Published: (2026)
FinTagging: Benchmarking LLMs for Extracting and Structuring Financial Information
by: Wang, Yan, et al.
Published: (2025)
by: Wang, Yan, et al.
Published: (2025)
Conv-FinRe: A Conversational and Longitudinal Benchmark for Utility-Grounded Financial Recommendation
by: Wang, Yan, et al.
Published: (2026)
by: Wang, Yan, et al.
Published: (2026)
FinMaster: A Holistic Benchmark for Mastering Full-Pipeline Financial Workflows with LLMs
by: Jiang, Junzhe, et al.
Published: (2025)
by: Jiang, Junzhe, et al.
Published: (2025)
FinAudio: A Benchmark for Audio Large Language Models in Financial Applications
by: Cao, Yupeng, et al.
Published: (2025)
by: Cao, Yupeng, et al.
Published: (2025)
FinBen: A Holistic Financial Benchmark for Large Language Models
by: Xie, Qianqian, et al.
Published: (2024)
by: Xie, Qianqian, et al.
Published: (2024)
FinLoRA: Benchmarking LoRA Methods for Fine-Tuning LLMs on Financial Datasets
by: Wang, Dannong, et al.
Published: (2025)
by: Wang, Dannong, et al.
Published: (2025)
FinHEAR: Human Expertise and Adaptive Risk-Aware Temporal Reasoning for Financial Decision-Making
by: Chen, Jiaxiang, et al.
Published: (2025)
by: Chen, Jiaxiang, et al.
Published: (2025)
AlphaAgents: Large Language Model based Multi-Agents for Equity Portfolio Constructions
by: Zhao, Tianjiao, et al.
Published: (2025)
by: Zhao, Tianjiao, et al.
Published: (2025)
Fin-RATE: A Real-world Financial Analytics and Tracking Evaluation Benchmark for LLMs on SEC Filings
by: Jiang, Yidong, et al.
Published: (2026)
by: Jiang, Yidong, et al.
Published: (2026)
FinSentiment: Predicting Financial Sentiment Through Transfer Learning
by: Zehra Erva Ergun, et al.
Published: (2025)
by: Zehra Erva Ergun, et al.
Published: (2025)
BizFinBench: A Business-Driven Real-World Financial Benchmark for Evaluating LLMs
by: Lu, Guilong, et al.
Published: (2025)
by: Lu, Guilong, et al.
Published: (2025)
FinMetaMind: A Tech Blueprint on NLQ Systems for Financial Knowledge Search
by: Pant, Lalit, et al.
Published: (2026)
by: Pant, Lalit, et al.
Published: (2026)
RealFin: How Well Do LLMs Reason About Finance When Users Leave Things Unsaid?
by: Dai, Yuyang, et al.
Published: (2026)
by: Dai, Yuyang, et al.
Published: (2026)
FinMTM: A Multi-Turn Multimodal Benchmark for Financial Reasoning and Agent Evaluation
by: Zhang, Chenxi, et al.
Published: (2026)
by: Zhang, Chenxi, et al.
Published: (2026)
FinDocMRE: A Benchmark for Document-Level Financial Multimodal Reasoning Evaluation
by: Zhu, Jiayong, et al.
Published: (2026)
by: Zhu, Jiayong, et al.
Published: (2026)
FinCast: A Foundation Model for Financial Time-Series Forecasting
by: Zhu, Zhuohang, et al.
Published: (2025)
by: Zhu, Zhuohang, et al.
Published: (2025)
FinDKG: Dynamic Knowledge Graphs with Large Language Models for Detecting Global Trends in Financial Markets
by: Li, Xiaohui Victor, et al.
Published: (2024)
by: Li, Xiaohui Victor, et al.
Published: (2024)
Reasoning on Time-Series for Financial Technical Analysis
by: Koa, Kelvin J. L., et al.
Published: (2025)
by: Koa, Kelvin J. L., et al.
Published: (2025)
MultiHop-RAG: Benchmarking Retrieval-Augmented Generation for Multi-Hop Queries
by: Tang, Yixuan, et al.
Published: (2024)
by: Tang, Yixuan, et al.
Published: (2024)
FinBloom: Knowledge Grounding Large Language Model with Real-time Financial Data
by: Sinha, Ankur, et al.
Published: (2025)
by: Sinha, Ankur, et al.
Published: (2025)
FinSight: Towards Real-World Financial Deep Research
by: Jin, Jiajie, et al.
Published: (2025)
by: Jin, Jiajie, et al.
Published: (2025)
CatMemo at the FinLLM Challenge Task: Fine-Tuning Large Language Models using Data Fusion in Financial Applications
by: Cao, Yupeng, et al.
Published: (2024)
by: Cao, Yupeng, et al.
Published: (2024)
Fin-Fact: A Benchmark Dataset for Multimodal Financial Fact Checking and Explanation Generation
by: Rangapur, Aman, et al.
Published: (2023)
by: Rangapur, Aman, et al.
Published: (2023)
INVESTORBENCH: A Benchmark for Financial Decision-Making Tasks with LLM-based Agent
by: Li, Haohang, et al.
Published: (2024)
by: Li, Haohang, et al.
Published: (2024)
Similar Items
-
FinReflectKG -- EvalBench: Benchmarking Financial KG with Multi-Dimensional Evaluation
by: Dimino, Fabrizio, et al.
Published: (2025) -
FinReflectKG: Agentic Construction and Evaluation of Financial Knowledge Graphs
by: Arun, Abhinav, et al.
Published: (2025) -
FinReflectKG -- HalluBench: GraphRAG Hallucination Benchmark for Financial Question Answering Systems
by: Kumar, Mahesh, et al.
Published: (2026) -
FinCARE: Financial Causal Analysis with Reasoning and Evidence
by: Michel, Alejandro, et al.
Published: (2025) -
Benchmarking Open-Source Safety Guard Models: A Comprehensive Evaluation
by: Harsh, Reetu Raj, et al.
Published: (2026)