FinReflectKG -- HalluBench: GraphRAG Hallucination Benchmark for Financial Question Answering Systems
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kumar, Mahesh, Sarmah, Bhaskarjit, Pasquali, Stefano |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
FinReflectKG -- EvalBench: Benchmarking Financial KG with Multi-Dimensional Evaluation
par: Dimino, Fabrizio, et autres
Publié: (2025)
par: Dimino, Fabrizio, et autres
Publié: (2025)
FinReflectKG -- MultiHop: Financial QA Benchmark for Reasoning with Knowledge Graph Evidence
par: Arun, Abhinav, et autres
Publié: (2025)
par: Arun, Abhinav, et autres
Publié: (2025)
FinReflectKG: Agentic Construction and Evaluation of Financial Knowledge Graphs
par: Arun, Abhinav, et autres
Publié: (2025)
par: Arun, Abhinav, et autres
Publié: (2025)
FinCARE: Financial Causal Analysis with Reasoning and Evidence
par: Michel, Alejandro, et autres
Publié: (2025)
par: Michel, Alejandro, et autres
Publié: (2025)
FINCH: Financial Intelligence using Natural language for Contextualized SQL Handling
par: Singh, Avinash Kumar, et autres
Publié: (2025)
par: Singh, Avinash Kumar, et autres
Publié: (2025)
Risk-Adjusted Harm Scoring for Automated Red Teaming for LLMs in Financial Services
par: Dimino, Fabrizio, et autres
Publié: (2026)
par: Dimino, Fabrizio, et autres
Publié: (2026)
HybridRAG: Integrating Knowledge Graphs and Vector Retrieval Augmented Generation for Efficient Information Extraction
par: Sarmah, Bhaskarjit, et autres
Publié: (2024)
par: Sarmah, Bhaskarjit, et autres
Publié: (2024)
Tracing Positional Bias in Financial Decision-Making: Mechanistic Insights from Qwen2.5
par: Dimino, Fabrizio, et autres
Publié: (2025)
par: Dimino, Fabrizio, et autres
Publié: (2025)
Uncovering Representation Bias for Investment Decisions in Open-Source Large Language Models
par: Dimino, Fabrizio, et autres
Publié: (2025)
par: Dimino, Fabrizio, et autres
Publié: (2025)
A Comparative Study of DSPy Teleprompter Algorithms for Aligning Large Language Models Evaluation Metrics to Human Evaluation
par: Sarmah, Bhaskarjit, et autres
Publié: (2024)
par: Sarmah, Bhaskarjit, et autres
Publié: (2024)
How to Choose a Threshold for an Evaluation Metric for Large Language Models
par: Sarmah, Bhaskarjit, et autres
Publié: (2024)
par: Sarmah, Bhaskarjit, et autres
Publié: (2024)
Benchmarking Open-Source Safety Guard Models: A Comprehensive Evaluation
par: Harsh, Reetu Raj, et autres
Publié: (2026)
par: Harsh, Reetu Raj, et autres
Publié: (2026)
HalluScore: Large Language Model Hallucination Question Answering Benchmark
par: Alansari, Aisha, et autres
Publié: (2026)
par: Alansari, Aisha, et autres
Publié: (2026)
Improving Retrieval for RAG based Question Answering Models on Financial Documents
par: Setty, Spurthi, et autres
Publié: (2024)
par: Setty, Spurthi, et autres
Publié: (2024)
FinBoardBench: Benchmarking Dynamic Wealth Management and Strategic Financial Reasoning of LLMs via Board Game Simulations
par: Hu, Xuesi, et autres
Publié: (2026)
par: Hu, Xuesi, et autres
Publié: (2026)
FinTradeBench: A Financial Reasoning Benchmark for LLMs
par: Agrawal, Yogesh, et autres
Publié: (2026)
par: Agrawal, Yogesh, et autres
Publié: (2026)
BizFinBench: A Business-Driven Real-World Financial Benchmark for Evaluating LLMs
par: Lu, Guilong, et autres
Publié: (2025)
par: Lu, Guilong, et autres
Publié: (2025)
Enhancing Startup Success Predictions in Venture Capital: A GraphRAG Augmented Multivariate Time Series Method
par: Gao, Zitian, et autres
Publié: (2024)
par: Gao, Zitian, et autres
Publié: (2024)
SMARTFinRAG: Interactive Modularized Financial RAG Benchmark
par: Zha, Yiwei
Publié: (2025)
par: Zha, Yiwei
Publié: (2025)
WildGraphBench: Benchmarking GraphRAG with Wild-Source Corpora
par: Wang, Pengyu, et autres
Publié: (2026)
par: Wang, Pengyu, et autres
Publié: (2026)
Open-FinLLMs: Open Multimodal Large Language Models for Financial Applications
par: Huang, Jimin, et autres
Publié: (2024)
par: Huang, Jimin, et autres
Publié: (2024)
FinTagging: Benchmarking LLMs for Extracting and Structuring Financial Information
par: Wang, Yan, et autres
Publié: (2025)
par: Wang, Yan, et autres
Publié: (2025)
A Role-Aware Multi-Agent Framework for Financial Education Question Answering with LLMs
par: Zhu, Andy, et autres
Publié: (2025)
par: Zhu, Andy, et autres
Publié: (2025)
FinBen: A Holistic Financial Benchmark for Large Language Models
par: Xie, Qianqian, et autres
Publié: (2024)
par: Xie, Qianqian, et autres
Publié: (2024)
Inference Scaled GraphRAG: Improving Multi Hop Question Answering on Knowledge Graphs
par: Thompson, Travis, et autres
Publié: (2025)
par: Thompson, Travis, et autres
Publié: (2025)
FinGEAR: Financial Mapping-Guided Enhanced Answer Retrieval
par: Li, Ying, et autres
Publié: (2025)
par: Li, Ying, et autres
Publié: (2025)
FinAuditing: A Financial Taxonomy-Structured Multi-Document Benchmark for Evaluating LLMs
par: Wang, Yan, et autres
Publié: (2025)
par: Wang, Yan, et autres
Publié: (2025)
StepChain GraphRAG: Reasoning Over Knowledge Graphs for Multi-Hop Question Answering
par: Ni, Tengjun, et autres
Publié: (2025)
par: Ni, Tengjun, et autres
Publié: (2025)
FinMarBa: A Market-Informed Dataset for Financial Sentiment Classification
par: Lefort, Baptiste, et autres
Publié: (2025)
par: Lefort, Baptiste, et autres
Publié: (2025)
FinAgentBench: A Benchmark Dataset for Agentic Retrieval in Financial Question Answering
par: Choi, Chanyeol, et autres
Publié: (2025)
par: Choi, Chanyeol, et autres
Publié: (2025)
EDINET-Bench: Evaluating LLMs on Complex Financial Tasks using Japanese Financial Statements
par: Sugiura, Issa, et autres
Publié: (2025)
par: Sugiura, Issa, et autres
Publié: (2025)
The CLEF-2026 FinMMEval Lab: Multilingual and Multimodal Evaluation of Financial AI Systems
par: Xie, Zhuohan, et autres
Publié: (2026)
par: Xie, Zhuohan, et autres
Publié: (2026)
FinAI-BERT: A Transformer-Based Model for Sentence-Level Detection of AI Disclosures in Financial Reports
par: Zafar, Muhammad Bilal
Publié: (2025)
par: Zafar, Muhammad Bilal
Publié: (2025)
UCFE: A User-Centric Financial Expertise Benchmark for Large Language Models
par: Yang, Yuzhe, et autres
Publié: (2024)
par: Yang, Yuzhe, et autres
Publié: (2024)
Construction of a Japanese Financial Benchmark for Large Language Models
par: Hirano, Masanori
Publié: (2024)
par: Hirano, Masanori
Publié: (2024)
All That Glisters Is Not Gold: A Benchmark for Reference-Free Counterfactual Financial Misinformation Detection
par: Jiang, Yuechen, et autres
Publié: (2026)
par: Jiang, Yuechen, et autres
Publié: (2026)
FinSight: Towards Real-World Financial Deep Research
par: Jin, Jiajie, et autres
Publié: (2025)
par: Jin, Jiajie, et autres
Publié: (2025)
L3iTC at the FinLLM Challenge Task: Quantization for Financial Text Classification & Summarization
par: Pontes, Elvys Linhares, et autres
Publié: (2024)
par: Pontes, Elvys Linhares, et autres
Publié: (2024)
HalluGraph: Auditable Hallucination Detection for Legal RAG Systems via Knowledge Graph Alignment
par: Noël, Valentin, et autres
Publié: (2025)
par: Noël, Valentin, et autres
Publié: (2025)
HalluLens: LLM Hallucination Benchmark
par: Bang, Yejin, et autres
Publié: (2025)
par: Bang, Yejin, et autres
Publié: (2025)
Documents similaires
-
FinReflectKG -- EvalBench: Benchmarking Financial KG with Multi-Dimensional Evaluation
par: Dimino, Fabrizio, et autres
Publié: (2025) -
FinReflectKG -- MultiHop: Financial QA Benchmark for Reasoning with Knowledge Graph Evidence
par: Arun, Abhinav, et autres
Publié: (2025) -
FinReflectKG: Agentic Construction and Evaluation of Financial Knowledge Graphs
par: Arun, Abhinav, et autres
Publié: (2025) -
FinCARE: Financial Causal Analysis with Reasoning and Evidence
par: Michel, Alejandro, et autres
Publié: (2025) -
FINCH: Financial Intelligence using Natural language for Contextualized SQL Handling
par: Singh, Avinash Kumar, et autres
Publié: (2025)