FinReflectKG -- EvalBench: Benchmarking Financial KG with Multi-Dimensional Evaluation
Fuente:
arXiv
Salvato in:
| Autori principali: | Dimino, Fabrizio, Arun, Abhinav, Sarmah, Bhaskarjit, Pasquali, Stefano |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
FinReflectKG: Agentic Construction and Evaluation of Financial Knowledge Graphs
di: Arun, Abhinav, et al.
Pubblicazione: (2025)
di: Arun, Abhinav, et al.
Pubblicazione: (2025)
FinReflectKG -- MultiHop: Financial QA Benchmark for Reasoning with Knowledge Graph Evidence
di: Arun, Abhinav, et al.
Pubblicazione: (2025)
di: Arun, Abhinav, et al.
Pubblicazione: (2025)
FinReflectKG -- HalluBench: GraphRAG Hallucination Benchmark for Financial Question Answering Systems
di: Kumar, Mahesh, et al.
Pubblicazione: (2026)
di: Kumar, Mahesh, et al.
Pubblicazione: (2026)
Risk-Adjusted Harm Scoring for Automated Red Teaming for LLMs in Financial Services
di: Dimino, Fabrizio, et al.
Pubblicazione: (2026)
di: Dimino, Fabrizio, et al.
Pubblicazione: (2026)
FinCARE: Financial Causal Analysis with Reasoning and Evidence
di: Michel, Alejandro, et al.
Pubblicazione: (2025)
di: Michel, Alejandro, et al.
Pubblicazione: (2025)
Uncovering Representation Bias for Investment Decisions in Open-Source Large Language Models
di: Dimino, Fabrizio, et al.
Pubblicazione: (2025)
di: Dimino, Fabrizio, et al.
Pubblicazione: (2025)
Tracing Positional Bias in Financial Decision-Making: Mechanistic Insights from Qwen2.5
di: Dimino, Fabrizio, et al.
Pubblicazione: (2025)
di: Dimino, Fabrizio, et al.
Pubblicazione: (2025)
FINCH: Financial Intelligence using Natural language for Contextualized SQL Handling
di: Singh, Avinash Kumar, et al.
Pubblicazione: (2025)
di: Singh, Avinash Kumar, et al.
Pubblicazione: (2025)
A Comparative Study of DSPy Teleprompter Algorithms for Aligning Large Language Models Evaluation Metrics to Human Evaluation
di: Sarmah, Bhaskarjit, et al.
Pubblicazione: (2024)
di: Sarmah, Bhaskarjit, et al.
Pubblicazione: (2024)
Benchmarking Open-Source Safety Guard Models: A Comprehensive Evaluation
di: Harsh, Reetu Raj, et al.
Pubblicazione: (2026)
di: Harsh, Reetu Raj, et al.
Pubblicazione: (2026)
FinAudio: A Benchmark for Audio Large Language Models in Financial Applications
di: Cao, Yupeng, et al.
Pubblicazione: (2025)
di: Cao, Yupeng, et al.
Pubblicazione: (2025)
FinRule-Bench: A Benchmark for Joint Reasoning over Financial Tables and Principles
di: Malarkkan, Arun Vignesh, et al.
Pubblicazione: (2026)
di: Malarkkan, Arun Vignesh, et al.
Pubblicazione: (2026)
BizFinBench: A Business-Driven Real-World Financial Benchmark for Evaluating LLMs
di: Lu, Guilong, et al.
Pubblicazione: (2025)
di: Lu, Guilong, et al.
Pubblicazione: (2025)
Enhanced Local Explainability and Trust Scores with Random Forest Proximities
di: Rosaler, Joshua, et al.
Pubblicazione: (2023)
di: Rosaler, Joshua, et al.
Pubblicazione: (2023)
UniFinEval: Towards Unified Evaluation of Financial Multimodal Models across Text, Images and Videos
di: Yang, Zhi, et al.
Pubblicazione: (2026)
di: Yang, Zhi, et al.
Pubblicazione: (2026)
FinTradeBench: A Financial Reasoning Benchmark for LLMs
di: Agrawal, Yogesh, et al.
Pubblicazione: (2026)
di: Agrawal, Yogesh, et al.
Pubblicazione: (2026)
Fin-RATE: A Real-world Financial Analytics and Tracking Evaluation Benchmark for LLMs on SEC Filings
di: Jiang, Yidong, et al.
Pubblicazione: (2026)
di: Jiang, Yidong, et al.
Pubblicazione: (2026)
FinTagging: Benchmarking LLMs for Extracting and Structuring Financial Information
di: Wang, Yan, et al.
Pubblicazione: (2025)
di: Wang, Yan, et al.
Pubblicazione: (2025)
FinZero: Launching Multi-modal Financial Time Series Forecast with Large Reasoning Model
di: Wang, Yanlong, et al.
Pubblicazione: (2025)
di: Wang, Yanlong, et al.
Pubblicazione: (2025)
FinBen: A Holistic Financial Benchmark for Large Language Models
di: Xie, Qianqian, et al.
Pubblicazione: (2024)
di: Xie, Qianqian, et al.
Pubblicazione: (2024)
Conv-FinRe: A Conversational and Longitudinal Benchmark for Utility-Grounded Financial Recommendation
di: Wang, Yan, et al.
Pubblicazione: (2026)
di: Wang, Yan, et al.
Pubblicazione: (2026)
How to Choose a Threshold for an Evaluation Metric for Large Language Models
di: Sarmah, Bhaskarjit, et al.
Pubblicazione: (2024)
di: Sarmah, Bhaskarjit, et al.
Pubblicazione: (2024)
FinLoRA: Benchmarking LoRA Methods for Fine-Tuning LLMs on Financial Datasets
di: Wang, Dannong, et al.
Pubblicazione: (2025)
di: Wang, Dannong, et al.
Pubblicazione: (2025)
HybridRAG: Integrating Knowledge Graphs and Vector Retrieval Augmented Generation for Efficient Information Extraction
di: Sarmah, Bhaskarjit, et al.
Pubblicazione: (2024)
di: Sarmah, Bhaskarjit, et al.
Pubblicazione: (2024)
RNA-KG: An ontology-based knowledge graph for representing interactions involving RNA molecules
di: Cavalleri, Emanuele, et al.
Pubblicazione: (2023)
di: Cavalleri, Emanuele, et al.
Pubblicazione: (2023)
The CLEF-2026 FinMMEval Lab: Multilingual and Multimodal Evaluation of Financial AI Systems
di: Xie, Zhuohan, et al.
Pubblicazione: (2026)
di: Xie, Zhuohan, et al.
Pubblicazione: (2026)
QuantBench: Benchmarking AI Methods for Quantitative Investment
di: Wang, Saizhuo, et al.
Pubblicazione: (2025)
di: Wang, Saizhuo, et al.
Pubblicazione: (2025)
FinCast: A Foundation Model for Financial Time-Series Forecasting
di: Zhu, Zhuohang, et al.
Pubblicazione: (2025)
di: Zhu, Zhuohang, et al.
Pubblicazione: (2025)
FinSight: Towards Real-World Financial Deep Research
di: Jin, Jiajie, et al.
Pubblicazione: (2025)
di: Jin, Jiajie, et al.
Pubblicazione: (2025)
INVESTORBENCH: A Benchmark for Financial Decision-Making Tasks with LLM-based Agent
di: Li, Haohang, et al.
Pubblicazione: (2024)
di: Li, Haohang, et al.
Pubblicazione: (2024)
FinHEAR: Human Expertise and Adaptive Risk-Aware Temporal Reasoning for Financial Decision-Making
di: Chen, Jiaxiang, et al.
Pubblicazione: (2025)
di: Chen, Jiaxiang, et al.
Pubblicazione: (2025)
RiskLabs: Predicting Financial Risk Using Large Language Model based on Multimodal and Multi-Sources Data
di: Cao, Yupeng, et al.
Pubblicazione: (2024)
di: Cao, Yupeng, et al.
Pubblicazione: (2024)
FinTrace: Holistic Trajectory-Level Evaluation of LLM Tool Calling for Long-Horizon Financial Tasks
di: Cao, Yupeng, et al.
Pubblicazione: (2026)
di: Cao, Yupeng, et al.
Pubblicazione: (2026)
CatMemo at the FinLLM Challenge Task: Fine-Tuning Large Language Models using Data Fusion in Financial Applications
di: Cao, Yupeng, et al.
Pubblicazione: (2024)
di: Cao, Yupeng, et al.
Pubblicazione: (2024)
MetaBench: A Multi-task Benchmark for Assessing LLMs in Metabolomics
di: Lu, Yuxing, et al.
Pubblicazione: (2025)
di: Lu, Yuxing, et al.
Pubblicazione: (2025)
FinMaster: A Holistic Benchmark for Mastering Full-Pipeline Financial Workflows with LLMs
di: Jiang, Junzhe, et al.
Pubblicazione: (2025)
di: Jiang, Junzhe, et al.
Pubblicazione: (2025)
SECQUE: A Benchmark for Evaluating Real-World Financial Analysis Capabilities
di: Yoash, Noga Ben, et al.
Pubblicazione: (2025)
di: Yoash, Noga Ben, et al.
Pubblicazione: (2025)
SmartEval: A Benchmark for Evaluating LLM-Generated Smart Contracts from Natural Language Specifications
di: Goel, Abhinav, et al.
Pubblicazione: (2026)
di: Goel, Abhinav, et al.
Pubblicazione: (2026)
AlphaAgents: Large Language Model based Multi-Agents for Equity Portfolio Constructions
di: Zhao, Tianjiao, et al.
Pubblicazione: (2025)
di: Zhao, Tianjiao, et al.
Pubblicazione: (2025)
RealFin: How Well Do LLMs Reason About Finance When Users Leave Things Unsaid?
di: Dai, Yuyang, et al.
Pubblicazione: (2026)
di: Dai, Yuyang, et al.
Pubblicazione: (2026)
Documenti analoghi
-
FinReflectKG: Agentic Construction and Evaluation of Financial Knowledge Graphs
di: Arun, Abhinav, et al.
Pubblicazione: (2025) -
FinReflectKG -- MultiHop: Financial QA Benchmark for Reasoning with Knowledge Graph Evidence
di: Arun, Abhinav, et al.
Pubblicazione: (2025) -
FinReflectKG -- HalluBench: GraphRAG Hallucination Benchmark for Financial Question Answering Systems
di: Kumar, Mahesh, et al.
Pubblicazione: (2026) -
Risk-Adjusted Harm Scoring for Automated Red Teaming for LLMs in Financial Services
di: Dimino, Fabrizio, et al.
Pubblicazione: (2026) -
FinCARE: Financial Causal Analysis with Reasoning and Evidence
di: Michel, Alejandro, et al.
Pubblicazione: (2025)