FinVerBench: Benchmark Validity and Calibration in Large Language Model Financial Statement Verification
Fuente:
arXiv
Guardado en:
| Autor principal: | Panda, Silu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
FinDABench: Benchmarking Financial Data Analysis Ability of Large Language Models
por: Liu, Shu, et al.
Publicado: (2024)
por: Liu, Shu, et al.
Publicado: (2024)
FinBen: A Holistic Financial Benchmark for Large Language Models
por: Xie, Qianqian, et al.
Publicado: (2024)
por: Xie, Qianqian, et al.
Publicado: (2024)
FinAudio: A Benchmark for Audio Large Language Models in Financial Applications
por: Cao, Yupeng, et al.
Publicado: (2025)
por: Cao, Yupeng, et al.
Publicado: (2025)
FinReflectKG -- EvalBench: Benchmarking Financial KG with Multi-Dimensional Evaluation
por: Dimino, Fabrizio, et al.
Publicado: (2025)
por: Dimino, Fabrizio, et al.
Publicado: (2025)
Financial Statement Analysis with Large Language Models
por: Kim, Alex, et al.
Publicado: (2024)
por: Kim, Alex, et al.
Publicado: (2024)
FinStat2SQL: A Text2SQL Pipeline for Financial Statement Analysis
por: Nguyen, Quang Hung, et al.
Publicado: (2025)
por: Nguyen, Quang Hung, et al.
Publicado: (2025)
IndiaFinBench: An Evaluation Benchmark for Large Language Model Performance on Indian Financial Regulatory Text
por: Pall, Rajveer Singh
Publicado: (2026)
por: Pall, Rajveer Singh
Publicado: (2026)
FinAgentBench: A Benchmark Dataset for Agentic Retrieval in Financial Question Answering
por: Choi, Chanyeol, et al.
Publicado: (2025)
por: Choi, Chanyeol, et al.
Publicado: (2025)
FinMCP-Bench: Benchmarking LLM Agents for Real-World Financial Tool Use under the Model Context Protocol
por: Zhu, Jie, et al.
Publicado: (2026)
por: Zhu, Jie, et al.
Publicado: (2026)
FinForge: Semi-Synthetic Financial Benchmark Generation
por: Matlin, Glenn, et al.
Publicado: (2026)
por: Matlin, Glenn, et al.
Publicado: (2026)
FinLLMs: A Framework for Financial Reasoning Dataset Generation with Large Language Models
por: Yuan, Ziqiang, et al.
Publicado: (2024)
por: Yuan, Ziqiang, et al.
Publicado: (2024)
FinRule-Bench: A Benchmark for Joint Reasoning over Financial Tables and Principles
por: Malarkkan, Arun Vignesh, et al.
Publicado: (2026)
por: Malarkkan, Arun Vignesh, et al.
Publicado: (2026)
FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use
por: Lu, Jiaxuan, et al.
Publicado: (2026)
por: Lu, Jiaxuan, et al.
Publicado: (2026)
FinLLM-B: When Large Language Models Meet Financial Breakout Trading
por: Zhang, Kang, et al.
Publicado: (2024)
por: Zhang, Kang, et al.
Publicado: (2024)
BizFinBench: A Business-Driven Real-World Financial Benchmark for Evaluating LLMs
por: Lu, Guilong, et al.
Publicado: (2025)
por: Lu, Guilong, et al.
Publicado: (2025)
FinTradeBench: A Financial Reasoning Benchmark for LLMs
por: Agrawal, Yogesh, et al.
Publicado: (2026)
por: Agrawal, Yogesh, et al.
Publicado: (2026)
BizFinBench.v2: A Unified Dual-Mode Bilingual Benchmark for Expert-Level Financial Capability Alignment
por: Guo, Xin, et al.
Publicado: (2026)
por: Guo, Xin, et al.
Publicado: (2026)
FinTral: A Family of GPT-4 Level Multimodal Financial Large Language Models
por: Bhatia, Gagan, et al.
Publicado: (2024)
por: Bhatia, Gagan, et al.
Publicado: (2024)
FinS-Pilot: A Benchmark for Online Financial RAG System
por: Wang, Feng, et al.
Publicado: (2025)
por: Wang, Feng, et al.
Publicado: (2025)
OR-Bench: An Over-Refusal Benchmark for Large Language Models
por: Cui, Justin, et al.
Publicado: (2024)
por: Cui, Justin, et al.
Publicado: (2024)
FinMR: A Knowledge-Intensive Multimodal Benchmark for Advanced Financial Reasoning
por: Deng, Shuangyan, et al.
Publicado: (2025)
por: Deng, Shuangyan, et al.
Publicado: (2025)
FinSheet-Bench: From Simple Lookups to Complex Reasoning, Where LLMs Break on Financial Spreadsheets
por: Ravnik, Jan, et al.
Publicado: (2026)
por: Ravnik, Jan, et al.
Publicado: (2026)
BarrierBench: Evaluating Large Language Models for Safety Verification in Dynamical Systems
por: Taheri, Ali, et al.
Publicado: (2025)
por: Taheri, Ali, et al.
Publicado: (2025)
ICU-Bench:Benchmarking Continual Unlearning in Multimodal Large Language Models
por: Wang, Yuhang, et al.
Publicado: (2026)
por: Wang, Yuhang, et al.
Publicado: (2026)
Market-Bench: Benchmarking Large Language Models on Economic and Trade Competition
por: Zheng, Yushuo, et al.
Publicado: (2026)
por: Zheng, Yushuo, et al.
Publicado: (2026)
PetroBench: A Benchmark for Large Language Models in Petroleum Engineering
por: Wang, Xiang, et al.
Publicado: (2026)
por: Wang, Xiang, et al.
Publicado: (2026)
SPM-Bench: Benchmarking Large Language Models for Scanning Probe Microscopy
por: Xiao, Peiyao, et al.
Publicado: (2026)
por: Xiao, Peiyao, et al.
Publicado: (2026)
SpatialBench: Benchmarking Multimodal Large Language Models for Spatial Cognition
por: Xu, Peiran, et al.
Publicado: (2025)
por: Xu, Peiran, et al.
Publicado: (2025)
FinVault: Benchmarking Financial Agent Safety in Execution-Grounded Environments
por: Yang, Zhi, et al.
Publicado: (2026)
por: Yang, Zhi, et al.
Publicado: (2026)
FinNLI: Novel Dataset for Multi-Genre Financial Natural Language Inference Benchmarking
por: Magomere, Jabez, et al.
Publicado: (2025)
por: Magomere, Jabez, et al.
Publicado: (2025)
Deep FinResearch Bench: Evaluating AI's Ability to Conduct Professional Financial Investment Research
por: Haque, Mirazul, et al.
Publicado: (2026)
por: Haque, Mirazul, et al.
Publicado: (2026)
TaskBench: Benchmarking Large Language Models for Task Automation
por: Shen, Yongliang, et al.
Publicado: (2023)
por: Shen, Yongliang, et al.
Publicado: (2023)
ElecBench: a Power Dispatch Evaluation Benchmark for Large Language Models
por: Zhou, Xiyuan, et al.
Publicado: (2024)
por: Zhou, Xiyuan, et al.
Publicado: (2024)
AccessEval: Benchmarking Disability Bias in Large Language Models
por: Panda, Srikant, et al.
Publicado: (2025)
por: Panda, Srikant, et al.
Publicado: (2025)
MonitorBench: A Comprehensive Benchmark for Chain-of-Thought Monitorability in Large Language Models
por: Wang, Han, et al.
Publicado: (2026)
por: Wang, Han, et al.
Publicado: (2026)
ItinBench: Benchmarking Planning Across Multiple Cognitive Dimensions with Large Language Models
por: Wang, Tianlong, et al.
Publicado: (2026)
por: Wang, Tianlong, et al.
Publicado: (2026)
TurkBench: A Benchmark for Evaluating Turkish Large Language Models
por: Toraman, Çağrı, et al.
Publicado: (2026)
por: Toraman, Çağrı, et al.
Publicado: (2026)
MatSciBench: Benchmarking the Reasoning Ability of Large Language Models in Materials Science
por: Zhang, Junkai, et al.
Publicado: (2025)
por: Zhang, Junkai, et al.
Publicado: (2025)
EngiBench: A Benchmark for Evaluating Large Language Models on Engineering Problem Solving
por: Zhou, Xiyuan, et al.
Publicado: (2025)
por: Zhou, Xiyuan, et al.
Publicado: (2025)
Towards Automated Regulatory Compliance Verification in Financial Auditing with Large Language Models
por: Berger, Armin, et al.
Publicado: (2025)
por: Berger, Armin, et al.
Publicado: (2025)
Ejemplares similares
-
FinDABench: Benchmarking Financial Data Analysis Ability of Large Language Models
por: Liu, Shu, et al.
Publicado: (2024) -
FinBen: A Holistic Financial Benchmark for Large Language Models
por: Xie, Qianqian, et al.
Publicado: (2024) -
FinAudio: A Benchmark for Audio Large Language Models in Financial Applications
por: Cao, Yupeng, et al.
Publicado: (2025) -
FinReflectKG -- EvalBench: Benchmarking Financial KG with Multi-Dimensional Evaluation
por: Dimino, Fabrizio, et al.
Publicado: (2025) -
Financial Statement Analysis with Large Language Models
por: Kim, Alex, et al.
Publicado: (2024)