FinCriticalED: A Visual Benchmark for Financial Fact-Level OCR

Fuente: arXiv
Enregistré dans:
Détails bibliographiques
Auteurs principaux: He, Yueru, Peng, Xueqing, Cao, Yupeng, Wang, Yan, Qian, Lingfei, Li, Haohang, Han, Yi, Wang, Shuyao, Xiang, Ruoyu, Zhang, Fan, Xie, Zhuohan, Lin, Mingquan, Tiwari, Prayag, Huang, Jimin, Xiong, Guojun, Ananiadou, Sophia
Format: Preprint
Publié: 2025
Sujets:
Accès en ligne:
Tags: Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
_version_ 1866915918451310592
author He, Yueru
Peng, Xueqing
Cao, Yupeng
Wang, Yan
Qian, Lingfei
Li, Haohang
Han, Yi
Wang, Shuyao
Xiang, Ruoyu
Zhang, Fan
Xie, Zhuohan
Lin, Mingquan
Tiwari, Prayag
Huang, Jimin
Xiong, Guojun
Ananiadou, Sophia
author_facet He, Yueru
Peng, Xueqing
Cao, Yupeng
Wang, Yan
Qian, Lingfei
Li, Haohang
Han, Yi
Wang, Shuyao
Xiang, Ruoyu
Zhang, Fan
Xie, Zhuohan
Lin, Mingquan
Tiwari, Prayag
Huang, Jimin
Xiong, Guojun
Ananiadou, Sophia
contents Recent progress in multimodal large language models (MLLMs) has substantially improved document understanding, yet strong optical character recognition (OCR) performance on surface metrics does not guarantee faithful preservation of decision-critical evidence. This limitation is especially consequential in financial documents, where small visual errors can induce discrete shifts in meaning. To study this gap, we introduce FinCriticalED (Financial Critical Error Detection), a fact-centric visual benchmark for evaluating whether OCR and vision-language systems preserve financially critical evidence beyond lexical similarity. FinCriticalED contains 859 real-world financial document pages with 9,481 expert-annotated facts spanning five critical field types: numeric, temporal, monetary unit, reporting entity, and financial concept. We formulate the task as structured OCR with fact-level verification, and develop a Deterministic-Rule-Guided LLM-as-Judge protocol to assess whether model outputs preserve annotated facts in context. We benchmark 13 systems spanning OCR pipelines, specialized OCR VLMs, open-source MLLMs, and proprietary MLLMs. Results reveal a clear gap between lexical accuracy and factual reliability, with numerical values and monetary units emerging as the most vulnerable fact types, and critical errors concentrating in visually complex, mixed-layout documents with distinct failure patterns across model families. Overall, FinCriticalED provides a rigorous benchmark for trustworthy financial OCR and a practical testbed for evidence fidelity in high-stakes multimodal document understanding. Benchmark and dataset details available at https://the-finai.github.io/FinCriticalED/
format Preprint
id arxiv_https___arxiv_org_abs_2511_14998
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle FinCriticalED: A Visual Benchmark for Financial Fact-Level OCR
He, Yueru
Peng, Xueqing
Cao, Yupeng
Wang, Yan
Qian, Lingfei
Li, Haohang
Han, Yi
Wang, Shuyao
Xiang, Ruoyu
Zhang, Fan
Xie, Zhuohan
Lin, Mingquan
Tiwari, Prayag
Huang, Jimin
Xiong, Guojun
Ananiadou, Sophia
Computer Vision and Pattern Recognition
Recent progress in multimodal large language models (MLLMs) has substantially improved document understanding, yet strong optical character recognition (OCR) performance on surface metrics does not guarantee faithful preservation of decision-critical evidence. This limitation is especially consequential in financial documents, where small visual errors can induce discrete shifts in meaning. To study this gap, we introduce FinCriticalED (Financial Critical Error Detection), a fact-centric visual benchmark for evaluating whether OCR and vision-language systems preserve financially critical evidence beyond lexical similarity. FinCriticalED contains 859 real-world financial document pages with 9,481 expert-annotated facts spanning five critical field types: numeric, temporal, monetary unit, reporting entity, and financial concept. We formulate the task as structured OCR with fact-level verification, and develop a Deterministic-Rule-Guided LLM-as-Judge protocol to assess whether model outputs preserve annotated facts in context. We benchmark 13 systems spanning OCR pipelines, specialized OCR VLMs, open-source MLLMs, and proprietary MLLMs. Results reveal a clear gap between lexical accuracy and factual reliability, with numerical values and monetary units emerging as the most vulnerable fact types, and critical errors concentrating in visually complex, mixed-layout documents with distinct failure patterns across model families. Overall, FinCriticalED provides a rigorous benchmark for trustworthy financial OCR and a practical testbed for evidence fidelity in high-stakes multimodal document understanding. Benchmark and dataset details available at https://the-finai.github.io/FinCriticalED/
title FinCriticalED: A Visual Benchmark for Financial Fact-Level OCR
topic Computer Vision and Pattern Recognition
url https://arxiv.org/abs/2511.14998