Early evidence of how LLMs outperform traditional systems on OCR/HTR tasks for historical records
Fuente:
arXiv
Guardado en:
| Autores principales: | Kim, Seorin, Baudru, Julien, Ryckbosch, Wouter, Bersini, Hugues, Ginis, Vincent |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DRetHTR: Linear-Time Decoder-Only Retentive Network for Handwritten Text Recognition
por: Kim, Changhun, et al.
Publicado: (2026)
por: Kim, Changhun, et al.
Publicado: (2026)
DharmaOCR: Specialized Small Language Models for Structured OCR that outperform Open-Source and Commercial Baselines
por: Cardoso, Gabriel Pimenta de Freitas, et al.
Publicado: (2026)
por: Cardoso, Gabriel Pimenta de Freitas, et al.
Publicado: (2026)
Combining OCR Models for Reading Early Modern Printed Books
por: Seuret, Mathias, et al.
Publicado: (2023)
por: Seuret, Mathias, et al.
Publicado: (2023)
MME-VideoOCR: Evaluating OCR-Based Capabilities of Multimodal LLMs in Video Scenarios
por: Shi, Yang, et al.
Publicado: (2025)
por: Shi, Yang, et al.
Publicado: (2025)
HTR-VT: Handwritten Text Recognition with Vision Transformer
por: Li, Yuting, et al.
Publicado: (2024)
por: Li, Yuting, et al.
Publicado: (2024)
Turning Citation Networks Inside Out: Studying Science Using Content-Based Knowledge Graphs from LLM-Derived Taxonomies
por: Kim, Seorin, et al.
Publicado: (2026)
por: Kim, Seorin, et al.
Publicado: (2026)
One in Eight OpenAlex Abstracts Has Integrity Issues
por: Kim, Seorin, et al.
Publicado: (2026)
por: Kim, Seorin, et al.
Publicado: (2026)
Cross-Language Learning within Arabic Script for Low-Resource HTR
por: Al-azzawi, Sana, et al.
Publicado: (2026)
por: Al-azzawi, Sana, et al.
Publicado: (2026)
TRIDIS: A Comprehensive Medieval and Early Modern Corpus for HTR and NER
por: Aguilar, Sergio Torres
Publicado: (2025)
por: Aguilar, Sergio Torres
Publicado: (2025)
HTR-JAND: Handwritten Text Recognition with Joint Attention Network and Knowledge Distillation
por: Hamdan, Mohammed, et al.
Publicado: (2024)
por: Hamdan, Mohammed, et al.
Publicado: (2024)
Understanding Cross-Language Transfer Improvements in Low-Resource HTR: The Role of Sequence Modeling
por: Al-azzawi, Sana, et al.
Publicado: (2026)
por: Al-azzawi, Sana, et al.
Publicado: (2026)
OCR-Agent: Agentic OCR with Capability and Memory Reflection
por: Wen, Shimin, et al.
Publicado: (2026)
por: Wen, Shimin, et al.
Publicado: (2026)
OmniOCR: Generalist OCR for Ethnic Minority Languages
por: Liu, Bonan, et al.
Publicado: (2026)
por: Liu, Bonan, et al.
Publicado: (2026)
Context-Independent OCR with Multimodal LLMs: Effects of Image Resolution and Visual Complexity
por: Inoue, Kotaro
Publicado: (2025)
por: Inoue, Kotaro
Publicado: (2025)
CER-HV: A Human-in-the-Loop Framework for Cleaning Datasets Applied to Arabic-Script HTR
por: Al-azzawi, Sana, et al.
Publicado: (2026)
por: Al-azzawi, Sana, et al.
Publicado: (2026)
Do Current Video LLMs Have Strong OCR Abilities? A Preliminary Study
por: Fei, Yulin, et al.
Publicado: (2024)
por: Fei, Yulin, et al.
Publicado: (2024)
Bridging Human Concepts and Computer Vision for Explainable Face Verification
por: Doh, Miriam, et al.
Publicado: (2024)
por: Doh, Miriam, et al.
Publicado: (2024)
Agentar-Fin-OCR
por: Qian, Siyi, et al.
Publicado: (2026)
por: Qian, Siyi, et al.
Publicado: (2026)
When Good OCR Is Not Enough: Benchmarking OCR Robustness for Retrieval-Augmented Generation
por: Sun, Lin, et al.
Publicado: (2026)
por: Sun, Lin, et al.
Publicado: (2026)
OCR Hinders RAG: Evaluating the Cascading Impact of OCR on Retrieval-Augmented Generation
por: Zhang, Junyuan, et al.
Publicado: (2024)
por: Zhang, Junyuan, et al.
Publicado: (2024)
HTR-ConvText: Leveraging Convolution and Textual Information for Handwritten Text Recognition
por: Truc, Pham Thach Thanh, et al.
Publicado: (2025)
por: Truc, Pham Thach Thanh, et al.
Publicado: (2025)
Ocean-OCR: Towards General OCR Application via a Vision-Language Model
por: Chen, Song, et al.
Publicado: (2025)
por: Chen, Song, et al.
Publicado: (2025)
TC-OCR: TableCraft OCR for Efficient Detection & Recognition of Table Structure & Content
por: Anand, Avinash, et al.
Publicado: (2024)
por: Anand, Avinash, et al.
Publicado: (2024)
ABot-OCR Technical Report
por: Jiang, Kaitao, et al.
Publicado: (2026)
por: Jiang, Kaitao, et al.
Publicado: (2026)
CC-OCR: A Comprehensive and Challenging OCR Benchmark for Evaluating Large Multimodal Models in Literacy
por: Yang, Zhibo, et al.
Publicado: (2024)
por: Yang, Zhibo, et al.
Publicado: (2024)
General OCR Theory: Towards OCR-2.0 via a Unified End-to-end Model
por: Wei, Haoran, et al.
Publicado: (2024)
por: Wei, Haoran, et al.
Publicado: (2024)
Error Patterns in Historical OCR: A Comparative Analysis of TrOCR and a Vision-Language Model
por: Vesalainen, Ari, et al.
Publicado: (2026)
por: Vesalainen, Ari, et al.
Publicado: (2026)
Multi-encoder nnU-Net outperforms transformer models with self-supervised pretraining
por: Otaghsara, Seyedeh Sahar Taheri, et al.
Publicado: (2025)
por: Otaghsara, Seyedeh Sahar Taheri, et al.
Publicado: (2025)
DODO: Discrete OCR Diffusion Models
por: Man, Sean, et al.
Publicado: (2026)
por: Man, Sean, et al.
Publicado: (2026)
An Empirical Study of Scaling Law for OCR
por: Rang, Miao, et al.
Publicado: (2023)
por: Rang, Miao, et al.
Publicado: (2023)
LightOnOCR: A 1B End-to-End Multilingual Vision-Language Model for State-of-the-Art OCR
por: Taghadouini, Said, et al.
Publicado: (2026)
por: Taghadouini, Said, et al.
Publicado: (2026)
Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?
por: He, Haibin, et al.
Publicado: (2025)
por: He, Haibin, et al.
Publicado: (2025)
olmOCR 2: Unit Test Rewards for Document OCR
por: Poznanski, Jake, et al.
Publicado: (2025)
por: Poznanski, Jake, et al.
Publicado: (2025)
OCR-Quality: A Human-Annotated Dataset for OCR Quality Assessment
por: Zhang, Yulong
Publicado: (2025)
por: Zhang, Yulong
Publicado: (2025)
GraDeT-HTR: A Resource-Efficient Bengali Handwritten Text Recognition System utilizing Grapheme-based Tokenizer and Decoder-only Transformer
por: Hasan, Md. Mahmudul, et al.
Publicado: (2025)
por: Hasan, Md. Mahmudul, et al.
Publicado: (2025)
DeepSeek-OCR: Contexts Optical Compression
por: Wei, Haoran, et al.
Publicado: (2025)
por: Wei, Haoran, et al.
Publicado: (2025)
Exploring OCR-augmented Generation for Bilingual VQA
por: Lee, JoonHo, et al.
Publicado: (2025)
por: Lee, JoonHo, et al.
Publicado: (2025)
Multimodal OCR: Parse Anything from Documents
por: Zheng, Handong, et al.
Publicado: (2026)
por: Zheng, Handong, et al.
Publicado: (2026)
PaddleOCR 3.0 Technical Report
por: Cui, Cheng, et al.
Publicado: (2025)
por: Cui, Cheng, et al.
Publicado: (2025)
DianJin-OCR-R1: Enhancing OCR Capabilities via a Reasoning-and-Tool Interleaved Vision-Language Model
por: Chen, Qian, et al.
Publicado: (2025)
por: Chen, Qian, et al.
Publicado: (2025)
Ejemplares similares
-
DRetHTR: Linear-Time Decoder-Only Retentive Network for Handwritten Text Recognition
por: Kim, Changhun, et al.
Publicado: (2026) -
DharmaOCR: Specialized Small Language Models for Structured OCR that outperform Open-Source and Commercial Baselines
por: Cardoso, Gabriel Pimenta de Freitas, et al.
Publicado: (2026) -
Combining OCR Models for Reading Early Modern Printed Books
por: Seuret, Mathias, et al.
Publicado: (2023) -
MME-VideoOCR: Evaluating OCR-Based Capabilities of Multimodal LLMs in Video Scenarios
por: Shi, Yang, et al.
Publicado: (2025) -
HTR-VT: Handwritten Text Recognition with Vision Transformer
por: Li, Yuting, et al.
Publicado: (2024)