Reference-Based Post-OCR Processing with LLM for Precise Diacritic Text in Historical Document Recognition
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Do, Thao, Tran, Dinh Phu, Vo, An, Kim, Daeyoung |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SAT: Selective Aggregation Transformer for Image Super-Resolution
par: Tran, Dinh Phu, et autres
Publié: (2026)
par: Tran, Dinh Phu, et autres
Publié: (2026)
VSRM: A Robust Mamba-Based Framework for Video Super-Resolution
par: Tran, Dinh Phu, et autres
Publié: (2025)
par: Tran, Dinh Phu, et autres
Publié: (2025)
TB-AVA: Text as a Semantic Bridge for Audio-Visual Parameter Efficient Finetuning
par: Kim, Seongah, et autres
Publié: (2026)
par: Kim, Seongah, et autres
Publié: (2026)
Channel-Partitioned Windowed Attention And Frequency Learning for Single Image Super-Resolution
par: Tran, Dinh Phu, et autres
Publié: (2024)
par: Tran, Dinh Phu, et autres
Publié: (2024)
LooComp: Leverage Leave-One-Out Strategy to Encoder-only Transformer for Efficient Query-aware Context Compression
par: Do, Thao, et autres
Publié: (2026)
par: Do, Thao, et autres
Publié: (2026)
Improving OCR for Historical Texts of Multiple Languages
par: Westerdijk, Hylke, et autres
Publié: (2025)
par: Westerdijk, Hylke, et autres
Publié: (2025)
olmOCR 2: Unit Test Rewards for Document OCR
par: Poznanski, Jake, et autres
Publié: (2025)
par: Poznanski, Jake, et autres
Publié: (2025)
PreP-OCR: A Complete Pipeline for Document Image Restoration and Enhanced OCR Accuracy
par: Guan, Shuhao, et autres
Publié: (2025)
par: Guan, Shuhao, et autres
Publié: (2025)
VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models
par: Ju, Jeongho, et autres
Publié: (2024)
par: Ju, Jeongho, et autres
Publié: (2024)
RoundTripOCR: A Data Generation Technique for Enhancing Post-OCR Error Correction in Low-Resource Devanagari Languages
par: Kashid, Harshvivek, et autres
Publié: (2024)
par: Kashid, Harshvivek, et autres
Publié: (2024)
Seeing Straight: Document Orientation Detection for Efficient OCR
par: Goswami, Suranjan, et autres
Publié: (2025)
par: Goswami, Suranjan, et autres
Publié: (2025)
HATFormer: Historic Handwritten Arabic Text Recognition with Transformers
par: Chan, Adrian, et autres
Publié: (2024)
par: Chan, Adrian, et autres
Publié: (2024)
Evaluating LLMs for Historical Document OCR: A Methodological Framework for Digital Humanities
par: Levchenko, Maria
Publié: (2025)
par: Levchenko, Maria
Publié: (2025)
Baseer: A Vision-Language Model for Arabic Document-to-Markdown OCR
par: Hennara, Khalil, et autres
Publié: (2025)
par: Hennara, Khalil, et autres
Publié: (2025)
LungCRCT: Causal Representation based Lung CT Processing for Lung Cancer Treatment
par: Kim, Daeyoung
Publié: (2026)
par: Kim, Daeyoung
Publié: (2026)
SegHist: A General Segmentation-based Framework for Chinese Historical Document Text Line Detection
par: Hu, Xingjian, et autres
Publié: (2024)
par: Hu, Xingjian, et autres
Publié: (2024)
Confidence-Aware Document OCR Error Detection
par: Hemmer, Arthur, et autres
Publié: (2024)
par: Hemmer, Arthur, et autres
Publié: (2024)
Trans2Unet: Neural fusion for Nuclei Semantic Segmentation
par: Tran, Dinh-Phu, et autres
Publié: (2024)
par: Tran, Dinh-Phu, et autres
Publié: (2024)
Handwriting Recognition in Historical Documents with Multimodal LLM
par: Li, Lucian
Publié: (2024)
par: Li, Lucian
Publié: (2024)
FastOCR: Dynamic Visual Fixation via KV Cache Pruning for Efficient Document Parsing
par: Tang, Zihan, et autres
Publié: (2026)
par: Tang, Zihan, et autres
Publié: (2026)
CHURRO: Making History Readable with an Open-Weight Large Vision-Language Model for High-Accuracy, Low-Cost Historical Text Recognition
par: Semnani, Sina J., et autres
Publié: (2025)
par: Semnani, Sina J., et autres
Publié: (2025)
LogicOCR: Do Your Large Multimodal Models Excel at Logical Reasoning on Text-Rich Images?
par: Ye, Maoyuan, et autres
Publié: (2025)
par: Ye, Maoyuan, et autres
Publié: (2025)
GlotOCR Bench: OCR Models Still Struggle Beyond a Handful of Unicode Scripts
par: Kargaran, Amir Hossein, et autres
Publié: (2026)
par: Kargaran, Amir Hossein, et autres
Publié: (2026)
VDInstruct: Zero-Shot Key Information Extraction via Content-Aware Vision Tokenization
par: Nguyen, Son, et autres
Publié: (2025)
par: Nguyen, Son, et autres
Publié: (2025)
KazakhOCR: A Synthetic Benchmark for Evaluating Multimodal Models in Low-Resource Kazakh Script OCR
par: Gagnier, Henry, et autres
Publié: (2026)
par: Gagnier, Henry, et autres
Publié: (2026)
QID: Efficient Query-Informed ViTs in Data-Scarce Regimes for OCR-free Visual Document Understanding
par: Le, Binh M., et autres
Publié: (2025)
par: Le, Binh M., et autres
Publié: (2025)
Cross-Lingual SynthDocs: A Large-Scale Synthetic Corpus for Any to Arabic OCR and Document Understanding
par: Al-Homoud, Haneen, et autres
Publié: (2025)
par: Al-Homoud, Haneen, et autres
Publié: (2025)
Reading or Reasoning? Format Decoupled Reinforcement Learning for Document OCR
par: Zhong, Yufeng, et autres
Publié: (2025)
par: Zhong, Yufeng, et autres
Publié: (2025)
Text-Enhanced Data-free Approach for Federated Class-Incremental Learning
par: Tran, Minh-Tuan, et autres
Publié: (2024)
par: Tran, Minh-Tuan, et autres
Publié: (2024)
Towards Deployable OCR models for Indic languages
par: Mathew, Minesh, et autres
Publié: (2022)
par: Mathew, Minesh, et autres
Publié: (2022)
Unified Framework with Consistency across Modalities for Human Activity Recognition
par: Tran, Tuyen, et autres
Publié: (2024)
par: Tran, Tuyen, et autres
Publié: (2024)
Multi-LLM Collaborative Caption Generation in Scientific Documents
par: Kim, Jaeyoung, et autres
Publié: (2025)
par: Kim, Jaeyoung, et autres
Publié: (2025)
OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models
par: Liu, Yuliang, et autres
Publié: (2023)
par: Liu, Yuliang, et autres
Publié: (2023)
FairImagen: Post-Processing for Bias Mitigation in Text-to-Image Models
par: Fu, Zihao, et autres
Publié: (2025)
par: Fu, Zihao, et autres
Publié: (2025)
Time-Efficient and Identity-Consistent Virtual Try-On Using A Variant of Altered Diffusion Models
par: Dam, Phuong, et autres
Publié: (2024)
par: Dam, Phuong, et autres
Publié: (2024)
SignBart -- New approach with the skeleton sequence for Isolated Sign language Recognition
par: Nguyen, Tinh, et autres
Publié: (2025)
par: Nguyen, Tinh, et autres
Publié: (2025)
TI-JEPA: An Innovative Energy-based Joint Embedding Strategy for Text-Image Multimodal Systems
par: Vo, Khang H. N., et autres
Publié: (2025)
par: Vo, Khang H. N., et autres
Publié: (2025)
MinerU-Popo: Universal Post-Processing Model for Structured Document Parsing
par: Xu, Bangrui, et autres
Publié: (2026)
par: Xu, Bangrui, et autres
Publié: (2026)
LightHCG: a Lightweight yet powerful HSIC Disentanglement based Causal Glaucoma Detection Model framework
par: Kim, Daeyoung
Publié: (2025)
par: Kim, Daeyoung
Publié: (2025)
ReceiptSense: Beyond Traditional OCR -- A Dataset for Receipt Understanding
par: Abdallah, Abdelrahman, et autres
Publié: (2024)
par: Abdallah, Abdelrahman, et autres
Publié: (2024)
Documents similaires
-
SAT: Selective Aggregation Transformer for Image Super-Resolution
par: Tran, Dinh Phu, et autres
Publié: (2026) -
VSRM: A Robust Mamba-Based Framework for Video Super-Resolution
par: Tran, Dinh Phu, et autres
Publié: (2025) -
TB-AVA: Text as a Semantic Bridge for Audio-Visual Parameter Efficient Finetuning
par: Kim, Seongah, et autres
Publié: (2026) -
Channel-Partitioned Windowed Attention And Frequency Learning for Single Image Super-Resolution
par: Tran, Dinh Phu, et autres
Publié: (2024) -
LooComp: Leverage Leave-One-Out Strategy to Encoder-only Transformer for Efficient Query-aware Context Compression
par: Do, Thao, et autres
Publié: (2026)