Enregistré dans:
| Auteurs principaux: | Urieli, Assaf, Clooney, Amber, Sigiel, Michelle, Leyfer, Grisha |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2501.08442 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
olmOCR 2: Unit Test Rewards for Document OCR
par: Poznanski, Jake, et autres
Publié: (2025)
par: Poznanski, Jake, et autres
Publié: (2025)
GLM-OCR Technical Report
par: Duan, Shuaiqi, et autres
Publié: (2026)
par: Duan, Shuaiqi, et autres
Publié: (2026)
TexOCR: Advancing Document OCR Models for Compilable Page-to-LaTeX Reconstruction
par: Wang, Chengye, et autres
Publié: (2026)
par: Wang, Chengye, et autres
Publié: (2026)
3CEL: A corpus of legal Spanish contract clauses
par: García, Nuria Aldama, et autres
Publié: (2025)
par: García, Nuria Aldama, et autres
Publié: (2025)
PreP-OCR: A Complete Pipeline for Document Image Restoration and Enhanced OCR Accuracy
par: Guan, Shuhao, et autres
Publié: (2025)
par: Guan, Shuhao, et autres
Publié: (2025)
GlotOCR Bench: OCR Models Still Struggle Beyond a Handful of Unicode Scripts
par: Kargaran, Amir Hossein, et autres
Publié: (2026)
par: Kargaran, Amir Hossein, et autres
Publié: (2026)
PubMed-OCR: PMC Open Access OCR Annotations
par: Heidenreich, Hunter, et autres
Publié: (2026)
par: Heidenreich, Hunter, et autres
Publié: (2026)
KazakhOCR: A Synthetic Benchmark for Evaluating Multimodal Models in Low-Resource Kazakh Script OCR
par: Gagnier, Henry, et autres
Publié: (2026)
par: Gagnier, Henry, et autres
Publié: (2026)
Ukrainian-to-English folktale corpus: Parallel corpus creation and augmentation for machine translation in low-resource languages
par: Burda-Lassen, Olena
Publié: (2024)
par: Burda-Lassen, Olena
Publié: (2024)
Telenor Nordics Customer Service self-help corpus
par: Riess, Mike
Publié: (2026)
par: Riess, Mike
Publié: (2026)
Multimodal LLMs for OCR, OCR Post-Correction, and Named Entity Recognition in Historical Documents
par: Greif, Gavin, et autres
Publié: (2025)
par: Greif, Gavin, et autres
Publié: (2025)
Ambiguities in the Romanization of Yiddish.
par: Weinberg, Bella Hass
Publié: (1995)
par: Weinberg, Bella Hass
Publié: (1995)
Improving OCR for Historical Texts of Multiple Languages
par: Westerdijk, Hylke, et autres
Publié: (2025)
par: Westerdijk, Hylke, et autres
Publié: (2025)
DharmaOCR: Specialized Small Language Models for Structured OCR that outperform Open-Source and Commercial Baselines
par: Cardoso, Gabriel Pimenta de Freitas, et autres
Publié: (2026)
par: Cardoso, Gabriel Pimenta de Freitas, et autres
Publié: (2026)
Towards Deployable OCR models for Indic languages
par: Mathew, Minesh, et autres
Publié: (2022)
par: Mathew, Minesh, et autres
Publié: (2022)
Semi-Synthetic Parallel Data for Translation Quality Estimation: A Case Study of Dataset Building for an Under-Resourced Language Pair
par: Siani, Assaf, et autres
Publié: (2026)
par: Siani, Assaf, et autres
Publié: (2026)
RoundTripOCR: A Data Generation Technique for Enhancing Post-OCR Error Correction in Low-Resource Devanagari Languages
par: Kashid, Harshvivek, et autres
Publié: (2024)
par: Kashid, Harshvivek, et autres
Publié: (2024)
Annotation and modeling of emotions in a textual corpus: an evaluative approach
par: Noblet, Jonas
Publié: (2025)
par: Noblet, Jonas
Publié: (2025)
Unsupervised multiple choices question answering via universal corpus
par: Zhang, Qin, et autres
Publié: (2024)
par: Zhang, Qin, et autres
Publié: (2024)
naab: A ready-to-use plug-and-play corpus for Farsi
par: Sabouri, Sadra, et autres
Publié: (2022)
par: Sabouri, Sadra, et autres
Publié: (2022)
RoMemes: A multimodal meme corpus for the Romanian language
par: Păiş, Vasile, et autres
Publié: (2024)
par: Păiş, Vasile, et autres
Publié: (2024)
A large corpus of lucid and non-lucid dream reports
par: Mallett, Remington
Publié: (2026)
par: Mallett, Remington
Publié: (2026)
OCRTurk: A Comprehensive OCR Benchmark for Turkish
par: Yılmaz, Deniz, et autres
Publié: (2026)
par: Yılmaz, Deniz, et autres
Publié: (2026)
Seeing Straight: Document Orientation Detection for Efficient OCR
par: Goswami, Suranjan, et autres
Publié: (2025)
par: Goswami, Suranjan, et autres
Publié: (2025)
OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models
par: Liu, Yuliang, et autres
Publié: (2023)
par: Liu, Yuliang, et autres
Publié: (2023)
The taggedPBC: Annotating a massive parallel corpus for crosslinguistic investigations
par: Ring, Hiram
Publié: (2025)
par: Ring, Hiram
Publié: (2025)
Evaluating Robustness of LLMs in Question Answering on Multilingual Noisy OCR Data
par: Piryani, Bhawna, et autres
Publié: (2025)
par: Piryani, Bhawna, et autres
Publié: (2025)
olmOCR: Unlocking Trillions of Tokens in PDFs with Vision Language Models
par: Poznanski, Jake, et autres
Publié: (2025)
par: Poznanski, Jake, et autres
Publié: (2025)
OCR Error Post-Correction with LLMs in Historical Documents: No Free Lunches
par: Kanerva, Jenna, et autres
Publié: (2025)
par: Kanerva, Jenna, et autres
Publié: (2025)
Advancing Post-OCR Correction: A Comparative Study of Synthetic Data
par: Guan, Shuhao, et autres
Publié: (2024)
par: Guan, Shuhao, et autres
Publié: (2024)
OCR-Memory: Optical Context Retrieval for Long-Horizon Agent Memory
par: Li, Jinze, et autres
Publié: (2026)
par: Li, Jinze, et autres
Publié: (2026)
Typhoon OCR: Open Vision-Language Model For Thai Document Extraction
par: Nonesung, Surapon, et autres
Publié: (2026)
par: Nonesung, Surapon, et autres
Publié: (2026)
Confidence-Aware Document OCR Error Detection
par: Hemmer, Arthur, et autres
Publié: (2024)
par: Hemmer, Arthur, et autres
Publié: (2024)
Tenyidie Syllabification corpus creation and deep learning applications
par: Angami, Teisovi, et autres
Publié: (2025)
par: Angami, Teisovi, et autres
Publié: (2025)
PRISM: PRIor from corpus Statistics for topic Modeling
par: Ishon, Tal, et autres
Publié: (2026)
par: Ishon, Tal, et autres
Publié: (2026)
Developing an efficient corpus using Ensemble Data cleaning approach
par: Ahad, Md Taimur
Publié: (2024)
par: Ahad, Md Taimur
Publié: (2024)
SemSketches-2021: experimenting with the machine processing of the pilot semantic sketches corpus
par: Ponomareva, Maria, et autres
Publié: (2025)
par: Ponomareva, Maria, et autres
Publié: (2025)
PARHAF, a human-authored corpus of clinical reports for fictitious patients in French
par: Tannier, Xavier, et autres
Publié: (2026)
par: Tannier, Xavier, et autres
Publié: (2026)
MTQE.en-he: Machine Translation Quality Estimation for English-Hebrew
par: Rosenbaum, Andy, et autres
Publié: (2026)
par: Rosenbaum, Andy, et autres
Publié: (2026)
Adaptive Querying with AI Persona Priors
par: Wang, Kaizheng, et autres
Publié: (2026)
par: Wang, Kaizheng, et autres
Publié: (2026)
Documents similaires
-
olmOCR 2: Unit Test Rewards for Document OCR
par: Poznanski, Jake, et autres
Publié: (2025) -
GLM-OCR Technical Report
par: Duan, Shuaiqi, et autres
Publié: (2026) -
TexOCR: Advancing Document OCR Models for Compilable Page-to-LaTeX Reconstruction
par: Wang, Chengye, et autres
Publié: (2026) -
3CEL: A corpus of legal Spanish contract clauses
par: García, Nuria Aldama, et autres
Publié: (2025) -
PreP-OCR: A Complete Pipeline for Document Image Restoration and Enhanced OCR Accuracy
par: Guan, Shuhao, et autres
Publié: (2025)