Baseer: A Vision-Language Model for Arabic Document-to-Markdown OCR
Fuente:
arXiv
Saved in:
| Main Authors: | Hennara, Khalil, Hreden, Muhammad, Hamed, Mohamed Motasim, Bastati, Ahmad, Aldallal, Zeina, Chrouf, Sara, AlModhayan, Safwan |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Wasm: A Pipeline for Constructing Structured Arabic Interleaved Multimodal Corpora
by: Hennara, Khalil, et al.
Published: (2025)
by: Hennara, Khalil, et al.
Published: (2025)
Sadeed: Advancing Arabic Diacritization Through Small Language Model
by: Aldallal, Zeina, et al.
Published: (2025)
by: Aldallal, Zeina, et al.
Published: (2025)
Mutarjim: Advancing Bidirectional Arabic-English Translation with a Small Language Model
by: Hennara, Khalil, et al.
Published: (2025)
by: Hennara, Khalil, et al.
Published: (2025)
Kuwain 1.5B: An Arabic SLM via Language Injection
by: Hennara, Khalil, et al.
Published: (2025)
by: Hennara, Khalil, et al.
Published: (2025)
Arabic-Nougat: Fine-Tuning Vision Transformers for Arabic OCR and Markdown Extraction
by: Rashad, Mohamed
Published: (2024)
by: Rashad, Mohamed
Published: (2024)
SyriSign: A Parallel Corpus for Arabic Text to Syrian Arabic Sign Language Translation
by: Khalil, Mohammad Amer, et al.
Published: (2026)
by: Khalil, Mohammad Amer, et al.
Published: (2026)
KITAB-Bench: A Comprehensive Multi-Domain Benchmark for Arabic OCR and Document Understanding
by: Heakl, Ahmed, et al.
Published: (2025)
by: Heakl, Ahmed, et al.
Published: (2025)
Benchmarking Vision-Language Models for French PDF-to-Markdown Conversion
by: Rigal, Bruno, et al.
Published: (2026)
by: Rigal, Bruno, et al.
Published: (2026)
Cross-Lingual SynthDocs: A Large-Scale Synthetic Corpus for Any to Arabic OCR and Document Understanding
by: Al-Homoud, Haneen, et al.
Published: (2025)
by: Al-Homoud, Haneen, et al.
Published: (2025)
Typhoon OCR: Open Vision-Language Model For Thai Document Extraction
by: Nonesung, Surapon, et al.
Published: (2026)
by: Nonesung, Surapon, et al.
Published: (2026)
JEEM: Vision-Language Understanding in Four Arabic Dialects
by: Kadaoui, Karima, et al.
Published: (2025)
by: Kadaoui, Karima, et al.
Published: (2025)
Strategies for Arabic Readability Modeling
by: Liberato, Juan Piñeros, et al.
Published: (2024)
by: Liberato, Juan Piñeros, et al.
Published: (2024)
GutenOCR: A Grounded Vision-Language Front-End for Documents
by: Heidenreich, Hunter, et al.
Published: (2026)
by: Heidenreich, Hunter, et al.
Published: (2026)
Arabic Handwritten Document OCR Solution with Binarization and Adaptive Scale Fusion Detection
by: Waly, Alhossien, et al.
Published: (2024)
by: Waly, Alhossien, et al.
Published: (2024)
MDEval: Evaluating and Enhancing Markdown Awareness in Large Language Models
by: Chen, Zhongpu, et al.
Published: (2025)
by: Chen, Zhongpu, et al.
Published: (2025)
The SAMER Arabic Text Simplification Corpus
by: Alhafni, Bashar, et al.
Published: (2024)
by: Alhafni, Bashar, et al.
Published: (2024)
The Landscape of Arabic Large Language Models (ALLMs): A New Era for Arabic Language Technology
by: Al-Khalifa, Shahad, et al.
Published: (2025)
by: Al-Khalifa, Shahad, et al.
Published: (2025)
Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning
by: Yu, Haiyang, et al.
Published: (2025)
by: Yu, Haiyang, et al.
Published: (2025)
Guidelines for Fine-grained Sentence-level Arabic Readability Annotation
by: Habash, Nizar, et al.
Published: (2024)
by: Habash, Nizar, et al.
Published: (2024)
Seeing Justice Clearly: Handwritten Legal Document Translation with OCR and Vision-Language Models
by: Nigam, Shubham Kumar, et al.
Published: (2025)
by: Nigam, Shubham Kumar, et al.
Published: (2025)
SARD: A Large-Scale Synthetic Arabic OCR Dataset for Book-Style Text Recognition
by: Nacar, Omer, et al.
Published: (2025)
by: Nacar, Omer, et al.
Published: (2025)
The Last Fingerprint: How Markdown Training Shapes LLM Prose
by: Freeburg, E. M.
Published: (2026)
by: Freeburg, E. M.
Published: (2026)
Fine-Tuning Vision-Language Models for Markdown Conversion of Financial Tables in Malaysian Audited Financial Reports
by: Tan, Jin Khye, et al.
Published: (2025)
by: Tan, Jin Khye, et al.
Published: (2025)
Linguistic Uncertainty and Engagement in Arabic-Language X (formerly Twitter) Discourse
by: Soufan, Mohamed
Published: (2026)
by: Soufan, Mohamed
Published: (2026)
Advances and Limitations in Open Source Arabic-Script OCR: A Case Study
by: Kiessling, Benjamin, et al.
Published: (2024)
by: Kiessling, Benjamin, et al.
Published: (2024)
olmOCR 2: Unit Test Rewards for Document OCR
by: Poznanski, Jake, et al.
Published: (2025)
by: Poznanski, Jake, et al.
Published: (2025)
Ocean-OCR: Towards General OCR Application via a Vision-Language Model
by: Chen, Song, et al.
Published: (2025)
by: Chen, Song, et al.
Published: (2025)
ALPS: A Diagnostic Challenge Set for Arabic Linguistic & Pragmatic Reasoning
by: Al-Olimat, Hussein S., et al.
Published: (2026)
by: Al-Olimat, Hussein S., et al.
Published: (2026)
ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task
by: Khalil, Ahmad, et al.
Published: (2025)
by: Khalil, Ahmad, et al.
Published: (2025)
Layout-Aware Text Editing for Efficient Transformation of Academic PDFs to Markdown
by: Duan, Changxu
Published: (2025)
by: Duan, Changxu
Published: (2025)
Lexicon-Enriched Graph Modeling for Arabic Document Readability Prediction
by: Elchafei, Passant, et al.
Published: (2025)
by: Elchafei, Passant, et al.
Published: (2025)
ArabicNumBench: Evaluating Arabic Number Reading in Large Language Models
by: Alhumud, Anas, et al.
Published: (2026)
by: Alhumud, Anas, et al.
Published: (2026)
A Survey of Large Language Models for Arabic Language and its Dialects
by: Mashaabi, Malak, et al.
Published: (2024)
by: Mashaabi, Malak, et al.
Published: (2024)
Where Vision Becomes Text: Locating the OCR Routing Bottleneck in Vision-Language Models
by: Steinberg, Jonathan, et al.
Published: (2026)
by: Steinberg, Jonathan, et al.
Published: (2026)
Error Patterns in Historical OCR: A Comparative Analysis of TrOCR and a Vision-Language Model
by: Vesalainen, Ari, et al.
Published: (2026)
by: Vesalainen, Ari, et al.
Published: (2026)
ArabicMMLU: Assessing Massive Multitask Language Understanding in Arabic
by: Koto, Fajri, et al.
Published: (2024)
by: Koto, Fajri, et al.
Published: (2024)
PreP-OCR: A Complete Pipeline for Document Image Restoration and Enhanced OCR Accuracy
by: Guan, Shuhao, et al.
Published: (2025)
by: Guan, Shuhao, et al.
Published: (2025)
QARI-OCR: High-Fidelity Arabic Text Recognition through Multimodal Large Language Model Adaptation
by: Wasfy, Ahmed, et al.
Published: (2025)
by: Wasfy, Ahmed, et al.
Published: (2025)
olmOCR: Unlocking Trillions of Tokens in PDFs with Vision Language Models
by: Poznanski, Jake, et al.
Published: (2025)
by: Poznanski, Jake, et al.
Published: (2025)
Question-Answering (QA) Model for a Personalized Learning Assistant for Arabic Language
by: Sammoudi, Mohammad, et al.
Published: (2024)
by: Sammoudi, Mohammad, et al.
Published: (2024)
Similar Items
-
Wasm: A Pipeline for Constructing Structured Arabic Interleaved Multimodal Corpora
by: Hennara, Khalil, et al.
Published: (2025) -
Sadeed: Advancing Arabic Diacritization Through Small Language Model
by: Aldallal, Zeina, et al.
Published: (2025) -
Mutarjim: Advancing Bidirectional Arabic-English Translation with a Small Language Model
by: Hennara, Khalil, et al.
Published: (2025) -
Kuwain 1.5B: An Arabic SLM via Language Injection
by: Hennara, Khalil, et al.
Published: (2025) -
Arabic-Nougat: Fine-Tuning Vision Transformers for Arabic OCR and Markdown Extraction
by: Rashad, Mohamed
Published: (2024)