synthocr-gen: A synthetic ocr dataset generator for low-resource languages- breaking the data barrier
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Malik, Haq Nawaz, Shafi, Kh Mohmad, Reshi, Tanveer Ahmad |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
600k-ks-ocr: a large-scale synthetic dataset for optical character recognition in kashmiri script
par: Malik, Haq Nawaz
Publié: (2026)
par: Malik, Haq Nawaz
Publié: (2026)
ks-lit-3m: A 3.1 million word kashmiri text dataset for large language model pretraining
par: Malik, Haq Nawaz
Publié: (2026)
par: Malik, Haq Nawaz
Publié: (2026)
ks-pret-5m: a 5 million word, 12 million token kashmiri pretraining dataset
par: Malik, Haq Nawaz, et autres
Publié: (2026)
par: Malik, Haq Nawaz, et autres
Publié: (2026)
PubMed-Ophtha: An open resource for training ophthalmology vision-language models on scientific literature
par: Hallitschke, Verena Jasmin, et autres
Publié: (2026)
par: Hallitschke, Verena Jasmin, et autres
Publié: (2026)
OmDet: Large-scale vision-language multi-dataset pre-training with multimodal detection network
par: Zhao, Tiancheng, et autres
Publié: (2022)
par: Zhao, Tiancheng, et autres
Publié: (2022)
dots.ocr: Multilingual Document Layout Parsing in a Single Vision-Language Model
par: Li, Yumeng, et autres
Publié: (2025)
par: Li, Yumeng, et autres
Publié: (2025)
ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos
par: Hannan, Tanveer, et autres
Publié: (2024)
par: Hannan, Tanveer, et autres
Publié: (2024)
Sumotosima: A Framework and Dataset for Classifying and Summarizing Otoscopic Images
par: Khan, Eram Anwarul, et autres
Publié: (2024)
par: Khan, Eram Anwarul, et autres
Publié: (2024)
A workflow for generating synthetic LiDAR datasets in simulation environments
par: Phadke, Abhishek, et autres
Publié: (2025)
par: Phadke, Abhishek, et autres
Publié: (2025)
Image captioning in different languages
par: van Miltenburg, Emiel
Publié: (2024)
par: van Miltenburg, Emiel
Publié: (2024)
AutoArabic: A Three-Stage Framework for Localizing Video-Text Retrieval Benchmarks
par: Eltahir, Mohamed, et autres
Publié: (2025)
par: Eltahir, Mohamed, et autres
Publié: (2025)
Towards Deployable OCR models for Indic languages
par: Mathew, Minesh, et autres
Publié: (2022)
par: Mathew, Minesh, et autres
Publié: (2022)
Kaleidoscope: In-language Exams for Massively Multilingual Vision Evaluation
par: Salazar, Israfel, et autres
Publié: (2025)
par: Salazar, Israfel, et autres
Publié: (2025)
A large-scale image-text dataset benchmark for farmland segmentation
par: Tao, Chao, et autres
Publié: (2025)
par: Tao, Chao, et autres
Publié: (2025)
Visually Grounded Speech Models for Low-resource Languages and Cognitive Modelling
par: Nortje, Leanne
Publié: (2024)
par: Nortje, Leanne
Publié: (2024)
FIRE: Food Image to REcipe generation
par: Chhikara, Prateek, et autres
Publié: (2023)
par: Chhikara, Prateek, et autres
Publié: (2023)
SignBart -- New approach with the skeleton sequence for Isolated Sign language Recognition
par: Nguyen, Tinh, et autres
Publié: (2025)
par: Nguyen, Tinh, et autres
Publié: (2025)
BEAF: Observing BEfore-AFter Changes to Evaluate Hallucination in Vision-language Models
par: Ye-Bin, Moon, et autres
Publié: (2024)
par: Ye-Bin, Moon, et autres
Publié: (2024)
Frame Sampling Strategies Matter: A Benchmark for small vision language models
par: Brkic, Marija, et autres
Publié: (2025)
par: Brkic, Marija, et autres
Publié: (2025)
Unveiling the "Fairness Seesaw": Discovering and Mitigating Gender and Race Bias in Vision-Language Models
par: Lan, Jian, et autres
Publié: (2025)
par: Lan, Jian, et autres
Publié: (2025)
Assessing the alignment between infants' visual and linguistic experience using multimodal language models
par: Tan, Alvin Wei Ming, et autres
Publié: (2025)
par: Tan, Alvin Wei Ming, et autres
Publié: (2025)
ProfVLM: A lightweight video-language model for multi-view proficiency estimation
par: Bianchi, Edoardo, et autres
Publié: (2025)
par: Bianchi, Edoardo, et autres
Publié: (2025)
Scaling medical imaging report generation with multimodal reinforcement learning
par: Liu, Qianchu, et autres
Publié: (2026)
par: Liu, Qianchu, et autres
Publié: (2026)
Interpreting the linear structure of vision-language model embedding spaces
par: Papadimitriou, Isabel, et autres
Publié: (2025)
par: Papadimitriou, Isabel, et autres
Publié: (2025)
Multimodal Evaluation of Russian-language Architectures
par: Chervyakov, Artem, et autres
Publié: (2025)
par: Chervyakov, Artem, et autres
Publié: (2025)
Bridging vision language model (VLM) evaluation gaps with a framework for scalable and cost-effective benchmark generation
par: Rädsch, Tim, et autres
Publié: (2025)
par: Rädsch, Tim, et autres
Publié: (2025)
CosSIF: Cosine similarity-based image filtering to overcome low inter-class variation in synthetic medical image datasets
par: Islam, Mominul, et autres
Publié: (2023)
par: Islam, Mominul, et autres
Publié: (2023)
ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL
par: Zhang, Yu, et autres
Publié: (2025)
par: Zhang, Yu, et autres
Publié: (2025)
When language and vision meet road safety: leveraging multimodal large language models for video-based traffic accident analysis
par: Zhang, Ruixuan, et autres
Publié: (2025)
par: Zhang, Ruixuan, et autres
Publié: (2025)
Towards synthetic generation of realistic wooden logs
par: Zolotarev, Fedor, et autres
Publié: (2025)
par: Zolotarev, Fedor, et autres
Publié: (2025)
Superhuman performance in urology board questions by an explainable large language model enabled for context integration of the European Association of Urology guidelines: the UroBot study
par: Hetz, Martin J., et autres
Publié: (2024)
par: Hetz, Martin J., et autres
Publié: (2024)
Linear Alignment of Vision-language Models for Image Captioning
par: Paischer, Fabian, et autres
Publié: (2023)
par: Paischer, Fabian, et autres
Publié: (2023)
AdaReTaKe: Adaptive Redundancy Reduction to Perceive Longer for Video-language Understanding
par: Wang, Xiao, et autres
Publié: (2025)
par: Wang, Xiao, et autres
Publié: (2025)
VR-based generation of photorealistic synthetic data for training hand-object tracking models
par: Zhang, Chengyan, et autres
Publié: (2024)
par: Zhang, Chengyan, et autres
Publié: (2024)
Agent-X: Evaluating Deep Multimodal Reasoning in Vision-Centric Agentic Tasks
par: Ashraf, Tajamul, et autres
Publié: (2025)
par: Ashraf, Tajamul, et autres
Publié: (2025)
Advancing vision-language models in front-end development via data synthesis
par: Ge, Tong, et autres
Publié: (2025)
par: Ge, Tong, et autres
Publié: (2025)
MATRIX: Multimodal Agent Tuning for Robust Tool-Use Reasoning
par: Ashraf, Tajamul, et autres
Publié: (2025)
par: Ashraf, Tajamul, et autres
Publié: (2025)
Using LLMs as prompt modifier to avoid biases in AI image generators
par: Peinl, René
Publié: (2025)
par: Peinl, René
Publié: (2025)
Chitrakshara: A Large Multilingual Multimodal Dataset for Indian languages
par: Khan, Shaharukh, et autres
Publié: (2026)
par: Khan, Shaharukh, et autres
Publié: (2026)
A benchmark multimodal oro-dental dataset for large vision-language models
par: Lv, Haoxin, et autres
Publié: (2025)
par: Lv, Haoxin, et autres
Publié: (2025)
Documents similaires
-
600k-ks-ocr: a large-scale synthetic dataset for optical character recognition in kashmiri script
par: Malik, Haq Nawaz
Publié: (2026) -
ks-lit-3m: A 3.1 million word kashmiri text dataset for large language model pretraining
par: Malik, Haq Nawaz
Publié: (2026) -
ks-pret-5m: a 5 million word, 12 million token kashmiri pretraining dataset
par: Malik, Haq Nawaz, et autres
Publié: (2026) -
PubMed-Ophtha: An open resource for training ophthalmology vision-language models on scientific literature
par: Hallitschke, Verena Jasmin, et autres
Publié: (2026) -
OmDet: Large-scale vision-language multi-dataset pre-training with multimodal detection network
par: Zhao, Tiancheng, et autres
Publié: (2022)