Comparative analysis of optical character recognition methods for Sámi texts from the National Library of Norway
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Enstad, Tita, Trosterud, Trond, Røsok, Marie Iversdatter, Beyer, Yngvil, Roald, Marie |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
600k-ks-ocr: a large-scale synthetic dataset for optical character recognition in kashmiri script
par: Malik, Haq Nawaz
Publié: (2026)
par: Malik, Haq Nawaz
Publié: (2026)
Visual Navigation of Digital Libraries: Retrieval and Classification of Images in the National Library of Norway's Digitised Book Collection
par: Roald, Marie, et autres
Publié: (2024)
par: Roald, Marie, et autres
Publié: (2024)
Improving Automatic Text Recognition with Language Models in the PyLaia Open-Source Library
par: Tarride, Solène, et autres
Publié: (2024)
par: Tarride, Solène, et autres
Publié: (2024)
FSboard: Over 3 million characters of ASL fingerspelling collected via smartphones
par: Georg, Manfred, et autres
Publié: (2024)
par: Georg, Manfred, et autres
Publié: (2024)
Altogether: Image Captioning via Re-aligning Alt-text
par: Xu, Hu, et autres
Publié: (2024)
par: Xu, Hu, et autres
Publié: (2024)
Link prediction Graph Neural Networks for structure recognition of Handwritten Mathematical Expressions
par: Nguyen, Cuong Tuan, et autres
Publié: (2025)
par: Nguyen, Cuong Tuan, et autres
Publié: (2025)
A large-scale image-text dataset benchmark for farmland segmentation
par: Tao, Chao, et autres
Publié: (2025)
par: Tao, Chao, et autres
Publié: (2025)
ROSA: Addressing text understanding challenges in photographs via ROtated SAmpling
par: Maina, Hernán, et autres
Publié: (2025)
par: Maina, Hernán, et autres
Publié: (2025)
Learning based Ge'ez character handwritten recognition
par: Yimer, Hailemicael Lulseged, et autres
Publié: (2024)
par: Yimer, Hailemicael Lulseged, et autres
Publié: (2024)
Assessing News Thumbnail Representativeness: Counterfactual text can enhance the cross-modal matching ability
par: Yoon, Yejun, et autres
Publié: (2024)
par: Yoon, Yejun, et autres
Publié: (2024)
Audio-visual training for improved grounding in video-text LLMs
par: Sagare, Shivprasad, et autres
Publié: (2024)
par: Sagare, Shivprasad, et autres
Publié: (2024)
BiomedCLIP: a multimodal biomedical foundation model pretrained from fifteen million scientific image-text pairs
par: Zhang, Sheng, et autres
Publié: (2023)
par: Zhang, Sheng, et autres
Publié: (2023)
Enhancement of text recognition for hanja handwritten documents of Ancient Korea
par: Ahna, Joonmo, et autres
Publié: (2024)
par: Ahna, Joonmo, et autres
Publié: (2024)
An accurate and revised version of optical character recognition-based speech synthesis using LabVIEW
par: Mehta, Prateek, et autres
Publié: (2025)
par: Mehta, Prateek, et autres
Publié: (2025)
$\left|\,\circlearrowright\,\boxed{\text{BUS}}\,\right|$: A Large and Diverse Multimodal Benchmark for evaluating the ability of Vision-Language Models to understand Rebus Puzzles
par: Das, Trishanu, et autres
Publié: (2025)
par: Das, Trishanu, et autres
Publié: (2025)
A Comparative Study of Continuous Sign Language Recognition Techniques
par: Alyami, Sarah, et autres
Publié: (2024)
par: Alyami, Sarah, et autres
Publié: (2024)
Movie2Story: A framework for understanding videos and telling stories in the form of novel text
par: Li, Kangning, et autres
Publié: (2024)
par: Li, Kangning, et autres
Publié: (2024)
HABD: a houma alliance book ancient handwritten character recognition database
par: Yuan, Xiaoyu, et autres
Publié: (2024)
par: Yuan, Xiaoyu, et autres
Publié: (2024)
Multimodal Adaptive Inference for Document Image Classification with Anytime Early Exiting
par: Hamed, Omar, et autres
Publié: (2024)
par: Hamed, Omar, et autres
Publié: (2024)
Meta-DAN: towards an efficient prediction strategy for page-level handwritten text recognition
par: Coquenet, Denis
Publié: (2025)
par: Coquenet, Denis
Publié: (2025)
A comprehensive survey of oracle character recognition: challenges, benchmarks, and beyond
par: Li, Jing, et autres
Publié: (2024)
par: Li, Jing, et autres
Publié: (2024)
When 'YES' Meets 'BUT': Can Large Models Comprehend Contradictory Humor Through Comparative Reasoning?
par: Liang, Tuo, et autres
Publié: (2025)
par: Liang, Tuo, et autres
Publié: (2025)
Decompose and Compare Consistency: Measuring VLMs' Answer Reliability via Task-Decomposition Consistency Comparison
par: Yang, Qian, et autres
Publié: (2024)
par: Yang, Qian, et autres
Publié: (2024)
Can Prompt Modifiers Control Bias? A Comparative Analysis of Text-to-Image Generative Models
par: Shin, Philip Wootaek, et autres
Publié: (2024)
par: Shin, Philip Wootaek, et autres
Publié: (2024)
Human vs. AI: A Novel Benchmark and a Comparative Study on the Detection of Generated Images and the Impact of Prompts
par: Moeßner, Philipp, et autres
Publié: (2024)
par: Moeßner, Philipp, et autres
Publié: (2024)
VCE: A zero-cost hallucination mitigation method of LVLMs via visual contrastive editing
par: Huang, Yanbin, et autres
Publié: (2026)
par: Huang, Yanbin, et autres
Publié: (2026)
Research on gesture recognition method based on SEDCNN-SVM
par: Zhang, Mingjin, et autres
Publié: (2024)
par: Zhang, Mingjin, et autres
Publié: (2024)
From Codicology to Code: A Comparative Study of Transformer and YOLO-based Detectors for Layout Analysis in Historical Documents
par: Aguilar, Sergio Torres
Publié: (2025)
par: Aguilar, Sergio Torres
Publié: (2025)
Gradient descent with generalized Newton's method
par: Bu, Zhiqi, et autres
Publié: (2024)
par: Bu, Zhiqi, et autres
Publié: (2024)
Enhancing Vision-Language Model Pre-training with Image-text Pair Pruning Based on Word Frequency
par: Liang, Mingliang, et autres
Publié: (2024)
par: Liang, Mingliang, et autres
Publié: (2024)
FLATTEN: optical FLow-guided ATTENtion for consistent text-to-video editing
par: Cong, Yuren, et autres
Publié: (2023)
par: Cong, Yuren, et autres
Publié: (2023)
MLLM-CompBench: A Comparative Reasoning Benchmark for Multimodal LLMs
par: Kil, Jihyung, et autres
Publié: (2024)
par: Kil, Jihyung, et autres
Publié: (2024)
Deciphering Emotions in Children Storybooks: A Comparative Analysis of Multimodal LLMs in Educational Applications
par: Asseri, Bushra, et autres
Publié: (2025)
par: Asseri, Bushra, et autres
Publié: (2025)
NorEval: A Norwegian Language Understanding and Generation Evaluation Benchmark
par: Mikhailov, Vladislav, et autres
Publié: (2025)
par: Mikhailov, Vladislav, et autres
Publié: (2025)
LogogramNLP: Comparing Visual and Textual Representations of Ancient Logographic Writing Systems for NLP
par: Chen, Danlu, et autres
Publié: (2024)
par: Chen, Danlu, et autres
Publié: (2024)
Lighthouse: A User-Friendly Library for Reproducible Video Moment Retrieval and Highlight Detection
par: Nishimura, Taichi, et autres
Publié: (2024)
par: Nishimura, Taichi, et autres
Publié: (2024)
Pixtral 12B
par: Agrawal, Pravesh, et autres
Publié: (2024)
par: Agrawal, Pravesh, et autres
Publié: (2024)
Irony in Emojis: A Comparative Study of Human and LLM Interpretation
par: Zheng, Yawen, et autres
Publié: (2025)
par: Zheng, Yawen, et autres
Publié: (2025)
Comparative Analysis of OpenAI GPT-4o and DeepSeek R1 for Scientific Text Categorization Using Prompt Engineering
par: Maiti, Aniruddha, et autres
Publié: (2025)
par: Maiti, Aniruddha, et autres
Publié: (2025)
LLaVA-MORE: A Comparative Study of LLMs and Visual Backbones for Enhanced Visual Instruction Tuning
par: Cocchi, Federico, et autres
Publié: (2025)
par: Cocchi, Federico, et autres
Publié: (2025)
Documents similaires
-
600k-ks-ocr: a large-scale synthetic dataset for optical character recognition in kashmiri script
par: Malik, Haq Nawaz
Publié: (2026) -
Visual Navigation of Digital Libraries: Retrieval and Classification of Images in the National Library of Norway's Digitised Book Collection
par: Roald, Marie, et autres
Publié: (2024) -
Improving Automatic Text Recognition with Language Models in the PyLaia Open-Source Library
par: Tarride, Solène, et autres
Publié: (2024) -
FSboard: Over 3 million characters of ASL fingerspelling collected via smartphones
par: Georg, Manfred, et autres
Publié: (2024) -
Altogether: Image Captioning via Re-aligning Alt-text
par: Xu, Hu, et autres
Publié: (2024)