Evaluating LLMs for Historical Document OCR: A Methodological Framework for Digital Humanities
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Levchenko, Maria |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VisGraphVar: A Benchmark Generator for Assessing Variability in Graph Analysis Using Large Vision-Language Models
par: Sartori, Camilo Chacón, et autres
Publié: (2024)
par: Sartori, Camilo Chacón, et autres
Publié: (2024)
Bonsai: Interpretable Tree-Adaptive Grounded Reasoning
par: Sanders, Kate, et autres
Publié: (2025)
par: Sanders, Kate, et autres
Publié: (2025)
jina-vlm: Small Multilingual Vision Language Model
par: Koukounas, Andreas, et autres
Publié: (2025)
par: Koukounas, Andreas, et autres
Publié: (2025)
MemeIntel: Explainable Detection of Propagandistic and Hateful Memes
par: Kmainasi, Mohamed Bayan, et autres
Publié: (2025)
par: Kmainasi, Mohamed Bayan, et autres
Publié: (2025)
BitMar: Low-Bit Multimodal Fusion with Episodic Memory for Edge Devices
par: Aman, Euhid, et autres
Publié: (2025)
par: Aman, Euhid, et autres
Publié: (2025)
Controlled Automatic Task-Specific Synthetic Data Generation for Hallucination Detection
par: Xie, Yong, et autres
Publié: (2024)
par: Xie, Yong, et autres
Publié: (2024)
ArMeme: Propagandistic Content in Arabic Memes
par: Alam, Firoj, et autres
Publié: (2024)
par: Alam, Firoj, et autres
Publié: (2024)
Enhancing OCR for Sino-Vietnamese Language Processing via Fine-tuned PaddleOCRv5
par: Nguyen, Minh Hoang, et autres
Publié: (2025)
par: Nguyen, Minh Hoang, et autres
Publié: (2025)
Socratic Planner: Self-QA-Based Zero-Shot Planning for Embodied Instruction Following
par: Shin, Suyeon, et autres
Publié: (2024)
par: Shin, Suyeon, et autres
Publié: (2024)
Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark
par: Cheng, Ziming, et autres
Publié: (2025)
par: Cheng, Ziming, et autres
Publié: (2025)
Jina CLIP: Your CLIP Model Is Also Your Text Retriever
par: Koukounas, Andreas, et autres
Publié: (2024)
par: Koukounas, Andreas, et autres
Publié: (2024)
Evaluating Named Entity Recognition Models for Russian Cultural News Texts: From BERT to LLM
par: Levchenko, Maria
Publié: (2025)
par: Levchenko, Maria
Publié: (2025)
Continuous Latent Diffusion Language Model
par: Guo, Hongcan, et autres
Publié: (2026)
par: Guo, Hongcan, et autres
Publié: (2026)
COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation
par: Hassan, Umair
Publié: (2025)
par: Hassan, Umair
Publié: (2025)
IRONIC: Coherence-Aware Reasoning Chains for Multi-Modal Sarcasm Detection
par: Ramakrishnan, Aashish Anantha, et autres
Publié: (2025)
par: Ramakrishnan, Aashish Anantha, et autres
Publié: (2025)
RONA: Pragmatically Diverse Image Captioning with Coherence Relations
par: Ramakrishnan, Aashish Anantha, et autres
Publié: (2025)
par: Ramakrishnan, Aashish Anantha, et autres
Publié: (2025)
ArAIEval Shared Task: Propagandistic Techniques Detection in Unimodal and Multimodal Arabic Content
par: Hasanain, Maram, et autres
Publié: (2024)
par: Hasanain, Maram, et autres
Publié: (2024)
Meaning-infused grammar: Gradient Acceptability Shapes the Geometric Representations of Constructions in LLMs
par: Rakshit, Supantho, et autres
Publié: (2025)
par: Rakshit, Supantho, et autres
Publié: (2025)
One SPACE to Rule Them All: Jointly Mitigating Factuality and Faithfulness Hallucinations in LLMs
par: Wang, Pengbo, et autres
Publié: (2025)
par: Wang, Pengbo, et autres
Publié: (2025)
Confidence-Aware Document OCR Error Detection
par: Hemmer, Arthur, et autres
Publié: (2024)
par: Hemmer, Arthur, et autres
Publié: (2024)
OPENXRD: A Comprehensive Benchmark Framework for LLM/MLLM XRD Question Answering
par: Vosoughi, Ali, et autres
Publié: (2025)
par: Vosoughi, Ali, et autres
Publié: (2025)
Explainable Image Captioning using CNN- CNN architecture and Hierarchical Attention
par: Mohan, Rishi Kesav, et autres
Publié: (2024)
par: Mohan, Rishi Kesav, et autres
Publié: (2024)
Enhancing Large Vision-Language Models with Layout Modality for Table Question Answering on Japanese Annual Securities Reports
par: Aida, Hayato, et autres
Publié: (2025)
par: Aida, Hayato, et autres
Publié: (2025)
Crossing Linguistic Horizons: Finetuning and Comprehensive Evaluation of Vietnamese Large Language Models
par: Truong, Sang T., et autres
Publié: (2024)
par: Truong, Sang T., et autres
Publié: (2024)
Reading or Reasoning? Format Decoupled Reinforcement Learning for Document OCR
par: Zhong, Yufeng, et autres
Publié: (2025)
par: Zhong, Yufeng, et autres
Publié: (2025)
ReFACT: Updating Text-to-Image Models by Editing the Text Encoder
par: Arad, Dana, et autres
Publié: (2023)
par: Arad, Dana, et autres
Publié: (2023)
What is the Visual Cognition Gap between Humans and Multimodal LLMs?
par: Cao, Xu, et autres
Publié: (2024)
par: Cao, Xu, et autres
Publié: (2024)
A Primer on Large Language Models and their Limitations
par: Johnson, Sandra, et autres
Publié: (2024)
par: Johnson, Sandra, et autres
Publié: (2024)
T-VEC: A Telecom-Specific Vectorization Model with Enhanced Semantic Understanding via Deep Triplet Loss Fine-Tuning
par: Ethiraj, Vignesh, et autres
Publié: (2025)
par: Ethiraj, Vignesh, et autres
Publié: (2025)
LLMs as Deceptive Agents: How Role-Based Prompting Induces Semantic Ambiguity in Puzzle Tasks
par: Yoo, Seunghyun
Publié: (2025)
par: Yoo, Seunghyun
Publié: (2025)
Improving MLLM's Document Image Machine Translation via Synchronously Self-reviewing Its OCR Proficiency
par: Liang, Yupu, et autres
Publié: (2025)
par: Liang, Yupu, et autres
Publié: (2025)
EvidenceMap: Learning Evidence Analysis to Unleash the Power of Small Language Models for Biomedical Question Answering
par: Zong, Chang, et autres
Publié: (2025)
par: Zong, Chang, et autres
Publié: (2025)
Auto prompt sql: a resource-efficient architecture for text-to-sql translation in constrained environments
par: Tang, Zetong, et autres
Publié: (2025)
par: Tang, Zetong, et autres
Publié: (2025)
Japanese Tort-case Dataset for Rationale-supported Legal Judgment Prediction
par: Yamada, Hiroaki, et autres
Publié: (2023)
par: Yamada, Hiroaki, et autres
Publié: (2023)
Curriculum Recommendations Using Transformer Base Model with InfoNCE Loss And Language Switching Method
par: Xu, Xiaonan, et autres
Publié: (2024)
par: Xu, Xiaonan, et autres
Publié: (2024)
DharmaOCR: Specialized Small Language Models for Structured OCR that outperform Open-Source and Commercial Baselines
par: Cardoso, Gabriel Pimenta de Freitas, et autres
Publié: (2026)
par: Cardoso, Gabriel Pimenta de Freitas, et autres
Publié: (2026)
HInter: Exposing Hidden Intersectional Bias in Large Language Models
par: Souani, Badr, et autres
Publié: (2025)
par: Souani, Badr, et autres
Publié: (2025)
Pay Attention to What You Need
par: Gao, Yifei, et autres
Publié: (2023)
par: Gao, Yifei, et autres
Publié: (2023)
Semantic Needles in Document Haystacks: Sensitivity Testing of LLM-as-a-Judge Similarity Scoring
par: Aksoy, Sinan G., et autres
Publié: (2026)
par: Aksoy, Sinan G., et autres
Publié: (2026)
How Well Do Vision-Language Models Understand Sequential Driving Scenes? A Sensitivity Study
par: Brusnicki, Roberto, et autres
Publié: (2026)
par: Brusnicki, Roberto, et autres
Publié: (2026)
Documents similaires
-
VisGraphVar: A Benchmark Generator for Assessing Variability in Graph Analysis Using Large Vision-Language Models
par: Sartori, Camilo Chacón, et autres
Publié: (2024) -
Bonsai: Interpretable Tree-Adaptive Grounded Reasoning
par: Sanders, Kate, et autres
Publié: (2025) -
jina-vlm: Small Multilingual Vision Language Model
par: Koukounas, Andreas, et autres
Publié: (2025) -
MemeIntel: Explainable Detection of Propagandistic and Hateful Memes
par: Kmainasi, Mohamed Bayan, et autres
Publié: (2025) -
BitMar: Low-Bit Multimodal Fusion with Episodic Memory for Edge Devices
par: Aman, Euhid, et autres
Publié: (2025)