Transcribing Spanish Texts from the Past: Experiments with Transkribus, Tesseract and Granite
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Torterolo-Orta, Yanco Amor, Macicior-Mitxelena, Jaione, Miguez-Lamanuzzi, Marina, García-Serrano, Ana |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Transcrib3D: 3D Referring Expression Resolution through Large Language Models
par: Fang, Jiading, et autres
Publié: (2024)
par: Fang, Jiading, et autres
Publié: (2024)
Unlocking the Archives: Using Large Language Models to Transcribe Handwritten Historical Documents
par: Humphries, Mark, et autres
Publié: (2024)
par: Humphries, Mark, et autres
Publié: (2024)
CutPaste&Find: Efficient Multimodal Hallucination Detector with Visual-aid Knowledge Base
par: Nguyen, Cong-Duy, et autres
Publié: (2025)
par: Nguyen, Cong-Duy, et autres
Publié: (2025)
Summarize the Past to Predict the Future: Natural Language Descriptions of Context Boost Multimodal Object Interaction Anticipation
par: Pasca, Razvan-George, et autres
Publié: (2023)
par: Pasca, Razvan-George, et autres
Publié: (2023)
TextInVision: Text and Prompt Complexity Driven Visual Text Generation Benchmark
par: Fallah, Forouzan, et autres
Publié: (2025)
par: Fallah, Forouzan, et autres
Publié: (2025)
TextTIGER: Text-based Intelligent Generation with Entity Prompt Refinement for Text-to-Image Generation
par: Ozaki, Shintaro, et autres
Publié: (2025)
par: Ozaki, Shintaro, et autres
Publié: (2025)
Image2Text2Image: A Novel Framework for Label-Free Evaluation of Image-to-Text Generation with Text-to-Image Diffusion Models
par: Huang, Jia-Hong, et autres
Publié: (2024)
par: Huang, Jia-Hong, et autres
Publié: (2024)
TextFormer: A Query-based End-to-End Text Spotter with Mixed Supervision
par: Zhai, Yukun, et autres
Publié: (2023)
par: Zhai, Yukun, et autres
Publié: (2023)
Text2Vis: A Challenging and Diverse Benchmark for Generating Multimodal Visualizations from Text
par: Rahman, Mizanur, et autres
Publié: (2025)
par: Rahman, Mizanur, et autres
Publié: (2025)
Autoregressive Pre-Training on Pixels and Texts
par: Chai, Yekun, et autres
Publié: (2024)
par: Chai, Yekun, et autres
Publié: (2024)
Optimizing Prompts for Text-to-Image Generation
par: Hao, Yaru, et autres
Publié: (2022)
par: Hao, Yaru, et autres
Publié: (2022)
American Sign Language Video to Text Translation
par: Roy, Parsheeta, et autres
Publié: (2024)
par: Roy, Parsheeta, et autres
Publié: (2024)
Text Prompt Injection of Vision Language Models
par: Zhu, Ruizhe
Publié: (2025)
par: Zhu, Ruizhe
Publié: (2025)
Fast Prompt Alignment for Text-to-Image Generation
par: Mrini, Khalil, et autres
Publié: (2024)
par: Mrini, Khalil, et autres
Publié: (2024)
Improving OCR for Historical Texts of Multiple Languages
par: Westerdijk, Hylke, et autres
Publié: (2025)
par: Westerdijk, Hylke, et autres
Publié: (2025)
See the Text: From Tokenization to Visual Reading
par: Xing, Ling, et autres
Publié: (2025)
par: Xing, Ling, et autres
Publié: (2025)
Scaling Concept With Text-Guided Diffusion Models
par: Huang, Chao, et autres
Publié: (2024)
par: Huang, Chao, et autres
Publié: (2024)
Temporal Reasoning Transfer from Text to Video
par: Li, Lei, et autres
Publié: (2024)
par: Li, Lei, et autres
Publié: (2024)
Emergent Visual-Semantic Hierarchies in Image-Text Representations
par: Alper, Morris, et autres
Publié: (2024)
par: Alper, Morris, et autres
Publié: (2024)
Survey of Cultural Awareness in Language Models: Text and Beyond
par: Pawar, Siddhesh, et autres
Publié: (2024)
par: Pawar, Siddhesh, et autres
Publié: (2024)
Evaluating the Evaluators: Metrics for Compositional Text-to-Image Generation
par: Kasaei, Seyed Amir, et autres
Publié: (2025)
par: Kasaei, Seyed Amir, et autres
Publié: (2025)
Harnessing Webpage UIs for Text-Rich Visual Understanding
par: Liu, Junpeng, et autres
Publié: (2024)
par: Liu, Junpeng, et autres
Publié: (2024)
Universal Prompt Optimizer for Safe Text-to-Image Generation
par: Wu, Zongyu, et autres
Publié: (2024)
par: Wu, Zongyu, et autres
Publié: (2024)
ViConsFormer: Constituting Meaningful Phrases of Scene Texts using Transformer-based Method in Vietnamese Text-based Visual Question Answering
par: Nguyen, Nghia Hieu, et autres
Publié: (2024)
par: Nguyen, Nghia Hieu, et autres
Publié: (2024)
Lost in Variation? Evaluating NLI Performance in Basque and Spanish Geographical Variants
par: Bengoetxea, Jaione, et autres
Publié: (2025)
par: Bengoetxea, Jaione, et autres
Publié: (2025)
Bilingual Text-to-Motion Generation: A New Benchmark and Baselines
par: Weng, Wanjiang, et autres
Publié: (2026)
par: Weng, Wanjiang, et autres
Publié: (2026)
Improving Text-to-Image Consistency via Automatic Prompt Optimization
par: Mañas, Oscar, et autres
Publié: (2024)
par: Mañas, Oscar, et autres
Publié: (2024)
VIXEN: Visual Text Comparison Network for Image Difference Captioning
par: Black, Alexander, et autres
Publié: (2024)
par: Black, Alexander, et autres
Publié: (2024)
From Text to Pixel: Advancing Long-Context Understanding in MLLMs
par: Lu, Yujie, et autres
Publié: (2024)
par: Lu, Yujie, et autres
Publié: (2024)
Composition and Deformance: Measuring Imageability with a Text-to-Image Model
par: Wu, Si, et autres
Publié: (2023)
par: Wu, Si, et autres
Publié: (2023)
Context Cascade Compression: Exploring the Upper Limits of Text Compression
par: Liu, Fanfan, et autres
Publié: (2025)
par: Liu, Fanfan, et autres
Publié: (2025)
Navigating Text-to-Image Generative Bias across Indic Languages
par: Mittal, Surbhi, et autres
Publié: (2024)
par: Mittal, Surbhi, et autres
Publié: (2024)
Interleaved Scene Graphs for Interleaved Text-and-Image Generation Assessment
par: Chen, Dongping, et autres
Publié: (2024)
par: Chen, Dongping, et autres
Publié: (2024)
Image-to-LaTeX Converter for Mathematical Formulas and Text
par: Gurgurov, Daniil, et autres
Publié: (2024)
par: Gurgurov, Daniil, et autres
Publié: (2024)
Mismatch Quest: Visual and Textual Feedback for Image-Text Misalignment
par: Gordon, Brian, et autres
Publié: (2023)
par: Gordon, Brian, et autres
Publié: (2023)
FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation
par: Jing, Liqiang, et autres
Publié: (2025)
par: Jing, Liqiang, et autres
Publié: (2025)
Visually Guided Generative Text-Layout Pre-training for Document Intelligence
par: Mao, Zhiming, et autres
Publié: (2024)
par: Mao, Zhiming, et autres
Publié: (2024)
Text-Video Retrieval via Variational Multi-Modal Hypergraph Networks
par: Li, Qian, et autres
Publié: (2024)
par: Li, Qian, et autres
Publié: (2024)
Beyond Filtering: Adaptive Image-Text Quality Enhancement for MLLM Pretraining
par: Huang, Han, et autres
Publié: (2024)
par: Huang, Han, et autres
Publié: (2024)
Multi-Modal 3D Mesh Reconstruction from Images and Text
par: Reka, Melvin, et autres
Publié: (2025)
par: Reka, Melvin, et autres
Publié: (2025)
Documents similaires
-
Transcrib3D: 3D Referring Expression Resolution through Large Language Models
par: Fang, Jiading, et autres
Publié: (2024) -
Unlocking the Archives: Using Large Language Models to Transcribe Handwritten Historical Documents
par: Humphries, Mark, et autres
Publié: (2024) -
CutPaste&Find: Efficient Multimodal Hallucination Detector with Visual-aid Knowledge Base
par: Nguyen, Cong-Duy, et autres
Publié: (2025) -
Summarize the Past to Predict the Future: Natural Language Descriptions of Context Boost Multimodal Object Interaction Anticipation
par: Pasca, Razvan-George, et autres
Publié: (2023) -
TextInVision: Text and Prompt Complexity Driven Visual Text Generation Benchmark
par: Fallah, Forouzan, et autres
Publié: (2025)