Digitization of Document and Information Extraction using OCR
Fuente:
arXiv
Guardado en:
| Autores principales: | Sinha, Rasha, S, Rekha B |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Fetch-A-Set: A Large-Scale OCR-Free Benchmark for Historical Document Retrieval
por: Molina, Adrià, et al.
Publicado: (2024)
por: Molina, Adrià, et al.
Publicado: (2024)
ERPA: Efficient RPA Model Integrating OCR and LLMs for Intelligent Document Processing
por: Abdellaif, Osama, et al.
Publicado: (2024)
por: Abdellaif, Osama, et al.
Publicado: (2024)
GraphRevisedIE: Multimodal Information Extraction with Graph-Revised Network
por: Cao, Panfeng, et al.
Publicado: (2024)
por: Cao, Panfeng, et al.
Publicado: (2024)
VKIE: The Application of Key Information Extraction on Video Text
por: An, Siyu, et al.
Publicado: (2023)
por: An, Siyu, et al.
Publicado: (2023)
Benchmarking Document Parsers on Mathematical Formula Extraction from PDFs
por: Horn, Pius, et al.
Publicado: (2025)
por: Horn, Pius, et al.
Publicado: (2025)
PCFEx: Point Cloud Feature Extraction for Graph Neural Networks
por: Masud, Abdullah Al, et al.
Publicado: (2026)
por: Masud, Abdullah Al, et al.
Publicado: (2026)
Visual Zero-Shot E-Commerce Product Attribute Value Extraction
por: Gong, Jiaying, et al.
Publicado: (2025)
por: Gong, Jiaying, et al.
Publicado: (2025)
Automatic Funny Scene Extraction from Long-form Cinematic Videos
por: Paul, Sibendu, et al.
Publicado: (2026)
por: Paul, Sibendu, et al.
Publicado: (2026)
Optimizing Multi-Modal Models for Image-Based Shape Retrieval: The Role of Pre-Alignment and Hard Contrastive Learning
por: Kühn, Paul Julius, et al.
Publicado: (2026)
por: Kühn, Paul Julius, et al.
Publicado: (2026)
Semi-Supervised Image-Based Narrative Extraction: A Case Study with Historical Photographic Records
por: German, Fausto, et al.
Publicado: (2025)
por: German, Fausto, et al.
Publicado: (2025)
GMM-Based Comprehensive Feature Extraction and Relative Distance Preservation For Few-Shot Cross-Modal Retrieval
por: Sun, Chengsong, et al.
Publicado: (2025)
por: Sun, Chengsong, et al.
Publicado: (2025)
ViBERTgrid BiLSTM-CRF: Multimodal Key Information Extraction from Unstructured Financial Documents
por: Pala, Furkan, et al.
Publicado: (2024)
por: Pala, Furkan, et al.
Publicado: (2024)
$\texttt{InfoHier}$: Hierarchical Information Extraction via Encoding and Embedding
por: Zhang, Tianru, et al.
Publicado: (2025)
por: Zhang, Tianru, et al.
Publicado: (2025)
NovaLAD: A Fast, CPU-Optimized Document Extraction Pipeline for Generative AI and Data Intelligence
por: Ulla, Aman
Publicado: (2026)
por: Ulla, Aman
Publicado: (2026)
A Multi-Granularity Retrieval Framework for Visually-Rich Documents
por: Xu, Mingjun, et al.
Publicado: (2025)
por: Xu, Mingjun, et al.
Publicado: (2025)
Rethinking Detection Based Table Structure Recognition for Visually Rich Document Images
por: Xiao, Bin, et al.
Publicado: (2023)
por: Xiao, Bin, et al.
Publicado: (2023)
Hierarchical Patch Compression for ColPali: Efficient Multi-Vector Document Retrieval with Dynamic Pruning and Quantization
por: Bach, Duong
Publicado: (2025)
por: Bach, Duong
Publicado: (2025)
Hybrid-Vector Retrieval for Visually Rich Documents: Combining Single-Vector Efficiency and Multi-Vector Accuracy
por: Kim, Juyeon, et al.
Publicado: (2025)
por: Kim, Juyeon, et al.
Publicado: (2025)
Bridging Information Asymmetry in Text-video Retrieval: A Data-centric Approach
por: Bai, Zechen, et al.
Publicado: (2024)
por: Bai, Zechen, et al.
Publicado: (2024)
Automating Iconclass: LLMs and RAG for Large-Scale Classification of Religious Woodcuts
por: Thomas, Drew B.
Publicado: (2025)
por: Thomas, Drew B.
Publicado: (2025)
Personalized Video Summarization using Text-Based Queries and Conditional Modeling
por: Huang, Jia-Hong
Publicado: (2024)
por: Huang, Jia-Hong
Publicado: (2024)
Bridging the Modality Gap: Dimension Information Alignment and Sparse Spatial Constraint for Image-Text Matching
por: Ma, Xiang, et al.
Publicado: (2024)
por: Ma, Xiang, et al.
Publicado: (2024)
Cross-Modal Pre-Aligned Method with Global and Local Information for Remote-Sensing Image and Text Retrieval
por: Sun, Zengbao, et al.
Publicado: (2024)
por: Sun, Zengbao, et al.
Publicado: (2024)
Self-supervised Learning of Rotation-invariant 3D Point Set Features using Transformer and its Self-distillation
por: Furuya, Takahiko, et al.
Publicado: (2023)
por: Furuya, Takahiko, et al.
Publicado: (2023)
Attention Grounded Enhancement for Visual Document Retrieval
por: Cui, Wanqing, et al.
Publicado: (2025)
por: Cui, Wanqing, et al.
Publicado: (2025)
Beyond String Matching: Semantic Evaluation of PDF Table Extraction
por: Horn, Pius, et al.
Publicado: (2026)
por: Horn, Pius, et al.
Publicado: (2026)
Music Recommendation Based on Facial Emotion Recognition
por: B, Rajesh, et al.
Publicado: (2024)
por: B, Rajesh, et al.
Publicado: (2024)
Are We on the Right Way for Assessing Document Retrieval-Augmented Generation?
por: Shen, Wenxuan, et al.
Publicado: (2025)
por: Shen, Wenxuan, et al.
Publicado: (2025)
Benchmarking Retrieval-Augmented Multimodal Generation for Document Question Answering
por: Dong, Kuicai, et al.
Publicado: (2025)
por: Dong, Kuicai, et al.
Publicado: (2025)
ColPali: Efficient Document Retrieval with Vision Language Models
por: Faysse, Manuel, et al.
Publicado: (2024)
por: Faysse, Manuel, et al.
Publicado: (2024)
ContextIQ: A Multimodal Expert-Based Video Retrieval System for Contextual Advertising
por: Chaubey, Ashutosh, et al.
Publicado: (2024)
por: Chaubey, Ashutosh, et al.
Publicado: (2024)
TalentMine: LLM-Based Extraction and Question-Answering from Multimodal Talent Tables
por: Mannam, Varun, et al.
Publicado: (2025)
por: Mannam, Varun, et al.
Publicado: (2025)
Towards Natural Language-Based Document Image Retrieval: New Dataset and Benchmark
por: Guo, Hao, et al.
Publicado: (2025)
por: Guo, Hao, et al.
Publicado: (2025)
Visual Late Chunking: An Empirical Study of Contextual Chunking for Efficient Visual Document Retrieval
por: Yan, Yibo, et al.
Publicado: (2026)
por: Yan, Yibo, et al.
Publicado: (2026)
Structural Anchor Pruning: Training-Free Multi-Vector Compression for Visual Document Retrieval
por: Liu, Zhuchenyang, et al.
Publicado: (2026)
por: Liu, Zhuchenyang, et al.
Publicado: (2026)
Index Light, Reason Deep: Deferred Visual Ingestion for Visual-Dense Document Question Answering
por: Xu, Tao
Publicado: (2026)
por: Xu, Tao
Publicado: (2026)
Deep Learning for Technical Document Classification
por: Jiang, Shuo, et al.
Publicado: (2021)
por: Jiang, Shuo, et al.
Publicado: (2021)
Sculpting the Vector Space: Towards Efficient Multi-Vector Visual Document Retrieval via Prune-then-Merge Framework
por: Yan, Yibo, et al.
Publicado: (2026)
por: Yan, Yibo, et al.
Publicado: (2026)
Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval
por: Kong, Fanheng, et al.
Publicado: (2025)
por: Kong, Fanheng, et al.
Publicado: (2025)
Very Efficient Listwise Multimodal Reranking for Long Documents
por: Sun, Yiqun, et al.
Publicado: (2026)
por: Sun, Yiqun, et al.
Publicado: (2026)
Ejemplares similares
-
Fetch-A-Set: A Large-Scale OCR-Free Benchmark for Historical Document Retrieval
por: Molina, Adrià, et al.
Publicado: (2024) -
ERPA: Efficient RPA Model Integrating OCR and LLMs for Intelligent Document Processing
por: Abdellaif, Osama, et al.
Publicado: (2024) -
GraphRevisedIE: Multimodal Information Extraction with Graph-Revised Network
por: Cao, Panfeng, et al.
Publicado: (2024) -
VKIE: The Application of Key Information Extraction on Video Text
por: An, Siyu, et al.
Publicado: (2023) -
Benchmarking Document Parsers on Mathematical Formula Extraction from PDFs
por: Horn, Pius, et al.
Publicado: (2025)