Digitization of Document and Information Extraction using OCR
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sinha, Rasha, S, Rekha B |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Fetch-A-Set: A Large-Scale OCR-Free Benchmark for Historical Document Retrieval
par: Molina, Adrià, et autres
Publié: (2024)
par: Molina, Adrià, et autres
Publié: (2024)
ERPA: Efficient RPA Model Integrating OCR and LLMs for Intelligent Document Processing
par: Abdellaif, Osama, et autres
Publié: (2024)
par: Abdellaif, Osama, et autres
Publié: (2024)
GraphRevisedIE: Multimodal Information Extraction with Graph-Revised Network
par: Cao, Panfeng, et autres
Publié: (2024)
par: Cao, Panfeng, et autres
Publié: (2024)
VKIE: The Application of Key Information Extraction on Video Text
par: An, Siyu, et autres
Publié: (2023)
par: An, Siyu, et autres
Publié: (2023)
Benchmarking Document Parsers on Mathematical Formula Extraction from PDFs
par: Horn, Pius, et autres
Publié: (2025)
par: Horn, Pius, et autres
Publié: (2025)
PCFEx: Point Cloud Feature Extraction for Graph Neural Networks
par: Masud, Abdullah Al, et autres
Publié: (2026)
par: Masud, Abdullah Al, et autres
Publié: (2026)
Visual Zero-Shot E-Commerce Product Attribute Value Extraction
par: Gong, Jiaying, et autres
Publié: (2025)
par: Gong, Jiaying, et autres
Publié: (2025)
Automatic Funny Scene Extraction from Long-form Cinematic Videos
par: Paul, Sibendu, et autres
Publié: (2026)
par: Paul, Sibendu, et autres
Publié: (2026)
Optimizing Multi-Modal Models for Image-Based Shape Retrieval: The Role of Pre-Alignment and Hard Contrastive Learning
par: Kühn, Paul Julius, et autres
Publié: (2026)
par: Kühn, Paul Julius, et autres
Publié: (2026)
Semi-Supervised Image-Based Narrative Extraction: A Case Study with Historical Photographic Records
par: German, Fausto, et autres
Publié: (2025)
par: German, Fausto, et autres
Publié: (2025)
GMM-Based Comprehensive Feature Extraction and Relative Distance Preservation For Few-Shot Cross-Modal Retrieval
par: Sun, Chengsong, et autres
Publié: (2025)
par: Sun, Chengsong, et autres
Publié: (2025)
ViBERTgrid BiLSTM-CRF: Multimodal Key Information Extraction from Unstructured Financial Documents
par: Pala, Furkan, et autres
Publié: (2024)
par: Pala, Furkan, et autres
Publié: (2024)
$\texttt{InfoHier}$: Hierarchical Information Extraction via Encoding and Embedding
par: Zhang, Tianru, et autres
Publié: (2025)
par: Zhang, Tianru, et autres
Publié: (2025)
NovaLAD: A Fast, CPU-Optimized Document Extraction Pipeline for Generative AI and Data Intelligence
par: Ulla, Aman
Publié: (2026)
par: Ulla, Aman
Publié: (2026)
A Multi-Granularity Retrieval Framework for Visually-Rich Documents
par: Xu, Mingjun, et autres
Publié: (2025)
par: Xu, Mingjun, et autres
Publié: (2025)
Rethinking Detection Based Table Structure Recognition for Visually Rich Document Images
par: Xiao, Bin, et autres
Publié: (2023)
par: Xiao, Bin, et autres
Publié: (2023)
Hierarchical Patch Compression for ColPali: Efficient Multi-Vector Document Retrieval with Dynamic Pruning and Quantization
par: Bach, Duong
Publié: (2025)
par: Bach, Duong
Publié: (2025)
Hybrid-Vector Retrieval for Visually Rich Documents: Combining Single-Vector Efficiency and Multi-Vector Accuracy
par: Kim, Juyeon, et autres
Publié: (2025)
par: Kim, Juyeon, et autres
Publié: (2025)
Bridging Information Asymmetry in Text-video Retrieval: A Data-centric Approach
par: Bai, Zechen, et autres
Publié: (2024)
par: Bai, Zechen, et autres
Publié: (2024)
Automating Iconclass: LLMs and RAG for Large-Scale Classification of Religious Woodcuts
par: Thomas, Drew B.
Publié: (2025)
par: Thomas, Drew B.
Publié: (2025)
Personalized Video Summarization using Text-Based Queries and Conditional Modeling
par: Huang, Jia-Hong
Publié: (2024)
par: Huang, Jia-Hong
Publié: (2024)
Bridging the Modality Gap: Dimension Information Alignment and Sparse Spatial Constraint for Image-Text Matching
par: Ma, Xiang, et autres
Publié: (2024)
par: Ma, Xiang, et autres
Publié: (2024)
Cross-Modal Pre-Aligned Method with Global and Local Information for Remote-Sensing Image and Text Retrieval
par: Sun, Zengbao, et autres
Publié: (2024)
par: Sun, Zengbao, et autres
Publié: (2024)
Self-supervised Learning of Rotation-invariant 3D Point Set Features using Transformer and its Self-distillation
par: Furuya, Takahiko, et autres
Publié: (2023)
par: Furuya, Takahiko, et autres
Publié: (2023)
Attention Grounded Enhancement for Visual Document Retrieval
par: Cui, Wanqing, et autres
Publié: (2025)
par: Cui, Wanqing, et autres
Publié: (2025)
Beyond String Matching: Semantic Evaluation of PDF Table Extraction
par: Horn, Pius, et autres
Publié: (2026)
par: Horn, Pius, et autres
Publié: (2026)
Music Recommendation Based on Facial Emotion Recognition
par: B, Rajesh, et autres
Publié: (2024)
par: B, Rajesh, et autres
Publié: (2024)
Are We on the Right Way for Assessing Document Retrieval-Augmented Generation?
par: Shen, Wenxuan, et autres
Publié: (2025)
par: Shen, Wenxuan, et autres
Publié: (2025)
Benchmarking Retrieval-Augmented Multimodal Generation for Document Question Answering
par: Dong, Kuicai, et autres
Publié: (2025)
par: Dong, Kuicai, et autres
Publié: (2025)
ColPali: Efficient Document Retrieval with Vision Language Models
par: Faysse, Manuel, et autres
Publié: (2024)
par: Faysse, Manuel, et autres
Publié: (2024)
ContextIQ: A Multimodal Expert-Based Video Retrieval System for Contextual Advertising
par: Chaubey, Ashutosh, et autres
Publié: (2024)
par: Chaubey, Ashutosh, et autres
Publié: (2024)
TalentMine: LLM-Based Extraction and Question-Answering from Multimodal Talent Tables
par: Mannam, Varun, et autres
Publié: (2025)
par: Mannam, Varun, et autres
Publié: (2025)
Towards Natural Language-Based Document Image Retrieval: New Dataset and Benchmark
par: Guo, Hao, et autres
Publié: (2025)
par: Guo, Hao, et autres
Publié: (2025)
Visual Late Chunking: An Empirical Study of Contextual Chunking for Efficient Visual Document Retrieval
par: Yan, Yibo, et autres
Publié: (2026)
par: Yan, Yibo, et autres
Publié: (2026)
Structural Anchor Pruning: Training-Free Multi-Vector Compression for Visual Document Retrieval
par: Liu, Zhuchenyang, et autres
Publié: (2026)
par: Liu, Zhuchenyang, et autres
Publié: (2026)
Index Light, Reason Deep: Deferred Visual Ingestion for Visual-Dense Document Question Answering
par: Xu, Tao
Publié: (2026)
par: Xu, Tao
Publié: (2026)
Deep Learning for Technical Document Classification
par: Jiang, Shuo, et autres
Publié: (2021)
par: Jiang, Shuo, et autres
Publié: (2021)
Sculpting the Vector Space: Towards Efficient Multi-Vector Visual Document Retrieval via Prune-then-Merge Framework
par: Yan, Yibo, et autres
Publié: (2026)
par: Yan, Yibo, et autres
Publié: (2026)
Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval
par: Kong, Fanheng, et autres
Publié: (2025)
par: Kong, Fanheng, et autres
Publié: (2025)
Very Efficient Listwise Multimodal Reranking for Long Documents
par: Sun, Yiqun, et autres
Publié: (2026)
par: Sun, Yiqun, et autres
Publié: (2026)
Documents similaires
-
Fetch-A-Set: A Large-Scale OCR-Free Benchmark for Historical Document Retrieval
par: Molina, Adrià, et autres
Publié: (2024) -
ERPA: Efficient RPA Model Integrating OCR and LLMs for Intelligent Document Processing
par: Abdellaif, Osama, et autres
Publié: (2024) -
GraphRevisedIE: Multimodal Information Extraction with Graph-Revised Network
par: Cao, Panfeng, et autres
Publié: (2024) -
VKIE: The Application of Key Information Extraction on Video Text
par: An, Siyu, et autres
Publié: (2023) -
Benchmarking Document Parsers on Mathematical Formula Extraction from PDFs
par: Horn, Pius, et autres
Publié: (2025)