Saved in:
| Main Authors: | Khanchandani, Khushi, Thakur, Advait, Shetty, Akshita, Reddy, Chaitravi, Behera, Ritisa |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2511.05547 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Design and Implementation of an OCR-Powered Pipeline for Table Extraction from Invoices
by: Patel, Parshva Dhilankumar
Published: (2025)
by: Patel, Parshva Dhilankumar
Published: (2025)
Arabic-Nougat: Fine-Tuning Vision Transformers for Arabic OCR and Markdown Extraction
by: Rashad, Mohamed
Published: (2024)
by: Rashad, Mohamed
Published: (2024)
Towards Label-Free Single-Cell Phenotyping Using Multi-Task Learning
by: Nazir, Saqib, et al.
Published: (2026)
by: Nazir, Saqib, et al.
Published: (2026)
Automated Wicket-Taking Delivery Segmentation and Trajectory-Based Dismissal-Zone Analysis in Cricket Videos Using OCR-Guided YOLOv8
by: Karmoker, Joy, et al.
Published: (2025)
by: Karmoker, Joy, et al.
Published: (2025)
OCR-Quality: A Human-Annotated Dataset for OCR Quality Assessment
by: Zhang, Yulong
Published: (2025)
by: Zhang, Yulong
Published: (2025)
HunyuanOCR Technical Report
by: Hunyuan Vision Team, et al.
Published: (2025)
by: Hunyuan Vision Team, et al.
Published: (2025)
AtlasOCR: Building the First Open-Source Darija OCR Model with Vision Language Models
by: Momayiz, Imane, et al.
Published: (2026)
by: Momayiz, Imane, et al.
Published: (2026)
MAE-Based Self-Supervised Pretraining for Data-Efficient Medical Image Segmentation Using nnFormer
by: Sureddi, R. M. Krishna, et al.
Published: (2026)
by: Sureddi, R. M. Krishna, et al.
Published: (2026)
Automated Parsing of Engineering Drawings for Structured Information Extraction Using a Fine-tuned Document Understanding Transformer
by: Khan, Muhammad Tayyab, et al.
Published: (2025)
by: Khan, Muhammad Tayyab, et al.
Published: (2025)
Mero Nagarikta: Advanced Nepali Citizenship Data Extractor with Deep Learning-Powered Text Detection and OCR
by: Dhakal, Sisir, et al.
Published: (2024)
by: Dhakal, Sisir, et al.
Published: (2024)
BRITE: A Benchmark for Reliable and Interpretable T2V Evaluation on Implausible Scenarios
by: Tilak, Advait, et al.
Published: (2026)
by: Tilak, Advait, et al.
Published: (2026)
Adaptive Signal Analysis for Automated Subsurface Defect Detection Using Impact Echo in Concrete Slabs
by: Pavurala, Deepthi, et al.
Published: (2024)
by: Pavurala, Deepthi, et al.
Published: (2024)
InstructOCR: Instruction Boosting Scene Text Spotting
by: Duan, Chen, et al.
Published: (2024)
by: Duan, Chen, et al.
Published: (2024)
DharmaOCR: Specialized Small Language Models for Structured OCR that outperform Open-Source and Commercial Baselines
by: Cardoso, Gabriel Pimenta de Freitas, et al.
Published: (2026)
by: Cardoso, Gabriel Pimenta de Freitas, et al.
Published: (2026)
Re-Identifying Kākā with AI-Automated Video Key Frame Extraction
by: Maddigan, Paula, et al.
Published: (2025)
by: Maddigan, Paula, et al.
Published: (2025)
Leveraging Vision Capabilities of Multimodal LLMs for Automated Data Extraction from Plots
by: Polak, Maciej P., et al.
Published: (2025)
by: Polak, Maciej P., et al.
Published: (2025)
Evaluating OCR performance on food packaging labels in South Africa
by: Nagayi, Mayimunah, et al.
Published: (2025)
by: Nagayi, Mayimunah, et al.
Published: (2025)
Fine-Tuning Vision-Language Model for Automated Engineering Drawing Information Extraction
by: Khan, Muhammad Tayyab, et al.
Published: (2024)
by: Khan, Muhammad Tayyab, et al.
Published: (2024)
Real-Time Weapon Detection Using YOLOv8 for Enhanced Safety
by: Thakur, Ayush, et al.
Published: (2024)
by: Thakur, Ayush, et al.
Published: (2024)
Confidence-Aware Document OCR Error Detection
by: Hemmer, Arthur, et al.
Published: (2024)
by: Hemmer, Arthur, et al.
Published: (2024)
Q-FSRU: Quantum-Augmented Frequency-Spectral Fusion for Medical Visual Question Answering
by: Thakur, Rakesh, et al.
Published: (2025)
by: Thakur, Rakesh, et al.
Published: (2025)
Lost in OCR Translation? Vision-Based Approaches to Robust Document Retrieval
by: Most, Alexander, et al.
Published: (2025)
by: Most, Alexander, et al.
Published: (2025)
Designing Production-Scale OCR for India: Multilingual and Domain-Specific Systems
by: Faraz, Ali, et al.
Published: (2026)
by: Faraz, Ali, et al.
Published: (2026)
TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document
by: Liu, Yuliang, et al.
Published: (2024)
by: Liu, Yuliang, et al.
Published: (2024)
YOLOv8-Based Deep Learning Model for Automated Poultry Disease Detection and Health Monitoring paper
by: Sabbella, Akhil Saketh Reddy, et al.
Published: (2025)
by: Sabbella, Akhil Saketh Reddy, et al.
Published: (2025)
Adversarial Training with OCR Modality Perturbation for Scene-Text Visual Question Answering
by: Shen, Zhixuan, et al.
Published: (2024)
by: Shen, Zhixuan, et al.
Published: (2024)
VISTA: Visual Integrated System for Tailored Automation in Math Problem Generation Using LLM
by: Lee, Jeongwoo, et al.
Published: (2024)
by: Lee, Jeongwoo, et al.
Published: (2024)
ExTTNet: A Deep Learning Algorithm for Extracting Table Texts from Invoice Images
by: Akdoğan, Adem, et al.
Published: (2024)
by: Akdoğan, Adem, et al.
Published: (2024)
Seeing the Signs: A Survey of Edge-Deployable OCR Models for Billboard Visibility Analysis
by: Szankin, Maciej, et al.
Published: (2025)
by: Szankin, Maciej, et al.
Published: (2025)
A Novel AI-Driven System for Real-Time Detection of Mirror Absence, Helmet Non-Compliance, and License Plates Using YOLOv8 and OCR
by: Hegde, Nishant Vasantkumar, et al.
Published: (2025)
by: Hegde, Nishant Vasantkumar, et al.
Published: (2025)
Towards Automated Solar Panel Integrity: Hybrid Deep Feature Extraction for Advanced Surface Defect Identification
by: Asif, Muhammad Junaid, et al.
Published: (2026)
by: Asif, Muhammad Junaid, et al.
Published: (2026)
Reading or Reasoning? Format Decoupled Reinforcement Learning for Document OCR
by: Zhong, Yufeng, et al.
Published: (2025)
by: Zhong, Yufeng, et al.
Published: (2025)
Advanced Underwater Image Quality Enhancement via Hybrid Super-Resolution Convolutional Neural Networks and Multi-Scale Retinex-Based Defogging Techniques
by: Gogireddy, Yugandhar Reddy, et al.
Published: (2024)
by: Gogireddy, Yugandhar Reddy, et al.
Published: (2024)
Robustness Evaluation of OCR-based Visual Document Understanding under Multi-Modal Adversarial Attacks
by: Tien, Dong Nguyen, et al.
Published: (2025)
by: Tien, Dong Nguyen, et al.
Published: (2025)
SecurePose: Automated Face Blurring and Human Movement Kinematics Extraction from Videos Recorded in Clinical Settings
by: Bajpai, Rishabh, et al.
Published: (2024)
by: Bajpai, Rishabh, et al.
Published: (2024)
Beyond Diagnosis: Evaluating Multimodal LLMs for Pathology Localization in Chest Radiographs
by: Gosai, Advait, et al.
Published: (2025)
by: Gosai, Advait, et al.
Published: (2025)
MiSCHiEF: A Benchmark in Minimal-Pairs of Safety and Culture for Holistic Evaluation of Fine-Grained Image-Caption Alignment
by: Banerjee, Sagarika, et al.
Published: (2026)
by: Banerjee, Sagarika, et al.
Published: (2026)
Fine-tuning DeepSeek-OCR-2 for Molecular Structure Recognition
by: Tang, Haocheng, et al.
Published: (2026)
by: Tang, Haocheng, et al.
Published: (2026)
Deep Learning for Pavement Condition Evaluation Using Satellite Imagery
by: Lebaku, Prathyush Kumar Reddy, et al.
Published: (2025)
by: Lebaku, Prathyush Kumar Reddy, et al.
Published: (2025)
PsOCR: Benchmarking Large Multimodal Models for Optical Character Recognition in Low-resource Pashto Language
by: Haq, Ijazul, et al.
Published: (2025)
by: Haq, Ijazul, et al.
Published: (2025)
Similar Items
-
Design and Implementation of an OCR-Powered Pipeline for Table Extraction from Invoices
by: Patel, Parshva Dhilankumar
Published: (2025) -
Arabic-Nougat: Fine-Tuning Vision Transformers for Arabic OCR and Markdown Extraction
by: Rashad, Mohamed
Published: (2024) -
Towards Label-Free Single-Cell Phenotyping Using Multi-Task Learning
by: Nazir, Saqib, et al.
Published: (2026) -
Automated Wicket-Taking Delivery Segmentation and Trajectory-Based Dismissal-Zone Analysis in Cricket Videos Using OCR-Guided YOLOv8
by: Karmoker, Joy, et al.
Published: (2025) -
OCR-Quality: A Human-Annotated Dataset for OCR Quality Assessment
by: Zhang, Yulong
Published: (2025)