Handheld Video Document Scanning: A Robust On-Device Model for Multi-Page Document Scanning
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Wigington, Curtis |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DocSynthv2: A Practical Autoregressive Modeling for Document Generation
par: Biswas, Sanket, et autres
Publié: (2024)
par: Biswas, Sanket, et autres
Publié: (2024)
Transformers and Language Models in Form Understanding: A Comprehensive Review of Scanned Document Analysis
par: Abdallah, Abdelrahman, et autres
Publié: (2024)
par: Abdallah, Abdelrahman, et autres
Publié: (2024)
BiblioPage: A Dataset of Scanned Title Pages for Bibliographic Metadata Extraction
par: Kohút, Jan, et autres
Publié: (2025)
par: Kohút, Jan, et autres
Publié: (2025)
DocR1: Evidence Page-Guided GRPO for Multi-Page Document Understanding
par: Xiong, Junyu, et autres
Publié: (2025)
par: Xiong, Junyu, et autres
Publié: (2025)
AVIR: Adaptive Visual In-Document Retrieval for Efficient Multi-Page Document Question Answering
par: Li, Zongmin, et autres
Publié: (2026)
par: Li, Zongmin, et autres
Publié: (2026)
Partial Ring Scan: Revisiting Scan Order in Vision State Space Models
par: Hsieh, Yi-Kuan, et autres
Publié: (2026)
par: Hsieh, Yi-Kuan, et autres
Publié: (2026)
ScanFormer: Referring Expression Comprehension by Iteratively Scanning
par: Su, Wei, et autres
Publié: (2024)
par: Su, Wei, et autres
Publié: (2024)
Blurred LiDAR for Sharper 3D: Robust Handheld 3D Scanning with Diffuse LiDAR and RGB
par: Behari, Nikhil, et autres
Publié: (2024)
par: Behari, Nikhil, et autres
Publié: (2024)
A Multistage Extraction Pipeline for Long Scanned Financial Documents: An Empirical Study in Industrial KYC Workflows
par: Han, Yuxuan, et autres
Publié: (2026)
par: Han, Yuxuan, et autres
Publié: (2026)
DocParseNet: Advanced Semantic Segmentation and OCR Embeddings for Efficient Scanned Document Annotation
par: Mohammadshirazi, Ahmad, et autres
Publié: (2024)
par: Mohammadshirazi, Ahmad, et autres
Publié: (2024)
CT Scans As Video: Efficient Intracranial Hemorrhage Detection Using Multi-Object Tracking
par: Parvahan, Amirreza, et autres
Publié: (2026)
par: Parvahan, Amirreza, et autres
Publié: (2026)
μgat: Improving Single-Page Document Parsing by Providing Multi-Page Context
par: Quattrini, Fabio, et autres
Publié: (2024)
par: Quattrini, Fabio, et autres
Publié: (2024)
ScanTalk: 3D Talking Heads from Unregistered Scans
par: Nocentini, Federico, et autres
Publié: (2024)
par: Nocentini, Federico, et autres
Publié: (2024)
ScanEdit: Hierarchically-Guided Functional 3D Scan Editing
par: Boudjoghra, Mohamed el amine, et autres
Publié: (2025)
par: Boudjoghra, Mohamed el amine, et autres
Publié: (2025)
ARTIST: Improving the Generation of Text-rich Images with Disentangled Diffusion Models and Large Language Models
par: Zhang, Jianyi, et autres
Publié: (2024)
par: Zhang, Jianyi, et autres
Publié: (2024)
MambaVSR: Content-Aware Scanning State Space Model for Video Super-Resolution
par: He, Linfeng, et autres
Publié: (2025)
par: He, Linfeng, et autres
Publié: (2025)
SelfHVD: Self-Supervised Handheld Video Deblurring
par: Xu, Honglei, et autres
Publié: (2025)
par: Xu, Honglei, et autres
Publié: (2025)
Generating Fit Check Videos with a Handheld Camera
par: Chen, Bowei, et autres
Publié: (2025)
par: Chen, Bowei, et autres
Publié: (2025)
BIMBA: Selective-Scan Compression for Long-Range Video Question Answering
par: Islam, Md Mohaiminul, et autres
Publié: (2025)
par: Islam, Md Mohaiminul, et autres
Publié: (2025)
Multi-Page Document Visual Question Answering using Self-Attention Scoring Mechanism
par: Kang, Lei, et autres
Publié: (2024)
par: Kang, Lei, et autres
Publié: (2024)
From Scan to Action: Leveraging Realistic Scans for Embodied Scene Understanding
par: Halacheva, Anna-Maria, et autres
Publié: (2025)
par: Halacheva, Anna-Maria, et autres
Publié: (2025)
ABMAMBA: Multimodal Large Language Model with Aligned Hierarchical Bidirectional Scan for Efficient Video Captioning
par: Yashima, Daichi, et autres
Publié: (2026)
par: Yashima, Daichi, et autres
Publié: (2026)
Infinity Parser: Layout Aware Reinforcement Learning for Scanned Document Parsing
par: Wang, Baode, et autres
Publié: (2025)
par: Wang, Baode, et autres
Publié: (2025)
FoodTrack: Estimating Handheld Food Portions with Egocentric Video
par: Wang, Ervin, et autres
Publié: (2025)
par: Wang, Ervin, et autres
Publié: (2025)
Fast and Robust Normal Estimation for Sparse LiDAR Scans
par: Bogoslavskyi, Igor, et autres
Publié: (2024)
par: Bogoslavskyi, Igor, et autres
Publié: (2024)
VideoScan: Enabling Efficient Streaming Video Understanding via Frame-level Semantic Carriers
par: Li, Ruanjun, et autres
Publié: (2025)
par: Li, Ruanjun, et autres
Publié: (2025)
FastCAD: Real-Time CAD Retrieval and Alignment from Scans and Videos
par: Langer, Florian, et autres
Publié: (2024)
par: Langer, Florian, et autres
Publié: (2024)
SynJAC: Synthetic-data-driven Joint-granular Adaptation and Calibration for Domain Specific Scanned Document Key Information Extraction
par: Ding, Yihao, et autres
Publié: (2024)
par: Ding, Yihao, et autres
Publié: (2024)
Scalable Visual State Space Model with Fractal Scanning
par: Tang, Lv, et autres
Publié: (2024)
par: Tang, Lv, et autres
Publié: (2024)
Vision Transformer with Sparse Scan Prior
par: Zhang, Yuguang, et autres
Publié: (2024)
par: Zhang, Yuguang, et autres
Publié: (2024)
From Brainwaves to Brain Scans: A Robust Neural Network for EEG-to-fMRI Synthesis
par: Roos, Kristofer Grover, et autres
Publié: (2025)
par: Roos, Kristofer Grover, et autres
Publié: (2025)
SFA: Scan, Focus, and Amplify toward Guidance-aware Answering for Video TextVQA
par: He, Haibin, et autres
Publié: (2025)
par: He, Haibin, et autres
Publié: (2025)
Scanning Only Once: An End-to-end Framework for Fast Temporal Grounding in Long Videos
par: Pan, Yulin, et autres
Publié: (2023)
par: Pan, Yulin, et autres
Publié: (2023)
MFil-Mamba: Multi-Filter Scanning for Spatial Redundancy-Aware Visual State Space Models
par: Khadka, Puskal, et autres
Publié: (2026)
par: Khadka, Puskal, et autres
Publié: (2026)
Diffusion-based Aesthetic QR Code Generation via Scanning-Robust Perceptual Guidance
par: Liao, Jia-Wei, et autres
Publié: (2024)
par: Liao, Jia-Wei, et autres
Publié: (2024)
TextBite: A Historical Czech Document Dataset for Logical Page Segmentation
par: Kostelník, Martin, et autres
Publié: (2025)
par: Kostelník, Martin, et autres
Publié: (2025)
DAMamba: Vision State Space Model with Dynamic Adaptive Scan
par: Li, Tanzhe, et autres
Publié: (2025)
par: Li, Tanzhe, et autres
Publié: (2025)
You Only Scan Once: Efficient Multi-dimension Sequential Modeling with LightNet
par: Qin, Zhen, et autres
Publié: (2024)
par: Qin, Zhen, et autres
Publié: (2024)
BadScan: An Architectural Backdoor Attack on Visual State Space Models
par: Deshmukh, Om Suhas, et autres
Publié: (2024)
par: Deshmukh, Om Suhas, et autres
Publié: (2024)
Silhouette-to-Contour Registration: Aligning Intraoral Scan Models with Cephalometric Radiographs
par: Miao, Yiyi, et autres
Publié: (2025)
par: Miao, Yiyi, et autres
Publié: (2025)
Documents similaires
-
DocSynthv2: A Practical Autoregressive Modeling for Document Generation
par: Biswas, Sanket, et autres
Publié: (2024) -
Transformers and Language Models in Form Understanding: A Comprehensive Review of Scanned Document Analysis
par: Abdallah, Abdelrahman, et autres
Publié: (2024) -
BiblioPage: A Dataset of Scanned Title Pages for Bibliographic Metadata Extraction
par: Kohút, Jan, et autres
Publié: (2025) -
DocR1: Evidence Page-Guided GRPO for Multi-Page Document Understanding
par: Xiong, Junyu, et autres
Publié: (2025) -
AVIR: Adaptive Visual In-Document Retrieval for Efficient Multi-Page Document Question Answering
par: Li, Zongmin, et autres
Publié: (2026)