FP-THD: Full page transcription of historical documents
Fuente:
arXiv
Salvato in:
| Autori principali: | Neji, H, Nogueras-Iso, J, Lacasta, J, Latre, MÁ, García-Marco, FJ |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
HQ-DiT: Efficient Diffusion Transformer with FP4 Hybrid Quantization
di: Liu, Wenxuan, et al.
Pubblicazione: (2024)
di: Liu, Wenxuan, et al.
Pubblicazione: (2024)
M3DocRAG: Multi-modal Retrieval is What You Need for Multi-page Multi-document Understanding
di: Cho, Jaemin, et al.
Pubblicazione: (2024)
di: Cho, Jaemin, et al.
Pubblicazione: (2024)
ViFP: A Framework for Visual False Positive Detection to Enhance Reasoning Reliability in VLMs
di: Zhang, Ben, et al.
Pubblicazione: (2025)
di: Zhang, Ben, et al.
Pubblicazione: (2025)
DuQuant++: Fine-grained Rotation Enhances Microscaling FP4 Quantization
di: Lin, Haokun, et al.
Pubblicazione: (2026)
di: Lin, Haokun, et al.
Pubblicazione: (2026)
A document is worth a structured record: Principled inductive bias design for document recognition
di: Meyer, Benjamin, et al.
Pubblicazione: (2025)
di: Meyer, Benjamin, et al.
Pubblicazione: (2025)
AI Approach for MRI-only Full-Spine Vertebral Segmentation and 3D Reconstruction in Paediatric Scoliosis
di: Naranpanawa, Nathasha, et al.
Pubblicazione: (2026)
di: Naranpanawa, Nathasha, et al.
Pubblicazione: (2026)
LLM-FP4: 4-Bit Floating-Point Quantized Transformers
di: Liu, Shih-yang, et al.
Pubblicazione: (2023)
di: Liu, Shih-yang, et al.
Pubblicazione: (2023)
Kyrtos: A methodology for automatic deep analysis of graphic charts with curves in technical documents
di: Alexiou, Michail S., et al.
Pubblicazione: (2026)
di: Alexiou, Michail S., et al.
Pubblicazione: (2026)
FP4 Explore, BF16 Train: Diffusion Reinforcement Learning via Efficient Rollout Scaling
di: Li, Yitong, et al.
Pubblicazione: (2026)
di: Li, Yitong, et al.
Pubblicazione: (2026)
Global-Local Medical SAM Adaptor Based on Full Adaption
di: Wang, Meng, et al.
Pubblicazione: (2024)
di: Wang, Meng, et al.
Pubblicazione: (2024)
My Body My Choice: Human-Centric Full-Body Anonymization
di: Ciftci, Umur Aybars, et al.
Pubblicazione: (2024)
di: Ciftci, Umur Aybars, et al.
Pubblicazione: (2024)
F3G-Avatar : Face Focused Full-body Gaussian Avatar
di: Menu, Willem, et al.
Pubblicazione: (2026)
di: Menu, Willem, et al.
Pubblicazione: (2026)
EgoExo-Fitness: Towards Egocentric and Exocentric Full-Body Action Understanding
di: Li, Yuan-Ming, et al.
Pubblicazione: (2024)
di: Li, Yuan-Ming, et al.
Pubblicazione: (2024)
HIMO: A New Benchmark for Full-Body Human Interacting with Multiple Objects
di: Lv, Xintao, et al.
Pubblicazione: (2024)
di: Lv, Xintao, et al.
Pubblicazione: (2024)
Causal Disentanglement-Inspired Degradation Representation Learning for Full-Reference Image Quality Assessment
di: Zhang, Zhen, et al.
Pubblicazione: (2026)
di: Zhang, Zhen, et al.
Pubblicazione: (2026)
Bridge the Gap: From Weak to Full Supervision for Temporal Action Localization with PseudoFormer
di: Liu, Ziyi, et al.
Pubblicazione: (2025)
di: Liu, Ziyi, et al.
Pubblicazione: (2025)
Text-based Person Search in Full Images via Semantic-Driven Proposal Generation
di: Zhang, Shizhou, et al.
Pubblicazione: (2021)
di: Zhang, Shizhou, et al.
Pubblicazione: (2021)
Towards Full-parameter and Parameter-efficient Self-learning For Endoscopic Camera Depth Estimation
di: Zhao, Shuting, et al.
Pubblicazione: (2024)
di: Zhao, Shuting, et al.
Pubblicazione: (2024)
Virtual Full-stack Scanning of Brain MRI via Imputing Any Quantised Code
di: Wu, Yicheng, et al.
Pubblicazione: (2025)
di: Wu, Yicheng, et al.
Pubblicazione: (2025)
Robust Multispectral Semantic Segmentation under Missing or Full Modalities via Structured Latent Projection
di: Ulku, Irem, et al.
Pubblicazione: (2026)
di: Ulku, Irem, et al.
Pubblicazione: (2026)
FullFlow: Upgrading Text-to-Image Flow Matching Models for Bidirectional Vision--Language Generation
di: Bill, Eric Tillmann, et al.
Pubblicazione: (2026)
di: Bill, Eric Tillmann, et al.
Pubblicazione: (2026)
TruePose: Human-Parsing-guided Attention Diffusion for Full-ID Preserving Pose Transfer
di: Xu, Zhihong, et al.
Pubblicazione: (2025)
di: Xu, Zhihong, et al.
Pubblicazione: (2025)
Leveraging AI Predicted and Expert Revised Annotations in Interactive Segmentation: Continual Tuning or Full Training?
di: Zhang, Tiezheng, et al.
Pubblicazione: (2024)
di: Zhang, Tiezheng, et al.
Pubblicazione: (2024)
MQuant: Unleashing the Inference Potential of Multimodal Large Language Models via Full Static Quantization
di: Yu, JiangYong, et al.
Pubblicazione: (2025)
di: Yu, JiangYong, et al.
Pubblicazione: (2025)
Fair-Eye Net: A Fair, Trustworthy, Multimodal Integrated Glaucoma Full Chain AI System
di: Wei, Wenbin, et al.
Pubblicazione: (2026)
di: Wei, Wenbin, et al.
Pubblicazione: (2026)
Bee: A High-Quality Corpus and Full-Stack Suite to Unlock Advanced Fully Open MLLMs
di: Zhang, Yi, et al.
Pubblicazione: (2025)
di: Zhang, Yi, et al.
Pubblicazione: (2025)
GEM-TFL: Bridging Weak and Full Supervision for Forgery Localization through EM-Guided Decomposition and Temporal Refinement
di: Zhu, Xiaodong, et al.
Pubblicazione: (2026)
di: Zhu, Xiaodong, et al.
Pubblicazione: (2026)
Accelerating Diffusion-based Video Editing via Heterogeneous Caching: Beyond Full Computing at Sampled Denoising Timestep
di: Liu, Tianyi, et al.
Pubblicazione: (2026)
di: Liu, Tianyi, et al.
Pubblicazione: (2026)
Cheating Stereo Matching in Full-scale: Physical Adversarial Attack against Binocular Depth Estimation in Autonomous Driving
di: Zhao, Kangqiao, et al.
Pubblicazione: (2025)
di: Zhao, Kangqiao, et al.
Pubblicazione: (2025)
Towards Full-scene Domain Generalization in Multi-agent Collaborative Bird's Eye View Segmentation for Connected and Autonomous Driving
di: Hu, Senkang, et al.
Pubblicazione: (2023)
di: Hu, Senkang, et al.
Pubblicazione: (2023)
A Full-Stage Refined Proposal Algorithm for Suppressing False Positives in Two-Stage CNN-Based Detection Methods
di: Guo, Qiang, et al.
Pubblicazione: (2025)
di: Guo, Qiang, et al.
Pubblicazione: (2025)
OPENTOUCH: Bringing Full-Hand Touch to Real-World Interaction
di: Song, Yuxin Ray, et al.
Pubblicazione: (2025)
di: Song, Yuxin Ray, et al.
Pubblicazione: (2025)
Full end-to-end diagnostic workflow automation of 3D OCT via foundation model-driven AI for retinal diseases
di: Zhang, Jinze, et al.
Pubblicazione: (2026)
di: Zhang, Jinze, et al.
Pubblicazione: (2026)
PersonaCraft: Personalized and Controllable Full-Body Multi-Human Scene Generation Using Occlusion-Aware 3D-Conditioned Diffusion
di: Kim, Gwanghyun, et al.
Pubblicazione: (2024)
di: Kim, Gwanghyun, et al.
Pubblicazione: (2024)
MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders
di: Cao, Jiajun, et al.
Pubblicazione: (2025)
di: Cao, Jiajun, et al.
Pubblicazione: (2025)
TaskGround: Structured Executable Task Inference for Full-Scene Household Reasoning
di: Feng, ZhiYuan, et al.
Pubblicazione: (2026)
di: Feng, ZhiYuan, et al.
Pubblicazione: (2026)
WiGNet: Windowed Vision Graph Neural Network
di: Spadaro, Gabriele, et al.
Pubblicazione: (2024)
di: Spadaro, Gabriele, et al.
Pubblicazione: (2024)
The future of document indexing: GPT and Donut revolutionize table of content processing
di: Feyisa, Degaga Wolde, et al.
Pubblicazione: (2024)
di: Feyisa, Degaga Wolde, et al.
Pubblicazione: (2024)
RandLoRA: Full-rank parameter-efficient fine-tuning of large models
di: Albert, Paul, et al.
Pubblicazione: (2025)
di: Albert, Paul, et al.
Pubblicazione: (2025)
Attention-based multiple instance learning for predominant growth pattern prediction in lung adenocarcinoma wsi using foundation models
di: Perez-Herrera, Laura Valeria, et al.
Pubblicazione: (2026)
di: Perez-Herrera, Laura Valeria, et al.
Pubblicazione: (2026)
Documenti analoghi
-
HQ-DiT: Efficient Diffusion Transformer with FP4 Hybrid Quantization
di: Liu, Wenxuan, et al.
Pubblicazione: (2024) -
M3DocRAG: Multi-modal Retrieval is What You Need for Multi-page Multi-document Understanding
di: Cho, Jaemin, et al.
Pubblicazione: (2024) -
ViFP: A Framework for Visual False Positive Detection to Enhance Reasoning Reliability in VLMs
di: Zhang, Ben, et al.
Pubblicazione: (2025) -
DuQuant++: Fine-grained Rotation Enhances Microscaling FP4 Quantization
di: Lin, Haokun, et al.
Pubblicazione: (2026) -
A document is worth a structured record: Principled inductive bias design for document recognition
di: Meyer, Benjamin, et al.
Pubblicazione: (2025)