Judge a Book by its Cover: Investigating Multi-Modal LLMs for Multi-Page Handwritten Document Transcription
Fuente:
arXiv
Salvato in:
| Autori principali: | Gutteridge, Benjamin, Jackson, Matthew Thomas, Kukurin, Toni, Dong, Xiaowen |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SimpleDoc: Multi-Modal Document Understanding with Dual-Cue Page Retrieval and Iterative Refinement
di: Jain, Chelsi, et al.
Pubblicazione: (2025)
di: Jain, Chelsi, et al.
Pubblicazione: (2025)
ProJudge: A Multi-Modal Multi-Discipline Benchmark and Instruction-Tuning Dataset for MLLM-based Process Judges
di: Ai, Jiaxin, et al.
Pubblicazione: (2025)
di: Ai, Jiaxin, et al.
Pubblicazione: (2025)
InkFM: A Foundational Model for Full-Page Online Handwritten Note Understanding
di: Fadeeva, Anastasiia, et al.
Pubblicazione: (2025)
di: Fadeeva, Anastasiia, et al.
Pubblicazione: (2025)
Robustness Evaluation of OCR-based Visual Document Understanding under Multi-Modal Adversarial Attacks
di: Tien, Dong Nguyen, et al.
Pubblicazione: (2025)
di: Tien, Dong Nguyen, et al.
Pubblicazione: (2025)
Seeing the Big Picture: Evaluating Multimodal LLMs' Ability to Interpret and Grade Handwritten Student Work
di: Henkel, Owen, et al.
Pubblicazione: (2025)
di: Henkel, Owen, et al.
Pubblicazione: (2025)
Calibrating Uncertainty Quantification of Multi-Modal LLMs using Grounding
di: Padhi, Trilok, et al.
Pubblicazione: (2025)
di: Padhi, Trilok, et al.
Pubblicazione: (2025)
Handwritten Text Recognition: A Survey
di: Garrido-Munoz, Carlos, et al.
Pubblicazione: (2025)
di: Garrido-Munoz, Carlos, et al.
Pubblicazione: (2025)
End-to-End Multi-Modal Diffusion Mamba
di: Lu, Chunhao, et al.
Pubblicazione: (2025)
di: Lu, Chunhao, et al.
Pubblicazione: (2025)
DohaScript: A Large-Scale Multi-Writer Dataset for Continuous Handwritten Hindi Text
di: Singh, Kunwar Arpit, et al.
Pubblicazione: (2026)
di: Singh, Kunwar Arpit, et al.
Pubblicazione: (2026)
DocR1: Evidence Page-Guided GRPO for Multi-Page Document Understanding
di: Xiong, Junyu, et al.
Pubblicazione: (2025)
di: Xiong, Junyu, et al.
Pubblicazione: (2025)
Use of Metric Learning for the Recognition of Handwritten Digits, and its Application to Increase the Outreach of Voice-based Communication Platforms
di: Pant, Devesh, et al.
Pubblicazione: (2025)
di: Pant, Devesh, et al.
Pubblicazione: (2025)
Hydra-Bench: A Benchmark for Multi-Modal Leaf Wetness Sensing
di: Liu, Yimeng, et al.
Pubblicazione: (2025)
di: Liu, Yimeng, et al.
Pubblicazione: (2025)
Beyond CNNs: Efficient Fine-Tuning of Multi-Modal LLMs for Object Detection on Low-Data Regimes
di: Elamon, Nirmal, et al.
Pubblicazione: (2025)
di: Elamon, Nirmal, et al.
Pubblicazione: (2025)
PLATTER: A Page-Level Handwritten Text Recognition System for Indic Scripts
di: Kasuba, Badri Vishal, et al.
Pubblicazione: (2025)
di: Kasuba, Badri Vishal, et al.
Pubblicazione: (2025)
Multi-Modal Foundation Models for Computational Pathology: A Survey
di: Li, Dong, et al.
Pubblicazione: (2025)
di: Li, Dong, et al.
Pubblicazione: (2025)
MMPB: It's Time for Multi-Modal Personalization
di: Kim, Jaeik, et al.
Pubblicazione: (2025)
di: Kim, Jaeik, et al.
Pubblicazione: (2025)
ProReason: Multi-Modal Proactive Reasoning with Decoupled Eyesight and Wisdom
di: Zhou, Jingqi, et al.
Pubblicazione: (2024)
di: Zhou, Jingqi, et al.
Pubblicazione: (2024)
AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning
di: Zhong, Yiwu, et al.
Pubblicazione: (2024)
di: Zhong, Yiwu, et al.
Pubblicazione: (2024)
PAD: Phase-Amplitude Decoupling Fusion for Multi-Modal Land Cover Classification
di: Zheng, Huiling, et al.
Pubblicazione: (2025)
di: Zheng, Huiling, et al.
Pubblicazione: (2025)
M3D-BFS: a Multi-stage Dynamic Fusion Strategy for Sample-Adaptive Multi-Modal Brain Network Analysis
di: Dong, Rui, et al.
Pubblicazione: (2026)
di: Dong, Rui, et al.
Pubblicazione: (2026)
MM-R5: MultiModal Reasoning-Enhanced ReRanker via Reinforcement Learning for Document Retrieval
di: Xu, Mingjun, et al.
Pubblicazione: (2025)
di: Xu, Mingjun, et al.
Pubblicazione: (2025)
Hydra: Accurate Multi-Modal Leaf Wetness Sensing with mm-Wave and Camera Fusion
di: Liu, Yimeng, et al.
Pubblicazione: (2025)
di: Liu, Yimeng, et al.
Pubblicazione: (2025)
MultiOOD: Scaling Out-of-Distribution Detection for Multiple Modalities
di: Dong, Hao, et al.
Pubblicazione: (2024)
di: Dong, Hao, et al.
Pubblicazione: (2024)
Towards Scalable Training for Handwritten Mathematical Expression Recognition
di: Li, Haoyang, et al.
Pubblicazione: (2025)
di: Li, Haoyang, et al.
Pubblicazione: (2025)
MMHMER:Multi-viewer and Multi-task for Handwritten Mathematical Expression Recognition
di: Chen, Kehua, et al.
Pubblicazione: (2025)
di: Chen, Kehua, et al.
Pubblicazione: (2025)
μgat: Improving Single-Page Document Parsing by Providing Multi-Page Context
di: Quattrini, Fabio, et al.
Pubblicazione: (2024)
di: Quattrini, Fabio, et al.
Pubblicazione: (2024)
Multi-Modal interpretable automatic video captioning
di: Hanna-Asaad, Antoine, et al.
Pubblicazione: (2024)
di: Hanna-Asaad, Antoine, et al.
Pubblicazione: (2024)
Learning Progressive Adaptation for Multi-Modal Tracking
di: Wang, He, et al.
Pubblicazione: (2026)
di: Wang, He, et al.
Pubblicazione: (2026)
A Unified Model for Longitudinal Multi-Modal Multi-View Prediction with Missingness
di: Chen, Boqi, et al.
Pubblicazione: (2024)
di: Chen, Boqi, et al.
Pubblicazione: (2024)
DPO Learning with LLMs-Judge Signal for Computer Use Agents
di: Luo, Man, et al.
Pubblicazione: (2025)
di: Luo, Man, et al.
Pubblicazione: (2025)
MMXU: A Multi-Modal and Multi-X-ray Understanding Dataset for Disease Progression
di: Mu, Linjie, et al.
Pubblicazione: (2025)
di: Mu, Linjie, et al.
Pubblicazione: (2025)
VATr++: Choose Your Words Wisely for Handwritten Text Generation
di: Vanherle, Bram, et al.
Pubblicazione: (2024)
di: Vanherle, Bram, et al.
Pubblicazione: (2024)
Can AI Assistance Aid in the Grading of Handwritten Answer Sheets?
di: Sil, Pritam, et al.
Pubblicazione: (2024)
di: Sil, Pritam, et al.
Pubblicazione: (2024)
Enhanced OoD Detection through Cross-Modal Alignment of Multi-Modal Representations
di: Kim, Jeonghyeon, et al.
Pubblicazione: (2025)
di: Kim, Jeonghyeon, et al.
Pubblicazione: (2025)
MammothModa: Multi-Modal Large Language Model
di: She, Qi, et al.
Pubblicazione: (2024)
di: She, Qi, et al.
Pubblicazione: (2024)
Multi-Prompt with Depth Partitioned Cross-Modal Learning
di: Tian, Yingjie, et al.
Pubblicazione: (2023)
di: Tian, Yingjie, et al.
Pubblicazione: (2023)
Unveiling Ontological Commitment in Multi-Modal Foundation Models
di: Keser, Mert, et al.
Pubblicazione: (2024)
di: Keser, Mert, et al.
Pubblicazione: (2024)
A Generalized Multi-Modal Fusion Detection Framework
di: Cui, Leichao, et al.
Pubblicazione: (2023)
di: Cui, Leichao, et al.
Pubblicazione: (2023)
AVIR: Adaptive Visual In-Document Retrieval for Efficient Multi-Page Document Question Answering
di: Li, Zongmin, et al.
Pubblicazione: (2026)
di: Li, Zongmin, et al.
Pubblicazione: (2026)
Multi-modal Generative AI: Multi-modal LLMs, Diffusions, and the Unification
di: Wang, Xin, et al.
Pubblicazione: (2024)
di: Wang, Xin, et al.
Pubblicazione: (2024)
Documenti analoghi
-
SimpleDoc: Multi-Modal Document Understanding with Dual-Cue Page Retrieval and Iterative Refinement
di: Jain, Chelsi, et al.
Pubblicazione: (2025) -
ProJudge: A Multi-Modal Multi-Discipline Benchmark and Instruction-Tuning Dataset for MLLM-based Process Judges
di: Ai, Jiaxin, et al.
Pubblicazione: (2025) -
InkFM: A Foundational Model for Full-Page Online Handwritten Note Understanding
di: Fadeeva, Anastasiia, et al.
Pubblicazione: (2025) -
Robustness Evaluation of OCR-based Visual Document Understanding under Multi-Modal Adversarial Attacks
di: Tien, Dong Nguyen, et al.
Pubblicazione: (2025) -
Seeing the Big Picture: Evaluating Multimodal LLMs' Ability to Interpret and Grade Handwritten Student Work
di: Henkel, Owen, et al.
Pubblicazione: (2025)