Judge a Book by its Cover: Investigating Multi-Modal LLMs for Multi-Page Handwritten Document Transcription
Fuente:
arXiv
Guardado en:
| Autores principales: | Gutteridge, Benjamin, Jackson, Matthew Thomas, Kukurin, Toni, Dong, Xiaowen |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SimpleDoc: Multi-Modal Document Understanding with Dual-Cue Page Retrieval and Iterative Refinement
por: Jain, Chelsi, et al.
Publicado: (2025)
por: Jain, Chelsi, et al.
Publicado: (2025)
ProJudge: A Multi-Modal Multi-Discipline Benchmark and Instruction-Tuning Dataset for MLLM-based Process Judges
por: Ai, Jiaxin, et al.
Publicado: (2025)
por: Ai, Jiaxin, et al.
Publicado: (2025)
InkFM: A Foundational Model for Full-Page Online Handwritten Note Understanding
por: Fadeeva, Anastasiia, et al.
Publicado: (2025)
por: Fadeeva, Anastasiia, et al.
Publicado: (2025)
Robustness Evaluation of OCR-based Visual Document Understanding under Multi-Modal Adversarial Attacks
por: Tien, Dong Nguyen, et al.
Publicado: (2025)
por: Tien, Dong Nguyen, et al.
Publicado: (2025)
Seeing the Big Picture: Evaluating Multimodal LLMs' Ability to Interpret and Grade Handwritten Student Work
por: Henkel, Owen, et al.
Publicado: (2025)
por: Henkel, Owen, et al.
Publicado: (2025)
Calibrating Uncertainty Quantification of Multi-Modal LLMs using Grounding
por: Padhi, Trilok, et al.
Publicado: (2025)
por: Padhi, Trilok, et al.
Publicado: (2025)
Handwritten Text Recognition: A Survey
por: Garrido-Munoz, Carlos, et al.
Publicado: (2025)
por: Garrido-Munoz, Carlos, et al.
Publicado: (2025)
End-to-End Multi-Modal Diffusion Mamba
por: Lu, Chunhao, et al.
Publicado: (2025)
por: Lu, Chunhao, et al.
Publicado: (2025)
DohaScript: A Large-Scale Multi-Writer Dataset for Continuous Handwritten Hindi Text
por: Singh, Kunwar Arpit, et al.
Publicado: (2026)
por: Singh, Kunwar Arpit, et al.
Publicado: (2026)
DocR1: Evidence Page-Guided GRPO for Multi-Page Document Understanding
por: Xiong, Junyu, et al.
Publicado: (2025)
por: Xiong, Junyu, et al.
Publicado: (2025)
Use of Metric Learning for the Recognition of Handwritten Digits, and its Application to Increase the Outreach of Voice-based Communication Platforms
por: Pant, Devesh, et al.
Publicado: (2025)
por: Pant, Devesh, et al.
Publicado: (2025)
Hydra-Bench: A Benchmark for Multi-Modal Leaf Wetness Sensing
por: Liu, Yimeng, et al.
Publicado: (2025)
por: Liu, Yimeng, et al.
Publicado: (2025)
Beyond CNNs: Efficient Fine-Tuning of Multi-Modal LLMs for Object Detection on Low-Data Regimes
por: Elamon, Nirmal, et al.
Publicado: (2025)
por: Elamon, Nirmal, et al.
Publicado: (2025)
PLATTER: A Page-Level Handwritten Text Recognition System for Indic Scripts
por: Kasuba, Badri Vishal, et al.
Publicado: (2025)
por: Kasuba, Badri Vishal, et al.
Publicado: (2025)
Multi-Modal Foundation Models for Computational Pathology: A Survey
por: Li, Dong, et al.
Publicado: (2025)
por: Li, Dong, et al.
Publicado: (2025)
MMPB: It's Time for Multi-Modal Personalization
por: Kim, Jaeik, et al.
Publicado: (2025)
por: Kim, Jaeik, et al.
Publicado: (2025)
ProReason: Multi-Modal Proactive Reasoning with Decoupled Eyesight and Wisdom
por: Zhou, Jingqi, et al.
Publicado: (2024)
por: Zhou, Jingqi, et al.
Publicado: (2024)
AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning
por: Zhong, Yiwu, et al.
Publicado: (2024)
por: Zhong, Yiwu, et al.
Publicado: (2024)
PAD: Phase-Amplitude Decoupling Fusion for Multi-Modal Land Cover Classification
por: Zheng, Huiling, et al.
Publicado: (2025)
por: Zheng, Huiling, et al.
Publicado: (2025)
M3D-BFS: a Multi-stage Dynamic Fusion Strategy for Sample-Adaptive Multi-Modal Brain Network Analysis
por: Dong, Rui, et al.
Publicado: (2026)
por: Dong, Rui, et al.
Publicado: (2026)
MM-R5: MultiModal Reasoning-Enhanced ReRanker via Reinforcement Learning for Document Retrieval
por: Xu, Mingjun, et al.
Publicado: (2025)
por: Xu, Mingjun, et al.
Publicado: (2025)
Hydra: Accurate Multi-Modal Leaf Wetness Sensing with mm-Wave and Camera Fusion
por: Liu, Yimeng, et al.
Publicado: (2025)
por: Liu, Yimeng, et al.
Publicado: (2025)
MultiOOD: Scaling Out-of-Distribution Detection for Multiple Modalities
por: Dong, Hao, et al.
Publicado: (2024)
por: Dong, Hao, et al.
Publicado: (2024)
Towards Scalable Training for Handwritten Mathematical Expression Recognition
por: Li, Haoyang, et al.
Publicado: (2025)
por: Li, Haoyang, et al.
Publicado: (2025)
MMHMER:Multi-viewer and Multi-task for Handwritten Mathematical Expression Recognition
por: Chen, Kehua, et al.
Publicado: (2025)
por: Chen, Kehua, et al.
Publicado: (2025)
μgat: Improving Single-Page Document Parsing by Providing Multi-Page Context
por: Quattrini, Fabio, et al.
Publicado: (2024)
por: Quattrini, Fabio, et al.
Publicado: (2024)
Multi-Modal interpretable automatic video captioning
por: Hanna-Asaad, Antoine, et al.
Publicado: (2024)
por: Hanna-Asaad, Antoine, et al.
Publicado: (2024)
Learning Progressive Adaptation for Multi-Modal Tracking
por: Wang, He, et al.
Publicado: (2026)
por: Wang, He, et al.
Publicado: (2026)
A Unified Model for Longitudinal Multi-Modal Multi-View Prediction with Missingness
por: Chen, Boqi, et al.
Publicado: (2024)
por: Chen, Boqi, et al.
Publicado: (2024)
DPO Learning with LLMs-Judge Signal for Computer Use Agents
por: Luo, Man, et al.
Publicado: (2025)
por: Luo, Man, et al.
Publicado: (2025)
MMXU: A Multi-Modal and Multi-X-ray Understanding Dataset for Disease Progression
por: Mu, Linjie, et al.
Publicado: (2025)
por: Mu, Linjie, et al.
Publicado: (2025)
VATr++: Choose Your Words Wisely for Handwritten Text Generation
por: Vanherle, Bram, et al.
Publicado: (2024)
por: Vanherle, Bram, et al.
Publicado: (2024)
Can AI Assistance Aid in the Grading of Handwritten Answer Sheets?
por: Sil, Pritam, et al.
Publicado: (2024)
por: Sil, Pritam, et al.
Publicado: (2024)
Enhanced OoD Detection through Cross-Modal Alignment of Multi-Modal Representations
por: Kim, Jeonghyeon, et al.
Publicado: (2025)
por: Kim, Jeonghyeon, et al.
Publicado: (2025)
MammothModa: Multi-Modal Large Language Model
por: She, Qi, et al.
Publicado: (2024)
por: She, Qi, et al.
Publicado: (2024)
Multi-Prompt with Depth Partitioned Cross-Modal Learning
por: Tian, Yingjie, et al.
Publicado: (2023)
por: Tian, Yingjie, et al.
Publicado: (2023)
Unveiling Ontological Commitment in Multi-Modal Foundation Models
por: Keser, Mert, et al.
Publicado: (2024)
por: Keser, Mert, et al.
Publicado: (2024)
A Generalized Multi-Modal Fusion Detection Framework
por: Cui, Leichao, et al.
Publicado: (2023)
por: Cui, Leichao, et al.
Publicado: (2023)
AVIR: Adaptive Visual In-Document Retrieval for Efficient Multi-Page Document Question Answering
por: Li, Zongmin, et al.
Publicado: (2026)
por: Li, Zongmin, et al.
Publicado: (2026)
Multi-modal Generative AI: Multi-modal LLMs, Diffusions, and the Unification
por: Wang, Xin, et al.
Publicado: (2024)
por: Wang, Xin, et al.
Publicado: (2024)
Ejemplares similares
-
SimpleDoc: Multi-Modal Document Understanding with Dual-Cue Page Retrieval and Iterative Refinement
por: Jain, Chelsi, et al.
Publicado: (2025) -
ProJudge: A Multi-Modal Multi-Discipline Benchmark and Instruction-Tuning Dataset for MLLM-based Process Judges
por: Ai, Jiaxin, et al.
Publicado: (2025) -
InkFM: A Foundational Model for Full-Page Online Handwritten Note Understanding
por: Fadeeva, Anastasiia, et al.
Publicado: (2025) -
Robustness Evaluation of OCR-based Visual Document Understanding under Multi-Modal Adversarial Attacks
por: Tien, Dong Nguyen, et al.
Publicado: (2025) -
Seeing the Big Picture: Evaluating Multimodal LLMs' Ability to Interpret and Grade Handwritten Student Work
por: Henkel, Owen, et al.
Publicado: (2025)