Show, don't tell -- Providing Visual Error Feedback for Handwritten Documents
Fuente:
arXiv
Guardado en:
| Autores principales: | Yasin, Said, Zesch, Torsten |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Text or Image? What is More Important in Cross-Domain Generalization Capabilities of Hate Meme Detection Models?
por: Aggarwal, Piush, et al.
Publicado: (2024)
por: Aggarwal, Piush, et al.
Publicado: (2024)
BHDD: A Burmese Handwritten Digit Dataset
por: Aung, Swan Htet, et al.
Publicado: (2026)
por: Aung, Swan Htet, et al.
Publicado: (2026)
Can Vision-Language Models Evaluate Handwritten Math?
por: Nath, Oikantik, et al.
Publicado: (2025)
por: Nath, Oikantik, et al.
Publicado: (2025)
Link prediction Graph Neural Networks for structure recognition of Handwritten Mathematical Expressions
por: Nguyen, Cuong Tuan, et al.
Publicado: (2025)
por: Nguyen, Cuong Tuan, et al.
Publicado: (2025)
Revisiting N-Gram Models: Their Impact in Modern Neural Networks for Handwritten Text Recognition
por: Tarride, Solène, et al.
Publicado: (2024)
por: Tarride, Solène, et al.
Publicado: (2024)
VDebugger: Harnessing Execution Feedback for Debugging Visual Programs
por: Wu, Xueqing, et al.
Publicado: (2024)
por: Wu, Xueqing, et al.
Publicado: (2024)
Learning GUI Grounding with Spatial Reasoning from Visual Feedback
por: Zhao, Yu, et al.
Publicado: (2025)
por: Zhao, Yu, et al.
Publicado: (2025)
Mismatch Quest: Visual and Textual Feedback for Image-Text Misalignment
por: Gordon, Brian, et al.
Publicado: (2023)
por: Gordon, Brian, et al.
Publicado: (2023)
Automated LaTeX Code Generation from Handwritten Math Expressions Using Vision Transformer
por: Sundararaj, Jayaprakash, et al.
Publicado: (2024)
por: Sundararaj, Jayaprakash, et al.
Publicado: (2024)
Diffusion Is Your Friend in Show, Suggest and Tell
por: Hu, Jia Cheng, et al.
Publicado: (2025)
por: Hu, Jia Cheng, et al.
Publicado: (2025)
LED: A Benchmark for Evaluating Layout Error Detection in Document Analysis
por: Heo, Inbum, et al.
Publicado: (2026)
por: Heo, Inbum, et al.
Publicado: (2026)
Ancient but Digitized: Developing Handwritten Optical Character Recognition for East Syriac Script Through Creating KHAMIS Dataset
por: Majeed, Ameer, et al.
Publicado: (2024)
por: Majeed, Ameer, et al.
Publicado: (2024)
HATFormer: Historic Handwritten Arabic Text Recognition with Transformers
por: Chan, Adrian, et al.
Publicado: (2024)
por: Chan, Adrian, et al.
Publicado: (2024)
Unlocking the Archives: Using Large Language Models to Transcribe Handwritten Historical Documents
por: Humphries, Mark, et al.
Publicado: (2024)
por: Humphries, Mark, et al.
Publicado: (2024)
Show and Guide: Instructional-Plan Grounded Vision and Language Model
por: Glória-Silva, Diogo, et al.
Publicado: (2024)
por: Glória-Silva, Diogo, et al.
Publicado: (2024)
Seeing Justice Clearly: Handwritten Legal Document Translation with OCR and Vision-Language Models
por: Nigam, Shubham Kumar, et al.
Publicado: (2025)
por: Nigam, Shubham Kumar, et al.
Publicado: (2025)
VICCA: Visual Interpretation and Comprehension of Chest X-ray Anomalies in Generated Report Without Human Feedback
por: Picha, Sayeh Gholipour, et al.
Publicado: (2025)
por: Picha, Sayeh Gholipour, et al.
Publicado: (2025)
Efficient End-to-End Visual Document Understanding with Rationale Distillation
por: Zhu, Wang, et al.
Publicado: (2023)
por: Zhu, Wang, et al.
Publicado: (2023)
Confidence-Aware Document OCR Error Detection
por: Hemmer, Arthur, et al.
Publicado: (2024)
por: Hemmer, Arthur, et al.
Publicado: (2024)
Visually Guided Generative Text-Layout Pre-training for Document Intelligence
por: Mao, Zhiming, et al.
Publicado: (2024)
por: Mao, Zhiming, et al.
Publicado: (2024)
Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding
por: Xiao, Han, et al.
Publicado: (2025)
por: Xiao, Han, et al.
Publicado: (2025)
MMLongBench-Doc: Benchmarking Long-context Document Understanding with Visualizations
por: Ma, Yubo, et al.
Publicado: (2024)
por: Ma, Yubo, et al.
Publicado: (2024)
Now you see it, Now you don't: Damage Label Agreement in Drone & Satellite Post-Disaster Imagery
por: Manzini, Thomas, et al.
Publicado: (2025)
por: Manzini, Thomas, et al.
Publicado: (2025)
Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval
por: Sun, Hao, et al.
Publicado: (2026)
por: Sun, Hao, et al.
Publicado: (2026)
Deep Learning based Visually Rich Document Content Understanding: A Survey
por: Ding, Yihao, et al.
Publicado: (2024)
por: Ding, Yihao, et al.
Publicado: (2024)
UNIKIE-BENCH: Benchmarking Large Multimodal Models for Key Information Extraction in Visual Documents
por: Ji, Yifan, et al.
Publicado: (2026)
por: Ji, Yifan, et al.
Publicado: (2026)
InstructDoc: A Dataset for Zero-Shot Generalization of Visual Document Understanding with Instructions
por: Tanaka, Ryota, et al.
Publicado: (2024)
por: Tanaka, Ryota, et al.
Publicado: (2024)
FastOCR: Dynamic Visual Fixation via KV Cache Pruning for Efficient Document Parsing
por: Tang, Zihan, et al.
Publicado: (2026)
por: Tang, Zihan, et al.
Publicado: (2026)
VLM2Vec-V2: Advancing Multimodal Embedding for Videos, Images, and Visual Documents
por: Meng, Rui, et al.
Publicado: (2025)
por: Meng, Rui, et al.
Publicado: (2025)
DocLens : A Tool-Augmented Multi-Agent Framework for Long Visual Document Understanding
por: Zhu, Dawei, et al.
Publicado: (2025)
por: Zhu, Dawei, et al.
Publicado: (2025)
3MVRD: Multimodal Multi-task Multi-teacher Visually-Rich Form Document Understanding
por: Ding, Yihao, et al.
Publicado: (2024)
por: Ding, Yihao, et al.
Publicado: (2024)
Movie2Story: A framework for understanding videos and telling stories in the form of novel text
por: Li, Kangning, et al.
Publicado: (2024)
por: Li, Kangning, et al.
Publicado: (2024)
Innovative Methods for Non-Destructive Inspection of Handwritten Documents
por: Breci, Eleonora, et al.
Publicado: (2023)
por: Breci, Eleonora, et al.
Publicado: (2023)
ShowUI: One Vision-Language-Action Model for GUI Visual Agent
por: Lin, Kevin Qinghong, et al.
Publicado: (2024)
por: Lin, Kevin Qinghong, et al.
Publicado: (2024)
Joint Extraction Matters: Prompt-Based Visual Question Answering for Multi-Field Document Information Extraction
por: Loem, Mengsay, et al.
Publicado: (2025)
por: Loem, Mengsay, et al.
Publicado: (2025)
Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor
por: Chen, Jiali, et al.
Publicado: (2024)
por: Chen, Jiali, et al.
Publicado: (2024)
QID: Efficient Query-Informed ViTs in Data-Scarce Regimes for OCR-free Visual Document Understanding
por: Le, Binh M., et al.
Publicado: (2025)
por: Le, Binh M., et al.
Publicado: (2025)
A Novel Dataset for Non-Destructive Inspection of Handwritten Documents
por: Breci, Eleonora, et al.
Publicado: (2024)
por: Breci, Eleonora, et al.
Publicado: (2024)
Reading Order Independent Metrics for Information Extraction in Handwritten Documents
por: Villanova-Aparisi, David, et al.
Publicado: (2024)
por: Villanova-Aparisi, David, et al.
Publicado: (2024)
Invizo: Arabic Handwritten Document Optical Character Recognition Solution
por: Waly, Alhossien, et al.
Publicado: (2025)
por: Waly, Alhossien, et al.
Publicado: (2025)
Ejemplares similares
-
Text or Image? What is More Important in Cross-Domain Generalization Capabilities of Hate Meme Detection Models?
por: Aggarwal, Piush, et al.
Publicado: (2024) -
BHDD: A Burmese Handwritten Digit Dataset
por: Aung, Swan Htet, et al.
Publicado: (2026) -
Can Vision-Language Models Evaluate Handwritten Math?
por: Nath, Oikantik, et al.
Publicado: (2025) -
Link prediction Graph Neural Networks for structure recognition of Handwritten Mathematical Expressions
por: Nguyen, Cuong Tuan, et al.
Publicado: (2025) -
Revisiting N-Gram Models: Their Impact in Modern Neural Networks for Handwritten Text Recognition
por: Tarride, Solène, et al.
Publicado: (2024)