MeDocVL: A Visual Language Model for Medical Document Understanding and Parsing
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Wenjie, Wu, Wei, Liu, Ying, Zhao, Yuan, Lv, Xiaole, Diao, Liang, Fan, Zengjian, Xie, Wenfeng, Lin, Ziling, Shi, De, Huang, Lin, Xu, Kaihe, Li, Hong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Team PA-VCG's Solution for Competition on Understanding Chinese College Entrance Exam Papers in ICDAR'25
di: Wu, Wei, et al.
Pubblicazione: (2025)
di: Wu, Wei, et al.
Pubblicazione: (2025)
OmniDocBench: Benchmarking Diverse PDF Document Parsing with Comprehensive Annotations
di: Ouyang, Linke, et al.
Pubblicazione: (2024)
di: Ouyang, Linke, et al.
Pubblicazione: (2024)
DocPTBench: Benchmarking End-to-End Photographed Document Parsing and Translation
di: Du, Yongkun, et al.
Pubblicazione: (2025)
di: Du, Yongkun, et al.
Pubblicazione: (2025)
DocFusion: A Unified Framework for Document Parsing Tasks
di: Chai, Mingxu, et al.
Pubblicazione: (2024)
di: Chai, Mingxu, et al.
Pubblicazione: (2024)
SynthDoc: Bilingual Documents Synthesis for Visual Document Understanding
di: Ding, Chuanghao, et al.
Pubblicazione: (2024)
di: Ding, Chuanghao, et al.
Pubblicazione: (2024)
DocKylin: A Large Multimodal Model for Visual Document Understanding with Efficient Visual Slimming
di: Zhang, Jiaxin, et al.
Pubblicazione: (2024)
di: Zhang, Jiaxin, et al.
Pubblicazione: (2024)
Dr. DocBench: A Comprehensive Benchmark for Expert-Level and Difficult Document Parsing
di: Yang, Minglai, et al.
Pubblicazione: (2026)
di: Yang, Minglai, et al.
Pubblicazione: (2026)
Doc-Researcher: A Unified System for Multimodal Document Parsing and Deep Research
di: Dong, Kuicai, et al.
Pubblicazione: (2025)
di: Dong, Kuicai, et al.
Pubblicazione: (2025)
MMLongBench-Doc: Benchmarking Long-context Document Understanding with Visualizations
di: Ma, Yubo, et al.
Pubblicazione: (2024)
di: Ma, Yubo, et al.
Pubblicazione: (2024)
Reinforcement Learning with Token-level Feedback for Controllable Text Generation
di: Li, Wendi, et al.
Pubblicazione: (2024)
di: Li, Wendi, et al.
Pubblicazione: (2024)
DocSeeker: Structured Visual Reasoning with Evidence Grounding for Long Document Understanding
di: Yan, Hao, et al.
Pubblicazione: (2026)
di: Yan, Hao, et al.
Pubblicazione: (2026)
Doc-CoB: Enhancing Document Understanding with Visual Chain-of-Boxes Reasoning
di: Mo, Ye, et al.
Pubblicazione: (2025)
di: Mo, Ye, et al.
Pubblicazione: (2025)
PaddleOCR-VL-1.5: Towards a Multi-Task 0.9B VLM for Robust In-the-Wild Document Parsing
di: Cui, Cheng, et al.
Pubblicazione: (2026)
di: Cui, Cheng, et al.
Pubblicazione: (2026)
DocParseNet: Advanced Semantic Segmentation and OCR Embeddings for Efficient Scanned Document Annotation
di: Mohammadshirazi, Ahmad, et al.
Pubblicazione: (2024)
di: Mohammadshirazi, Ahmad, et al.
Pubblicazione: (2024)
PaddleOCR-VL: Boosting Multilingual Document Parsing via a 0.9B Ultra-Compact Vision-Language Model
di: Cui, Cheng, et al.
Pubblicazione: (2025)
di: Cui, Cheng, et al.
Pubblicazione: (2025)
SceneParser: Hierarchical Scene Parsing for Visual Semantics Understanding
di: Xu, Pengxin, et al.
Pubblicazione: (2026)
di: Xu, Pengxin, et al.
Pubblicazione: (2026)
HaploVL: A Single-Transformer Baseline for Multi-Modal Understanding
di: Yang, Rui, et al.
Pubblicazione: (2025)
di: Yang, Rui, et al.
Pubblicazione: (2025)
PP-DocBee2: Improved Baselines with Efficient Data for Multimodal Document Understanding
di: Huang, Kui, et al.
Pubblicazione: (2025)
di: Huang, Kui, et al.
Pubblicazione: (2025)
MosaicDoc: A Large-Scale Bilingual Benchmark for Visually Rich Document Understanding
di: Chen, Ketong, et al.
Pubblicazione: (2025)
di: Chen, Ketong, et al.
Pubblicazione: (2025)
InstructDoc: A Dataset for Zero-Shot Generalization of Visual Document Understanding with Instructions
di: Tanaka, Ryota, et al.
Pubblicazione: (2024)
di: Tanaka, Ryota, et al.
Pubblicazione: (2024)
DocRefine: An Intelligent Framework for Scientific Document Understanding and Content Optimization based on Multimodal Large Model Agents
di: Qian, Kun, et al.
Pubblicazione: (2025)
di: Qian, Kun, et al.
Pubblicazione: (2025)
PP-DocBee: Improving Multimodal Document Understanding Through a Bag of Tricks
di: Ni, Feng, et al.
Pubblicazione: (2025)
di: Ni, Feng, et al.
Pubblicazione: (2025)
CogDoc: Towards Unified thinking in Documents
di: Xu, Qixin, et al.
Pubblicazione: (2025)
di: Xu, Qixin, et al.
Pubblicazione: (2025)
AgriGPT-VL: Agricultural Vision-Language Understanding Suite
di: Yang, Bo, et al.
Pubblicazione: (2025)
di: Yang, Bo, et al.
Pubblicazione: (2025)
DocLens : A Tool-Augmented Multi-Agent Framework for Long Visual Document Understanding
di: Zhu, Dawei, et al.
Pubblicazione: (2025)
di: Zhu, Dawei, et al.
Pubblicazione: (2025)
Boosting Document Parsing Efficiency and Performance with Coarse-to-Fine Visual Processing
di: Cui, Cheng, et al.
Pubblicazione: (2026)
di: Cui, Cheng, et al.
Pubblicazione: (2026)
DocAtlas: Multilingual Document Understanding Across 80+ Languages
di: Heakl, Ahmed, et al.
Pubblicazione: (2026)
di: Heakl, Ahmed, et al.
Pubblicazione: (2026)
Parse Graph-Based Visual-Language Interaction for Human Pose Estimation
di: Liu, Shibang, et al.
Pubblicazione: (2025)
di: Liu, Shibang, et al.
Pubblicazione: (2025)
Fleming-VL: Towards Universal Medical Visual Reasoning with Multimodal LLMs
di: Shu, Yan, et al.
Pubblicazione: (2025)
di: Shu, Yan, et al.
Pubblicazione: (2025)
Real5-OmniDocBench: A Full-Scale Physical Reconstruction Benchmark for Robust Document Parsing in the Wild
di: Zhou, Changda, et al.
Pubblicazione: (2026)
di: Zhou, Changda, et al.
Pubblicazione: (2026)
DocTer: Documentation Guided Fuzzing for Testing Deep Learning API Functions
di: Xie, Danning, et al.
Pubblicazione: (2021)
di: Xie, Danning, et al.
Pubblicazione: (2021)
DocTER: Evaluating Document-based Knowledge Editing
di: Wu, Suhang, et al.
Pubblicazione: (2023)
di: Wu, Suhang, et al.
Pubblicazione: (2023)
DistilDoc: Knowledge Distillation for Visually-Rich Document Applications
di: Van Landeghem, Jordy, et al.
Pubblicazione: (2024)
di: Van Landeghem, Jordy, et al.
Pubblicazione: (2024)
How Far Is Document Parsing from Solved? PureDocBench: A Source-TraceableBenchmark across Clean, Degraded, and Real-World Settings
di: Li, Zhiheng, et al.
Pubblicazione: (2026)
di: Li, Zhiheng, et al.
Pubblicazione: (2026)
AMANDA: Agentic Medical Knowledge Augmentation for Data-Efficient Medical Visual Question Answering
di: Wang, Ziqing, et al.
Pubblicazione: (2025)
di: Wang, Ziqing, et al.
Pubblicazione: (2025)
Docs2Synth: A Synthetic Data Trained Retriever Framework for Scanned Visually Rich Documents Understanding
di: Ding, Yihao, et al.
Pubblicazione: (2026)
di: Ding, Yihao, et al.
Pubblicazione: (2026)
DocScope: Benchmarking Verifiable Reasoning for Trustworthy Long-Document Understanding
di: Feng, Xiang, et al.
Pubblicazione: (2026)
di: Feng, Xiang, et al.
Pubblicazione: (2026)
ContraDoc: Understanding Self-Contradictions in Documents with Large Language Models
di: Li, Jierui, et al.
Pubblicazione: (2023)
di: Li, Jierui, et al.
Pubblicazione: (2023)
DocShaDiffusion: Diffusion Model in Latent Space for Document Image Shadow Removal
di: Liu, Wenjie, et al.
Pubblicazione: (2025)
di: Liu, Wenjie, et al.
Pubblicazione: (2025)
LongDocURL: a Comprehensive Multimodal Long Document Benchmark Integrating Understanding, Reasoning, and Locating
di: Deng, Chao, et al.
Pubblicazione: (2024)
di: Deng, Chao, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Team PA-VCG's Solution for Competition on Understanding Chinese College Entrance Exam Papers in ICDAR'25
di: Wu, Wei, et al.
Pubblicazione: (2025) -
OmniDocBench: Benchmarking Diverse PDF Document Parsing with Comprehensive Annotations
di: Ouyang, Linke, et al.
Pubblicazione: (2024) -
DocPTBench: Benchmarking End-to-End Photographed Document Parsing and Translation
di: Du, Yongkun, et al.
Pubblicazione: (2025) -
DocFusion: A Unified Framework for Document Parsing Tasks
di: Chai, Mingxu, et al.
Pubblicazione: (2024) -
SynthDoc: Bilingual Documents Synthesis for Visual Document Understanding
di: Ding, Chuanghao, et al.
Pubblicazione: (2024)