Lightweight and Production-Ready PDF Visual Element Parsing
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Meizhu, Abbasi, Yassi, Rowe, Matthew, Avendi, Michael, Li, Paul |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Do Image-Text Metrics Respect Semantic Invariances?
par: Agarwal, Amit, et autres
Publié: (2026)
par: Agarwal, Amit, et autres
Publié: (2026)
Think Twice Before You Write -- an Entropy-based Decoding Strategy to Enhance LLM Reasoning
par: He, Jiashu, et autres
Publié: (2026)
par: He, Jiashu, et autres
Publié: (2026)
PDF-WuKong: A Large Multimodal Model for Efficient Long PDF Reading with End-to-End Sparse Sampling
par: Xie, Xudong, et autres
Publié: (2024)
par: Xie, Xudong, et autres
Publié: (2024)
Dr. DocBench: A Comprehensive Benchmark for Expert-Level and Difficult Document Parsing
par: Yang, Minglai, et autres
Publié: (2026)
par: Yang, Minglai, et autres
Publié: (2026)
MinerU-Popo: Universal Post-Processing Model for Structured Document Parsing
par: Xu, Bangrui, et autres
Publié: (2026)
par: Xu, Bangrui, et autres
Publié: (2026)
Lightweight Operations for Visual Speech Recognition
par: Panagos, Iason Ioannis, et autres
Publié: (2025)
par: Panagos, Iason Ioannis, et autres
Publié: (2025)
Layout-Aware Parsing Meets Efficient LLMs: A Unified, Scalable Framework for Resume Information Extraction and Evaluation
par: Zhu, Fanwei, et autres
Publié: (2025)
par: Zhu, Fanwei, et autres
Publié: (2025)
Harnessing PDF Data for Improving Japanese Large Multimodal Models
par: Baek, Jeonghun, et autres
Publié: (2025)
par: Baek, Jeonghun, et autres
Publié: (2025)
Are We Ready for RL in Text-to-3D Generation? A Progressive Investigation
par: Tang, Yiwen, et autres
Publié: (2025)
par: Tang, Yiwen, et autres
Publié: (2025)
Are Video Models Ready as Zero-Shot Reasoners? An Empirical Study with the MME-CoF Benchmark
par: Guo, Ziyu, et autres
Publié: (2025)
par: Guo, Ziyu, et autres
Publié: (2025)
Red Teaming Visual Language Models
par: Li, Mukai, et autres
Publié: (2024)
par: Li, Mukai, et autres
Publié: (2024)
Document Parsing Unveiled: Techniques, Challenges, and Prospects for Structured Information Extraction
par: Zhang, Qintong, et autres
Publié: (2024)
par: Zhang, Qintong, et autres
Publié: (2024)
InfoDet: A Dataset for Infographic Element Detection
par: Zhu, Jiangning, et autres
Publié: (2025)
par: Zhu, Jiangning, et autres
Publié: (2025)
Unbiased Visual Reasoning with Controlled Visual Inputs
par: Li, Zhaonan, et autres
Publié: (2025)
par: Li, Zhaonan, et autres
Publié: (2025)
GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models
par: Li, Mukai, et autres
Publié: (2024)
par: Li, Mukai, et autres
Publié: (2024)
Infinity Parser: Layout Aware Reinforcement Learning for Scanned Document Parsing
par: Wang, Baode, et autres
Publié: (2025)
par: Wang, Baode, et autres
Publié: (2025)
Jigsaw-R1: A Study of Rule-based Visual Reinforcement Learning with Jigsaw Puzzles
par: Wang, Zifu, et autres
Publié: (2025)
par: Wang, Zifu, et autres
Publié: (2025)
ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning
par: Kim, Taewhan, et autres
Publié: (2024)
par: Kim, Taewhan, et autres
Publié: (2024)
Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search
par: Lai, Xin, et autres
Publié: (2025)
par: Lai, Xin, et autres
Publié: (2025)
VisualRWKV-HD and UHD: Advancing High-Resolution Processing for Visual Language Models
par: Li, Zihang, et autres
Publié: (2024)
par: Li, Zihang, et autres
Publié: (2024)
LLaVA-OneVision: Easy Visual Task Transfer
par: Li, Bo, et autres
Publié: (2024)
par: Li, Bo, et autres
Publié: (2024)
Semantically-Prompted Language Models Improve Visual Descriptions
par: Ogezi, Michael, et autres
Publié: (2023)
par: Ogezi, Michael, et autres
Publié: (2023)
OmniDocBench: Benchmarking Diverse PDF Document Parsing with Comprehensive Annotations
par: Ouyang, Linke, et autres
Publié: (2024)
par: Ouyang, Linke, et autres
Publié: (2024)
Index-Preserving Lightweight Token Pruning for Efficient Document Understanding in Vision-Language Models
par: Son, Jaemin, et autres
Publié: (2025)
par: Son, Jaemin, et autres
Publié: (2025)
AC-Lite : A Lightweight Image Captioning Model for Low-Resource Assamese Language
par: Choudhury, Pankaj, et autres
Publié: (2025)
par: Choudhury, Pankaj, et autres
Publié: (2025)
AutoFigure: Generating and Refining Publication-Ready Scientific Illustrations
par: Zhu, Minjun, et autres
Publié: (2026)
par: Zhu, Minjun, et autres
Publié: (2026)
On Data Synthesis and Post-training for Visual Abstract Reasoning
par: Zhu, Ke, et autres
Publié: (2025)
par: Zhu, Ke, et autres
Publié: (2025)
SparkUI-Parser: Enhancing GUI Perception with Robust Grounding and Parsing
par: Jing, Hongyi, et autres
Publié: (2025)
par: Jing, Hongyi, et autres
Publié: (2025)
CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning
par: Li, Kailing, et autres
Publié: (2025)
par: Li, Kailing, et autres
Publié: (2025)
VisualAgentBench: Towards Large Multimodal Models as Visual Foundation Agents
par: Liu, Xiao, et autres
Publié: (2024)
par: Liu, Xiao, et autres
Publié: (2024)
Chatting with Images for Introspective Visual Thinking
par: Wu, Junfei, et autres
Publié: (2026)
par: Wu, Junfei, et autres
Publié: (2026)
Towards Visual-Prompt Temporal Answering Grounding in Medical Instructional Video
par: Li, Bin, et autres
Publié: (2022)
par: Li, Bin, et autres
Publié: (2022)
VGR: Visual Grounded Reasoning
par: Wang, Jiacong, et autres
Publié: (2025)
par: Wang, Jiacong, et autres
Publié: (2025)
VIALM: A Survey and Benchmark of Visually Impaired Assistance with Large Models
par: Zhao, Yi, et autres
Publié: (2024)
par: Zhao, Yi, et autres
Publié: (2024)
CognArtive: Large Language Models for Automating Art Analysis and Decoding Aesthetic Elements
par: Khadangi, Afshin, et autres
Publié: (2025)
par: Khadangi, Afshin, et autres
Publié: (2025)
The Role of Entropy in Visual Grounding: Analysis and Optimization
par: Li, Shuo, et autres
Publié: (2025)
par: Li, Shuo, et autres
Publié: (2025)
Vero: An Open RL Recipe for General Visual Reasoning
par: Sarch, Gabriel, et autres
Publié: (2026)
par: Sarch, Gabriel, et autres
Publié: (2026)
Losing Visual Needles in Image Haystacks: Vision Language Models are Easily Distracted in Short and Long Contexts
par: Sharma, Aditya, et autres
Publié: (2024)
par: Sharma, Aditya, et autres
Publié: (2024)
Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation
par: Wu, Chengyue, et autres
Publié: (2024)
par: Wu, Chengyue, et autres
Publié: (2024)
Small Drafts, Big Verdict: Information-Intensive Visual Reasoning via Speculation
par: Liu, Yuhan, et autres
Publié: (2025)
par: Liu, Yuhan, et autres
Publié: (2025)
Documents similaires
-
Do Image-Text Metrics Respect Semantic Invariances?
par: Agarwal, Amit, et autres
Publié: (2026) -
Think Twice Before You Write -- an Entropy-based Decoding Strategy to Enhance LLM Reasoning
par: He, Jiashu, et autres
Publié: (2026) -
PDF-WuKong: A Large Multimodal Model for Efficient Long PDF Reading with End-to-End Sparse Sampling
par: Xie, Xudong, et autres
Publié: (2024) -
Dr. DocBench: A Comprehensive Benchmark for Expert-Level and Difficult Document Parsing
par: Yang, Minglai, et autres
Publié: (2026) -
MinerU-Popo: Universal Post-Processing Model for Structured Document Parsing
par: Xu, Bangrui, et autres
Publié: (2026)