OmniParser: A Unified Framework for Text Spotting, Key Information Extraction and Table Recognition
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wan, Jianqiang, Song, Sibo, Yu, Wenwen, Liu, Yuliang, Cheng, Wenqing, Huang, Fei, Bai, Xiang, Yao, Cong, Yang, Zhibo |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models
par: Yu, Wenwen, et autres
Publié: (2025)
par: Yu, Wenwen, et autres
Publié: (2025)
OmniParser for Pure Vision Based GUI Agent
par: Lu, Yadong, et autres
Publié: (2024)
par: Lu, Yadong, et autres
Publié: (2024)
Generative Compositor for Few-Shot Visual Information Extraction
par: Yang, Zhibo, et autres
Publié: (2025)
par: Yang, Zhibo, et autres
Publié: (2025)
DocThinker: Explainable Multimodal Large Language Models with Rule-based Reinforcement Learning for Document Understanding
par: Yu, Wenwen, et autres
Publié: (2025)
par: Yu, Wenwen, et autres
Publié: (2025)
Bridging the Gap Between End-to-End and Two-Step Text Spotting
par: Huang, Mingxin, et autres
Publié: (2024)
par: Huang, Mingxin, et autres
Publié: (2024)
The First Swahili Language Scene Text Detection and Recognition Dataset
par: Douamba, Fadila Wendigoundi, et autres
Publié: (2024)
par: Douamba, Fadila Wendigoundi, et autres
Publié: (2024)
VL-Reader: Vision and Language Reconstructor is an Effective Scene Text Recognizer
par: Zhong, Humen, et autres
Publié: (2024)
par: Zhong, Humen, et autres
Publié: (2024)
FineParser: A Fine-grained Spatio-temporal Action Parser for Human-centric Action Quality Assessment
par: Xu, Jinglin, et autres
Publié: (2024)
par: Xu, Jinglin, et autres
Publié: (2024)
SwinTextSpotter v2: Towards Better Synergy for Scene Text Spotting
par: Huang, Mingxin, et autres
Publié: (2024)
par: Huang, Mingxin, et autres
Publié: (2024)
SemiETS: Integrating Spatial and Content Consistencies for Semi-Supervised End-to-end Text Spotting
par: Luo, Dongliang, et autres
Publié: (2025)
par: Luo, Dongliang, et autres
Publié: (2025)
LORE++: Logical Location Regression Network for Table Structure Recognition with Pre-training
par: Long, Rujiao, et autres
Publié: (2024)
par: Long, Rujiao, et autres
Publié: (2024)
XFormParser: A Simple and Effective Multimodal Multilingual Semi-structured Form Parser
par: Cheng, Xianfu, et autres
Publié: (2024)
par: Cheng, Xianfu, et autres
Publié: (2024)
Dataset and Benchmark for Urdu Natural Scenes Text Detection, Recognition and Visual Question Answering
par: Maryam, Hiba, et autres
Publié: (2024)
par: Maryam, Hiba, et autres
Publié: (2024)
Extraction of tabulated statistical results with tableParser
par: Böschen, Ingmar
Publié: (2026)
par: Böschen, Ingmar
Publié: (2026)
HIP: Hierarchical Point Modeling and Pre-training for Visual Information Extraction
par: Long, Rujiao, et autres
Publié: (2024)
par: Long, Rujiao, et autres
Publié: (2024)
ThinkOmni: Lifting Textual Reasoning to Omni-modal Scenarios via Guidance Decoding
par: Guan, Yiran, et autres
Publié: (2026)
par: Guan, Yiran, et autres
Publié: (2026)
Grid: Omni Visual Generation
par: Wan, Cong, et autres
Publié: (2024)
par: Wan, Cong, et autres
Publié: (2024)
MolParser: End-to-end Visual Recognition of Molecule Structures in the Wild
par: Fang, Xi, et autres
Publié: (2024)
par: Fang, Xi, et autres
Publié: (2024)
Benchmarking Document Parsers on Mathematical Formula Extraction from PDFs
par: Horn, Pius, et autres
Publié: (2025)
par: Horn, Pius, et autres
Publié: (2025)
HierCode: A Lightweight Hierarchical Codebook for Zero-shot Chinese Text Recognition
par: Zhang, Yuyi, et autres
Publié: (2024)
par: Zhang, Yuyi, et autres
Publié: (2024)
Qwen3-VL-Embedding and Qwen3-VL-Reranker: A Unified Framework for State-of-the-Art Multimodal Retrieval and Ranking
par: Li, Mingxin, et autres
Publié: (2026)
par: Li, Mingxin, et autres
Publié: (2026)
Liquid: Language Models are Scalable and Unified Multi-modal Generators
par: Wu, Junfeng, et autres
Publié: (2024)
par: Wu, Junfeng, et autres
Publié: (2024)
Platypus: A Generalized Specialist Model for Reading Text in Various Forms
par: Wang, Peng, et autres
Publié: (2024)
par: Wang, Peng, et autres
Publié: (2024)
AgriGPT-Omni: A Unified Speech-Vision-Text Framework for Multilingual Agricultural Intelligence
par: Yang, Bo, et autres
Publié: (2025)
par: Yang, Bo, et autres
Publié: (2025)
Bridging Discourse Treebanks with a Unified Rhetorical Structure Parser
par: Chistova, Elena
Publié: (2025)
par: Chistova, Elena
Publié: (2025)
OmniTrace: A Unified Framework for Generation-Time Attribution in Omni-Modal LLMs
par: Yan, Qianqi, et autres
Publié: (2026)
par: Yan, Qianqi, et autres
Publié: (2026)
Intra and Inter Parser-Prompted Transformers for Effective Image Restoration
par: Wang, Cong, et autres
Publié: (2025)
par: Wang, Cong, et autres
Publié: (2025)
Tele-Omni: a Unified Multimodal Framework for Video Generation and Editing
par: Liu, Jialun, et autres
Publié: (2026)
par: Liu, Jialun, et autres
Publié: (2026)
VimTS: A Unified Video and Image Text Spotter for Enhancing the Cross-domain Generalization
par: Liu, Yuliang, et autres
Publié: (2024)
par: Liu, Yuliang, et autres
Publié: (2024)
Optimizing Nepali PDF Extraction: A Comparative Study of Parser and OCR Technologies
par: Paudel, Prabin, et autres
Publié: (2024)
par: Paudel, Prabin, et autres
Publié: (2024)
LLMs Underperform Graph-Based Parsers on Supervised Relation Extraction for Complex Graphs
par: Gajo, Paolo, et autres
Publié: (2026)
par: Gajo, Paolo, et autres
Publié: (2026)
InteractiveOmni: A Unified Omni-modal Model for Audio-Visual Multi-turn Dialogue
par: Tong, Wenwen, et autres
Publié: (2025)
par: Tong, Wenwen, et autres
Publié: (2025)
HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation
par: Xiao, Yicheng, et autres
Publié: (2025)
par: Xiao, Yicheng, et autres
Publié: (2025)
UniParser: Multi-Human Parsing with Unified Correlation Representation Learning
par: Chu, Jiaming, et autres
Publié: (2023)
par: Chu, Jiaming, et autres
Publié: (2023)
Visual Text Generation in the Wild
par: Zhu, Yuanzhi, et autres
Publié: (2024)
par: Zhu, Yuanzhi, et autres
Publié: (2024)
OmniSep: Unified Omni-Modality Sound Separation with Query-Mixup
par: Cheng, Xize, et autres
Publié: (2024)
par: Cheng, Xize, et autres
Publié: (2024)
MSTAR: Box-free Multi-query Scene Text Retrieval with Attention Recycling
par: Yin, Liang, et autres
Publié: (2025)
par: Yin, Liang, et autres
Publié: (2025)
Omni2Sound: Towards Unified Video-Text-to-Audio Generation
par: Dai, Yusheng, et autres
Publié: (2026)
par: Dai, Yusheng, et autres
Publié: (2026)
OmniLiDAR: A Unified Diffusion Framework for Multi-Domain 3D LiDAR Generation
par: Liu, Youquan, et autres
Publié: (2026)
par: Liu, Youquan, et autres
Publié: (2026)
Omni-AVSR: Towards Unified Multimodal Speech Recognition with Large Language Models
par: Cappellazzo, Umberto, et autres
Publié: (2025)
par: Cappellazzo, Umberto, et autres
Publié: (2025)
Documents similaires
-
OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models
par: Yu, Wenwen, et autres
Publié: (2025) -
OmniParser for Pure Vision Based GUI Agent
par: Lu, Yadong, et autres
Publié: (2024) -
Generative Compositor for Few-Shot Visual Information Extraction
par: Yang, Zhibo, et autres
Publié: (2025) -
DocThinker: Explainable Multimodal Large Language Models with Rule-based Reinforcement Learning for Document Understanding
par: Yu, Wenwen, et autres
Publié: (2025) -
Bridging the Gap Between End-to-End and Two-Step Text Spotting
par: Huang, Mingxin, et autres
Publié: (2024)