Platypus: A Generalized Specialist Model for Reading Text in Various Forms
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Peng, Li, Zhaohai, Tang, Jun, Zhong, Humen, Huang, Fei, Yang, Zhibo, Yao, Cong |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VL-Reader: Vision and Language Reconstructor is an Effective Scene Text Recognizer
par: Zhong, Humen, et autres
Publié: (2024)
par: Zhong, Humen, et autres
Publié: (2024)
CC-OCR: A Comprehensive and Challenging OCR Benchmark for Evaluating Large Multimodal Models in Literacy
par: Yang, Zhibo, et autres
Publié: (2024)
par: Yang, Zhibo, et autres
Publié: (2024)
Visual Text Generation in the Wild
par: Zhu, Yuanzhi, et autres
Publié: (2024)
par: Zhu, Yuanzhi, et autres
Publié: (2024)
Qwen3-VL-Seg: Unlocking Open-World Referring Segmentation with Vision-Language Grounding
par: Yao, Yuan, et autres
Publié: (2026)
par: Yao, Yuan, et autres
Publié: (2026)
HIP: Hierarchical Point Modeling and Pre-training for Visual Information Extraction
par: Long, Rujiao, et autres
Publié: (2024)
par: Long, Rujiao, et autres
Publié: (2024)
OmniParser: A Unified Framework for Text Spotting, Key Information Extraction and Table Recognition
par: Wan, Jianqiang, et autres
Publié: (2024)
par: Wan, Jianqiang, et autres
Publié: (2024)
HierCode: A Lightweight Hierarchical Codebook for Zero-shot Chinese Text Recognition
par: Zhang, Yuyi, et autres
Publié: (2024)
par: Zhang, Yuyi, et autres
Publié: (2024)
LORE++: Logical Location Regression Network for Table Structure Recognition with Pre-training
par: Long, Rujiao, et autres
Publié: (2024)
par: Long, Rujiao, et autres
Publié: (2024)
Region-Aware Text-to-Image Generation via Hard Binding and Soft Refinement
par: Chen, Zhennan, et autres
Publié: (2024)
par: Chen, Zhennan, et autres
Publié: (2024)
SceneVTG++: Controllable Multilingual Visual Text Generation in the Wild
par: Liu, Jiawei, et autres
Publié: (2025)
par: Liu, Jiawei, et autres
Publié: (2025)
TOUCH: Text-guided Controllable Generation of Free-Form Hand-Object Interactions
par: Han, Guangyi, et autres
Publié: (2025)
par: Han, Guangyi, et autres
Publié: (2025)
Arbitrary Reading Order Scene Text Spotter with Local Semantics Guidance
par: Lyu, Jiahao, et autres
Publié: (2024)
par: Lyu, Jiahao, et autres
Publié: (2024)
Generative Compositor for Few-Shot Visual Information Extraction
par: Yang, Zhibo, et autres
Publié: (2025)
par: Yang, Zhibo, et autres
Publié: (2025)
Unified Prompt Attack Against Text-to-Image Generation Models
par: Peng, Duo, et autres
Publié: (2025)
par: Peng, Duo, et autres
Publié: (2025)
RepText: Rendering Visual Text via Replicating
par: Wang, Haofan, et autres
Publié: (2025)
par: Wang, Haofan, et autres
Publié: (2025)
OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models
par: Yu, Wenwen, et autres
Publié: (2025)
par: Yu, Wenwen, et autres
Publié: (2025)
FTMoMamba: Motion Generation with Frequency and Text State Space Models
par: Li, Chengjian, et autres
Publié: (2024)
par: Li, Chengjian, et autres
Publié: (2024)
SurrogatePrompt: Bypassing the Safety Filter of Text-to-Image Models via Substitution
par: Ba, Zhongjie, et autres
Publié: (2023)
par: Ba, Zhongjie, et autres
Publié: (2023)
Qwen2.5-VL Technical Report
par: Bai, Shuai, et autres
Publié: (2025)
par: Bai, Shuai, et autres
Publié: (2025)
OrthoPhys: Physically Plausible Video Generation with Orthogonal-View Geometry Guidance
par: Wang, Cong, et autres
Publié: (2026)
par: Wang, Cong, et autres
Publié: (2026)
ConText: Driving In-context Learning for Text Removal and Segmentation
par: Zhang, Fei, et autres
Publié: (2025)
par: Zhang, Fei, et autres
Publié: (2025)
Interactive Visual Assessment for Text-to-Image Generation Models
par: Mi, Xiaoyue, et autres
Publié: (2024)
par: Mi, Xiaoyue, et autres
Publié: (2024)
FC3DNet: A Fully Connected Encoder-Decoder for Efficient Demoir'eing
par: Du, Zhibo, et autres
Publié: (2024)
par: Du, Zhibo, et autres
Publié: (2024)
Generative Model-Based Feature Attention Module for Video Action Analysis
par: Wang, Guiqin, et autres
Publié: (2025)
par: Wang, Guiqin, et autres
Publié: (2025)
Taming the Tri-Space Tension: ARC-Guided Hallucination Modeling and Control for Text-to-Image Generation
par: Yang, Jianjiang, et autres
Publié: (2025)
par: Yang, Jianjiang, et autres
Publié: (2025)
See the Text: From Tokenization to Visual Reading
par: Xing, Ling, et autres
Publié: (2025)
par: Xing, Ling, et autres
Publié: (2025)
DreamLCM: Towards High-Quality Text-to-3D Generation via Latent Consistency Model
par: Zhong, Yiming, et autres
Publié: (2024)
par: Zhong, Yiming, et autres
Publié: (2024)
TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation
par: Wang, Xingrui, et autres
Publié: (2024)
par: Wang, Xingrui, et autres
Publié: (2024)
Adaptively Clustering Neighbor Elements for Image-Text Generation
par: Wang, Zihua, et autres
Publié: (2023)
par: Wang, Zihua, et autres
Publié: (2023)
Reading Images Like Texts: Sequential Image Understanding in Vision-Language Models
par: Li, Yueyan, et autres
Publié: (2025)
par: Li, Yueyan, et autres
Publié: (2025)
AI-Generated Content (AIGC) for Various Data Modalities: A Survey
par: Foo, Lin Geng, et autres
Publié: (2023)
par: Foo, Lin Geng, et autres
Publié: (2023)
PacTure: Efficient PBR Texture Generation on Packed Views with Visual Autoregressive Models
par: Fei, Fan, et autres
Publié: (2025)
par: Fei, Fan, et autres
Publié: (2025)
Talk is Not Always Cheap: Promoting Wireless Sensing Models with Text Prompts
par: Yang, Zhenkui, et autres
Publié: (2025)
par: Yang, Zhenkui, et autres
Publié: (2025)
Advancing Pose-Guided Image Synthesis with Progressive Conditional Diffusion Models
par: Shen, Fei, et autres
Publié: (2023)
par: Shen, Fei, et autres
Publié: (2023)
FITA: Fine-grained Image-Text Aligner for Radiology Report Generation
par: Yang, Honglong, et autres
Publié: (2024)
par: Yang, Honglong, et autres
Publié: (2024)
Reading Between the Pixels: An Inscriptive Jailbreak Attack on Text-to-Image Models
par: Ying, Zonghao, et autres
Publié: (2026)
par: Ying, Zonghao, et autres
Publié: (2026)
Visual-CoG: Stage-Aware Reinforcement Learning with Chain of Guidance for Text-to-Image Generation
par: Li, Yaqi, et autres
Publié: (2025)
par: Li, Yaqi, et autres
Publié: (2025)
Long-Term TalkingFace Generation via Motion-Prior Conditional Diffusion Model
par: Shen, Fei, et autres
Publié: (2025)
par: Shen, Fei, et autres
Publié: (2025)
New Dataset and Methods for Fine-Grained Compositional Referring Expression Comprehension via Specialist-MLLM Collaboration
par: Yang, Xuzheng, et autres
Publié: (2025)
par: Yang, Xuzheng, et autres
Publié: (2025)
Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation
par: He, Yiguo, et autres
Publié: (2025)
par: He, Yiguo, et autres
Publié: (2025)
Documents similaires
-
VL-Reader: Vision and Language Reconstructor is an Effective Scene Text Recognizer
par: Zhong, Humen, et autres
Publié: (2024) -
CC-OCR: A Comprehensive and Challenging OCR Benchmark for Evaluating Large Multimodal Models in Literacy
par: Yang, Zhibo, et autres
Publié: (2024) -
Visual Text Generation in the Wild
par: Zhu, Yuanzhi, et autres
Publié: (2024) -
Qwen3-VL-Seg: Unlocking Open-World Referring Segmentation with Vision-Language Grounding
par: Yao, Yuan, et autres
Publié: (2026) -
HIP: Hierarchical Point Modeling and Pre-training for Visual Information Extraction
par: Long, Rujiao, et autres
Publié: (2024)