A Token-level Text Image Foundation Model for Document Understanding
Fuente:
arXiv
Salvato in:
| Autori principali: | Guan, Tongkun, Wang, Zining, Fu, Pei, Guo, Zhengtao, Shen, Wei, Zhou, Kai, Yue, Tiezhu, Duan, Chen, Sun, Hao, Jiang, Qianyi, Luo, Junfeng, Yang, Xiaokang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Marten: Visual Question Answering with Mask Generation for Multi-modal Document Understanding
di: Wang, Zining, et al.
Pubblicazione: (2025)
di: Wang, Zining, et al.
Pubblicazione: (2025)
Multimodal Large Language Models for Text-rich Image Understanding: A Comprehensive Review
di: Fu, Pei, et al.
Pubblicazione: (2025)
di: Fu, Pei, et al.
Pubblicazione: (2025)
InstructOCR: Instruction Boosting Scene Text Spotting
di: Duan, Chen, et al.
Pubblicazione: (2024)
di: Duan, Chen, et al.
Pubblicazione: (2024)
ODM: A Text-Image Further Alignment Pre-training Approach for Scene Text Detection and Spotting
di: Duan, Chen, et al.
Pubblicazione: (2024)
di: Duan, Chen, et al.
Pubblicazione: (2024)
Bridging Synthetic and Real Worlds for Pre-training Scene Text Detectors
di: Guan, Tongkun, et al.
Pubblicazione: (2023)
di: Guan, Tongkun, et al.
Pubblicazione: (2023)
PosFormer: Recognizing Complex Handwritten Mathematical Expression with Position Forest Transformer
di: Guan, Tongkun, et al.
Pubblicazione: (2024)
di: Guan, Tongkun, et al.
Pubblicazione: (2024)
CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder
di: Ma, Lichen, et al.
Pubblicazione: (2024)
di: Ma, Lichen, et al.
Pubblicazione: (2024)
High-Resolution Image Synthesis via Next-Token Prediction
di: Chen, Dengsheng, et al.
Pubblicazione: (2024)
di: Chen, Dengsheng, et al.
Pubblicazione: (2024)
CodePercept: Code-Grounded Visual STEM Perception for MLLMs
di: Guan, Tongkun, et al.
Pubblicazione: (2026)
di: Guan, Tongkun, et al.
Pubblicazione: (2026)
PositionOCR: Augmenting Positional Awareness in Multi-Modal Models via Hybrid Specialist Integration
di: Duan, Chen, et al.
Pubblicazione: (2026)
di: Duan, Chen, et al.
Pubblicazione: (2026)
ArtAug: Enhancing Text-to-Image Generation through Synthesis-Understanding Interaction
di: Duan, Zhongjie, et al.
Pubblicazione: (2024)
di: Duan, Zhongjie, et al.
Pubblicazione: (2024)
Token-level Correlation-guided Compression for Efficient Multimodal Document Understanding
di: Zhang, Renshan, et al.
Pubblicazione: (2024)
di: Zhang, Renshan, et al.
Pubblicazione: (2024)
Distribution Prompting: Understanding the Expressivity of Language Models Through the Next-Token Distributions They Can Produce
di: Wang, Haojin, et al.
Pubblicazione: (2025)
di: Wang, Haojin, et al.
Pubblicazione: (2025)
Hierarchical Context Transformer for Multi-level Semantic Scene Understanding
di: Hao, Luoying, et al.
Pubblicazione: (2025)
di: Hao, Luoying, et al.
Pubblicazione: (2025)
TokenCompose: Text-to-Image Diffusion with Token-level Supervision
di: Wang, Zirui, et al.
Pubblicazione: (2023)
di: Wang, Zirui, et al.
Pubblicazione: (2023)
REDEditing: Relationship-Driven Precise Backdoor Poisoning on Text-to-Image Diffusion Models
di: Guo, Chongye, et al.
Pubblicazione: (2025)
di: Guo, Chongye, et al.
Pubblicazione: (2025)
Text2Street: Controllable Text-to-image Generation for Street Views
di: Su, Jinming, et al.
Pubblicazione: (2024)
di: Su, Jinming, et al.
Pubblicazione: (2024)
HTS-Attack: Heuristic Token Search for Jailbreaking Text-to-Image Models
di: Gao, Sensen, et al.
Pubblicazione: (2024)
di: Gao, Sensen, et al.
Pubblicazione: (2024)
Exploring Concept Subspace for Self-explainable Text-Attributed Graph Learning
di: Han, Xiaoxue, et al.
Pubblicazione: (2026)
di: Han, Xiaoxue, et al.
Pubblicazione: (2026)
Improving Long Text Understanding with Knowledge Distilled from Summarization Model
di: Liu, Yan, et al.
Pubblicazione: (2024)
di: Liu, Yan, et al.
Pubblicazione: (2024)
A Bounding Box is Worth One Token: Interleaving Layout and Text in a Large Language Model for Document Understanding
di: Lu, Jinghui, et al.
Pubblicazione: (2024)
di: Lu, Jinghui, et al.
Pubblicazione: (2024)
TextRegion: Text-Aligned Region Tokens from Frozen Image-Text Models
di: Xiao, Yao, et al.
Pubblicazione: (2025)
di: Xiao, Yao, et al.
Pubblicazione: (2025)
TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation
di: Qu, Liao, et al.
Pubblicazione: (2024)
di: Qu, Liao, et al.
Pubblicazione: (2024)
Understanding and Characterizing Obfuscated Funds Transfers in Ethereum Smart Contracts
di: Sheng, Zhang, et al.
Pubblicazione: (2025)
di: Sheng, Zhang, et al.
Pubblicazione: (2025)
UniTok: A Unified Tokenizer for Visual Generation and Understanding
di: Ma, Chuofan, et al.
Pubblicazione: (2025)
di: Ma, Chuofan, et al.
Pubblicazione: (2025)
Reinforcement Learning-Guided Chain-of-Draft for Token-Efficient Code Generation
di: Tang, Xunzhu, et al.
Pubblicazione: (2025)
di: Tang, Xunzhu, et al.
Pubblicazione: (2025)
Two-dimensional Weyl nodal-line semimetal and antihelical edge states in a modified Kane-Mele model
di: Dai, Xiaokang, et al.
Pubblicazione: (2024)
di: Dai, Xiaokang, et al.
Pubblicazione: (2024)
UniProcessor: A Text-induced Unified Low-level Image Processor
di: Duan, Huiyu, et al.
Pubblicazione: (2024)
di: Duan, Huiyu, et al.
Pubblicazione: (2024)
InsightTok: Improving Text and Face Fidelity in Discrete Tokenization for Autoregressive Image Generation
di: Yue, Yang, et al.
Pubblicazione: (2026)
di: Yue, Yang, et al.
Pubblicazione: (2026)
Advancing the Foundation Model for Music Understanding
di: Jiang, Yi, et al.
Pubblicazione: (2025)
di: Jiang, Yi, et al.
Pubblicazione: (2025)
Few-shot Defect Image Generation based on Consistency Modeling
di: Shi, Qingfeng, et al.
Pubblicazione: (2024)
di: Shi, Qingfeng, et al.
Pubblicazione: (2024)
Understanding Language Model Circuits through Knowledge Editing
di: Ge, Huaizhi, et al.
Pubblicazione: (2024)
di: Ge, Huaizhi, et al.
Pubblicazione: (2024)
T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT
di: Jiang, Dongzhi, et al.
Pubblicazione: (2025)
di: Jiang, Dongzhi, et al.
Pubblicazione: (2025)
2D-TPE: Two-Dimensional Positional Encoding Enhances Table Understanding for Large Language Models
di: Li, Jia-Nan, et al.
Pubblicazione: (2024)
di: Li, Jia-Nan, et al.
Pubblicazione: (2024)
UM-Text: A Unified Multimodal Model for Image Understanding and Visual Text Editing
di: Ma, Lichen, et al.
Pubblicazione: (2026)
di: Ma, Lichen, et al.
Pubblicazione: (2026)
Image Tokenizer Needs Post-Training
di: Qiu, Kai, et al.
Pubblicazione: (2025)
di: Qiu, Kai, et al.
Pubblicazione: (2025)
Lens: Rethinking Training Efficiency for Foundational Text-to-Image Models
di: Chen, Dong, et al.
Pubblicazione: (2026)
di: Chen, Dong, et al.
Pubblicazione: (2026)
Isomerization‐Cracking of Bio‐Octadecane to Sustainable Aviation Fuel on P‐Modulated Ni x P y /SAPO‐11
di: Xiaokang Yue, et al.
Pubblicazione: (2026)
di: Xiaokang Yue, et al.
Pubblicazione: (2026)
Postionization Mass Spectrometry Imaging: Past, Present, and Future
di: Xiaokang Guan, et al.
Pubblicazione: (2024)
di: Xiaokang Guan, et al.
Pubblicazione: (2024)
Aligning Text, Images, and 3D Structure Token-by-Token
di: Sahoo, Aadarsh, et al.
Pubblicazione: (2025)
di: Sahoo, Aadarsh, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Marten: Visual Question Answering with Mask Generation for Multi-modal Document Understanding
di: Wang, Zining, et al.
Pubblicazione: (2025) -
Multimodal Large Language Models for Text-rich Image Understanding: A Comprehensive Review
di: Fu, Pei, et al.
Pubblicazione: (2025) -
InstructOCR: Instruction Boosting Scene Text Spotting
di: Duan, Chen, et al.
Pubblicazione: (2024) -
ODM: A Text-Image Further Alignment Pre-training Approach for Scene Text Detection and Spotting
di: Duan, Chen, et al.
Pubblicazione: (2024) -
Bridging Synthetic and Real Worlds for Pre-training Scene Text Detectors
di: Guan, Tongkun, et al.
Pubblicazione: (2023)