Multimodal Large Language Models for Text-rich Image Understanding: A Comprehensive Review
Fuente:
arXiv
Salvato in:
| Autori principali: | Fu, Pei, Guan, Tongkun, Wang, Zining, Guo, Zhentao, Duan, Chen, Sun, Hao, Chen, Boming, Ma, Jiayao, Jiang, Qianyi, Zhou, Kai, Luo, Junfeng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Marten: Visual Question Answering with Mask Generation for Multi-modal Document Understanding
di: Wang, Zining, et al.
Pubblicazione: (2025)
di: Wang, Zining, et al.
Pubblicazione: (2025)
A Token-level Text Image Foundation Model for Document Understanding
di: Guan, Tongkun, et al.
Pubblicazione: (2025)
di: Guan, Tongkun, et al.
Pubblicazione: (2025)
InstructOCR: Instruction Boosting Scene Text Spotting
di: Duan, Chen, et al.
Pubblicazione: (2024)
di: Duan, Chen, et al.
Pubblicazione: (2024)
ODM: A Text-Image Further Alignment Pre-training Approach for Scene Text Detection and Spotting
di: Duan, Chen, et al.
Pubblicazione: (2024)
di: Duan, Chen, et al.
Pubblicazione: (2024)
PositionOCR: Augmenting Positional Awareness in Multi-Modal Models via Hybrid Specialist Integration
di: Duan, Chen, et al.
Pubblicazione: (2026)
di: Duan, Chen, et al.
Pubblicazione: (2026)
InstructTable: Improving Table Structure Recognition Through Instructions
di: Chen, Boming, et al.
Pubblicazione: (2026)
di: Chen, Boming, et al.
Pubblicazione: (2026)
ArtAug: Enhancing Text-to-Image Generation through Synthesis-Understanding Interaction
di: Duan, Zhongjie, et al.
Pubblicazione: (2024)
di: Duan, Zhongjie, et al.
Pubblicazione: (2024)
TextCoT: Zoom In for Enhanced Multimodal Text-Rich Image Understanding
di: Luan, Bozhi, et al.
Pubblicazione: (2024)
di: Luan, Bozhi, et al.
Pubblicazione: (2024)
MULTI: Multimodal Understanding Leaderboard with Text and Images
di: Zhu, Zichen, et al.
Pubblicazione: (2024)
di: Zhu, Zichen, et al.
Pubblicazione: (2024)
Text2Street: Controllable Text-to-image Generation for Street Views
di: Su, Jinming, et al.
Pubblicazione: (2024)
di: Su, Jinming, et al.
Pubblicazione: (2024)
Bridging Synthetic and Real Worlds for Pre-training Scene Text Detectors
di: Guan, Tongkun, et al.
Pubblicazione: (2023)
di: Guan, Tongkun, et al.
Pubblicazione: (2023)
Understanding Large Language Models in Your Pockets: Performance Study on COTS Mobile Devices
di: Xiao, Jie, et al.
Pubblicazione: (2024)
di: Xiao, Jie, et al.
Pubblicazione: (2024)
UM-Text: A Unified Multimodal Model for Image Understanding and Visual Text Editing
di: Ma, Lichen, et al.
Pubblicazione: (2026)
di: Ma, Lichen, et al.
Pubblicazione: (2026)
UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs
di: Jiang, Houcheng, et al.
Pubblicazione: (2026)
di: Jiang, Houcheng, et al.
Pubblicazione: (2026)
InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation
di: Wang, Yi, et al.
Pubblicazione: (2023)
di: Wang, Yi, et al.
Pubblicazione: (2023)
Offline Model-Based Optimization: Comprehensive Review
di: Kim, Minsu, et al.
Pubblicazione: (2025)
di: Kim, Minsu, et al.
Pubblicazione: (2025)
VEGA: Learning Interleaved Image-Text Comprehension in Vision-Language Large Models
di: Zhou, Chenyu, et al.
Pubblicazione: (2024)
di: Zhou, Chenyu, et al.
Pubblicazione: (2024)
Ultrasound Report Generation with Multimodal Large Language Models for Standardized Texts
di: Ge, Peixuan, et al.
Pubblicazione: (2025)
di: Ge, Peixuan, et al.
Pubblicazione: (2025)
A Multimode Soft Robot Based on a Single Braided Tube
di: Zhenhao Jia, et al.
Pubblicazione: (2025)
di: Zhenhao Jia, et al.
Pubblicazione: (2025)
Distributed Interpretability and Control for Large Language Models
di: Zhu, Zining
Pubblicazione: (2026)
di: Zhu, Zining
Pubblicazione: (2026)
REDEditing: Relationship-Driven Precise Backdoor Poisoning on Text-to-Image Diffusion Models
di: Guo, Chongye, et al.
Pubblicazione: (2025)
di: Guo, Chongye, et al.
Pubblicazione: (2025)
VIP: Versatile Image Outpainting Empowered by Multimodal Large Language Model
di: Yang, Jinze, et al.
Pubblicazione: (2024)
di: Yang, Jinze, et al.
Pubblicazione: (2024)
Unified Multimodal Understanding and Generation Models: Advances, Challenges, and Opportunities
di: Zhao, Shanshan, et al.
Pubblicazione: (2025)
di: Zhao, Shanshan, et al.
Pubblicazione: (2025)
Fractal structure of Christ-Lee model
di: Zhang, Boming, et al.
Pubblicazione: (2025)
di: Zhang, Boming, et al.
Pubblicazione: (2025)
PosFormer: Recognizing Complex Handwritten Mathematical Expression with Position Forest Transformer
di: Guan, Tongkun, et al.
Pubblicazione: (2024)
di: Guan, Tongkun, et al.
Pubblicazione: (2024)
Multimodal Imaging in the Comprehensive Evaluation of Kohler Disease: A Case Report and Literature Review
di: Juan Liu, et al.
Pubblicazione: (2026)
di: Juan Liu, et al.
Pubblicazione: (2026)
CoMM: A Coherent Interleaved Image-Text Dataset for Multimodal Understanding and Generation
di: Chen, Wei, et al.
Pubblicazione: (2024)
di: Chen, Wei, et al.
Pubblicazione: (2024)
Dynamic Optimization and Safety Indicator Injection for Jailbreaking Text-to-Image Models with Multimodal Safety Filters
di: Chen, Zixuan, et al.
Pubblicazione: (2025)
di: Chen, Zixuan, et al.
Pubblicazione: (2025)
StrucTexTv3: An Efficient Vision-Language Model for Text-rich Image Perception, Comprehension, and Beyond
di: Lyu, Pengyuan, et al.
Pubblicazione: (2024)
di: Lyu, Pengyuan, et al.
Pubblicazione: (2024)
ARTIST: Improving the Generation of Text-rich Images with Disentangled Diffusion Models and Large Language Models
di: Zhang, Jianyi, et al.
Pubblicazione: (2024)
di: Zhang, Jianyi, et al.
Pubblicazione: (2024)
Beyond Facts: Benchmarking Distributional Reading Comprehension in Large Language Models
di: Guo, Pei-Fu, et al.
Pubblicazione: (2026)
di: Guo, Pei-Fu, et al.
Pubblicazione: (2026)
Boosting Text-To-Image Generation via Multilingual Prompting in Large Multimodal Models
di: Mu, Yongyu, et al.
Pubblicazione: (2025)
di: Mu, Yongyu, et al.
Pubblicazione: (2025)
From Narrow to Panoramic Vision: Attention-Guided Cold-Start Reshapes Multimodal Reasoning
di: Luo, Ruilin, et al.
Pubblicazione: (2026)
di: Luo, Ruilin, et al.
Pubblicazione: (2026)
COHERENCE: Benchmarking Fine-Grained Image-Text Alignment in Interleaved Multimodal Contexts
di: Wang, Bingli, et al.
Pubblicazione: (2026)
di: Wang, Bingli, et al.
Pubblicazione: (2026)
VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding
di: Zhang, Zhihong, et al.
Pubblicazione: (2025)
di: Zhang, Zhihong, et al.
Pubblicazione: (2025)
Minimal Nilpotent Orbits of type D and E
di: Jia, Boming
Pubblicazione: (2025)
di: Jia, Boming
Pubblicazione: (2025)
Highest Weight Varieties and Narayana Numbers
di: Jia, Boming
Pubblicazione: (2023)
di: Jia, Boming
Pubblicazione: (2023)
The Affine Closure of T^*(SL_n/U)
di: Jia, Boming
Pubblicazione: (2021)
di: Jia, Boming
Pubblicazione: (2021)
SPORTU: A Comprehensive Sports Understanding Benchmark for Multimodal Large Language Models
di: Xia, Haotian, et al.
Pubblicazione: (2024)
di: Xia, Haotian, et al.
Pubblicazione: (2024)
Benchmarking Egocentric Clinical Intent Understanding Capability for Medical Multimodal Large Language Models
di: Liu, Shaonan, et al.
Pubblicazione: (2026)
di: Liu, Shaonan, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Marten: Visual Question Answering with Mask Generation for Multi-modal Document Understanding
di: Wang, Zining, et al.
Pubblicazione: (2025) -
A Token-level Text Image Foundation Model for Document Understanding
di: Guan, Tongkun, et al.
Pubblicazione: (2025) -
InstructOCR: Instruction Boosting Scene Text Spotting
di: Duan, Chen, et al.
Pubblicazione: (2024) -
ODM: A Text-Image Further Alignment Pre-training Approach for Scene Text Detection and Spotting
di: Duan, Chen, et al.
Pubblicazione: (2024) -
PositionOCR: Augmenting Positional Awareness in Multi-Modal Models via Hybrid Specialist Integration
di: Duan, Chen, et al.
Pubblicazione: (2026)