StrucTexTv3: An Efficient Vision-Language Model for Text-rich Image Perception, Comprehension, and Beyond

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Lyu, Pengyuan, Li, Yulin, Zhou, Hao, Ma, Weihong, Wan, Xingyu, Xie, Qunyi, Wu, Liang, Zhang, Chengquan, Yao, Kun, Ding, Errui, Wang, Jingdong
Format: Preprint
Published: 2024
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!

Similar Items