MME-VideoOCR: Evaluating OCR-Based Capabilities of Multimodal LLMs in Video Scenarios

Fuente: arXiv
Enregistré dans:
Détails bibliographiques
Auteurs principaux: Shi, Yang, Wang, Huanqian, Xie, Wulin, Zhang, Huanyao, Zhao, Lijie, Zhang, Yi-Fan, Li, Xinfeng, Fu, Chaoyou, Wen, Zhuoer, Liu, Wenting, Zhang, Zhuoran, Chen, Xinlong, Zeng, Bohan, Yang, Sihan, Guan, Yushuo, Zhang, Zhang, Wang, Liang, Li, Haoxuan, Lin, Zhouchen, Zhang, Yuanxing, Wan, Pengfei, Wang, Haotian, Yang, Wenjing
Format: Preprint
Publié: 2025
Sujets:
Accès en ligne:
Tags: Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!

Documents similaires