MME-VideoOCR: Evaluating OCR-Based Capabilities of Multimodal LLMs in Video Scenarios
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Shi, Yang, Wang, Huanqian, Xie, Wulin, Zhang, Huanyao, Zhao, Lijie, Zhang, Yi-Fan, Li, Xinfeng, Fu, Chaoyou, Wen, Zhuoer, Liu, Wenting, Zhang, Zhuoran, Chen, Xinlong, Zeng, Bohan, Yang, Sihan, Guan, Yushuo, Zhang, Zhang, Wang, Liang, Li, Haoxuan, Lin, Zhouchen, Zhang, Yuanxing, Wan, Pengfei, Wang, Haotian, Yang, Wenjing |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MME-Unify: A Comprehensive Benchmark for Unified Multimodal Understanding and Generation Models
par: Xie, Wulin, et autres
Publié: (2025)
par: Xie, Wulin, et autres
Publié: (2025)
Mavors: Multi-granularity Video Representation for Multimodal Large Language Model
par: Shi, Yang, et autres
Publié: (2025)
par: Shi, Yang, et autres
Publié: (2025)
VidBridge-R1: Bridging QA and Captioning for RL-based Video Understanding Models with Intermediate Proxy Tasks
par: Chen, Xinlong, et autres
Publié: (2025)
par: Chen, Xinlong, et autres
Publié: (2025)
The Unseen Bias: How Norm Discrepancy in Pre-Norm MLLMs Leads to Visual Information Loss
par: Li, Bozhou, et autres
Publié: (2025)
par: Li, Bozhou, et autres
Publié: (2025)
OmniOCR: Generalist OCR for Ethnic Minority Languages
par: Liu, Bonan, et autres
Publié: (2026)
par: Liu, Bonan, et autres
Publié: (2026)
HumanVideo-MME: Benchmarking MLLMs for Human-Centric Video Understanding
par: Cai, Yuxuan, et autres
Publié: (2025)
par: Cai, Yuxuan, et autres
Publié: (2025)
VidCapBench: A Comprehensive Benchmark of Video Captioning for Controllable Text-to-Video Generation
par: Chen, Xinlong, et autres
Publié: (2025)
par: Chen, Xinlong, et autres
Publié: (2025)
Agentar-Fin-OCR
par: Qian, Siyi, et autres
Publié: (2026)
par: Qian, Siyi, et autres
Publié: (2026)
GRAN-TED: Generating Robust, Aligned, and Nuanced Text Embedding for Diffusion Models
par: Li, Bozhou, et autres
Publié: (2025)
par: Li, Bozhou, et autres
Publié: (2025)
OCR-Quality: A Human-Annotated Dataset for OCR Quality Assessment
par: Zhang, Yulong
Publié: (2025)
par: Zhang, Yulong
Publié: (2025)
OCR Hinders RAG: Evaluating the Cascading Impact of OCR on Retrieval-Augmented Generation
par: Zhang, Junyuan, et autres
Publié: (2024)
par: Zhang, Junyuan, et autres
Publié: (2024)
When Good OCR Is Not Enough: Benchmarking OCR Robustness for Retrieval-Augmented Generation
par: Sun, Lin, et autres
Publié: (2026)
par: Sun, Lin, et autres
Publié: (2026)
GLM-OCR Technical Report
par: Duan, Shuaiqi, et autres
Publié: (2026)
par: Duan, Shuaiqi, et autres
Publié: (2026)
Ocean-OCR: Towards General OCR Application via a Vision-Language Model
par: Chen, Song, et autres
Publié: (2025)
par: Chen, Song, et autres
Publié: (2025)
HunyuanOCR Technical Report
par: Hunyuan Vision Team, et autres
Publié: (2025)
par: Hunyuan Vision Team, et autres
Publié: (2025)
ConsisDrive: Identity-Preserving Driving World Models for Video Generation by Instance Mask
par: Yang, Zhuoran, et autres
Publié: (2026)
par: Yang, Zhuoran, et autres
Publié: (2026)
MonkeyOCR: Document Parsing with a Structure-Recognition-Relation Triplet Paradigm
par: Li, Zhang, et autres
Publié: (2025)
par: Li, Zhang, et autres
Publié: (2025)
RealUnify: Do Unified Models Truly Benefit from Unification? A Comprehensive Benchmark
par: Shi, Yang, et autres
Publié: (2025)
par: Shi, Yang, et autres
Publié: (2025)
Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis
par: Fu, Chaoyou, et autres
Publié: (2024)
par: Fu, Chaoyou, et autres
Publié: (2024)
Video-MME-v2: Towards the Next Stage in Benchmarks for Comprehensive Video Understanding
par: Fu, Chaoyou, et autres
Publié: (2026)
par: Fu, Chaoyou, et autres
Publié: (2026)
PaddleOCR 3.0 Technical Report
par: Cui, Cheng, et autres
Publié: (2025)
par: Cui, Cheng, et autres
Publié: (2025)
XFEM‐Based Analysis of Crack Propagation in Cold‐Region Railway Tunnels Under Coupled Train Loads and Localized Frost Heave
par: Wei Chen, et autres
Publié: (2026)
par: Wei Chen, et autres
Publié: (2026)
OCR-Agent: Agentic OCR with Capability and Memory Reflection
par: Wen, Shimin, et autres
Publié: (2026)
par: Wen, Shimin, et autres
Publié: (2026)
Beyond Rational Illusion: Behaviorally Realistic Strategic Classification
par: Lv, Xinpeng, et autres
Publié: (2026)
par: Lv, Xinpeng, et autres
Publié: (2026)
TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document
par: Liu, Yuliang, et autres
Publié: (2024)
par: Liu, Yuliang, et autres
Publié: (2024)
DianJin-OCR-R1: Enhancing OCR Capabilities via a Reasoning-and-Tool Interleaved Vision-Language Model
par: Chen, Qian, et autres
Publié: (2025)
par: Chen, Qian, et autres
Publié: (2025)
Agentic-MME: What Agentic Capability Really Brings to Multimodal Intelligence?
par: Wei, Qianshan, et autres
Publié: (2026)
par: Wei, Qianshan, et autres
Publié: (2026)
Do Current Video LLMs Have Strong OCR Abilities? A Preliminary Study
par: Fei, Yulin, et autres
Publié: (2024)
par: Fei, Yulin, et autres
Publié: (2024)
When Modalities Conflict: How Unimodal Reasoning Uncertainty Governs Preference Dynamics in MLLMs
par: Zhang, Zhuoran, et autres
Publié: (2025)
par: Zhang, Zhuoran, et autres
Publié: (2025)
OCRGenBench: A Comprehensive Benchmark for Evaluating OCR Generative Capabilities
par: Zhang, Peirong, et autres
Publié: (2025)
par: Zhang, Peirong, et autres
Publié: (2025)
OpenGPT-4o-Image: A Comprehensive Dataset for Advanced Image Generation and Editing
par: Chen, Zhihong, et autres
Publié: (2025)
par: Chen, Zhihong, et autres
Publié: (2025)
Multimodal OCR: Parse Anything from Documents
par: Zheng, Handong, et autres
Publié: (2026)
par: Zheng, Handong, et autres
Publié: (2026)
Artifact-Bench: Evaluating MLLMs on Detecting and Assessing the Artifacts of AI-Generated Videos
par: Tang, Yuqi, et autres
Publié: (2026)
par: Tang, Yuqi, et autres
Publié: (2026)
MME-RealWorld: Could Your Multimodal LLM Challenge High-Resolution Real-World Scenarios that are Difficult for Humans?
par: Zhang, Yi-Fan, et autres
Publié: (2024)
par: Zhang, Yi-Fan, et autres
Publié: (2024)
CC-OCR: A Comprehensive and Challenging OCR Benchmark for Evaluating Large Multimodal Models in Literacy
par: Yang, Zhibo, et autres
Publié: (2024)
par: Yang, Zhibo, et autres
Publié: (2024)
OCR-Memory: Optical Context Retrieval for Long-Horizon Agent Memory
par: Li, Jinze, et autres
Publié: (2026)
par: Li, Jinze, et autres
Publié: (2026)
SRNeRV: A Scale-wise Recursive Framework for Neural Video Representation
par: Wang, Jia, et autres
Publié: (2026)
par: Wang, Jia, et autres
Publié: (2026)
UPOCR: Towards Unified Pixel-Level OCR Interface
par: Peng, Dezhi, et autres
Publié: (2023)
par: Peng, Dezhi, et autres
Publié: (2023)
MME-Reasoning: A Comprehensive Benchmark for Logical Reasoning in MLLMs
par: Yuan, Jiakang, et autres
Publié: (2025)
par: Yuan, Jiakang, et autres
Publié: (2025)
Seeing is Believing? Mitigating OCR Hallucinations in Multimodal Large Language Models
par: He, Zhentao, et autres
Publié: (2025)
par: He, Zhentao, et autres
Publié: (2025)
Documents similaires
-
MME-Unify: A Comprehensive Benchmark for Unified Multimodal Understanding and Generation Models
par: Xie, Wulin, et autres
Publié: (2025) -
Mavors: Multi-granularity Video Representation for Multimodal Large Language Model
par: Shi, Yang, et autres
Publié: (2025) -
VidBridge-R1: Bridging QA and Captioning for RL-based Video Understanding Models with Intermediate Proxy Tasks
par: Chen, Xinlong, et autres
Publié: (2025) -
The Unseen Bias: How Norm Discrepancy in Pre-Norm MLLMs Leads to Visual Information Loss
par: Li, Bozhou, et autres
Publié: (2025) -
OmniOCR: Generalist OCR for Ethnic Minority Languages
par: Liu, Bonan, et autres
Publié: (2026)