Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis
Fuente:
arXiv
Salvato in:
| Autori principali: | Fu, Chaoyou, Dai, Yuhan, Luo, Yongdong, Li, Lei, Ren, Shuhuai, Zhang, Renrui, Wang, Zihan, Zhou, Chenyu, Shen, Yunhang, Zhang, Mengdan, Chen, Peixian, Li, Yanwei, Lin, Shaohui, Zhao, Sirui, Li, Ke, Xu, Tong, Zheng, Xiawu, Chen, Enhong, Shan, Caifeng, He, Ran, Sun, Xing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models
di: Fu, Chaoyou, et al.
Pubblicazione: (2023)
di: Fu, Chaoyou, et al.
Pubblicazione: (2023)
VEGA: Learning Interleaved Image-Text Comprehension in Vision-Language Large Models
di: Zhou, Chenyu, et al.
Pubblicazione: (2024)
di: Zhou, Chenyu, et al.
Pubblicazione: (2024)
Sparrow: Data-Efficient Video-LLM with Text-to-Image Augmentation
di: Yin, Shukang, et al.
Pubblicazione: (2024)
di: Yin, Shukang, et al.
Pubblicazione: (2024)
Video-MME-v2: Towards the Next Stage in Benchmarks for Comprehensive Video Understanding
di: Fu, Chaoyou, et al.
Pubblicazione: (2026)
di: Fu, Chaoyou, et al.
Pubblicazione: (2026)
Long-VITA: Scaling Large Multi-modal Models to 1 Million Tokens with Leading Short-Context Accuracy
di: Shen, Yunhang, et al.
Pubblicazione: (2025)
di: Shen, Yunhang, et al.
Pubblicazione: (2025)
Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs
di: Li, Xudong, et al.
Pubblicazione: (2025)
di: Li, Xudong, et al.
Pubblicazione: (2025)
Cantor: Inspiring Multimodal Chain-of-Thought of MLLM
di: Gao, Timin, et al.
Pubblicazione: (2024)
di: Gao, Timin, et al.
Pubblicazione: (2024)
MME-Survey: A Comprehensive Survey on Evaluation of Multimodal LLMs
di: Fu, Chaoyou, et al.
Pubblicazione: (2024)
di: Fu, Chaoyou, et al.
Pubblicazione: (2024)
Streaming Video Instruction Tuning
di: Xia, Jiaer, et al.
Pubblicazione: (2025)
di: Xia, Jiaer, et al.
Pubblicazione: (2025)
Are Video Models Ready as Zero-Shot Reasoners? An Empirical Study with the MME-CoF Benchmark
di: Guo, Ziyu, et al.
Pubblicazione: (2025)
di: Guo, Ziyu, et al.
Pubblicazione: (2025)
MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency
di: Jiang, Dongzhi, et al.
Pubblicazione: (2025)
di: Jiang, Dongzhi, et al.
Pubblicazione: (2025)
VideoDetective: Clue Hunting via both Extrinsic Query and Intrinsic Relevance for Long Video Understanding
di: Yang, Ruoliu, et al.
Pubblicazione: (2026)
di: Yang, Ruoliu, et al.
Pubblicazione: (2026)
MME-VideoOCR: Evaluating OCR-Based Capabilities of Multimodal LLMs in Video Scenarios
di: Shi, Yang, et al.
Pubblicazione: (2025)
di: Shi, Yang, et al.
Pubblicazione: (2025)
Tango: Taming Visual Signals for Efficient Video Large Language Models
di: Yin, Shukang, et al.
Pubblicazione: (2026)
di: Yin, Shukang, et al.
Pubblicazione: (2026)
HumanVideo-MME: Benchmarking MLLMs for Human-Centric Video Understanding
di: Cai, Yuxuan, et al.
Pubblicazione: (2025)
di: Cai, Yuxuan, et al.
Pubblicazione: (2025)
MME-Reasoning: A Comprehensive Benchmark for Logical Reasoning in MLLMs
di: Yuan, Jiakang, et al.
Pubblicazione: (2025)
di: Yuan, Jiakang, et al.
Pubblicazione: (2025)
Video-RAG: Visually-aligned Retrieval-Augmented Long Video Comprehension
di: Luo, Yongdong, et al.
Pubblicazione: (2024)
di: Luo, Yongdong, et al.
Pubblicazione: (2024)
Woodpecker: Hallucination Correction for Multimodal Large Language Models
di: Yin, Shukang, et al.
Pubblicazione: (2023)
di: Yin, Shukang, et al.
Pubblicazione: (2023)
VITA-Audio: Fast Interleaved Cross-Modal Token Generation for Efficient Large Speech-Language Model
di: Long, Zuwei, et al.
Pubblicazione: (2025)
di: Long, Zuwei, et al.
Pubblicazione: (2025)
MME-CoF-Pro: Evaluating Reasoning Coherence in Video Generative Models with Text and Visual Hints
di: Qi, Yu, et al.
Pubblicazione: (2026)
di: Qi, Yu, et al.
Pubblicazione: (2026)
Omni-Diffusion: Unified Multimodal Understanding and Generation with Masked Discrete Diffusion
di: Li, Lijiang, et al.
Pubblicazione: (2026)
di: Li, Lijiang, et al.
Pubblicazione: (2026)
A Survey on Multimodal Large Language Models
di: Yin, Shukang, et al.
Pubblicazione: (2023)
di: Yin, Shukang, et al.
Pubblicazione: (2023)
QuoTA: Query-oriented Token Assignment via CoT Query Decouple for Long Video Comprehension
di: Luo, Yongdong, et al.
Pubblicazione: (2025)
di: Luo, Yongdong, et al.
Pubblicazione: (2025)
SpeechParaling-Bench: A Comprehensive Benchmark for Paralinguistic-Aware Speech Generation
di: Liu, Ruohan, et al.
Pubblicazione: (2026)
di: Liu, Ruohan, et al.
Pubblicazione: (2026)
Class-Imbalanced Semi-Supervised Learning for Large-Scale Point Cloud Semantic Segmentation via Decoupling Optimization
di: Li, Mengtian, et al.
Pubblicazione: (2024)
di: Li, Mengtian, et al.
Pubblicazione: (2024)
Wavelet-based Frame Selection by Detecting Semantic Boundary for Long Video Understanding
di: Chen, Wang, et al.
Pubblicazione: (2026)
di: Chen, Wang, et al.
Pubblicazione: (2026)
MME-Unify: A Comprehensive Benchmark for Unified Multimodal Understanding and Generation Models
di: Xie, Wulin, et al.
Pubblicazione: (2025)
di: Xie, Wulin, et al.
Pubblicazione: (2025)
MME-Finance: A Multimodal Finance Benchmark for Expert-level Understanding and Reasoning
di: Gan, Ziliang, et al.
Pubblicazione: (2024)
di: Gan, Ziliang, et al.
Pubblicazione: (2024)
Event-Anchored Frame Selection for Effective Long-Video Understanding
di: Chen, Wang, et al.
Pubblicazione: (2026)
di: Chen, Wang, et al.
Pubblicazione: (2026)
Human-MME: A Holistic Evaluation Benchmark for Human-Centric Multimodal Large Language Models
di: Liu, Yuansen, et al.
Pubblicazione: (2025)
di: Liu, Yuansen, et al.
Pubblicazione: (2025)
PersonaVLM: Long-Term Personalized Multimodal LLMs
di: Nie, Chang, et al.
Pubblicazione: (2026)
di: Nie, Chang, et al.
Pubblicazione: (2026)
TempCompass: Do Video LLMs Really Understand Videos?
di: Liu, Yuanxin, et al.
Pubblicazione: (2024)
di: Liu, Yuanxin, et al.
Pubblicazione: (2024)
MELLM: A Flow-Guided Large Language Model for Micro-Expression Understanding
di: Zhao, Sirui, et al.
Pubblicazione: (2025)
di: Zhao, Sirui, et al.
Pubblicazione: (2025)
VideoXum: Cross-modal Visual and Textural Summarization of Videos
di: Lin, Jingyang, et al.
Pubblicazione: (2023)
di: Lin, Jingyang, et al.
Pubblicazione: (2023)
LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models
di: Li, Feng, et al.
Pubblicazione: (2024)
di: Li, Feng, et al.
Pubblicazione: (2024)
MMSearch: Benchmarking the Potential of Large Models as Multi-modal Search Engines
di: Jiang, Dongzhi, et al.
Pubblicazione: (2024)
di: Jiang, Dongzhi, et al.
Pubblicazione: (2024)
VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction
di: Fu, Chaoyou, et al.
Pubblicazione: (2025)
di: Fu, Chaoyou, et al.
Pubblicazione: (2025)
Knowledge-Guided Large Language Model for Automatic Pediatric Dental Record Understanding and Safe Antibiotic Recommendation
di: Han, Zihan, et al.
Pubblicazione: (2025)
di: Han, Zihan, et al.
Pubblicazione: (2025)
MME-RealWorld: Could Your Multimodal LLM Challenge High-Resolution Real-World Scenarios that are Difficult for Humans?
di: Zhang, Yi-Fan, et al.
Pubblicazione: (2024)
di: Zhang, Yi-Fan, et al.
Pubblicazione: (2024)
Bind-Your-Avatar: Multi-Talking-Character Video Generation with Dynamic 3D-mask-based Embedding Router
di: Huang, Yubo, et al.
Pubblicazione: (2025)
di: Huang, Yubo, et al.
Pubblicazione: (2025)
Documenti analoghi
-
MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models
di: Fu, Chaoyou, et al.
Pubblicazione: (2023) -
VEGA: Learning Interleaved Image-Text Comprehension in Vision-Language Large Models
di: Zhou, Chenyu, et al.
Pubblicazione: (2024) -
Sparrow: Data-Efficient Video-LLM with Text-to-Image Augmentation
di: Yin, Shukang, et al.
Pubblicazione: (2024) -
Video-MME-v2: Towards the Next Stage in Benchmarks for Comprehensive Video Understanding
di: Fu, Chaoyou, et al.
Pubblicazione: (2026) -
Long-VITA: Scaling Large Multi-modal Models to 1 Million Tokens with Leading Short-Context Accuracy
di: Shen, Yunhang, et al.
Pubblicazione: (2025)