Video-MME-v2: Towards the Next Stage in Benchmarks for Comprehensive Video Understanding
Fuente:
arXiv
Salvato in:
| Autori principali: | Fu, Chaoyou, Yuan, Haozhi, Dong, Yuhao, Zhang, Yi-Fan, Shen, Yunhang, Hu, Xiaoxing, Li, Xueying, Su, Jinsen, Long, Chengwu, Xie, Xiaoyao, Xie, Yongkang, Zheng, Xiawu, Yang, Xue, Cao, Haoyu, Wu, Yunsheng, Liu, Ziwei, Sun, Xing, Shan, Caifeng, He, Ran |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models
di: Fu, Chaoyou, et al.
Pubblicazione: (2023)
di: Fu, Chaoyou, et al.
Pubblicazione: (2023)
Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis
di: Fu, Chaoyou, et al.
Pubblicazione: (2024)
di: Fu, Chaoyou, et al.
Pubblicazione: (2024)
MME-Survey: A Comprehensive Survey on Evaluation of Multimodal LLMs
di: Fu, Chaoyou, et al.
Pubblicazione: (2024)
di: Fu, Chaoyou, et al.
Pubblicazione: (2024)
VideoDetective: Clue Hunting via both Extrinsic Query and Intrinsic Relevance for Long Video Understanding
di: Yang, Ruoliu, et al.
Pubblicazione: (2026)
di: Yang, Ruoliu, et al.
Pubblicazione: (2026)
Omni-Diffusion: Unified Multimodal Understanding and Generation with Masked Discrete Diffusion
di: Li, Lijiang, et al.
Pubblicazione: (2026)
di: Li, Lijiang, et al.
Pubblicazione: (2026)
VEGA: Learning Interleaved Image-Text Comprehension in Vision-Language Large Models
di: Zhou, Chenyu, et al.
Pubblicazione: (2024)
di: Zhou, Chenyu, et al.
Pubblicazione: (2024)
HumanVideo-MME: Benchmarking MLLMs for Human-Centric Video Understanding
di: Cai, Yuxuan, et al.
Pubblicazione: (2025)
di: Cai, Yuxuan, et al.
Pubblicazione: (2025)
MME-Unify: A Comprehensive Benchmark for Unified Multimodal Understanding and Generation Models
di: Xie, Wulin, et al.
Pubblicazione: (2025)
di: Xie, Wulin, et al.
Pubblicazione: (2025)
MME-VideoOCR: Evaluating OCR-Based Capabilities of Multimodal LLMs in Video Scenarios
di: Shi, Yang, et al.
Pubblicazione: (2025)
di: Shi, Yang, et al.
Pubblicazione: (2025)
Video-RAG: Visually-aligned Retrieval-Augmented Long Video Comprehension
di: Luo, Yongdong, et al.
Pubblicazione: (2024)
di: Luo, Yongdong, et al.
Pubblicazione: (2024)
VITA: Towards Open-Source Interactive Omni Multimodal LLM
di: Fu, Chaoyou, et al.
Pubblicazione: (2024)
di: Fu, Chaoyou, et al.
Pubblicazione: (2024)
VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction
di: Fu, Chaoyou, et al.
Pubblicazione: (2025)
di: Fu, Chaoyou, et al.
Pubblicazione: (2025)
MME-Reasoning: A Comprehensive Benchmark for Logical Reasoning in MLLMs
di: Yuan, Jiakang, et al.
Pubblicazione: (2025)
di: Yuan, Jiakang, et al.
Pubblicazione: (2025)
Long-VITA: Scaling Large Multi-modal Models to 1 Million Tokens with Leading Short-Context Accuracy
di: Shen, Yunhang, et al.
Pubblicazione: (2025)
di: Shen, Yunhang, et al.
Pubblicazione: (2025)
Video Unsupervised Domain Adaptation with Deep Learning: A Comprehensive Survey
di: Xu, Yuecong, et al.
Pubblicazione: (2022)
di: Xu, Yuecong, et al.
Pubblicazione: (2022)
SpeechParaling-Bench: A Comprehensive Benchmark for Paralinguistic-Aware Speech Generation
di: Liu, Ruohan, et al.
Pubblicazione: (2026)
di: Liu, Ruohan, et al.
Pubblicazione: (2026)
Sparrow: Data-Efficient Video-LLM with Text-to-Image Augmentation
di: Yin, Shukang, et al.
Pubblicazione: (2024)
di: Yin, Shukang, et al.
Pubblicazione: (2024)
PersonaVLM: Long-Term Personalized Multimodal LLMs
di: Nie, Chang, et al.
Pubblicazione: (2026)
di: Nie, Chang, et al.
Pubblicazione: (2026)
QuoTA: Query-oriented Token Assignment via CoT Query Decouple for Long Video Comprehension
di: Luo, Yongdong, et al.
Pubblicazione: (2025)
di: Luo, Yongdong, et al.
Pubblicazione: (2025)
Human-MME: A Holistic Evaluation Benchmark for Human-Centric Multimodal Large Language Models
di: Liu, Yuansen, et al.
Pubblicazione: (2025)
di: Liu, Yuansen, et al.
Pubblicazione: (2025)
VITA-VLA: Efficiently Teaching Vision-Language Models to Act via Action Expert Distillation
di: Dong, Shaoqi, et al.
Pubblicazione: (2025)
di: Dong, Shaoqi, et al.
Pubblicazione: (2025)
A2RBench: An Automatic Paradigm for Formally Verifiable Abstract Reasoning Benchmark Generation
di: Ma, Qingchuan, et al.
Pubblicazione: (2026)
di: Ma, Qingchuan, et al.
Pubblicazione: (2026)
Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM
di: Wang, Xiong, et al.
Pubblicazione: (2024)
di: Wang, Xiong, et al.
Pubblicazione: (2024)
FunQA: Towards Surprising Video Comprehension
di: Xie, Binzhu, et al.
Pubblicazione: (2023)
di: Xie, Binzhu, et al.
Pubblicazione: (2023)
Cantor: Inspiring Multimodal Chain-of-Thought of MLLM
di: Gao, Timin, et al.
Pubblicazione: (2024)
di: Gao, Timin, et al.
Pubblicazione: (2024)
Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs
di: Li, Xudong, et al.
Pubblicazione: (2025)
di: Li, Xudong, et al.
Pubblicazione: (2025)
MME-CoF-Pro: Evaluating Reasoning Coherence in Video Generative Models with Text and Visual Hints
di: Qi, Yu, et al.
Pubblicazione: (2026)
di: Qi, Yu, et al.
Pubblicazione: (2026)
Exposing and Defending the Achilles' Heel of Video Mixture-of-Experts
di: Wang, Songping, et al.
Pubblicazione: (2026)
di: Wang, Songping, et al.
Pubblicazione: (2026)
VITA-E: Natural Embodied Interaction with Concurrent Seeing, Hearing, Speaking, and Acting
di: Liu, Xiaoyu, et al.
Pubblicazione: (2025)
di: Liu, Xiaoyu, et al.
Pubblicazione: (2025)
Event-Anchored Frame Selection for Effective Long-Video Understanding
di: Chen, Wang, et al.
Pubblicazione: (2026)
di: Chen, Wang, et al.
Pubblicazione: (2026)
MME-Finance: A Multimodal Finance Benchmark for Expert-level Understanding and Reasoning
di: Gan, Ziliang, et al.
Pubblicazione: (2024)
di: Gan, Ziliang, et al.
Pubblicazione: (2024)
Towards Video Thinking Test: A Holistic Benchmark for Advanced Video Reasoning and Understanding
di: Zhang, Yuanhan, et al.
Pubblicazione: (2025)
di: Zhang, Yuanhan, et al.
Pubblicazione: (2025)
Are Video Models Ready as Zero-Shot Reasoners? An Empirical Study with the MME-CoF Benchmark
di: Guo, Ziyu, et al.
Pubblicazione: (2025)
di: Guo, Ziyu, et al.
Pubblicazione: (2025)
Agentic-MME: What Agentic Capability Really Brings to Multimodal Intelligence?
di: Wei, Qianshan, et al.
Pubblicazione: (2026)
di: Wei, Qianshan, et al.
Pubblicazione: (2026)
Wavelet-based Frame Selection by Detecting Semantic Boundary for Long Video Understanding
di: Chen, Wang, et al.
Pubblicazione: (2026)
di: Chen, Wang, et al.
Pubblicazione: (2026)
RunawayEvil: Jailbreaking the Image-to-Video Generative Models
di: Wang, Songping, et al.
Pubblicazione: (2025)
di: Wang, Songping, et al.
Pubblicazione: (2025)
Parameter instance learning with enhanced vision transformers for aerial person re‐identification
di: Houfu Peng, et al.
Pubblicazione: (2024)
di: Houfu Peng, et al.
Pubblicazione: (2024)
InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption
di: Fan, Tiehan, et al.
Pubblicazione: (2024)
di: Fan, Tiehan, et al.
Pubblicazione: (2024)
MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency
di: Jiang, Dongzhi, et al.
Pubblicazione: (2025)
di: Jiang, Dongzhi, et al.
Pubblicazione: (2025)
Compressed-Domain-Aware Online Video Super-Resolution
di: Wang, Yuhang, et al.
Pubblicazione: (2026)
di: Wang, Yuhang, et al.
Pubblicazione: (2026)
Documenti analoghi
-
MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models
di: Fu, Chaoyou, et al.
Pubblicazione: (2023) -
Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis
di: Fu, Chaoyou, et al.
Pubblicazione: (2024) -
MME-Survey: A Comprehensive Survey on Evaluation of Multimodal LLMs
di: Fu, Chaoyou, et al.
Pubblicazione: (2024) -
VideoDetective: Clue Hunting via both Extrinsic Query and Intrinsic Relevance for Long Video Understanding
di: Yang, Ruoliu, et al.
Pubblicazione: (2026) -
Omni-Diffusion: Unified Multimodal Understanding and Generation with Masked Discrete Diffusion
di: Li, Lijiang, et al.
Pubblicazione: (2026)