H2VU-Benchmark: A Comprehensive Benchmark for Hierarchical Holistic Video Understanding
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wu, Qi, Zheng, Quanlong, Zhang, Yanhao, Xie, Junlin, Luo, Jinguo, Wang, Kuo, Liu, Peng, Xie, Qingsong, Zhen, Ru, Yang, Zhenyu, Lu, Haonan |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Free-MoRef: Instantly Multiplexing Context Perception Capabilities of Video-MLLMs within Single Inference
von: Wang, Kuo, et al.
Veröffentlicht: (2025)
von: Wang, Kuo, et al.
Veröffentlicht: (2025)
Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM
von: Liu, Peng, et al.
Veröffentlicht: (2025)
von: Liu, Peng, et al.
Veröffentlicht: (2025)
Layton: Latent Consistency Tokenizer for 1024-pixel Image Reconstruction and Generation by 256 Tokens
von: Xie, Qingsong, et al.
Veröffentlicht: (2025)
von: Xie, Qingsong, et al.
Veröffentlicht: (2025)
X-OmniClaw Technical Report: A Unified Mobile Agent for Multimodal Understanding and Interaction
von: Ren, Xiaoming, et al.
Veröffentlicht: (2026)
von: Ren, Xiaoming, et al.
Veröffentlicht: (2026)
MetaphorVU: Towards Metaphorical Video Understanding
von: Li, Zhuoqun, et al.
Veröffentlicht: (2026)
von: Li, Zhuoqun, et al.
Veröffentlicht: (2026)
Improved Visual-Spatial Reasoning via R1-Zero-Like Training
von: Liao, Zhenyi, et al.
Veröffentlicht: (2025)
von: Liao, Zhenyi, et al.
Veröffentlicht: (2025)
Video-MME-v2: Towards the Next Stage in Benchmarks for Comprehensive Video Understanding
von: Fu, Chaoyou, et al.
Veröffentlicht: (2026)
von: Fu, Chaoyou, et al.
Veröffentlicht: (2026)
MT-Video-Bench: A Holistic Video Understanding Benchmark for Evaluating Multimodal LLMs in Multi-Turn Dialogues
von: Pan, Yaning, et al.
Veröffentlicht: (2025)
von: Pan, Yaning, et al.
Veröffentlicht: (2025)
LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding
von: Shen, Xiaoqian, et al.
Veröffentlicht: (2024)
von: Shen, Xiaoqian, et al.
Veröffentlicht: (2024)
HEIE: MLLM-Based Hierarchical Explainable AIGC Image Implausibility Evaluator
von: Yang, Fan, et al.
Veröffentlicht: (2024)
von: Yang, Fan, et al.
Veröffentlicht: (2024)
OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning
von: Liang, Zhijia, et al.
Veröffentlicht: (2026)
von: Liang, Zhijia, et al.
Veröffentlicht: (2026)
MMBench-Video: A Long-Form Multi-Shot Benchmark for Holistic Video Understanding
von: Fang, Xinyu, et al.
Veröffentlicht: (2024)
von: Fang, Xinyu, et al.
Veröffentlicht: (2024)
Towards Video Thinking Test: A Holistic Benchmark for Advanced Video Reasoning and Understanding
von: Zhang, Yuanhan, et al.
Veröffentlicht: (2025)
von: Zhang, Yuanhan, et al.
Veröffentlicht: (2025)
MMSI-Video-Bench: A Holistic Benchmark for Video-Based Spatial Intelligence
von: Lin, Jingli, et al.
Veröffentlicht: (2025)
von: Lin, Jingli, et al.
Veröffentlicht: (2025)
MVBench: A Comprehensive Multi-modal Video Understanding Benchmark
von: Li, Kunchang, et al.
Veröffentlicht: (2023)
von: Li, Kunchang, et al.
Veröffentlicht: (2023)
VEFX-Bench: A Holistic Benchmark for Generic Video Editing and Visual Effects
von: Gao, Xiangbo, et al.
Veröffentlicht: (2026)
von: Gao, Xiangbo, et al.
Veröffentlicht: (2026)
Surgical Visual Understanding (SurgVU) Dataset
von: Zia, Aneeq, et al.
Veröffentlicht: (2025)
von: Zia, Aneeq, et al.
Veröffentlicht: (2025)
FaceScore: Benchmarking and Enhancing Face Quality in Human Generation
von: Liao, Zhenyi, et al.
Veröffentlicht: (2024)
von: Liao, Zhenyi, et al.
Veröffentlicht: (2024)
Raccoon: Prompt Extraction Benchmark of LLM-Integrated Applications
von: Wang, Junlin, et al.
Veröffentlicht: (2024)
von: Wang, Junlin, et al.
Veröffentlicht: (2024)
PEA-Diffusion: Parameter-Efficient Adapter with Knowledge Distillation in non-English Text-to-Image Generation
von: Ma, Jian, et al.
Veröffentlicht: (2023)
von: Ma, Jian, et al.
Veröffentlicht: (2023)
ViMU: Benchmarking Video Metaphorical Understanding
von: Li, Qi, et al.
Veröffentlicht: (2026)
von: Li, Qi, et al.
Veröffentlicht: (2026)
HAVEN: Hierarchically Aligned Multimodal Benchmark for Unified Video Understanding
von: Shi, Mengqi, et al.
Veröffentlicht: (2026)
von: Shi, Mengqi, et al.
Veröffentlicht: (2026)
FluxMem: Adaptive Hierarchical Memory for Streaming Video Understanding
von: Xie, Yiweng, et al.
Veröffentlicht: (2026)
von: Xie, Yiweng, et al.
Veröffentlicht: (2026)
FAVOR-Bench: A Comprehensive Benchmark for Fine-Grained Video Motion Understanding
von: Tu, Chongjun, et al.
Veröffentlicht: (2025)
von: Tu, Chongjun, et al.
Veröffentlicht: (2025)
Benchmarking Table Comprehension In The Wild
von: Pan, Yikang, et al.
Veröffentlicht: (2024)
von: Pan, Yikang, et al.
Veröffentlicht: (2024)
ExpVid: A Benchmark for Experiment Video Understanding & Reasoning
von: Xu, Yicheng, et al.
Veröffentlicht: (2025)
von: Xu, Yicheng, et al.
Veröffentlicht: (2025)
Thinking in Streaming Video
von: Liu, Zikang, et al.
Veröffentlicht: (2026)
von: Liu, Zikang, et al.
Veröffentlicht: (2026)
Uncovering What, Why and How: A Comprehensive Benchmark for Causation Understanding of Video Anomaly
von: Du, Hang, et al.
Veröffentlicht: (2024)
von: Du, Hang, et al.
Veröffentlicht: (2024)
Video-MMLU: A Massive Multi-Discipline Lecture Understanding Benchmark
von: Song, Enxin, et al.
Veröffentlicht: (2025)
von: Song, Enxin, et al.
Veröffentlicht: (2025)
Federated Learning for Medical Image Classification: A Comprehensive Benchmark
von: Zhou, Zhekai, et al.
Veröffentlicht: (2025)
von: Zhou, Zhekai, et al.
Veröffentlicht: (2025)
VisFinEval: A Scenario-Driven Chinese Multimodal Benchmark for Holistic Financial Understanding
von: Liu, Zhaowei, et al.
Veröffentlicht: (2025)
von: Liu, Zhaowei, et al.
Veröffentlicht: (2025)
In the Eye of MLLM: Benchmarking Egocentric Video Intent Understanding with Gaze-Guided Prompting
von: Peng, Taiying, et al.
Veröffentlicht: (2025)
von: Peng, Taiying, et al.
Veröffentlicht: (2025)
UniER: A Unified Benchmark for Item-level and Path-level Exercise Recommendation
von: Cheng, Xinghe, et al.
Veröffentlicht: (2026)
von: Cheng, Xinghe, et al.
Veröffentlicht: (2026)
ELV-Halluc: Benchmarking Semantic Aggregation Hallucinations in Long Video Understanding
von: Lu, Hao, et al.
Veröffentlicht: (2025)
von: Lu, Hao, et al.
Veröffentlicht: (2025)
TextVidBench: A Benchmark for Long Video Scene Text Understanding
von: Zhong, Yangyang, et al.
Veröffentlicht: (2025)
von: Zhong, Yangyang, et al.
Veröffentlicht: (2025)
SPORTU: A Comprehensive Sports Understanding Benchmark for Multimodal Large Language Models
von: Xia, Haotian, et al.
Veröffentlicht: (2024)
von: Xia, Haotian, et al.
Veröffentlicht: (2024)
SVBench: A Benchmark with Temporal Multi-Turn Dialogues for Streaming Video Understanding
von: Yang, Zhenyu, et al.
Veröffentlicht: (2025)
von: Yang, Zhenyu, et al.
Veröffentlicht: (2025)
MMTS-BENCH: A Comprehensive Benchmark for Time Series Understanding and Reasoning
von: Yin, Yao, et al.
Veröffentlicht: (2026)
von: Yin, Yao, et al.
Veröffentlicht: (2026)
Are Vision LLMs Road-Ready? A Comprehensive Benchmark for Safety-Critical Driving Video Understanding
von: Zeng, Tong, et al.
Veröffentlicht: (2025)
von: Zeng, Tong, et al.
Veröffentlicht: (2025)
Flattery in Motion: Benchmarking and Analyzing Sycophancy in Video-LLMs
von: Zhou, Wenrui, et al.
Veröffentlicht: (2025)
von: Zhou, Wenrui, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Free-MoRef: Instantly Multiplexing Context Perception Capabilities of Video-MLLMs within Single Inference
von: Wang, Kuo, et al.
Veröffentlicht: (2025) -
Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM
von: Liu, Peng, et al.
Veröffentlicht: (2025) -
Layton: Latent Consistency Tokenizer for 1024-pixel Image Reconstruction and Generation by 256 Tokens
von: Xie, Qingsong, et al.
Veröffentlicht: (2025) -
X-OmniClaw Technical Report: A Unified Mobile Agent for Multimodal Understanding and Interaction
von: Ren, Xiaoming, et al.
Veröffentlicht: (2026) -
MetaphorVU: Towards Metaphorical Video Understanding
von: Li, Zhuoqun, et al.
Veröffentlicht: (2026)