MLVU: Benchmarking Multi-task Long Video Understanding
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhou, Junjie, Shu, Yan, Zhao, Bo, Wu, Boya, Liang, Zhengyang, Xiao, Shitao, Qin, Minghao, Yang, Xi, Xiong, Yongping, Zhang, Bo, Huang, Tiejun, Liu, Zheng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding
por: Shu, Yan, et al.
Publicado: (2024)
por: Shu, Yan, et al.
Publicado: (2024)
Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification
por: Qin, Minghao, et al.
Publicado: (2025)
por: Qin, Minghao, et al.
Publicado: (2025)
VISTA: Visualized Text Embedding For Universal Multi-Modal Retrieval
por: Zhou, Junjie, et al.
Publicado: (2024)
por: Zhou, Junjie, et al.
Publicado: (2024)
Task-Aware KV Compression For Cost-Effective Long Video Understanding
por: Qin, Minghao, et al.
Publicado: (2025)
por: Qin, Minghao, et al.
Publicado: (2025)
TimeScope: Towards Task-Oriented Temporal Grounding In Long Videos
por: Liu, Xiangrui, et al.
Publicado: (2025)
por: Liu, Xiangrui, et al.
Publicado: (2025)
MegaPairs: Massive Data Synthesis For Universal Multimodal Retrieval
por: Zhou, Junjie, et al.
Publicado: (2024)
por: Zhou, Junjie, et al.
Publicado: (2024)
Video-Browser: Towards Agentic Open-web Video Browsing
por: Liang, Zhengyang, et al.
Publicado: (2025)
por: Liang, Zhengyang, et al.
Publicado: (2025)
VideoExplorer: Think With Videos For Agentic Long-Video Understanding
por: Yuan, Huaying, et al.
Publicado: (2025)
por: Yuan, Huaying, et al.
Publicado: (2025)
MomentSeeker: A Task-Oriented Benchmark For Long-Video Moment Retrieval
por: Yuan, Huaying, et al.
Publicado: (2025)
por: Yuan, Huaying, et al.
Publicado: (2025)
Memory-enhanced Retrieval Augmentation for Long Video Understanding
por: Yuan, Huaying, et al.
Publicado: (2025)
por: Yuan, Huaying, et al.
Publicado: (2025)
Video-XL-Pro: Reconstructive Token Compression for Extremely Long Video Understanding
por: Liu, Xiangrui, et al.
Publicado: (2025)
por: Liu, Xiangrui, et al.
Publicado: (2025)
ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding
por: Ma, David, et al.
Publicado: (2025)
por: Ma, David, et al.
Publicado: (2025)
Progressive Video Condensation with MLLM Agent for Long-form Video Understanding
por: Yin, Yufei, et al.
Publicado: (2026)
por: Yin, Yufei, et al.
Publicado: (2026)
Efficient RGB-D Scene Understanding via Multi-task Adaptive Learning and Cross-dimensional Feature Guidance
por: Sun, Guodong, et al.
Publicado: (2026)
por: Sun, Guodong, et al.
Publicado: (2026)
Large Language Models as Foundations for Next-Gen Dense Retrieval: A Comprehensive Empirical Assessment
por: Luo, Kun, et al.
Publicado: (2024)
por: Luo, Kun, et al.
Publicado: (2024)
VideoARM: Agentic Reasoning over Hierarchical Memory for Long-Form Video Understanding
por: Yin, Yufei, et al.
Publicado: (2025)
por: Yin, Yufei, et al.
Publicado: (2025)
UVLM: Benchmarking Video Language Model for Underwater World Understanding
por: Xue, Xizhe, et al.
Publicado: (2025)
por: Xue, Xizhe, et al.
Publicado: (2025)
E-VAds: An E-commerce Short Videos Understanding Benchmark for MLLMs
por: Liu, Xianjie, et al.
Publicado: (2026)
por: Liu, Xianjie, et al.
Publicado: (2026)
$M^3EL$: A Multi-task Multi-topic Dataset for Multi-modal Entity Linking
por: Wang, Fang, et al.
Publicado: (2024)
por: Wang, Fang, et al.
Publicado: (2024)
v-HUB: A Benchmark for Video Humor Understanding from Vision and Sound
por: Shi, Zhengpeng, et al.
Publicado: (2025)
por: Shi, Zhengpeng, et al.
Publicado: (2025)
Towards Effective Long-Video Event Prediction via Multi-Level Event Semantics Mining
por: Peng, Bo, et al.
Publicado: (2026)
por: Peng, Bo, et al.
Publicado: (2026)
PhysLab: A Benchmark Dataset for Multi-Granularity Visual Parsing of Physics Experiments
por: Zou, Minghao, et al.
Publicado: (2025)
por: Zou, Minghao, et al.
Publicado: (2025)
OmniGen: Unified Image Generation
por: Xiao, Shitao, et al.
Publicado: (2024)
por: Xiao, Shitao, et al.
Publicado: (2024)
AIR-Bench: Automated Heterogeneous Information Retrieval Benchmark
por: Chen, Jianlyu, et al.
Publicado: (2024)
por: Chen, Jianlyu, et al.
Publicado: (2024)
Thinking with Drafts: Speculative Temporal Reasoning for Efficient Long Video Understanding
por: Hu, Pengfei, et al.
Publicado: (2025)
por: Hu, Pengfei, et al.
Publicado: (2025)
BGE Landmark Embedding: A Chunking-Free Embedding Method For Retrieval Augmented Long-Context Large Language Models
por: Luo, Kun, et al.
Publicado: (2024)
por: Luo, Kun, et al.
Publicado: (2024)
MILU: A Multi-task Indic Language Understanding Benchmark
por: Verma, Sshubam, et al.
Publicado: (2024)
por: Verma, Sshubam, et al.
Publicado: (2024)
TraceAV-Bench: Benchmarking Multi-Hop Trajectory Reasoning over Long Audio-Visual Videos
por: Feng, Hengyi, et al.
Publicado: (2026)
por: Feng, Hengyi, et al.
Publicado: (2026)
Ref-Long: Benchmarking the Long-context Referencing Capability of Long-context Language Models
por: Wu, Junjie, et al.
Publicado: (2025)
por: Wu, Junjie, et al.
Publicado: (2025)
Any Information Is Just Worth One Single Screenshot: Unifying Search With Visualized Information Retrieval
por: Liu, Ze, et al.
Publicado: (2025)
por: Liu, Ze, et al.
Publicado: (2025)
LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding
por: Wu, Haoning, et al.
Publicado: (2024)
por: Wu, Haoning, et al.
Publicado: (2024)
X-LeBench: A Benchmark for Extremely Long Egocentric Video Understanding
por: Zhou, Wenqi, et al.
Publicado: (2025)
por: Zhou, Wenqi, et al.
Publicado: (2025)
VideoOdyssey: A Benchmark for Ultra-Long-Context and Omni-Modal Video Understanding
por: He, Haichen, et al.
Publicado: (2026)
por: He, Haichen, et al.
Publicado: (2026)
MMVIAD: Multi-view Multi-task Video Understanding for Industrial Anomaly Detection
por: Zhao, Xiran, et al.
Publicado: (2026)
por: Zhao, Xiran, et al.
Publicado: (2026)
Hierarchical Long Video Understanding with Audiovisual Entity Cohesion and Agentic Search
por: Yin, Xinlei, et al.
Publicado: (2026)
por: Yin, Xinlei, et al.
Publicado: (2026)
Think, Then Verify: A Hypothesis-Verification Multi-Agent Framework for Long Video Understanding
por: Wang, Zheng, et al.
Publicado: (2026)
por: Wang, Zheng, et al.
Publicado: (2026)
Video-MTR: Reinforced Multi-Turn Reasoning for Long Video Understanding
por: Xie, Yuan, et al.
Publicado: (2025)
por: Xie, Yuan, et al.
Publicado: (2025)
Enhancing Long Video Understanding via Hierarchical Event-Based Memory
por: Cheng, Dingxin, et al.
Publicado: (2024)
por: Cheng, Dingxin, et al.
Publicado: (2024)
Efficient Multimodal Learning from Data-centric Perspective
por: He, Muyang, et al.
Publicado: (2024)
por: He, Muyang, et al.
Publicado: (2024)
Neptune: The Long Orbit to Benchmarking Long Video Understanding
por: Nagrani, Arsha, et al.
Publicado: (2024)
por: Nagrani, Arsha, et al.
Publicado: (2024)
Ejemplares similares
-
Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding
por: Shu, Yan, et al.
Publicado: (2024) -
Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification
por: Qin, Minghao, et al.
Publicado: (2025) -
VISTA: Visualized Text Embedding For Universal Multi-Modal Retrieval
por: Zhou, Junjie, et al.
Publicado: (2024) -
Task-Aware KV Compression For Cost-Effective Long Video Understanding
por: Qin, Minghao, et al.
Publicado: (2025) -
TimeScope: Towards Task-Oriented Temporal Grounding In Long Videos
por: Liu, Xiangrui, et al.
Publicado: (2025)