E.T. Bench: Towards Open-Ended Event-Level Video-Language Understanding
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Ye, Ma, Zongyang, Qi, Zhongang, Wu, Yang, Shan, Ying, Chen, Chang Wen |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
UniPixel: Unified Object Referring and Segmentation for Pixel-Level Visual Reasoning
di: Liu, Ye, et al.
Pubblicazione: (2025)
di: Liu, Ye, et al.
Pubblicazione: (2025)
EA-VTR: Event-Aware Video-Text Retrieval
di: Ma, Zongyang, et al.
Pubblicazione: (2024)
di: Ma, Zongyang, et al.
Pubblicazione: (2024)
AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding
di: Xu, Weili, et al.
Pubblicazione: (2025)
di: Xu, Weili, et al.
Pubblicazione: (2025)
PosterLLaVa: Constructing a Unified Multi-modal Layout Generator with LLM
di: Yang, Tao, et al.
Pubblicazione: (2024)
di: Yang, Tao, et al.
Pubblicazione: (2024)
How to Make Cross Encoder a Good Teacher for Efficient Image-Text Retrieval?
di: Chen, Yuxin, et al.
Pubblicazione: (2024)
di: Chen, Yuxin, et al.
Pubblicazione: (2024)
VideoMaker: Zero-shot Customized Video Generation with the Inherent Force of Video Diffusion Models
di: Wu, Tao, et al.
Pubblicazione: (2024)
di: Wu, Tao, et al.
Pubblicazione: (2024)
CustomCrafter: Customized Video Generation with Preserving Motion and Concept Composition Abilities
di: Wu, Tao, et al.
Pubblicazione: (2024)
di: Wu, Tao, et al.
Pubblicazione: (2024)
DOGR: Towards Versatile Visual Document Grounding and Referring
di: Zhou, Yinan, et al.
Pubblicazione: (2024)
di: Zhou, Yinan, et al.
Pubblicazione: (2024)
SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction
di: Zhang, Zhixiong, et al.
Pubblicazione: (2026)
di: Zhang, Zhixiong, et al.
Pubblicazione: (2026)
OSMa-Bench++: Toward Open-Ended Benchmarking of Semantic Mapping for Manipulation with Prompt-Generated Synthetic Scenes
di: Kurkova, Regina, et al.
Pubblicazione: (2026)
di: Kurkova, Regina, et al.
Pubblicazione: (2026)
EmoVid: A Multimodal Emotion Video Dataset for Emotion-Centric Video Understanding and Generation
di: Qiu, Zongyang, et al.
Pubblicazione: (2025)
di: Qiu, Zongyang, et al.
Pubblicazione: (2025)
VEU-Bench: Towards Comprehensive Understanding of Video Editing
di: Li, Bozheng, et al.
Pubblicazione: (2025)
di: Li, Bozheng, et al.
Pubblicazione: (2025)
LayoutDiffusion: Controllable Diffusion Model for Layout-to-image Generation
di: Zheng, Guangcong, et al.
Pubblicazione: (2023)
di: Zheng, Guangcong, et al.
Pubblicazione: (2023)
SphereDiffusion: Spherical Geometry-Aware Distortion Resilient Diffusion Model
di: Wu, Tao, et al.
Pubblicazione: (2024)
di: Wu, Tao, et al.
Pubblicazione: (2024)
iMOVE: Instance-Motion-Aware Video Understanding
di: Li, Jiaze, et al.
Pubblicazione: (2025)
di: Li, Jiaze, et al.
Pubblicazione: (2025)
Towards Open-Ended Visual Scientific Discovery with Sparse Autoencoders
di: Stevens, Samuel, et al.
Pubblicazione: (2025)
di: Stevens, Samuel, et al.
Pubblicazione: (2025)
InstructionBench: An Instructional Video Understanding Benchmark
di: Wei, Haiwan, et al.
Pubblicazione: (2025)
di: Wei, Haiwan, et al.
Pubblicazione: (2025)
Ranking Distillation for Open-Ended Video Question Answering with Insufficient Labels
di: Liang, Tianming, et al.
Pubblicazione: (2024)
di: Liang, Tianming, et al.
Pubblicazione: (2024)
AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering
di: Chen, Xiuyuan, et al.
Pubblicazione: (2023)
di: Chen, Xiuyuan, et al.
Pubblicazione: (2023)
Hawk: Learning to Understand Open-World Video Anomalies
di: Tang, Jiaqi, et al.
Pubblicazione: (2024)
di: Tang, Jiaqi, et al.
Pubblicazione: (2024)
Towards Event-oriented Long Video Understanding
di: Du, Yifan, et al.
Pubblicazione: (2024)
di: Du, Yifan, et al.
Pubblicazione: (2024)
EventMemAgent: Hierarchical Event-Centric Memory for Online Video Understanding with Adaptive Tool Use
di: Wen, Siwei, et al.
Pubblicazione: (2026)
di: Wen, Siwei, et al.
Pubblicazione: (2026)
Generative Region-Language Pretraining for Open-Ended Object Detection
di: Lin, Chuang, et al.
Pubblicazione: (2024)
di: Lin, Chuang, et al.
Pubblicazione: (2024)
ShotBench: Expert-Level Cinematic Understanding in Vision-Language Models
di: Liu, Hongbo, et al.
Pubblicazione: (2025)
di: Liu, Hongbo, et al.
Pubblicazione: (2025)
Q-Bench-Video: Benchmarking the Video Quality Understanding of LMMs
di: Zhang, Zicheng, et al.
Pubblicazione: (2024)
di: Zhang, Zicheng, et al.
Pubblicazione: (2024)
StyleAdapter: A Unified Stylized Image Generation Model
di: Wang, Zhouxia, et al.
Pubblicazione: (2023)
di: Wang, Zhouxia, et al.
Pubblicazione: (2023)
TennisExpert: Towards Expert-Level Analytical Sports Video Understanding
di: Liu, Zhaoyu, et al.
Pubblicazione: (2026)
di: Liu, Zhaoyu, et al.
Pubblicazione: (2026)
EventBench: Towards Comprehensive Benchmarking of Event-based MLLMs
di: Liu, Shaoyu, et al.
Pubblicazione: (2025)
di: Liu, Shaoyu, et al.
Pubblicazione: (2025)
Open-Event Procedure Planning in Instructional Videos
di: Wu, Yilu, et al.
Pubblicazione: (2024)
di: Wu, Yilu, et al.
Pubblicazione: (2024)
Towards Safe Mobility: A Unified Transportation Foundation Model enabled by Open-Ended Vision-Language Dataset
di: Huang, Wenhui, et al.
Pubblicazione: (2026)
di: Huang, Wenhui, et al.
Pubblicazione: (2026)
OpenGaussian: Towards Point-Level 3D Gaussian-based Open Vocabulary Understanding
di: Wu, Yanmin, et al.
Pubblicazione: (2024)
di: Wu, Yanmin, et al.
Pubblicazione: (2024)
MovieBench: A Hierarchical Movie Level Dataset for Long Video Generation
di: Wu, Weijia, et al.
Pubblicazione: (2024)
di: Wu, Weijia, et al.
Pubblicazione: (2024)
TextVidBench: A Benchmark for Long Video Scene Text Understanding
di: Zhong, Yangyang, et al.
Pubblicazione: (2025)
di: Zhong, Yangyang, et al.
Pubblicazione: (2025)
VADER: Towards Causal Video Anomaly Understanding with Relation-Aware Large Language Models
di: Cheng, Ying, et al.
Pubblicazione: (2025)
di: Cheng, Ying, et al.
Pubblicazione: (2025)
MovieRecapsQA: A Multimodal Open-Ended Video Question-Answering Benchmark
di: Shaar, Shaden, et al.
Pubblicazione: (2026)
di: Shaar, Shaden, et al.
Pubblicazione: (2026)
Hierarchical Auto-Organizing System for Open-Ended Multi-Agent Navigation
di: Zhao, Zhonghan, et al.
Pubblicazione: (2024)
di: Zhao, Zhonghan, et al.
Pubblicazione: (2024)
VCR-Bench: A Comprehensive Evaluation Framework for Video Chain-of-Thought Reasoning
di: Qi, Yukun, et al.
Pubblicazione: (2025)
di: Qi, Yukun, et al.
Pubblicazione: (2025)
Taming Rectified Flow for Inversion and Editing
di: Wang, Jiangshan, et al.
Pubblicazione: (2024)
di: Wang, Jiangshan, et al.
Pubblicazione: (2024)
Open-Det: An Efficient Learning Framework for Open-Ended Detection
di: Cao, Guiping, et al.
Pubblicazione: (2025)
di: Cao, Guiping, et al.
Pubblicazione: (2025)
TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision
di: Gupta, Ayush, et al.
Pubblicazione: (2025)
di: Gupta, Ayush, et al.
Pubblicazione: (2025)
Documenti analoghi
-
UniPixel: Unified Object Referring and Segmentation for Pixel-Level Visual Reasoning
di: Liu, Ye, et al.
Pubblicazione: (2025) -
EA-VTR: Event-Aware Video-Text Retrieval
di: Ma, Zongyang, et al.
Pubblicazione: (2024) -
AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding
di: Xu, Weili, et al.
Pubblicazione: (2025) -
PosterLLaVa: Constructing a Unified Multi-modal Layout Generator with LLM
di: Yang, Tao, et al.
Pubblicazione: (2024) -
How to Make Cross Encoder a Good Teacher for Efficient Image-Text Retrieval?
di: Chen, Yuxin, et al.
Pubblicazione: (2024)