AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Chen, Xiuyuan, Lin, Yuan, Zhang, Yuchen, Huang, Weiran |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2023
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
MovieRecapsQA: A Multimodal Open-Ended Video Question-Answering Benchmark
von: Shaar, Shaden, et al.
Veröffentlicht: (2026)
von: Shaar, Shaden, et al.
Veröffentlicht: (2026)
Ranking Distillation for Open-Ended Video Question Answering with Insufficient Labels
von: Liang, Tianming, et al.
Veröffentlicht: (2024)
von: Liang, Tianming, et al.
Veröffentlicht: (2024)
A Benchmarking Methodology to Assess Open-Source Video Large Language Models in Automatic Captioning of News Videos
von: Paredes, David Miranda, et al.
Veröffentlicht: (2026)
von: Paredes, David Miranda, et al.
Veröffentlicht: (2026)
ChineseVideoBench: Benchmarking Multi-modal Large Models for Chinese Video Question Answering
von: Nie, Yuxiang, et al.
Veröffentlicht: (2025)
von: Nie, Yuxiang, et al.
Veröffentlicht: (2025)
VideoDistill: Language-aware Vision Distillation for Video Question Answering
von: Zou, Bo, et al.
Veröffentlicht: (2024)
von: Zou, Bo, et al.
Veröffentlicht: (2024)
AutoOcc: Automatic Open-Ended Semantic Occupancy Annotation via Vision-Language Guided Gaussian Splatting
von: Zhou, Xiaoyu, et al.
Veröffentlicht: (2025)
von: Zhou, Xiaoyu, et al.
Veröffentlicht: (2025)
Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding
von: Yuan, Liping, et al.
Veröffentlicht: (2025)
von: Yuan, Liping, et al.
Veröffentlicht: (2025)
ViLA: Efficient Video-Language Alignment for Video Question Answering
von: Wang, Xijun, et al.
Veröffentlicht: (2023)
von: Wang, Xijun, et al.
Veröffentlicht: (2023)
EvalCrafter: Benchmarking and Evaluating Large Video Generation Models
von: Liu, Yaofang, et al.
Veröffentlicht: (2023)
von: Liu, Yaofang, et al.
Veröffentlicht: (2023)
HORNet: Task-Guided Frame Selection for Video Question Answering with Vision-Language Models
von: Bai, Xiangyu, et al.
Veröffentlicht: (2026)
von: Bai, Xiangyu, et al.
Veröffentlicht: (2026)
VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding
von: Kim, Younggun, et al.
Veröffentlicht: (2025)
von: Kim, Younggun, et al.
Veröffentlicht: (2025)
CG-Bench: Clue-grounded Question Answering Benchmark for Long Video Understanding
von: Chen, Guo, et al.
Veröffentlicht: (2024)
von: Chen, Guo, et al.
Veröffentlicht: (2024)
Empowering Large Language Model for Continual Video Question Answering with Collaborative Prompting
von: Cai, Chen, et al.
Veröffentlicht: (2024)
von: Cai, Chen, et al.
Veröffentlicht: (2024)
EgoCross: Benchmarking Multimodal Large Language Models for Cross-Domain Egocentric Video Question Answering
von: Li, Yanjun, et al.
Veröffentlicht: (2025)
von: Li, Yanjun, et al.
Veröffentlicht: (2025)
E.T. Bench: Towards Open-Ended Event-Level Video-Language Understanding
von: Liu, Ye, et al.
Veröffentlicht: (2024)
von: Liu, Ye, et al.
Veröffentlicht: (2024)
Bridging Vision Language Models and Symbolic Grounding for Video Question Answering
von: Ma, Haodi, et al.
Veröffentlicht: (2025)
von: Ma, Haodi, et al.
Veröffentlicht: (2025)
VideoEval: Comprehensive Benchmark Suite for Low-Cost Evaluation of Video Foundation Model
von: Li, Xinhao, et al.
Veröffentlicht: (2024)
von: Li, Xinhao, et al.
Veröffentlicht: (2024)
AutoHallusion: Automatic Generation of Hallucination Benchmarks for Vision-Language Models
von: Wu, Xiyang, et al.
Veröffentlicht: (2024)
von: Wu, Xiyang, et al.
Veröffentlicht: (2024)
Uncertainty-Guided Self-Questioning and Answering for Video-Language Alignment
von: Chen, Jin, et al.
Veröffentlicht: (2024)
von: Chen, Jin, et al.
Veröffentlicht: (2024)
Sports-QA: A Large-Scale Video Question Answering Benchmark for Complex and Professional Sports
von: Li, Haopeng, et al.
Veröffentlicht: (2024)
von: Li, Haopeng, et al.
Veröffentlicht: (2024)
Fewer Tokens and Fewer Videos: Extending Video Understanding Abilities in Large Vision-Language Models
von: Chen, Shimin, et al.
Veröffentlicht: (2024)
von: Chen, Shimin, et al.
Veröffentlicht: (2024)
VideoAuto-R1: Video Auto Reasoning via Thinking Once, Answering Twice
von: Liu, Shuming, et al.
Veröffentlicht: (2026)
von: Liu, Shuming, et al.
Veröffentlicht: (2026)
Prompting Video-Language Foundation Models with Domain-specific Fine-grained Heuristics for Video Question Answering
von: Yu, Ting, et al.
Veröffentlicht: (2024)
von: Yu, Ting, et al.
Veröffentlicht: (2024)
POLYCHARTQA: Benchmarking Large Vision-Language Models with Multilingual Chart Question Answering
von: Xu, Yichen, et al.
Veröffentlicht: (2025)
von: Xu, Yichen, et al.
Veröffentlicht: (2025)
Advancing Egocentric Video Question Answering with Multimodal Large Language Models
von: Patel, Alkesh, et al.
Veröffentlicht: (2025)
von: Patel, Alkesh, et al.
Veröffentlicht: (2025)
Benchmarking Vision, Language, & Action Models in Procedurally Generated, Open Ended Action Environments
von: Guruprasad, Pranav, et al.
Veröffentlicht: (2025)
von: Guruprasad, Pranav, et al.
Veröffentlicht: (2025)
Neuro Symbolic Knowledge Reasoning for Procedural Video Question Answering
von: Fernando, Basura, et al.
Veröffentlicht: (2025)
von: Fernando, Basura, et al.
Veröffentlicht: (2025)
TransMed: Large Language Models Enhance Vision Transformer for Biomedical Image Classification
von: Zheng, Kaipeng, et al.
Veröffentlicht: (2023)
von: Zheng, Kaipeng, et al.
Veröffentlicht: (2023)
Grounded Question-Answering in Long Egocentric Videos
von: Di, Shangzhe, et al.
Veröffentlicht: (2023)
von: Di, Shangzhe, et al.
Veröffentlicht: (2023)
Agentic Keyframe Search for Video Question Answering
von: Fan, Sunqi, et al.
Veröffentlicht: (2025)
von: Fan, Sunqi, et al.
Veröffentlicht: (2025)
Admitting Ignorance Helps the Video Question Answering Models to Answer
von: Li, Haopeng, et al.
Veröffentlicht: (2025)
von: Li, Haopeng, et al.
Veröffentlicht: (2025)
REVEAL: Relation-based Video Representation Learning for Video-Question-Answering
von: Chaybouti, Sofian, et al.
Veröffentlicht: (2025)
von: Chaybouti, Sofian, et al.
Veröffentlicht: (2025)
Streaming Video Question-Answering with In-context Video KV-Cache Retrieval
von: Di, Shangzhe, et al.
Veröffentlicht: (2025)
von: Di, Shangzhe, et al.
Veröffentlicht: (2025)
TUBench: Benchmarking Large Vision-Language Models on Trustworthiness with Unanswerable Questions
von: He, Xingwei, et al.
Veröffentlicht: (2024)
von: He, Xingwei, et al.
Veröffentlicht: (2024)
LvBench: A Benchmark for Long-form Video Understanding with Versatile Multi-modal Question Answering
von: Zhang, Hongjie, et al.
Veröffentlicht: (2023)
von: Zhang, Hongjie, et al.
Veröffentlicht: (2023)
CHIRP: A Fine-Grained Benchmark for Open-Ended Response Evaluation in Vision-Language Models
von: Roger, Alexis, et al.
Veröffentlicht: (2025)
von: Roger, Alexis, et al.
Veröffentlicht: (2025)
CaST-Bench: Benchmarking Causal Chain-Grounded Spatio-Temporal Reasoning for Video Question Answering
von: Zhang, Mingfang, et al.
Veröffentlicht: (2026)
von: Zhang, Mingfang, et al.
Veröffentlicht: (2026)
Generative Region-Language Pretraining for Open-Ended Object Detection
von: Lin, Chuang, et al.
Veröffentlicht: (2024)
von: Lin, Chuang, et al.
Veröffentlicht: (2024)
Rolling Sink: Bridging Limited-Horizon Training and Open-Ended Testing in Autoregressive Video Diffusion
von: Li, Haodong, et al.
Veröffentlicht: (2026)
von: Li, Haodong, et al.
Veröffentlicht: (2026)
Follow the Rules: Reasoning for Video Anomaly Detection with Large Language Models
von: Yang, Yuchen, et al.
Veröffentlicht: (2024)
von: Yang, Yuchen, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
MovieRecapsQA: A Multimodal Open-Ended Video Question-Answering Benchmark
von: Shaar, Shaden, et al.
Veröffentlicht: (2026) -
Ranking Distillation for Open-Ended Video Question Answering with Insufficient Labels
von: Liang, Tianming, et al.
Veröffentlicht: (2024) -
A Benchmarking Methodology to Assess Open-Source Video Large Language Models in Automatic Captioning of News Videos
von: Paredes, David Miranda, et al.
Veröffentlicht: (2026) -
ChineseVideoBench: Benchmarking Multi-modal Large Models for Chinese Video Question Answering
von: Nie, Yuxiang, et al.
Veröffentlicht: (2025) -
VideoDistill: Language-aware Vision Distillation for Video Question Answering
von: Zou, Bo, et al.
Veröffentlicht: (2024)