MovieRecapsQA: A Multimodal Open-Ended Video Question-Answering Benchmark
Fuente:
arXiv
Guardado en:
| Autores principales: | Shaar, Shaden, Thymes, Bradon, Chaixanien, Sirawut, Cardie, Claire, Hariharan, Bharath |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Ranking Distillation for Open-Ended Video Question Answering with Insufficient Labels
por: Liang, Tianming, et al.
Publicado: (2024)
por: Liang, Tianming, et al.
Publicado: (2024)
AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering
por: Chen, Xiuyuan, et al.
Publicado: (2023)
por: Chen, Xiuyuan, et al.
Publicado: (2023)
MovieChat+: Question-aware Sparse Memory for Long Video Question Answering
por: Song, Enxin, et al.
Publicado: (2024)
por: Song, Enxin, et al.
Publicado: (2024)
MOD-UV: Learning Mobile Object Detectors from Unlabeled Videos
por: Sun, Yihong, et al.
Publicado: (2024)
por: Sun, Yihong, et al.
Publicado: (2024)
Sports-QA: A Large-Scale Video Question Answering Benchmark for Complex and Professional Sports
por: Li, Haopeng, et al.
Publicado: (2024)
por: Li, Haopeng, et al.
Publicado: (2024)
InfoChartQA: A Benchmark for Multimodal Question Answering on Infographic Charts
por: Xie, Tianchi, et al.
Publicado: (2025)
por: Xie, Tianchi, et al.
Publicado: (2025)
TOGA: Temporally Grounded Open-Ended Video QA with Weak Supervision
por: Gupta, Ayush, et al.
Publicado: (2025)
por: Gupta, Ayush, et al.
Publicado: (2025)
DocVideoQA: Towards Comprehensive Understanding of Document-Centric Videos through Question Answering
por: Wang, Haochen, et al.
Publicado: (2025)
por: Wang, Haochen, et al.
Publicado: (2025)
RoadscapesQA: A Multitask, Multimodal Dataset for Visual Question Answering on Indian Roads
por: Iyer, Vijayasri, et al.
Publicado: (2026)
por: Iyer, Vijayasri, et al.
Publicado: (2026)
Overview of TREC 2024 Medical Video Question Answering (MedVidQA) Track
por: Gupta, Deepak, et al.
Publicado: (2024)
por: Gupta, Deepak, et al.
Publicado: (2024)
Neural-Symbolic VideoQA: Learning Compositional Spatio-Temporal Reasoning for Real-world Video Question Answering
por: Liang, Lili, et al.
Publicado: (2024)
por: Liang, Lili, et al.
Publicado: (2024)
RSVLM-QA: A Benchmark Dataset for Remote Sensing Vision Language Model-based Question Answering
por: Zi, Xing, et al.
Publicado: (2025)
por: Zi, Xing, et al.
Publicado: (2025)
NuScenes-QA: A Multi-modal Visual Question Answering Benchmark for Autonomous Driving Scenario
por: Qian, Tianwen, et al.
Publicado: (2023)
por: Qian, Tianwen, et al.
Publicado: (2023)
MMToM-QA: Multimodal Theory of Mind Question Answering
por: Jin, Chuanyang, et al.
Publicado: (2024)
por: Jin, Chuanyang, et al.
Publicado: (2024)
VideoMathQA: Benchmarking Mathematical Reasoning via Multimodal Understanding in Videos
por: Rasheed, Hanoona, et al.
Publicado: (2025)
por: Rasheed, Hanoona, et al.
Publicado: (2025)
VoQA: Visual-only Question Answering
por: An, Jianing, et al.
Publicado: (2025)
por: An, Jianing, et al.
Publicado: (2025)
Cinéaste: A Fine-grained Contextual Movie Question Answering Benchmark
por: Shah, Nisarg A., et al.
Publicado: (2025)
por: Shah, Nisarg A., et al.
Publicado: (2025)
VideoQA-SC: Adaptive Semantic Communication for Video Question Answering
por: Guo, Jiangyuan, et al.
Publicado: (2024)
por: Guo, Jiangyuan, et al.
Publicado: (2024)
CCTVBench: Contrastive Consistency Traffic VideoQA Benchmark for Multimodal LLMs
por: Zhou, Xingcheng, et al.
Publicado: (2026)
por: Zhou, Xingcheng, et al.
Publicado: (2026)
UpstreamQA: A Modular Framework for Explicit Reasoning on Video Question Answering Tasks
por: Nguyen, Jason, et al.
Publicado: (2026)
por: Nguyen, Jason, et al.
Publicado: (2026)
Live Interactive Training for Video Segmentation
por: Yang, Xinyu, et al.
Publicado: (2026)
por: Yang, Xinyu, et al.
Publicado: (2026)
"Previously on ..." From Recaps to Story Summarization
por: Singh, Aditya Kumar, et al.
Publicado: (2024)
por: Singh, Aditya Kumar, et al.
Publicado: (2024)
MONITRS: Multimodal Observations of Natural Incidents Through Remote Sensing
por: Revankar, Shreelekha, et al.
Publicado: (2025)
por: Revankar, Shreelekha, et al.
Publicado: (2025)
PitVQA++: Vector Matrix-Low-Rank Adaptation for Open-Ended Visual Question Answering in Pituitary Surgery
por: He, Runlong, et al.
Publicado: (2025)
por: He, Runlong, et al.
Publicado: (2025)
SViQA: A Unified Speech-Vision Multimodal Model for Textless Visual Question Answering
por: Li, Bingxin
Publicado: (2025)
por: Li, Bingxin
Publicado: (2025)
PuzzleWorld: A Benchmark for Multimodal, Open-Ended Reasoning in Puzzlehunts
por: Li, Hengzhi, et al.
Publicado: (2025)
por: Li, Hengzhi, et al.
Publicado: (2025)
UDVideoQA: A Traffic Video Question Answering Dataset for Multi-Object Spatio-Temporal Reasoning in Urban Dynamics
por: Vishal, Joseph Raj, et al.
Publicado: (2026)
por: Vishal, Joseph Raj, et al.
Publicado: (2026)
CTIS-QA: Clinical Template-Informed Slide-level Question Answering for Pathology
por: Lu, Hao, et al.
Publicado: (2026)
por: Lu, Hao, et al.
Publicado: (2026)
VeriSciQA: An Auto-Verified Dataset for Scientific Visual Question Answering
por: Li, Yuyi, et al.
Publicado: (2025)
por: Li, Yuyi, et al.
Publicado: (2025)
LeAdQA: LLM-Driven Context-Aware Temporal Grounding for Video Question Answering
por: Dong, Xinxin, et al.
Publicado: (2025)
por: Dong, Xinxin, et al.
Publicado: (2025)
MA-EgoQA: Question Answering over Egocentric Videos from Multiple Embodied Agents
por: Kim, Kangsan, et al.
Publicado: (2026)
por: Kim, Kangsan, et al.
Publicado: (2026)
CG-Bench: Clue-grounded Question Answering Benchmark for Long Video Understanding
por: Chen, Guo, et al.
Publicado: (2024)
por: Chen, Guo, et al.
Publicado: (2024)
ChineseVideoBench: Benchmarking Multi-modal Large Models for Chinese Video Question Answering
por: Nie, Yuxiang, et al.
Publicado: (2025)
por: Nie, Yuxiang, et al.
Publicado: (2025)
Answering Questions in Stages: Prompt Chaining for Contract QA
por: Roegiest, Adam, et al.
Publicado: (2024)
por: Roegiest, Adam, et al.
Publicado: (2024)
Composing People Together: Iterative Pose-Image Generation for Multi-Person Interaction Scenes
por: Peng, Wenxuan, et al.
Publicado: (2026)
por: Peng, Wenxuan, et al.
Publicado: (2026)
MAVIS: A Benchmark for Multimodal Source Attribution in Long-form Visual Question Answering
por: Song, Seokwon, et al.
Publicado: (2025)
por: Song, Seokwon, et al.
Publicado: (2025)
STRIDE-QA: Visual Question Answering Dataset for Spatiotemporal Reasoning in Urban Driving Scenes
por: Ishihara, Keishi, et al.
Publicado: (2025)
por: Ishihara, Keishi, et al.
Publicado: (2025)
LingoQA: Visual Question Answering for Autonomous Driving
por: Marcu, Ana-Maria, et al.
Publicado: (2023)
por: Marcu, Ana-Maria, et al.
Publicado: (2023)
VisualSimpleQA: A Benchmark for Decoupled Evaluation of Large Vision-Language Models in Fact-Seeking Question Answering
por: Wang, Yanling, et al.
Publicado: (2025)
por: Wang, Yanling, et al.
Publicado: (2025)
EgoCross: Benchmarking Multimodal Large Language Models for Cross-Domain Egocentric Video Question Answering
por: Li, Yanjun, et al.
Publicado: (2025)
por: Li, Yanjun, et al.
Publicado: (2025)
Ejemplares similares
-
Ranking Distillation for Open-Ended Video Question Answering with Insufficient Labels
por: Liang, Tianming, et al.
Publicado: (2024) -
AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering
por: Chen, Xiuyuan, et al.
Publicado: (2023) -
MovieChat+: Question-aware Sparse Memory for Long Video Question Answering
por: Song, Enxin, et al.
Publicado: (2024) -
MOD-UV: Learning Mobile Object Detectors from Unlabeled Videos
por: Sun, Yihong, et al.
Publicado: (2024) -
Sports-QA: A Large-Scale Video Question Answering Benchmark for Complex and Professional Sports
por: Li, Haopeng, et al.
Publicado: (2024)