FriendsQA: A New Large-Scale Deep Video Understanding Dataset with Fine-grained Topic Categorization for Story Videos
Fuente:
arXiv
Salvato in:
| Autori principali: | Wu, Zhengqian, Li, Ruizhe, Xu, Zijun, Wang, Zhongyuan, Xiao, Chunxia, Liang, Chao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Towards Long Video Understanding via Fine-detailed Video Story Generation
di: You, Zeng, et al.
Pubblicazione: (2024)
di: You, Zeng, et al.
Pubblicazione: (2024)
SciPrompt: Knowledge-augmented Prompting for Fine-grained Categorization of Scientific Topics
di: You, Zhiwen, et al.
Pubblicazione: (2024)
di: You, Zhiwen, et al.
Pubblicazione: (2024)
Car-1000: A New Large Scale Fine-Grained Visual Categorization Dataset
di: Hu, Yutao, et al.
Pubblicazione: (2025)
di: Hu, Yutao, et al.
Pubblicazione: (2025)
VidEvent: A Large Dataset for Understanding Dynamic Evolution of Events in Videos
di: Liang, Baoyu, et al.
Pubblicazione: (2025)
di: Liang, Baoyu, et al.
Pubblicazione: (2025)
LLM4Brain: Training a Large Language Model for Brain Video Understanding
di: Zheng, Ruizhe, et al.
Pubblicazione: (2024)
di: Zheng, Ruizhe, et al.
Pubblicazione: (2024)
AdsQA: Towards Advertisement Video Understanding
di: Long, Xinwei, et al.
Pubblicazione: (2025)
di: Long, Xinwei, et al.
Pubblicazione: (2025)
WTS: A Pedestrian-Centric Traffic Video Dataset for Fine-grained Spatial-Temporal Understanding
di: Kong, Quan, et al.
Pubblicazione: (2024)
di: Kong, Quan, et al.
Pubblicazione: (2024)
SlowFocus: Enhancing Fine-grained Temporal Understanding in Video LLM
di: Nie, Ming, et al.
Pubblicazione: (2026)
di: Nie, Ming, et al.
Pubblicazione: (2026)
Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought
di: Zhang, Shuyi, et al.
Pubblicazione: (2025)
di: Zhang, Shuyi, et al.
Pubblicazione: (2025)
Fine-grained Spatiotemporal Grounding on Egocentric Videos
di: Liang, Shuo, et al.
Pubblicazione: (2025)
di: Liang, Shuo, et al.
Pubblicazione: (2025)
Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models
di: Wang, Haibo, et al.
Pubblicazione: (2024)
di: Wang, Haibo, et al.
Pubblicazione: (2024)
FineBadminton: A Multi-Level Dataset for Fine-Grained Badminton Video Understanding
di: He, Xusheng, et al.
Pubblicazione: (2025)
di: He, Xusheng, et al.
Pubblicazione: (2025)
Koala-36M: A Large-scale Video Dataset Improving Consistency between Fine-grained Conditions and Video Content
di: Wang, Qiuheng, et al.
Pubblicazione: (2024)
di: Wang, Qiuheng, et al.
Pubblicazione: (2024)
BASKET: A Large-Scale Video Dataset for Fine-Grained Skill Estimation
di: Pan, Yulu, et al.
Pubblicazione: (2025)
di: Pan, Yulu, et al.
Pubblicazione: (2025)
RoadSocial: A Diverse VideoQA Dataset and Benchmark for Road Event Understanding from Social Video Narratives
di: Parikh, Chirag, et al.
Pubblicazione: (2025)
di: Parikh, Chirag, et al.
Pubblicazione: (2025)
Large-scale and Fine-grained Vision-language Pre-training for Enhanced CT Image Understanding
di: Shui, Zhongyi, et al.
Pubblicazione: (2025)
di: Shui, Zhongyi, et al.
Pubblicazione: (2025)
Understanding Complexity in VideoQA via Visual Program Generation
di: Eyzaguirre, Cristobal, et al.
Pubblicazione: (2025)
di: Eyzaguirre, Cristobal, et al.
Pubblicazione: (2025)
VideoEspresso: A Large-Scale Chain-of-Thought Dataset for Fine-Grained Video Reasoning via Core Frame Selection
di: Han, Songhao, et al.
Pubblicazione: (2024)
di: Han, Songhao, et al.
Pubblicazione: (2024)
Scaling the Long Video Understanding of Multimodal Large Language Models via Visual Memory Mechanism
di: Chen, Tao, et al.
Pubblicazione: (2026)
di: Chen, Tao, et al.
Pubblicazione: (2026)
VideoMathQA: Benchmarking Mathematical Reasoning via Multimodal Understanding in Videos
di: Rasheed, Hanoona, et al.
Pubblicazione: (2025)
di: Rasheed, Hanoona, et al.
Pubblicazione: (2025)
Video SimpleQA: Towards Factuality Evaluation in Large Video Language Models
di: Cao, Meng, et al.
Pubblicazione: (2025)
di: Cao, Meng, et al.
Pubblicazione: (2025)
PinpointQA: A Dataset and Benchmark for Small Object-Centric Spatial Understanding in Indoor Videos
di: Zhou, Zhiyu, et al.
Pubblicazione: (2026)
di: Zhou, Zhiyu, et al.
Pubblicazione: (2026)
Trajectory Attention for Fine-grained Video Motion Control
di: Xiao, Zeqi, et al.
Pubblicazione: (2024)
di: Xiao, Zeqi, et al.
Pubblicazione: (2024)
VideoMind: An Omni-Modal Video Dataset with Intent Grounding for Deep-Cognitive Video Understanding
di: Yang, Baoyao, et al.
Pubblicazione: (2025)
di: Yang, Baoyao, et al.
Pubblicazione: (2025)
TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models
di: Cai, Mu, et al.
Pubblicazione: (2024)
di: Cai, Mu, et al.
Pubblicazione: (2024)
TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos
di: Kong, Fanheng, et al.
Pubblicazione: (2025)
di: Kong, Fanheng, et al.
Pubblicazione: (2025)
Linear Scaling Video VLMs for Long Video Understanding
di: Eyzaguirre, Cristobal, et al.
Pubblicazione: (2026)
di: Eyzaguirre, Cristobal, et al.
Pubblicazione: (2026)
Storyboard guided Alignment for Fine-grained Video Action Recognition
di: Liu, Enqi, et al.
Pubblicazione: (2024)
di: Liu, Enqi, et al.
Pubblicazione: (2024)
VideoQA in the Era of LLMs: An Empirical Study
di: Xiao, Junbin, et al.
Pubblicazione: (2024)
di: Xiao, Junbin, et al.
Pubblicazione: (2024)
Towards Emotion Analysis in Short-form Videos: A Large-Scale Dataset and Baseline
di: Wu, Xuecheng, et al.
Pubblicazione: (2023)
di: Wu, Xuecheng, et al.
Pubblicazione: (2023)
Video-in-the-Loop: Span-Grounded Long Video QA with Interleaved Reasoning
di: Wang, Chendong, et al.
Pubblicazione: (2025)
di: Wang, Chendong, et al.
Pubblicazione: (2025)
Shot2Story: A New Benchmark for Comprehensive Understanding of Multi-shot Videos
di: Han, Mingfei, et al.
Pubblicazione: (2023)
di: Han, Mingfei, et al.
Pubblicazione: (2023)
A Shortcut-aware Video-QA Benchmark for Physical Understanding via Minimal Video Pairs
di: Krojer, Benno, et al.
Pubblicazione: (2025)
di: Krojer, Benno, et al.
Pubblicazione: (2025)
TUMTraffic-VideoQA: A Benchmark for Unified Spatio-Temporal Video Understanding in Traffic Scenes
di: Zhou, Xingcheng, et al.
Pubblicazione: (2025)
di: Zhou, Xingcheng, et al.
Pubblicazione: (2025)
DocVideoQA: Towards Comprehensive Understanding of Document-Centric Videos through Question Answering
di: Wang, Haochen, et al.
Pubblicazione: (2025)
di: Wang, Haochen, et al.
Pubblicazione: (2025)
SpatialVID: A Large-Scale Video Dataset with Spatial Annotations
di: Wang, Jiahao, et al.
Pubblicazione: (2025)
di: Wang, Jiahao, et al.
Pubblicazione: (2025)
STF: Sentence Transformer Fine-Tuning For Topic Categorization With Limited Data
di: Daouadi, Kheir Eddine, et al.
Pubblicazione: (2024)
di: Daouadi, Kheir Eddine, et al.
Pubblicazione: (2024)
Caption Anything in Video: Fine-grained Object-centric Captioning via Spatiotemporal Multimodal Prompting
di: Tang, Yunlong, et al.
Pubblicazione: (2025)
di: Tang, Yunlong, et al.
Pubblicazione: (2025)
VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation
di: Zhang, Shi-Xue, et al.
Pubblicazione: (2025)
di: Zhang, Shi-Xue, et al.
Pubblicazione: (2025)
BEAR: A Video Dataset For Fine-grained Behaviors Recognition Oriented with Action and Environment Factors
di: Hu, Chengyang, et al.
Pubblicazione: (2025)
di: Hu, Chengyang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Towards Long Video Understanding via Fine-detailed Video Story Generation
di: You, Zeng, et al.
Pubblicazione: (2024) -
SciPrompt: Knowledge-augmented Prompting for Fine-grained Categorization of Scientific Topics
di: You, Zhiwen, et al.
Pubblicazione: (2024) -
Car-1000: A New Large Scale Fine-Grained Visual Categorization Dataset
di: Hu, Yutao, et al.
Pubblicazione: (2025) -
VidEvent: A Large Dataset for Understanding Dynamic Evolution of Events in Videos
di: Liang, Baoyu, et al.
Pubblicazione: (2025) -
LLM4Brain: Training a Large Language Model for Brain Video Understanding
di: Zheng, Ruizhe, et al.
Pubblicazione: (2024)