A Survey of Video Datasets for Grounded Event Understanding
Fuente:
arXiv
Salvato in:
| Autori principali: | Sanders, Kate, Van Durme, Benjamin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Bonsai: Interpretable Tree-Adaptive Grounded Reasoning
di: Sanders, Kate, et al.
Pubblicazione: (2025)
di: Sanders, Kate, et al.
Pubblicazione: (2025)
TV-TREES: Multimodal Entailment Trees for Neuro-Symbolic Video Reasoning
di: Sanders, Kate, et al.
Pubblicazione: (2024)
di: Sanders, Kate, et al.
Pubblicazione: (2024)
VidEvent: A Large Dataset for Understanding Dynamic Evolution of Events in Videos
di: Liang, Baoyu, et al.
Pubblicazione: (2025)
di: Liang, Baoyu, et al.
Pubblicazione: (2025)
Grounding Partially-Defined Events in Multimodal Data
di: Sanders, Kate, et al.
Pubblicazione: (2024)
di: Sanders, Kate, et al.
Pubblicazione: (2024)
Think with Grounding: Curriculum Reinforced Reasoning with Video Grounding for Long Video Understanding
di: Chen, Houlun, et al.
Pubblicazione: (2026)
di: Chen, Houlun, et al.
Pubblicazione: (2026)
VideoITG: Multimodal Video Understanding with Instructed Temporal Grounding
di: Wang, Shihao, et al.
Pubblicazione: (2025)
di: Wang, Shihao, et al.
Pubblicazione: (2025)
Event-VStream: Event-Driven Real-Time Understanding for Long Video Streams
di: Guo, Zhenghui, et al.
Pubblicazione: (2026)
di: Guo, Zhenghui, et al.
Pubblicazione: (2026)
Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning
di: Chen, Ruizhe, et al.
Pubblicazione: (2025)
di: Chen, Ruizhe, et al.
Pubblicazione: (2025)
VideoTemp-o3: Harmonizing Temporal Grounding and Video Understanding in Agentic Thinking-with-Videos
di: Liu, Wenqi, et al.
Pubblicazione: (2026)
di: Liu, Wenqi, et al.
Pubblicazione: (2026)
Pause and Think: A Dataset and Benchmark for Video-Grounded Assistive Action Suggestion
di: Singh, Shivam, et al.
Pubblicazione: (2026)
di: Singh, Shivam, et al.
Pubblicazione: (2026)
Tur[k]ingBench: A Challenge Benchmark for Web Agents
di: Xu, Kevin, et al.
Pubblicazione: (2024)
di: Xu, Kevin, et al.
Pubblicazione: (2024)
Motion-Grounded Video Reasoning: Understanding and Perceiving Motion at Pixel Level
di: Deng, Andong, et al.
Pubblicazione: (2024)
di: Deng, Andong, et al.
Pubblicazione: (2024)
Enhancing Long Video Understanding via Hierarchical Event-Based Memory
di: Cheng, Dingxin, et al.
Pubblicazione: (2024)
di: Cheng, Dingxin, et al.
Pubblicazione: (2024)
Looking Beyond the Obvious: A Survey on Abstract Concept Recognition for Video Understanding
di: Mago, Gowreesh, et al.
Pubblicazione: (2025)
di: Mago, Gowreesh, et al.
Pubblicazione: (2025)
Video-EM: Event-Centric Episodic Memory for Long-Form Video Understanding
di: Wang, Yun, et al.
Pubblicazione: (2025)
di: Wang, Yun, et al.
Pubblicazione: (2025)
Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding
di: Clark, Christopher, et al.
Pubblicazione: (2026)
di: Clark, Christopher, et al.
Pubblicazione: (2026)
Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges
di: Akter, Sanjeda, et al.
Pubblicazione: (2025)
di: Akter, Sanjeda, et al.
Pubblicazione: (2025)
PinpointQA: A Dataset and Benchmark for Small Object-Centric Spatial Understanding in Indoor Videos
di: Zhou, Zhiyu, et al.
Pubblicazione: (2026)
di: Zhou, Zhiyu, et al.
Pubblicazione: (2026)
MSC: A Marine Wildlife Video Dataset with Grounded Segmentation and Clip-Level Captioning
di: Truong, Quang-Trung, et al.
Pubblicazione: (2025)
di: Truong, Quang-Trung, et al.
Pubblicazione: (2025)
QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design
di: Schneider, Benjamin, et al.
Pubblicazione: (2025)
di: Schneider, Benjamin, et al.
Pubblicazione: (2025)
A Survey on Generative AI and LLM for Video Generation, Understanding, and Streaming
di: Zhou, Pengyuan, et al.
Pubblicazione: (2024)
di: Zhou, Pengyuan, et al.
Pubblicazione: (2024)
Gaussian Mixture Proposals with Pull-Push Learning Scheme to Capture Diverse Events for Weakly Supervised Temporal Video Grounding
di: Kim, Sunoh, et al.
Pubblicazione: (2023)
di: Kim, Sunoh, et al.
Pubblicazione: (2023)
TimeSuite: Improving MLLMs for Long Video Understanding via Grounded Tuning
di: Zeng, Xiangyu, et al.
Pubblicazione: (2024)
di: Zeng, Xiangyu, et al.
Pubblicazione: (2024)
Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models
di: Wang, Haibo, et al.
Pubblicazione: (2024)
di: Wang, Haibo, et al.
Pubblicazione: (2024)
GUI-World: A Video Benchmark and Dataset for Multimodal GUI-oriented Understanding
di: Chen, Dongping, et al.
Pubblicazione: (2024)
di: Chen, Dongping, et al.
Pubblicazione: (2024)
VITATECS: A Diagnostic Dataset for Temporal Concept Understanding of Video-Language Models
di: Li, Shicheng, et al.
Pubblicazione: (2023)
di: Li, Shicheng, et al.
Pubblicazione: (2023)
MADTempo: An Interactive System for Multi-Event Temporal Video Retrieval with Query Augmentation
di: Vu, Huu-An, et al.
Pubblicazione: (2025)
di: Vu, Huu-An, et al.
Pubblicazione: (2025)
Transformer-based Spatial Grounding: A Comprehensive Survey
di: Haq, Ijazul, et al.
Pubblicazione: (2025)
di: Haq, Ijazul, et al.
Pubblicazione: (2025)
A Survey of 3D Reconstruction with Event Cameras
di: Xu, Chuanzhi, et al.
Pubblicazione: (2025)
di: Xu, Chuanzhi, et al.
Pubblicazione: (2025)
EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition
di: Wang, Xiao, et al.
Pubblicazione: (2025)
di: Wang, Xiao, et al.
Pubblicazione: (2025)
Outside Knowledge Conversational Video (OKCV) Dataset -- Dialoguing over Videos
di: Reichman, Benjamin, et al.
Pubblicazione: (2025)
di: Reichman, Benjamin, et al.
Pubblicazione: (2025)
Video Panels for Long Video Understanding
di: Doorenbos, Lars, et al.
Pubblicazione: (2025)
di: Doorenbos, Lars, et al.
Pubblicazione: (2025)
WikiVideo: Article Generation from Multiple Videos
di: Martin, Alexander, et al.
Pubblicazione: (2025)
di: Martin, Alexander, et al.
Pubblicazione: (2025)
EventVL: Understand Event Streams via Multimodal Large Language Model
di: Li, Pengteng, et al.
Pubblicazione: (2025)
di: Li, Pengteng, et al.
Pubblicazione: (2025)
When and Where do Events Switch in Multi-Event Video Generation?
di: Liao, Ruotong, et al.
Pubblicazione: (2025)
di: Liao, Ruotong, et al.
Pubblicazione: (2025)
Localizing Events in Videos with Multimodal Queries
di: Zhang, Gengyuan, et al.
Pubblicazione: (2024)
di: Zhang, Gengyuan, et al.
Pubblicazione: (2024)
VideoPrism: A Foundational Visual Encoder for Video Understanding
di: Zhao, Long, et al.
Pubblicazione: (2024)
di: Zhao, Long, et al.
Pubblicazione: (2024)
VideoMind: A Chain-of-LoRA Agent for Temporal-Grounded Video Reasoning
di: Liu, Ye, et al.
Pubblicazione: (2025)
di: Liu, Ye, et al.
Pubblicazione: (2025)
Personalized Video Summarization by Multimodal Video Understanding
di: Chen, Brian, et al.
Pubblicazione: (2024)
di: Chen, Brian, et al.
Pubblicazione: (2024)
CEIA: CLIP-Based Event-Image Alignment for Open-World Event-Based Understanding
di: Xu, Wenhao, et al.
Pubblicazione: (2024)
di: Xu, Wenhao, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Bonsai: Interpretable Tree-Adaptive Grounded Reasoning
di: Sanders, Kate, et al.
Pubblicazione: (2025) -
TV-TREES: Multimodal Entailment Trees for Neuro-Symbolic Video Reasoning
di: Sanders, Kate, et al.
Pubblicazione: (2024) -
VidEvent: A Large Dataset for Understanding Dynamic Evolution of Events in Videos
di: Liang, Baoyu, et al.
Pubblicazione: (2025) -
Grounding Partially-Defined Events in Multimodal Data
di: Sanders, Kate, et al.
Pubblicazione: (2024) -
Think with Grounding: Curriculum Reinforced Reasoning with Video Grounding for Long Video Understanding
di: Chen, Houlun, et al.
Pubblicazione: (2026)