VERIFIED: A Video Corpus Moment Retrieval Benchmark for Fine-Grained Video Understanding
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Houlun, Wang, Xin, Chen, Hong, Zhang, Zeyang, Feng, Wei, Huang, Bin, Jia, Jia, Zhu, Wenwu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Think with Grounding: Curriculum Reinforced Reasoning with Video Grounding for Long Video Understanding
di: Chen, Houlun, et al.
Pubblicazione: (2026)
di: Chen, Houlun, et al.
Pubblicazione: (2026)
Multi-sentence Video Grounding for Long Video Generation
di: Feng, Wei, et al.
Pubblicazione: (2024)
di: Feng, Wei, et al.
Pubblicazione: (2024)
LLM4VG: Large Language Models Evaluation for Video Grounding
di: Feng, Wei, et al.
Pubblicazione: (2023)
di: Feng, Wei, et al.
Pubblicazione: (2023)
FAVOR-Bench: A Comprehensive Benchmark for Fine-Grained Video Motion Understanding
di: Tu, Chongjun, et al.
Pubblicazione: (2025)
di: Tu, Chongjun, et al.
Pubblicazione: (2025)
MomentSeeker: A Task-Oriented Benchmark For Long-Video Moment Retrieval
di: Yuan, Huaying, et al.
Pubblicazione: (2025)
di: Yuan, Huaying, et al.
Pubblicazione: (2025)
Selective Query-guided Debiasing for Video Corpus Moment Retrieval
di: Yoon, Sunjae, et al.
Pubblicazione: (2022)
di: Yoon, Sunjae, et al.
Pubblicazione: (2022)
PhyVLLM: Physics-Guided Video Language Model with Motion-Appearance Disentanglement
di: Zhan, Yu-Wei, et al.
Pubblicazione: (2025)
di: Zhan, Yu-Wei, et al.
Pubblicazione: (2025)
3D-RFT: Reinforcement Fine-Tuning for Video-based 3D Scene Understanding
di: Linghu, Xiongkun, et al.
Pubblicazione: (2026)
di: Linghu, Xiongkun, et al.
Pubblicazione: (2026)
Event-aware Video Corpus Moment Retrieval
di: Hou, Danyang, et al.
Pubblicazione: (2024)
di: Hou, Danyang, et al.
Pubblicazione: (2024)
DisenStudio: Customized Multi-subject Text-to-Video Generation with Disentangled Spatial Control
di: Chen, Hong, et al.
Pubblicazione: (2024)
di: Chen, Hong, et al.
Pubblicazione: (2024)
LVBench: An Extreme Long Video Understanding Benchmark
di: Wang, Weihan, et al.
Pubblicazione: (2024)
di: Wang, Weihan, et al.
Pubblicazione: (2024)
Multi-modal Generative AI: Multi-modal LLMs, Diffusions, and the Unification
di: Wang, Xin, et al.
Pubblicazione: (2024)
di: Wang, Xin, et al.
Pubblicazione: (2024)
GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval
di: Zhang, Shihang, et al.
Pubblicazione: (2026)
di: Zhang, Shihang, et al.
Pubblicazione: (2026)
SIV-Bench: A Video Benchmark for Social Interaction Understanding and Reasoning
di: Kong, Fanqi, et al.
Pubblicazione: (2025)
di: Kong, Fanqi, et al.
Pubblicazione: (2025)
Personalized Video Summarization by Multimodal Video Understanding
di: Chen, Brian, et al.
Pubblicazione: (2024)
di: Chen, Brian, et al.
Pubblicazione: (2024)
Multimodal Alignment with Cross-Attentive GRUs for Fine-Grained Video Understanding
di: Kim, Namho, et al.
Pubblicazione: (2025)
di: Kim, Namho, et al.
Pubblicazione: (2025)
Improving Video Corpus Moment Retrieval with Partial Relevance Enhancement
di: Hou, Danyang, et al.
Pubblicazione: (2024)
di: Hou, Danyang, et al.
Pubblicazione: (2024)
SLVideo: A Sign Language Video Moment Retrieval Framework
di: Martins, Gonçalo Vinagre, et al.
Pubblicazione: (2024)
di: Martins, Gonçalo Vinagre, et al.
Pubblicazione: (2024)
Towards Fine-Grained Human Motion Video Captioning
di: Song, Guorui, et al.
Pubblicazione: (2025)
di: Song, Guorui, et al.
Pubblicazione: (2025)
EgoCVR: An Egocentric Benchmark for Fine-Grained Composed Video Retrieval
di: Hummel, Thomas, et al.
Pubblicazione: (2024)
di: Hummel, Thomas, et al.
Pubblicazione: (2024)
FiLA-Video: Spatio-Temporal Compression for Fine-Grained Long Video Understanding
di: Guo, Yanan, et al.
Pubblicazione: (2025)
di: Guo, Yanan, et al.
Pubblicazione: (2025)
HumanVideo-MME: Benchmarking MLLMs for Human-Centric Video Understanding
di: Cai, Yuxuan, et al.
Pubblicazione: (2025)
di: Cai, Yuxuan, et al.
Pubblicazione: (2025)
Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events
di: Liu, Xiaolin, et al.
Pubblicazione: (2026)
di: Liu, Xiaolin, et al.
Pubblicazione: (2026)
Q-Bench-Video: Benchmarking the Video Quality Understanding of LMMs
di: Zhang, Zicheng, et al.
Pubblicazione: (2024)
di: Zhang, Zicheng, et al.
Pubblicazione: (2024)
BrokenVideos: A Benchmark Dataset for Fine-Grained Artifact Localization in AI-Generated Videos
di: Lin, Jiahao, et al.
Pubblicazione: (2025)
di: Lin, Jiahao, et al.
Pubblicazione: (2025)
Text-Video Multi-Grained Integration for Video Moment Montage
di: Yin, Zhihui, et al.
Pubblicazione: (2024)
di: Yin, Zhihui, et al.
Pubblicazione: (2024)
FastV-RAG: Towards Fast and Fine-Grained Video QA with Retrieval-Augmented Generation
di: Li, Gen, et al.
Pubblicazione: (2026)
di: Li, Gen, et al.
Pubblicazione: (2026)
VideoVista: A Versatile Benchmark for Video Understanding and Reasoning
di: Li, Yunxin, et al.
Pubblicazione: (2024)
di: Li, Yunxin, et al.
Pubblicazione: (2024)
Denoise-then-Retrieve: Text-Conditioned Video Denoising for Video Moment Retrieval
di: Liu, Weijia, et al.
Pubblicazione: (2025)
di: Liu, Weijia, et al.
Pubblicazione: (2025)
VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding
di: Zhang, Zhihong, et al.
Pubblicazione: (2025)
di: Zhang, Zhihong, et al.
Pubblicazione: (2025)
Benchmarking Scientific Understanding and Reasoning for Video Generation using VideoScience-Bench
di: Hu, Lanxiang, et al.
Pubblicazione: (2025)
di: Hu, Lanxiang, et al.
Pubblicazione: (2025)
Fine-gained Zero-shot Video Sampling
di: Chen, Dengsheng, et al.
Pubblicazione: (2024)
di: Chen, Dengsheng, et al.
Pubblicazione: (2024)
VideoLights: Feature Refinement and Cross-Task Alignment Transformer for Joint Video Highlight Detection and Moment Retrieval
di: Paul, Dhiman, et al.
Pubblicazione: (2024)
di: Paul, Dhiman, et al.
Pubblicazione: (2024)
MMDocBench: Benchmarking Large Vision-Language Models for Fine-Grained Visual Document Understanding
di: Zhu, Fengbin, et al.
Pubblicazione: (2024)
di: Zhu, Fengbin, et al.
Pubblicazione: (2024)
Attributes Grouping and Mining Hashing for Fine-Grained Image Retrieval
di: Lu, Xin, et al.
Pubblicazione: (2023)
di: Lu, Xin, et al.
Pubblicazione: (2023)
Towards Fine-Grained Video Question Answering
di: Dai, Wei, et al.
Pubblicazione: (2025)
di: Dai, Wei, et al.
Pubblicazione: (2025)
MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation
di: Tong, Haibo, et al.
Pubblicazione: (2025)
di: Tong, Haibo, et al.
Pubblicazione: (2025)
SF2T: Self-supervised Fragment Finetuning of Video-LLMs for Fine-Grained Understanding
di: Hu, Yangliu, et al.
Pubblicazione: (2025)
di: Hu, Yangliu, et al.
Pubblicazione: (2025)
SMART: Shot-Aware Multimodal Video Moment Retrieval with Audio-Enhanced MLLM
di: Yu, An, et al.
Pubblicazione: (2025)
di: Yu, An, et al.
Pubblicazione: (2025)
FineVAU: A Novel Human-Aligned Benchmark for Fine-Grained Video Anomaly Understanding
di: Pereira, João, et al.
Pubblicazione: (2026)
di: Pereira, João, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Think with Grounding: Curriculum Reinforced Reasoning with Video Grounding for Long Video Understanding
di: Chen, Houlun, et al.
Pubblicazione: (2026) -
Multi-sentence Video Grounding for Long Video Generation
di: Feng, Wei, et al.
Pubblicazione: (2024) -
LLM4VG: Large Language Models Evaluation for Video Grounding
di: Feng, Wei, et al.
Pubblicazione: (2023) -
FAVOR-Bench: A Comprehensive Benchmark for Fine-Grained Video Motion Understanding
di: Tu, Chongjun, et al.
Pubblicazione: (2025) -
MomentSeeker: A Task-Oriented Benchmark For Long-Video Moment Retrieval
di: Yuan, Huaying, et al.
Pubblicazione: (2025)