KFS-Bench: Comprehensive Evaluation of Key Frame Sampling in Long Video Understanding
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Zongyao, Ishida, Kengo, Yamazaki, Satoshi, Ji, Xiaotong, Liu, Jianquan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Object-Centric Framework for Video Moment Retrieval
di: Li, Zongyao, et al.
Pubblicazione: (2025)
di: Li, Zongyao, et al.
Pubblicazione: (2025)
VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding
di: Zhang, Zhihong, et al.
Pubblicazione: (2025)
di: Zhang, Zhihong, et al.
Pubblicazione: (2025)
VEU-Bench: Towards Comprehensive Understanding of Video Editing
di: Li, Bozheng, et al.
Pubblicazione: (2025)
di: Li, Bozheng, et al.
Pubblicazione: (2025)
Adaptive Greedy Frame Selection for Long Video Understanding
di: Huang, Yuning, et al.
Pubblicazione: (2026)
di: Huang, Yuning, et al.
Pubblicazione: (2026)
Think-Clip-Sample: Slow-Fast Frame Selection for Video Understanding
di: Tan, Wenhui, et al.
Pubblicazione: (2026)
di: Tan, Wenhui, et al.
Pubblicazione: (2026)
FRAG: Frame Selection Augmented Generation for Long Video and Long Document Understanding
di: Huang, De-An, et al.
Pubblicazione: (2025)
di: Huang, De-An, et al.
Pubblicazione: (2025)
VFIMamba: Video Frame Interpolation with State Space Models
di: Zhang, Guozhen, et al.
Pubblicazione: (2024)
di: Zhang, Guozhen, et al.
Pubblicazione: (2024)
FAVOR-Bench: A Comprehensive Benchmark for Fine-Grained Video Motion Understanding
di: Tu, Chongjun, et al.
Pubblicazione: (2025)
di: Tu, Chongjun, et al.
Pubblicazione: (2025)
"PhyWorldBench": A Comprehensive Evaluation of Physical Realism in Text-to-Video Models
di: Gu, Jing, et al.
Pubblicazione: (2025)
di: Gu, Jing, et al.
Pubblicazione: (2025)
Video-RAG: Visually-aligned Retrieval-Augmented Long Video Comprehension
di: Luo, Yongdong, et al.
Pubblicazione: (2024)
di: Luo, Yongdong, et al.
Pubblicazione: (2024)
VideoMiner: Iteratively Grounding Key Frames of Hour-Long Videos via Tree-based Group Relative Policy Optimization
di: Cao, Xinye, et al.
Pubblicazione: (2025)
di: Cao, Xinye, et al.
Pubblicazione: (2025)
MT-Video-Bench: A Holistic Video Understanding Benchmark for Evaluating Multimodal LLMs in Multi-Turn Dialogues
di: Pan, Yaning, et al.
Pubblicazione: (2025)
di: Pan, Yaning, et al.
Pubblicazione: (2025)
Divide, then Ground: Adapting Frame Selection to Query Types for Long-Form Video Understanding
di: Li, Jialuo, et al.
Pubblicazione: (2025)
di: Li, Jialuo, et al.
Pubblicazione: (2025)
DynFrame: Adaptive Reasoning-Driven Multimodal Framework with Dynamic Frame Augmentation for Complex Video Understanding
di: Zhang, Peng, et al.
Pubblicazione: (2026)
di: Zhang, Peng, et al.
Pubblicazione: (2026)
StreamingBench: Assessing the Gap for MLLMs to Achieve Streaming Video Understanding
di: Lin, Junming, et al.
Pubblicazione: (2024)
di: Lin, Junming, et al.
Pubblicazione: (2024)
M-LLM Based Video Frame Selection for Efficient Video Understanding
di: Hu, Kai, et al.
Pubblicazione: (2025)
di: Hu, Kai, et al.
Pubblicazione: (2025)
Re-Identifying Kākā with AI-Automated Video Key Frame Extraction
di: Maddigan, Paula, et al.
Pubblicazione: (2025)
di: Maddigan, Paula, et al.
Pubblicazione: (2025)
Adaptive Keyframe Sampling for Long Video Understanding
di: Tang, Xi, et al.
Pubblicazione: (2025)
di: Tang, Xi, et al.
Pubblicazione: (2025)
KeyFace: Expressive Audio-Driven Facial Animation for Long Sequences via KeyFrame Interpolation
di: Bigata, Antoni, et al.
Pubblicazione: (2025)
di: Bigata, Antoni, et al.
Pubblicazione: (2025)
VideoWebArena: Evaluating Long Context Multimodal Agents with Video Understanding Web Tasks
di: Jang, Lawrence, et al.
Pubblicazione: (2024)
di: Jang, Lawrence, et al.
Pubblicazione: (2024)
Enhancing Long Video Question Answering with Scene-Localized Frame Grouping
di: Yang, Xuyi, et al.
Pubblicazione: (2025)
di: Yang, Xuyi, et al.
Pubblicazione: (2025)
Video Panels for Long Video Understanding
di: Doorenbos, Lars, et al.
Pubblicazione: (2025)
di: Doorenbos, Lars, et al.
Pubblicazione: (2025)
LVBench: An Extreme Long Video Understanding Benchmark
di: Wang, Weihan, et al.
Pubblicazione: (2024)
di: Wang, Weihan, et al.
Pubblicazione: (2024)
Revisiting the Evaluation Bias Introduced by Frame Sampling Strategies in Surgical Video Segmentation Using SAM2
di: Ozbulak, Utku, et al.
Pubblicazione: (2025)
di: Ozbulak, Utku, et al.
Pubblicazione: (2025)
VideoExplorer: Think With Videos For Agentic Long-Video Understanding
di: Yuan, Huaying, et al.
Pubblicazione: (2025)
di: Yuan, Huaying, et al.
Pubblicazione: (2025)
Benchmarking Scientific Understanding and Reasoning for Video Generation using VideoScience-Bench
di: Hu, Lanxiang, et al.
Pubblicazione: (2025)
di: Hu, Lanxiang, et al.
Pubblicazione: (2025)
VideoAR: Autoregressive Video Generation via Next-Frame & Scale Prediction
di: Ji, Longbin, et al.
Pubblicazione: (2026)
di: Ji, Longbin, et al.
Pubblicazione: (2026)
CRAFT: Critic-Refined Adaptive Key-Frame Targeting for Multimodal Video Question Answering
di: Bhosale, Mahesh, et al.
Pubblicazione: (2026)
di: Bhosale, Mahesh, et al.
Pubblicazione: (2026)
AdaFocus: Adaptive Relevance-Diversity Sampling with Zero-Cache Look-back for Efficient Long Video Understanding
di: Yang, Xiao, et al.
Pubblicazione: (2026)
di: Yang, Xiao, et al.
Pubblicazione: (2026)
Video-CCAM: Enhancing Video-Language Understanding with Causal Cross-Attention Masks for Short and Long Videos
di: Fei, Jiajun, et al.
Pubblicazione: (2024)
di: Fei, Jiajun, et al.
Pubblicazione: (2024)
DySink: Dynamic Frame Sinks for Autoregressive Long Video Generation
di: Ye, Bo, et al.
Pubblicazione: (2026)
di: Ye, Bo, et al.
Pubblicazione: (2026)
From Seconds to Hours: Reviewing MultiModal Large Language Models on Comprehensive Long Video Understanding
di: Zou, Heqing, et al.
Pubblicazione: (2024)
di: Zou, Heqing, et al.
Pubblicazione: (2024)
VCR-Bench: A Comprehensive Evaluation Framework for Video Chain-of-Thought Reasoning
di: Qi, Yukun, et al.
Pubblicazione: (2025)
di: Qi, Yukun, et al.
Pubblicazione: (2025)
Latent Modulated Function for Computational Optimal Continuous Image Representation
di: He, Zongyao, et al.
Pubblicazione: (2024)
di: He, Zongyao, et al.
Pubblicazione: (2024)
PackForcing: Short Video Training Suffices for Long Video Sampling and Long Context Inference
di: Mao, Xiaofeng, et al.
Pubblicazione: (2026)
di: Mao, Xiaofeng, et al.
Pubblicazione: (2026)
Query-Conditioned Evidential Keyframe Sampling for MLLM-Based Long-Form Video Understanding
di: Wang, Yiheng, et al.
Pubblicazione: (2026)
di: Wang, Yiheng, et al.
Pubblicazione: (2026)
Enhancing Long Video Understanding via Hierarchical Event-Based Memory
di: Cheng, Dingxin, et al.
Pubblicazione: (2024)
di: Cheng, Dingxin, et al.
Pubblicazione: (2024)
VCA: Video Curious Agent for Long Video Understanding
di: Yang, Zeyuan, et al.
Pubblicazione: (2024)
di: Yang, Zeyuan, et al.
Pubblicazione: (2024)
VideoRouter: Query-Adaptive Dual Routing for Efficient Long-Video Understanding
di: Lin, Kuanwei, et al.
Pubblicazione: (2026)
di: Lin, Kuanwei, et al.
Pubblicazione: (2026)
MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding
di: Wang, Fei, et al.
Pubblicazione: (2024)
di: Wang, Fei, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Object-Centric Framework for Video Moment Retrieval
di: Li, Zongyao, et al.
Pubblicazione: (2025) -
VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding
di: Zhang, Zhihong, et al.
Pubblicazione: (2025) -
VEU-Bench: Towards Comprehensive Understanding of Video Editing
di: Li, Bozheng, et al.
Pubblicazione: (2025) -
Adaptive Greedy Frame Selection for Long Video Understanding
di: Huang, Yuning, et al.
Pubblicazione: (2026) -
Think-Clip-Sample: Slow-Fast Frame Selection for Video Understanding
di: Tan, Wenhui, et al.
Pubblicazione: (2026)