Adaptive Greedy Frame Selection for Long Video Understanding
Fuente:
arXiv
Salvato in:
| Autori principali: | Huang, Yuning, Ji, Xiaoyu, Huang, Joseph, Zhang, Yichi, Zhu, Fengqing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
FRAG: Frame Selection Augmented Generation for Long Video and Long Document Understanding
di: Huang, De-An, et al.
Pubblicazione: (2025)
di: Huang, De-An, et al.
Pubblicazione: (2025)
VideoExplorer: Think With Videos For Agentic Long-Video Understanding
di: Yuan, Huaying, et al.
Pubblicazione: (2025)
di: Yuan, Huaying, et al.
Pubblicazione: (2025)
MLVU: Benchmarking Multi-task Long Video Understanding
di: Zhou, Junjie, et al.
Pubblicazione: (2024)
di: Zhou, Junjie, et al.
Pubblicazione: (2024)
VideoEspresso: A Large-Scale Chain-of-Thought Dataset for Fine-Grained Video Reasoning via Core Frame Selection
di: Han, Songhao, et al.
Pubblicazione: (2024)
di: Han, Songhao, et al.
Pubblicazione: (2024)
DynFrame: Adaptive Reasoning-Driven Multimodal Framework with Dynamic Frame Augmentation for Complex Video Understanding
di: Zhang, Peng, et al.
Pubblicazione: (2026)
di: Zhang, Peng, et al.
Pubblicazione: (2026)
Deep Video Discovery: Agentic Search with Tool Use for Long-form Video Understanding
di: Zhang, Xiaoyi, et al.
Pubblicazione: (2025)
di: Zhang, Xiaoyi, et al.
Pubblicazione: (2025)
APB-V: Accelerating Long-Video Understanding via Sequence-Parallelism-aware Approximate Attention
di: Huang, Yuxiang, et al.
Pubblicazione: (2026)
di: Huang, Yuxiang, et al.
Pubblicazione: (2026)
VideoTree: Adaptive Tree-based Video Representation for LLM Reasoning on Long Videos
di: Wang, Ziyang, et al.
Pubblicazione: (2024)
di: Wang, Ziyang, et al.
Pubblicazione: (2024)
Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding
di: Wang, Ziyang, et al.
Pubblicazione: (2025)
di: Wang, Ziyang, et al.
Pubblicazione: (2025)
Scaling RL to Long Videos
di: Chen, Yukang, et al.
Pubblicazione: (2025)
di: Chen, Yukang, et al.
Pubblicazione: (2025)
KFS-Bench: Comprehensive Evaluation of Key Frame Sampling in Long Video Understanding
di: Li, Zongyao, et al.
Pubblicazione: (2025)
di: Li, Zongyao, et al.
Pubblicazione: (2025)
Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation
di: Zhang, Yichi, et al.
Pubblicazione: (2025)
di: Zhang, Yichi, et al.
Pubblicazione: (2025)
EgoMemReason: A Memory-Driven Reasoning Benchmark for Long-Horizon Egocentric Video Understanding
di: Wang, Ziyang, et al.
Pubblicazione: (2026)
di: Wang, Ziyang, et al.
Pubblicazione: (2026)
M-LLM Based Video Frame Selection for Efficient Video Understanding
di: Hu, Kai, et al.
Pubblicazione: (2025)
di: Hu, Kai, et al.
Pubblicazione: (2025)
Logic-in-Frames: Dynamic Keyframe Search via Visual Semantic-Logical Verification for Long Video Understanding
di: Guo, Weiyu, et al.
Pubblicazione: (2025)
di: Guo, Weiyu, et al.
Pubblicazione: (2025)
Xiaoice: Training-Free Video Understanding via Self-Supervised Spatio-Temporal Clustering of Semantic Features
di: Ji, Shihao, et al.
Pubblicazione: (2025)
di: Ji, Shihao, et al.
Pubblicazione: (2025)
Accelerating Learned Image Compression Through Modeling Neural Training Dynamics
di: Zhang, Yichi, et al.
Pubblicazione: (2025)
di: Zhang, Yichi, et al.
Pubblicazione: (2025)
Balanced Rate-Distortion Optimization in Learned Image Compression
di: Zhang, Yichi, et al.
Pubblicazione: (2025)
di: Zhang, Yichi, et al.
Pubblicazione: (2025)
VideoAgent: Long-form Video Understanding with Large Language Model as Agent
di: Wang, Xiaohan, et al.
Pubblicazione: (2024)
di: Wang, Xiaohan, et al.
Pubblicazione: (2024)
Long Story Short: Story-level Video Understanding from 20K Short Films
di: Ghermi, Ridouane, et al.
Pubblicazione: (2024)
di: Ghermi, Ridouane, et al.
Pubblicazione: (2024)
TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding
di: Ren, Shuhuai, et al.
Pubblicazione: (2023)
di: Ren, Shuhuai, et al.
Pubblicazione: (2023)
VideoVista: A Versatile Benchmark for Video Understanding and Reasoning
di: Li, Yunxin, et al.
Pubblicazione: (2024)
di: Li, Yunxin, et al.
Pubblicazione: (2024)
TimeViper: A Hybrid Mamba-Transformer Vision-Language Model for Efficient Long Video Understanding
di: Xu, Boshen, et al.
Pubblicazione: (2025)
di: Xu, Boshen, et al.
Pubblicazione: (2025)
Think-Clip-Sample: Slow-Fast Frame Selection for Video Understanding
di: Tan, Wenhui, et al.
Pubblicazione: (2026)
di: Tan, Wenhui, et al.
Pubblicazione: (2026)
VTCBench: Can Vision-Language Models Understand Long Context with Vision-Text Compression?
di: Zhao, Hongbo, et al.
Pubblicazione: (2025)
di: Zhao, Hongbo, et al.
Pubblicazione: (2025)
AdaptToken: Entropy-based Adaptive Token Selection for MLLM Long Video Understanding
di: Qi, Haozhe, et al.
Pubblicazione: (2026)
di: Qi, Haozhe, et al.
Pubblicazione: (2026)
LVBench: An Extreme Long Video Understanding Benchmark
di: Wang, Weihan, et al.
Pubblicazione: (2024)
di: Wang, Weihan, et al.
Pubblicazione: (2024)
AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction
di: Man, Yuanbin, et al.
Pubblicazione: (2024)
di: Man, Yuanbin, et al.
Pubblicazione: (2024)
VideoScaffold: Elastic-Scale Visual Hierarchies for Streaming Video Understanding in MLLMs
di: Zheng, Naishan, et al.
Pubblicazione: (2025)
di: Zheng, Naishan, et al.
Pubblicazione: (2025)
VideoRouter: Query-Adaptive Dual Routing for Efficient Long-Video Understanding
di: Lin, Kuanwei, et al.
Pubblicazione: (2026)
di: Lin, Kuanwei, et al.
Pubblicazione: (2026)
Small Vision-Language Models are Smart Compressors for Long Video Understanding
di: Fei, Junjie, et al.
Pubblicazione: (2026)
di: Fei, Junjie, et al.
Pubblicazione: (2026)
GUI-World: A Video Benchmark and Dataset for Multimodal GUI-oriented Understanding
di: Chen, Dongping, et al.
Pubblicazione: (2024)
di: Chen, Dongping, et al.
Pubblicazione: (2024)
Moment Sampling in Video LLMs for Long-Form Video QA
di: Chasmai, Mustafa, et al.
Pubblicazione: (2025)
di: Chasmai, Mustafa, et al.
Pubblicazione: (2025)
HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering
di: Ben-Ami, Dan, et al.
Pubblicazione: (2026)
di: Ben-Ami, Dan, et al.
Pubblicazione: (2026)
Divide, then Ground: Adapting Frame Selection to Query Types for Long-Form Video Understanding
di: Li, Jialuo, et al.
Pubblicazione: (2025)
di: Li, Jialuo, et al.
Pubblicazione: (2025)
Temporal Preference Optimization for Long-Form Video Understanding
di: Li, Rui, et al.
Pubblicazione: (2025)
di: Li, Rui, et al.
Pubblicazione: (2025)
v-HUB: A Benchmark for Video Humor Understanding from Vision and Sound
di: Shi, Zhengpeng, et al.
Pubblicazione: (2025)
di: Shi, Zhengpeng, et al.
Pubblicazione: (2025)
ViTCoT: Video-Text Interleaved Chain-of-Thought for Boosting Video Understanding in Large Language Models
di: Zhang, Yongheng, et al.
Pubblicazione: (2025)
di: Zhang, Yongheng, et al.
Pubblicazione: (2025)
mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models
di: Ye, Jiabo, et al.
Pubblicazione: (2024)
di: Ye, Jiabo, et al.
Pubblicazione: (2024)
VideoSeek: Long-Horizon Video Agent with Tool-Guided Seeking
di: Lin, Jingyang, et al.
Pubblicazione: (2026)
di: Lin, Jingyang, et al.
Pubblicazione: (2026)
Documenti analoghi
-
FRAG: Frame Selection Augmented Generation for Long Video and Long Document Understanding
di: Huang, De-An, et al.
Pubblicazione: (2025) -
VideoExplorer: Think With Videos For Agentic Long-Video Understanding
di: Yuan, Huaying, et al.
Pubblicazione: (2025) -
MLVU: Benchmarking Multi-task Long Video Understanding
di: Zhou, Junjie, et al.
Pubblicazione: (2024) -
VideoEspresso: A Large-Scale Chain-of-Thought Dataset for Fine-Grained Video Reasoning via Core Frame Selection
di: Han, Songhao, et al.
Pubblicazione: (2024) -
DynFrame: Adaptive Reasoning-Driven Multimodal Framework with Dynamic Frame Augmentation for Complex Video Understanding
di: Zhang, Peng, et al.
Pubblicazione: (2026)