Divide, then Ground: Adapting Frame Selection to Query Types for Long-Form Video Understanding
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Jialuo, Li, Bin, Li, Jiahao, Lu, Yan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Query-Conditioned Evidential Keyframe Sampling for MLLM-Based Long-Form Video Understanding
di: Wang, Yiheng, et al.
Pubblicazione: (2026)
di: Wang, Yiheng, et al.
Pubblicazione: (2026)
Temporal Preference Optimization for Long-Form Video Understanding
di: Li, Rui, et al.
Pubblicazione: (2025)
di: Li, Rui, et al.
Pubblicazione: (2025)
FOCUS: Efficient Keyframe Selection for Long Video Understanding
di: Zhu, Zirui, et al.
Pubblicazione: (2025)
di: Zhu, Zirui, et al.
Pubblicazione: (2025)
PAVE: Patching and Adapting Video Large Language Models
di: Liu, Zhuoming, et al.
Pubblicazione: (2025)
di: Liu, Zhuoming, et al.
Pubblicazione: (2025)
Deep Video Discovery: Agentic Search with Tool Use for Long-form Video Understanding
di: Zhang, Xiaoyi, et al.
Pubblicazione: (2025)
di: Zhang, Xiaoyi, et al.
Pubblicazione: (2025)
Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing
di: Lee, Hosu, et al.
Pubblicazione: (2024)
di: Lee, Hosu, et al.
Pubblicazione: (2024)
Science-T2I: Addressing Scientific Illusions in Image Synthesis
di: Li, Jialuo, et al.
Pubblicazione: (2025)
di: Li, Jialuo, et al.
Pubblicazione: (2025)
Neptune: The Long Orbit to Benchmarking Long Video Understanding
di: Nagrani, Arsha, et al.
Pubblicazione: (2024)
di: Nagrani, Arsha, et al.
Pubblicazione: (2024)
Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding
di: Du, Zilin, et al.
Pubblicazione: (2024)
di: Du, Zilin, et al.
Pubblicazione: (2024)
From Video to EEG: Adapting Joint Embedding Predictive Architecture to Uncover Saptiotemporal Dynamics in Brain Signal Analysis
di: Hojjati, Amirabbas, et al.
Pubblicazione: (2025)
di: Hojjati, Amirabbas, et al.
Pubblicazione: (2025)
Adaptive Keyframe Sampling for Long Video Understanding
di: Tang, Xi, et al.
Pubblicazione: (2025)
di: Tang, Xi, et al.
Pubblicazione: (2025)
Dual-Signal Adaptive KV-Cache Optimization for Long-Form Video Understanding in Vision-Language Models
di: Sai, Vishnu, et al.
Pubblicazione: (2026)
di: Sai, Vishnu, et al.
Pubblicazione: (2026)
Aligning Forest and Trees in Images & Long Captions for Visually Grounded Understanding
di: Woo, Byeongju, et al.
Pubblicazione: (2026)
di: Woo, Byeongju, et al.
Pubblicazione: (2026)
HourVideo: 1-Hour Video-Language Understanding
di: Chandrasegaran, Keshigeyan, et al.
Pubblicazione: (2024)
di: Chandrasegaran, Keshigeyan, et al.
Pubblicazione: (2024)
VideoRefer Suite: Advancing Spatial-Temporal Object Understanding with Video LLM
di: Yuan, Yuqian, et al.
Pubblicazione: (2024)
di: Yuan, Yuqian, et al.
Pubblicazione: (2024)
Video-EM: Event-Centric Episodic Memory for Long-Form Video Understanding
di: Wang, Yun, et al.
Pubblicazione: (2025)
di: Wang, Yun, et al.
Pubblicazione: (2025)
FRAG: Frame Selection Augmented Generation for Long Video and Long Document Understanding
di: Huang, De-An, et al.
Pubblicazione: (2025)
di: Huang, De-An, et al.
Pubblicazione: (2025)
VideoRouter: Query-Adaptive Dual Routing for Efficient Long-Video Understanding
di: Lin, Kuanwei, et al.
Pubblicazione: (2026)
di: Lin, Kuanwei, et al.
Pubblicazione: (2026)
Adaptive Greedy Frame Selection for Long Video Understanding
di: Huang, Yuning, et al.
Pubblicazione: (2026)
di: Huang, Yuning, et al.
Pubblicazione: (2026)
Think with Grounding: Curriculum Reinforced Reasoning with Video Grounding for Long Video Understanding
di: Chen, Houlun, et al.
Pubblicazione: (2026)
di: Chen, Houlun, et al.
Pubblicazione: (2026)
ReactDance: Hierarchical Representation for High-Fidelity and Coherent Long-Form Reactive Dance Generation
di: Lin, Jingzhong, et al.
Pubblicazione: (2025)
di: Lin, Jingzhong, et al.
Pubblicazione: (2025)
PSA: Pyramid Sparse Attention for Efficient Video Understanding and Generation
di: Li, Xiaolong, et al.
Pubblicazione: (2025)
di: Li, Xiaolong, et al.
Pubblicazione: (2025)
Think-Clip-Sample: Slow-Fast Frame Selection for Video Understanding
di: Tan, Wenhui, et al.
Pubblicazione: (2026)
di: Tan, Wenhui, et al.
Pubblicazione: (2026)
Enhancing Long Video Generation Consistency without Tuning
di: Li, Xingyao, et al.
Pubblicazione: (2024)
di: Li, Xingyao, et al.
Pubblicazione: (2024)
PipeFlow: Pipelined Processing and Motion-Aware Frame Selection for Long-Form Video Editing
di: Munir, Mustafa, et al.
Pubblicazione: (2025)
di: Munir, Mustafa, et al.
Pubblicazione: (2025)
Thinking in Frames: How Visual Context and Test-Time Scaling Empower Video Reasoning
di: Li, Chengzu, et al.
Pubblicazione: (2026)
di: Li, Chengzu, et al.
Pubblicazione: (2026)
KFS-Bench: Comprehensive Evaluation of Key Frame Sampling in Long Video Understanding
di: Li, Zongyao, et al.
Pubblicazione: (2025)
di: Li, Zongyao, et al.
Pubblicazione: (2025)
AdaptToken: Entropy-based Adaptive Token Selection for MLLM Long Video Understanding
di: Qi, Haozhe, et al.
Pubblicazione: (2026)
di: Qi, Haozhe, et al.
Pubblicazione: (2026)
FrameBridge: Improving Image-to-Video Generation with Bridge Models
di: Wang, Yuji, et al.
Pubblicazione: (2024)
di: Wang, Yuji, et al.
Pubblicazione: (2024)
Ground-A-Video: Zero-shot Grounded Video Editing using Text-to-image Diffusion Models
di: Jeong, Hyeonho, et al.
Pubblicazione: (2023)
di: Jeong, Hyeonho, et al.
Pubblicazione: (2023)
Information-Theoretic Optimization for Task-Adapted Compressed Sensing Magnetic Resonance Imaging
di: Peng, Xinyu, et al.
Pubblicazione: (2026)
di: Peng, Xinyu, et al.
Pubblicazione: (2026)
Real-Time Fitness Exercise Classification and Counting from Video Frames
di: Riccio, Riccardo
Pubblicazione: (2024)
di: Riccio, Riccardo
Pubblicazione: (2024)
Divide & Bind Your Attention for Improved Generative Semantic Nursing
di: Li, Yumeng, et al.
Pubblicazione: (2023)
di: Li, Yumeng, et al.
Pubblicazione: (2023)
CVA: Context-aware Video-text Alignment for Video Temporal Grounding
di: Moon, Sungho, et al.
Pubblicazione: (2026)
di: Moon, Sungho, et al.
Pubblicazione: (2026)
LongViTU: Instruction Tuning for Long-Form Video Understanding
di: Wu, Rujie, et al.
Pubblicazione: (2025)
di: Wu, Rujie, et al.
Pubblicazione: (2025)
Interacted Object Grounding in Spatio-Temporal Human-Object Interactions
di: Liu, Xiaoyang, et al.
Pubblicazione: (2024)
di: Liu, Xiaoyang, et al.
Pubblicazione: (2024)
From Isolated Islands to Pangea: Unifying Semantic Space for Human Action Understanding
di: Li, Yong-Lu, et al.
Pubblicazione: (2023)
di: Li, Yong-Lu, et al.
Pubblicazione: (2023)
Small Vision-Language Models are Smart Compressors for Long Video Understanding
di: Fei, Junjie, et al.
Pubblicazione: (2026)
di: Fei, Junjie, et al.
Pubblicazione: (2026)
TimeSuite: Improving MLLMs for Long Video Understanding via Grounded Tuning
di: Zeng, Xiangyu, et al.
Pubblicazione: (2024)
di: Zeng, Xiangyu, et al.
Pubblicazione: (2024)
Self-Supervised Multi-Frame Neural Scene Flow
di: Liu, Dongrui, et al.
Pubblicazione: (2024)
di: Liu, Dongrui, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Query-Conditioned Evidential Keyframe Sampling for MLLM-Based Long-Form Video Understanding
di: Wang, Yiheng, et al.
Pubblicazione: (2026) -
Temporal Preference Optimization for Long-Form Video Understanding
di: Li, Rui, et al.
Pubblicazione: (2025) -
FOCUS: Efficient Keyframe Selection for Long Video Understanding
di: Zhu, Zirui, et al.
Pubblicazione: (2025) -
PAVE: Patching and Adapting Video Large Language Models
di: Liu, Zhuoming, et al.
Pubblicazione: (2025) -
Deep Video Discovery: Agentic Search with Tool Use for Long-form Video Understanding
di: Zhang, Xiaoyi, et al.
Pubblicazione: (2025)