Where to Focus: Query-Modulated Multimodal Keyframe Selection for Long Video Understanding
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Shaoguang, Guo, Weiyu, Chen, Ziyang, Hu, Xuming, Xiong, Hui |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VSI: Visual Subtitle Integration for Keyframe Selection to enhance Long Video Understanding
di: He, Jianxiang, et al.
Pubblicazione: (2025)
di: He, Jianxiang, et al.
Pubblicazione: (2025)
KeyVideoLLM: Towards Large-scale Video Keyframe Selection
di: Liang, Hao, et al.
Pubblicazione: (2024)
di: Liang, Hao, et al.
Pubblicazione: (2024)
Less is More: Token-Efficient Video-QA via Adaptive Frame-Pruning and Semantic Graph Integration
di: Wang, Shaoguang, et al.
Pubblicazione: (2025)
di: Wang, Shaoguang, et al.
Pubblicazione: (2025)
Logic-in-Frames: Dynamic Keyframe Search via Visual Semantic-Logical Verification for Long Video Understanding
di: Guo, Weiyu, et al.
Pubblicazione: (2025)
di: Guo, Weiyu, et al.
Pubblicazione: (2025)
Generative Frame Sampler for Long Video Understanding
di: Yao, Linli, et al.
Pubblicazione: (2025)
di: Yao, Linli, et al.
Pubblicazione: (2025)
MMBench-Video: A Long-Form Multi-Shot Benchmark for Holistic Video Understanding
di: Fang, Xinyu, et al.
Pubblicazione: (2024)
di: Fang, Xinyu, et al.
Pubblicazione: (2024)
Memory-enhanced Retrieval Augmentation for Long Video Understanding
di: Yuan, Huaying, et al.
Pubblicazione: (2025)
di: Yuan, Huaying, et al.
Pubblicazione: (2025)
Towards Event-oriented Long Video Understanding
di: Du, Yifan, et al.
Pubblicazione: (2024)
di: Du, Yifan, et al.
Pubblicazione: (2024)
DanceCamAnimator: Keyframe-Based Controllable 3D Dance Camera Synthesis
di: Wang, Zixuan, et al.
Pubblicazione: (2024)
di: Wang, Zixuan, et al.
Pubblicazione: (2024)
DrawVideo: Generating Long Video from Storyboard Keyframe Sketches
di: Xu, Chuanzhi, et al.
Pubblicazione: (2026)
di: Xu, Chuanzhi, et al.
Pubblicazione: (2026)
Enhancing DETRs Variants through Improved Content Query and Similar Query Aggregation
di: Zhang, Yingying, et al.
Pubblicazione: (2024)
di: Zhang, Yingying, et al.
Pubblicazione: (2024)
LongInsightBench: A Comprehensive Benchmark for Evaluating Omni-Modal Models on Human-Centric Long-Video Understanding
di: Han, ZhaoYang, et al.
Pubblicazione: (2025)
di: Han, ZhaoYang, et al.
Pubblicazione: (2025)
VideoCLIP-XL: Advancing Long Description Understanding for Video CLIP Models
di: Wang, Jiapeng, et al.
Pubblicazione: (2024)
di: Wang, Jiapeng, et al.
Pubblicazione: (2024)
HFS: Holistic Query-Aware Frame Selection for Efficient Video Reasoning
di: Yang, Yiqing, et al.
Pubblicazione: (2025)
di: Yang, Yiqing, et al.
Pubblicazione: (2025)
Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing
di: Zhao, Pengcheng, et al.
Pubblicazione: (2024)
di: Zhao, Pengcheng, et al.
Pubblicazione: (2024)
Event Camera Demosaicing via Swin Transformer and Pixel-focus Loss
di: Lu, Yunfan, et al.
Pubblicazione: (2024)
di: Lu, Yunfan, et al.
Pubblicazione: (2024)
Scaling up Multimodal Pre-training for Sign Language Understanding
di: Zhou, Wengang, et al.
Pubblicazione: (2024)
di: Zhou, Wengang, et al.
Pubblicazione: (2024)
Video-EM: Event-Centric Episodic Memory for Long-Form Video Understanding
di: Wang, Yun, et al.
Pubblicazione: (2025)
di: Wang, Yun, et al.
Pubblicazione: (2025)
When Video Coding Meets Multimodal Large Language Models: A Unified Paradigm for Video Coding
di: Zhang, Pingping, et al.
Pubblicazione: (2024)
di: Zhang, Pingping, et al.
Pubblicazione: (2024)
ReTaKe: Reducing Temporal and Knowledge Redundancy for Long Video Understanding
di: Wang, Xiao, et al.
Pubblicazione: (2024)
di: Wang, Xiao, et al.
Pubblicazione: (2024)
Learning Video Context as Interleaved Multimodal Sequences
di: Lin, Kevin Qinghong, et al.
Pubblicazione: (2024)
di: Lin, Kevin Qinghong, et al.
Pubblicazione: (2024)
OmniScript: Towards Audio-Visual Script Generation for Long-Form Cinematic Video
di: Pu, Junfu, et al.
Pubblicazione: (2026)
di: Pu, Junfu, et al.
Pubblicazione: (2026)
Where Does Vision Meet Language? Understanding and Refining Visual Fusion in MLLMs via Contrastive Attention
di: Song, Shezheng, et al.
Pubblicazione: (2026)
di: Song, Shezheng, et al.
Pubblicazione: (2026)
Multimodal Fake News Video Explanation: Dataset, Analysis and Evaluation
di: Chen, Lizhi, et al.
Pubblicazione: (2025)
di: Chen, Lizhi, et al.
Pubblicazione: (2025)
TimeSuite: Improving MLLMs for Long Video Understanding via Grounded Tuning
di: Zeng, Xiangyu, et al.
Pubblicazione: (2024)
di: Zeng, Xiangyu, et al.
Pubblicazione: (2024)
Multimodal Chaptering for Long-Form TV Newscast Video
di: Guetari, Khalil, et al.
Pubblicazione: (2024)
di: Guetari, Khalil, et al.
Pubblicazione: (2024)
Multi-source Multimodal Progressive Domain Adaption for Audio-Visual Deception Detection
di: Lin, Ronghao, et al.
Pubblicazione: (2025)
di: Lin, Ronghao, et al.
Pubblicazione: (2025)
UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation
di: Chen, Yanzhe, et al.
Pubblicazione: (2025)
di: Chen, Yanzhe, et al.
Pubblicazione: (2025)
TimeLoc: A Unified End-to-End Framework for Precise Timestamp Localization in Long Videos
di: Zhang, Chen-Lin, et al.
Pubblicazione: (2025)
di: Zhang, Chen-Lin, et al.
Pubblicazione: (2025)
StreamingEval: A Unified Evaluation Protocol towards Realistic Streaming Video Understanding
di: Tang, Guowei, et al.
Pubblicazione: (2026)
di: Tang, Guowei, et al.
Pubblicazione: (2026)
HR-INR: Continuous Space-Time Video Super-Resolution via Event Camera
di: Lu, Yunfan, et al.
Pubblicazione: (2024)
di: Lu, Yunfan, et al.
Pubblicazione: (2024)
Enrich and Detect: Video Temporal Grounding with Multimodal LLMs
di: Pramanick, Shraman, et al.
Pubblicazione: (2025)
di: Pramanick, Shraman, et al.
Pubblicazione: (2025)
Multimodal Engagement Analysis from Facial Videos in the Classroom
di: Sümer, Ömer, et al.
Pubblicazione: (2021)
di: Sümer, Ömer, et al.
Pubblicazione: (2021)
Can Multimodal Large Language Models Understand Spatial Relations?
di: Liu, Jingping, et al.
Pubblicazione: (2025)
di: Liu, Jingping, et al.
Pubblicazione: (2025)
VideoMem: Constructing, Analyzing, Predicting Short-term and Long-term Video Memorability
di: Cohendet, Romain, et al.
Pubblicazione: (2018)
di: Cohendet, Romain, et al.
Pubblicazione: (2018)
VAGU & GtS: LLM-Based Benchmark and Framework for Joint Video Anomaly Grounding and Understanding
di: Gao, Shibo, et al.
Pubblicazione: (2025)
di: Gao, Shibo, et al.
Pubblicazione: (2025)
TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos
di: Kong, Fanheng, et al.
Pubblicazione: (2025)
di: Kong, Fanheng, et al.
Pubblicazione: (2025)
Detached and Interactive Multimodal Learning
di: Fan, Yunfeng, et al.
Pubblicazione: (2024)
di: Fan, Yunfeng, et al.
Pubblicazione: (2024)
ArchGPT: Understanding the World's Architectures with Large Multimodal Models
di: Wang, Yuze, et al.
Pubblicazione: (2025)
di: Wang, Yuze, et al.
Pubblicazione: (2025)
MangaUB: A Manga Understanding Benchmark for Large Multimodal Models
di: Ikuta, Hikaru, et al.
Pubblicazione: (2024)
di: Ikuta, Hikaru, et al.
Pubblicazione: (2024)
Documenti analoghi
-
VSI: Visual Subtitle Integration for Keyframe Selection to enhance Long Video Understanding
di: He, Jianxiang, et al.
Pubblicazione: (2025) -
KeyVideoLLM: Towards Large-scale Video Keyframe Selection
di: Liang, Hao, et al.
Pubblicazione: (2024) -
Less is More: Token-Efficient Video-QA via Adaptive Frame-Pruning and Semantic Graph Integration
di: Wang, Shaoguang, et al.
Pubblicazione: (2025) -
Logic-in-Frames: Dynamic Keyframe Search via Visual Semantic-Logical Verification for Long Video Understanding
di: Guo, Weiyu, et al.
Pubblicazione: (2025) -
Generative Frame Sampler for Long Video Understanding
di: Yao, Linli, et al.
Pubblicazione: (2025)