Minimal Clips, Maximum Salience: Long Video Summarization via Key Moment Extraction
Fuente:
arXiv
Guardado en:
| Autores principales: | Pennec, Galann, Liu, Zhengyuan, Asher, Nicholas, Muller, Philippe, Chen, Nancy F. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Integrating Video and Text: A Balanced Approach to Multimodal Summary Generation and Evaluation
por: Pennec, Galann, et al.
Publicado: (2025)
por: Pennec, Galann, et al.
Publicado: (2025)
From Long Videos to Engaging Clips: A Human-Inspired Video Editing Framework with Multimodal Narrative Understanding
por: Wang, Xiangfeng, et al.
Publicado: (2025)
por: Wang, Xiangfeng, et al.
Publicado: (2025)
From Frames to Clips: Training-free Adaptive Key Clip Selection for Long-Form Video Understanding
por: Sun, Guangyu, et al.
Publicado: (2025)
por: Sun, Guangyu, et al.
Publicado: (2025)
Moment Sampling in Video LLMs for Long-Form Video QA
por: Chasmai, Mustafa, et al.
Publicado: (2025)
por: Chasmai, Mustafa, et al.
Publicado: (2025)
VideoXum: Cross-modal Visual and Textural Summarization of Videos
por: Lin, Jingyang, et al.
Publicado: (2023)
por: Lin, Jingyang, et al.
Publicado: (2023)
Multimodal Abstractive Summarization of Instructional Videos with Vision-Language Models
por: Nazir, Maham, et al.
Publicado: (2026)
por: Nazir, Maham, et al.
Publicado: (2026)
Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization
por: Islam, Md Moinul, et al.
Publicado: (2025)
por: Islam, Md Moinul, et al.
Publicado: (2025)
Realizing Video Summarization from the Path of Language-based Semantic Understanding
por: Mu, Kuan-Chen, et al.
Publicado: (2024)
por: Mu, Kuan-Chen, et al.
Publicado: (2024)
Jailbreaking Multimodal Large Language Models using Multi-Clip Video
por: Kang, Choongwon, et al.
Publicado: (2026)
por: Kang, Choongwon, et al.
Publicado: (2026)
Modality-Agnostic fMRI Decoding of Vision and Language
por: Nikolaus, Mitja, et al.
Publicado: (2024)
por: Nikolaus, Mitja, et al.
Publicado: (2024)
MS4UI: A Dataset for Multi-modal Summarization of User Interface Instructional Videos
por: Zang, Yuan, et al.
Publicado: (2025)
por: Zang, Yuan, et al.
Publicado: (2025)
UNIKIE-BENCH: Benchmarking Large Multimodal Models for Key Information Extraction in Visual Documents
por: Ji, Yifan, et al.
Publicado: (2026)
por: Ji, Yifan, et al.
Publicado: (2026)
LongVILA: Scaling Long-Context Visual Language Models for Long Videos
por: Chen, Yukang, et al.
Publicado: (2024)
por: Chen, Yukang, et al.
Publicado: (2024)
LLMs Meet Long Video: Advancing Long Video Question Answering with An Interactive Visual Adapter in LLMs
por: Li, Yunxin, et al.
Publicado: (2024)
por: Li, Yunxin, et al.
Publicado: (2024)
VideoAVE: A Multi-Attribute Video-to-Text Attribute Value Extraction Dataset and Benchmark Models
por: Cheng, Ming, et al.
Publicado: (2025)
por: Cheng, Ming, et al.
Publicado: (2025)
ROAP: A Reading-Order and Attention-Prior Pipeline for Optimizing Layout Transformers in Key Information Extraction
por: Xie, Tingwei, et al.
Publicado: (2026)
por: Xie, Tingwei, et al.
Publicado: (2026)
LVCHAT: Facilitating Long Video Comprehension
por: Wang, Yu, et al.
Publicado: (2024)
por: Wang, Yu, et al.
Publicado: (2024)
Wolf: Dense Video Captioning with a World Summarization Framework
por: Li, Boyi, et al.
Publicado: (2024)
por: Li, Boyi, et al.
Publicado: (2024)
ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding
por: Ma, David, et al.
Publicado: (2025)
por: Ma, David, et al.
Publicado: (2025)
Unleashing Hour-Scale Video Training for Long Video-Language Understanding
por: Lin, Jingyang, et al.
Publicado: (2025)
por: Lin, Jingyang, et al.
Publicado: (2025)
KeyVideoLLM: Towards Large-scale Video Keyframe Selection
por: Liang, Hao, et al.
Publicado: (2024)
por: Liang, Hao, et al.
Publicado: (2024)
Video Summarization: Towards Entity-Aware Captions
por: Ayyubi, Hammad A., et al.
Publicado: (2023)
por: Ayyubi, Hammad A., et al.
Publicado: (2023)
Towards Effective Long-Video Event Prediction via Multi-Level Event Semantics Mining
por: Peng, Bo, et al.
Publicado: (2026)
por: Peng, Bo, et al.
Publicado: (2026)
Saliency-Guided DETR for Moment Retrieval and Highlight Detection
por: Gordeev, Aleksandr, et al.
Publicado: (2024)
por: Gordeev, Aleksandr, et al.
Publicado: (2024)
Lighthouse: A User-Friendly Library for Reproducible Video Moment Retrieval and Highlight Detection
por: Nishimura, Taichi, et al.
Publicado: (2024)
por: Nishimura, Taichi, et al.
Publicado: (2024)
VideoLLaMB: Long Streaming Video Understanding with Recurrent Memory Bridges
por: Wang, Yuxuan, et al.
Publicado: (2024)
por: Wang, Yuxuan, et al.
Publicado: (2024)
RGNet: A Unified Clip Retrieval and Grounding Network for Long Videos
por: Hannan, Tanveer, et al.
Publicado: (2023)
por: Hannan, Tanveer, et al.
Publicado: (2023)
VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization
por: Li, Yunxin, et al.
Publicado: (2025)
por: Li, Yunxin, et al.
Publicado: (2025)
VideoARM: Agentic Reasoning over Hierarchical Memory for Long-Form Video Understanding
por: Yin, Yufei, et al.
Publicado: (2025)
por: Yin, Yufei, et al.
Publicado: (2025)
Large Model based Sequential Keyframe Extraction for Video Summarization
por: Tan, Kailong, et al.
Publicado: (2024)
por: Tan, Kailong, et al.
Publicado: (2024)
What Is That Talk About? A Video-to-Text Summarization Dataset for Scientific Presentations
por: Liu, Dongqi, et al.
Publicado: (2025)
por: Liu, Dongqi, et al.
Publicado: (2025)
Decomposing Queries into Tool Calls for Long-Video Keyframe Retrieval
por: Shlapentokh-Rothman, Michal, et al.
Publicado: (2026)
por: Shlapentokh-Rothman, Michal, et al.
Publicado: (2026)
RealKIE: Five Novel Datasets for Enterprise Key Information Extraction
por: Townsend, Benjamin, et al.
Publicado: (2024)
por: Townsend, Benjamin, et al.
Publicado: (2024)
Sumotosima: A Framework and Dataset for Classifying and Summarizing Otoscopic Images
por: Khan, Eram Anwarul, et al.
Publicado: (2024)
por: Khan, Eram Anwarul, et al.
Publicado: (2024)
A Video is Worth 10,000 Words: Training and Benchmarking with Diverse Captions for Better Long Video Retrieval
por: Gwilliam, Matthew, et al.
Publicado: (2023)
por: Gwilliam, Matthew, et al.
Publicado: (2023)
DocSum: Domain-Adaptive Pre-training for Document Abstractive Summarization
por: Chau, Phan Phuong Mai, et al.
Publicado: (2024)
por: Chau, Phan Phuong Mai, et al.
Publicado: (2024)
Towards Effective Long Video Understanding of Multimodal Large Language Models via One-shot Clip Retrieval
por: Chen, Tao, et al.
Publicado: (2025)
por: Chen, Tao, et al.
Publicado: (2025)
A Novel Trustworthy Video Summarization Algorithm Through a Mixture of LoRA Experts
por: Du, Wenzhuo, et al.
Publicado: (2025)
por: Du, Wenzhuo, et al.
Publicado: (2025)
Saliency Map-based Image Retrieval using Invariant Krawtchouk Moments
por: Nejad, Ashkan, et al.
Publicado: (2024)
por: Nejad, Ashkan, et al.
Publicado: (2024)
Towards Event-oriented Long Video Understanding
por: Du, Yifan, et al.
Publicado: (2024)
por: Du, Yifan, et al.
Publicado: (2024)
Ejemplares similares
-
Integrating Video and Text: A Balanced Approach to Multimodal Summary Generation and Evaluation
por: Pennec, Galann, et al.
Publicado: (2025) -
From Long Videos to Engaging Clips: A Human-Inspired Video Editing Framework with Multimodal Narrative Understanding
por: Wang, Xiangfeng, et al.
Publicado: (2025) -
From Frames to Clips: Training-free Adaptive Key Clip Selection for Long-Form Video Understanding
por: Sun, Guangyu, et al.
Publicado: (2025) -
Moment Sampling in Video LLMs for Long-Form Video QA
por: Chasmai, Mustafa, et al.
Publicado: (2025) -
VideoXum: Cross-modal Visual and Textural Summarization of Videos
por: Lin, Jingyang, et al.
Publicado: (2023)