Personalized Video Summarization by Multimodal Video Understanding
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Brian, Zhao, Xiangyuan, Zhu, Yingnan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
EdgeVidSum: Real-Time Personalized Video Summarization at the Edge
di: Mujtaba, Ghulam, et al.
Pubblicazione: (2025)
di: Mujtaba, Ghulam, et al.
Pubblicazione: (2025)
VideoITG: Multimodal Video Understanding with Instructed Temporal Grounding
di: Wang, Shihao, et al.
Pubblicazione: (2025)
di: Wang, Shihao, et al.
Pubblicazione: (2025)
VideoSAGE: Video Summarization with Graph Representation Learning
di: Chaves, Jose M. Rojas, et al.
Pubblicazione: (2024)
di: Chaves, Jose M. Rojas, et al.
Pubblicazione: (2024)
VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding
di: Zhang, Zhihong, et al.
Pubblicazione: (2025)
di: Zhang, Zhihong, et al.
Pubblicazione: (2025)
Unlocking Financial Insights: An advanced Multimodal Summarization with Multimodal Output Framework for Financial Advisory Videos
di: Das, Sarmistha, et al.
Pubblicazione: (2025)
di: Das, Sarmistha, et al.
Pubblicazione: (2025)
VideoWebArena: Evaluating Long Context Multimodal Agents with Video Understanding Web Tasks
di: Jang, Lawrence, et al.
Pubblicazione: (2024)
di: Jang, Lawrence, et al.
Pubblicazione: (2024)
Enhancing Video Summarization with Context Awareness
di: Huynh-Lam, Hai-Dang, et al.
Pubblicazione: (2024)
di: Huynh-Lam, Hai-Dang, et al.
Pubblicazione: (2024)
QEVA: A Reference-Free Evaluation Metric for Narrative Video Summarization with Multimodal Question Answering
di: Jung, Woojun, et al.
Pubblicazione: (2026)
di: Jung, Woojun, et al.
Pubblicazione: (2026)
Comparing Learning Paradigms for Egocentric Video Summarization
di: Wen, Daniel
Pubblicazione: (2025)
di: Wen, Daniel
Pubblicazione: (2025)
Think with Grounding: Curriculum Reinforced Reasoning with Video Grounding for Long Video Understanding
di: Chen, Houlun, et al.
Pubblicazione: (2026)
di: Chen, Houlun, et al.
Pubblicazione: (2026)
Apollo: An Exploration of Video Understanding in Large Multimodal Models
di: Zohar, Orr, et al.
Pubblicazione: (2024)
di: Zohar, Orr, et al.
Pubblicazione: (2024)
Perception, Understanding and Reasoning, A Multimodal Benchmark for Video Fake News Detection
di: Yakun, Cui, et al.
Pubblicazione: (2025)
di: Yakun, Cui, et al.
Pubblicazione: (2025)
LEMON: How Well Do MLLMs Perform Temporal Multimodal Understanding on Instructional Videos?
di: Yu, Zhuang, et al.
Pubblicazione: (2026)
di: Yu, Zhuang, et al.
Pubblicazione: (2026)
VERIFIED: A Video Corpus Moment Retrieval Benchmark for Fine-Grained Video Understanding
di: Chen, Houlun, et al.
Pubblicazione: (2024)
di: Chen, Houlun, et al.
Pubblicazione: (2024)
VCA: Video Curious Agent for Long Video Understanding
di: Yang, Zeyuan, et al.
Pubblicazione: (2024)
di: Yang, Zeyuan, et al.
Pubblicazione: (2024)
An Integrated Framework for Multi-Granular Explanation of Video Summarization
di: Tsigos, Konstantinos, et al.
Pubblicazione: (2024)
di: Tsigos, Konstantinos, et al.
Pubblicazione: (2024)
Cluster-based Video Summarization with Temporal Context Awareness
di: Huynh-Lam, Hai-Dang, et al.
Pubblicazione: (2024)
di: Huynh-Lam, Hai-Dang, et al.
Pubblicazione: (2024)
Video Panels for Long Video Understanding
di: Doorenbos, Lars, et al.
Pubblicazione: (2025)
di: Doorenbos, Lars, et al.
Pubblicazione: (2025)
Show, Tell and Summarize: Dense Video Captioning Using Visual Cue Aided Sentence Summarization
di: Zhang, Zhiwang, et al.
Pubblicazione: (2025)
di: Zhang, Zhiwang, et al.
Pubblicazione: (2025)
Vamos: Versatile Action Models for Video Understanding
di: Wang, Shijie, et al.
Pubblicazione: (2023)
di: Wang, Shijie, et al.
Pubblicazione: (2023)
VideoPrism: A Foundational Visual Encoder for Video Understanding
di: Zhao, Long, et al.
Pubblicazione: (2024)
di: Zhao, Long, et al.
Pubblicazione: (2024)
MT-Video-Bench: A Holistic Video Understanding Benchmark for Evaluating Multimodal LLMs in Multi-Turn Dialogues
di: Pan, Yaning, et al.
Pubblicazione: (2025)
di: Pan, Yaning, et al.
Pubblicazione: (2025)
Benchmarking Scientific Understanding and Reasoning for Video Generation using VideoScience-Bench
di: Hu, Lanxiang, et al.
Pubblicazione: (2025)
di: Hu, Lanxiang, et al.
Pubblicazione: (2025)
X2SAM: Any Segmentation in Images and Videos
di: Wang, Hao, et al.
Pubblicazione: (2026)
di: Wang, Hao, et al.
Pubblicazione: (2026)
MVU-Eval: Towards Multi-Video Understanding Evaluation for Multimodal LLMs
di: Peng, Tianhao, et al.
Pubblicazione: (2025)
di: Peng, Tianhao, et al.
Pubblicazione: (2025)
HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation
di: Xiao, Yicheng, et al.
Pubblicazione: (2025)
di: Xiao, Yicheng, et al.
Pubblicazione: (2025)
Multimodal Alignment with Cross-Attentive GRUs for Fine-Grained Video Understanding
di: Kim, Namho, et al.
Pubblicazione: (2025)
di: Kim, Namho, et al.
Pubblicazione: (2025)
Exploring Efficient Foundational Multi-modal Models for Video Summarization
di: Samel, Karan, et al.
Pubblicazione: (2024)
di: Samel, Karan, et al.
Pubblicazione: (2024)
Dense Video Captioning using Graph-based Sentence Summarization
di: Zhang, Zhiwang, et al.
Pubblicazione: (2025)
di: Zhang, Zhiwang, et al.
Pubblicazione: (2025)
Language-guided Recursive Spatiotemporal Graph Modeling for Video Summarization
di: Park, Jungin, et al.
Pubblicazione: (2025)
di: Park, Jungin, et al.
Pubblicazione: (2025)
An Experimental Study on Generating Plausible Textual Explanations for Video Summarization
di: Eleftheriadis, Thomas, et al.
Pubblicazione: (2025)
di: Eleftheriadis, Thomas, et al.
Pubblicazione: (2025)
Less is More: Label-Guided Summarization of Procedural and Instructional Videos
di: Rajpal, Shreya, et al.
Pubblicazione: (2026)
di: Rajpal, Shreya, et al.
Pubblicazione: (2026)
PEARL: Personalized Streaming Video Understanding Model
di: Zheng, Yuanhong, et al.
Pubblicazione: (2026)
di: Zheng, Yuanhong, et al.
Pubblicazione: (2026)
Video Summarization: Towards Entity-Aware Captions
di: Ayyubi, Hammad A., et al.
Pubblicazione: (2023)
di: Ayyubi, Hammad A., et al.
Pubblicazione: (2023)
Scaling the Long Video Understanding of Multimodal Large Language Models via Visual Memory Mechanism
di: Chen, Tao, et al.
Pubblicazione: (2026)
di: Chen, Tao, et al.
Pubblicazione: (2026)
HumanVideo-MME: Benchmarking MLLMs for Human-Centric Video Understanding
di: Cai, Yuxuan, et al.
Pubblicazione: (2025)
di: Cai, Yuxuan, et al.
Pubblicazione: (2025)
Multimodal Video Emotion Recognition with Reliable Reasoning Priors
di: Wang, Zhepeng, et al.
Pubblicazione: (2025)
di: Wang, Zhepeng, et al.
Pubblicazione: (2025)
MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models
di: Yang, Garry, et al.
Pubblicazione: (2025)
di: Yang, Garry, et al.
Pubblicazione: (2025)
SciVideoBench: Benchmarking Scientific Video Reasoning in Large Multimodal Models
di: Deng, Andong, et al.
Pubblicazione: (2025)
di: Deng, Andong, et al.
Pubblicazione: (2025)
PrismVAU: Prompt-Refined Inference System for Multimodal Video Anomaly Understanding
di: Erregue, Iñaki, et al.
Pubblicazione: (2026)
di: Erregue, Iñaki, et al.
Pubblicazione: (2026)
Documenti analoghi
-
EdgeVidSum: Real-Time Personalized Video Summarization at the Edge
di: Mujtaba, Ghulam, et al.
Pubblicazione: (2025) -
VideoITG: Multimodal Video Understanding with Instructed Temporal Grounding
di: Wang, Shihao, et al.
Pubblicazione: (2025) -
VideoSAGE: Video Summarization with Graph Representation Learning
di: Chaves, Jose M. Rojas, et al.
Pubblicazione: (2024) -
VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding
di: Zhang, Zhihong, et al.
Pubblicazione: (2025) -
Unlocking Financial Insights: An advanced Multimodal Summarization with Multimodal Output Framework for Financial Advisory Videos
di: Das, Sarmistha, et al.
Pubblicazione: (2025)