Realizing Video Summarization from the Path of Language-based Semantic Understanding
Fuente:
arXiv
Salvato in:
| Autori principali: | Mu, Kuan-Chen, Chin, Zhi-Yi, Chiu, Wei-Chen |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Sigma: Semantically Informative Pre-training for Skeleton-based Sign Language Understanding
di: Pu, Muxin, et al.
Pubblicazione: (2025)
di: Pu, Muxin, et al.
Pubblicazione: (2025)
Red-Teaming Text-to-Image Models via In-Context Experience Replay and Semantic-Preserving Prompt Rewriting
di: Chin, Zhi-Yi, et al.
Pubblicazione: (2024)
di: Chin, Zhi-Yi, et al.
Pubblicazione: (2024)
Prompting4Debugging: Red-Teaming Text-to-Image Diffusion Models by Finding Problematic Prompts
di: Chin, Zhi-Yi, et al.
Pubblicazione: (2023)
di: Chin, Zhi-Yi, et al.
Pubblicazione: (2023)
VideoXum: Cross-modal Visual and Textural Summarization of Videos
di: Lin, Jingyang, et al.
Pubblicazione: (2023)
di: Lin, Jingyang, et al.
Pubblicazione: (2023)
Multimodal Abstractive Summarization of Instructional Videos with Vision-Language Models
di: Nazir, Maham, et al.
Pubblicazione: (2026)
di: Nazir, Maham, et al.
Pubblicazione: (2026)
DoraemonGPT: Toward Understanding Dynamic Scenes with Large Language Models (Exemplified as A Video Agent)
di: Yang, Zongxin, et al.
Pubblicazione: (2024)
di: Yang, Zongxin, et al.
Pubblicazione: (2024)
Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models
di: Lee, Yi-Lun, et al.
Pubblicazione: (2024)
di: Lee, Yi-Lun, et al.
Pubblicazione: (2024)
Unleashing Hour-Scale Video Training for Long Video-Language Understanding
di: Lin, Jingyang, et al.
Pubblicazione: (2025)
di: Lin, Jingyang, et al.
Pubblicazione: (2025)
Minimal Clips, Maximum Salience: Long Video Summarization via Key Moment Extraction
di: Pennec, Galann, et al.
Pubblicazione: (2025)
di: Pennec, Galann, et al.
Pubblicazione: (2025)
Semantic Frame Aggregation-based Transformer for Live Video Comment Generation
di: Fatima, Anam, et al.
Pubblicazione: (2025)
di: Fatima, Anam, et al.
Pubblicazione: (2025)
MS4UI: A Dataset for Multi-modal Summarization of User Interface Instructional Videos
di: Zang, Yuan, et al.
Pubblicazione: (2025)
di: Zang, Yuan, et al.
Pubblicazione: (2025)
NeMo: Needle in a Montage for Video-Language Understanding
di: Hu, Zi-Yuan, et al.
Pubblicazione: (2025)
di: Hu, Zi-Yuan, et al.
Pubblicazione: (2025)
Pop-Up Distractions Reveal Bag-of-Events Behavior in Video Large Language Models
di: Chew, Oscar, et al.
Pubblicazione: (2026)
di: Chew, Oscar, et al.
Pubblicazione: (2026)
VideoChat: Chat-Centric Video Understanding
di: Li, KunChang, et al.
Pubblicazione: (2023)
di: Li, KunChang, et al.
Pubblicazione: (2023)
SignDPO: Multi-level Direct Preference Optimisation for Skeleton-based Gloss-free Sign Language Translation
di: Pu, Muxin, et al.
Pubblicazione: (2026)
di: Pu, Muxin, et al.
Pubblicazione: (2026)
Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization
di: Islam, Md Moinul, et al.
Pubblicazione: (2025)
di: Islam, Md Moinul, et al.
Pubblicazione: (2025)
Video Understanding with Large Language Models: A Survey
di: Tang, Yolo Y., et al.
Pubblicazione: (2023)
di: Tang, Yolo Y., et al.
Pubblicazione: (2023)
LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding
di: Wu, Haoning, et al.
Pubblicazione: (2024)
di: Wu, Haoning, et al.
Pubblicazione: (2024)
VideoARM: Agentic Reasoning over Hierarchical Memory for Long-Form Video Understanding
di: Yin, Yufei, et al.
Pubblicazione: (2025)
di: Yin, Yufei, et al.
Pubblicazione: (2025)
Video-LaVIT: Unified Video-Language Pre-training with Decoupled Visual-Motional Tokenization
di: Jin, Yang, et al.
Pubblicazione: (2024)
di: Jin, Yang, et al.
Pubblicazione: (2024)
TOPA: Extending Large Language Models for Video Understanding via Text-Only Pre-Alignment
di: Li, Wei, et al.
Pubblicazione: (2024)
di: Li, Wei, et al.
Pubblicazione: (2024)
From Long Videos to Engaging Clips: A Human-Inspired Video Editing Framework with Multimodal Narrative Understanding
di: Wang, Xiangfeng, et al.
Pubblicazione: (2025)
di: Wang, Xiangfeng, et al.
Pubblicazione: (2025)
Enhancing Meme Emotion Understanding with Multi-Level Modality Enhancement and Dual-Stage Modal Fusion
di: Shi, Yi, et al.
Pubblicazione: (2025)
di: Shi, Yi, et al.
Pubblicazione: (2025)
Personalized Video Summarization by Multimodal Video Understanding
di: Chen, Brian, et al.
Pubblicazione: (2024)
di: Chen, Brian, et al.
Pubblicazione: (2024)
Wolf: Dense Video Captioning with a World Summarization Framework
di: Li, Boyi, et al.
Pubblicazione: (2024)
di: Li, Boyi, et al.
Pubblicazione: (2024)
VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs
di: Cheng, Zesen, et al.
Pubblicazione: (2024)
di: Cheng, Zesen, et al.
Pubblicazione: (2024)
MuLTI: Efficient Video-and-Language Understanding with Text-Guided MultiWay-Sampler and Multiple Choice Modeling
di: Xu, Jiaqi, et al.
Pubblicazione: (2023)
di: Xu, Jiaqi, et al.
Pubblicazione: (2023)
VLMT: Vision-Language Multimodal Transformer for Multimodal Multi-hop Question Answering
di: Lim, Qi Zhi, et al.
Pubblicazione: (2025)
di: Lim, Qi Zhi, et al.
Pubblicazione: (2025)
ViTCoT: Video-Text Interleaved Chain-of-Thought for Boosting Video Understanding in Large Language Models
di: Zhang, Yongheng, et al.
Pubblicazione: (2025)
di: Zhang, Yongheng, et al.
Pubblicazione: (2025)
A Novel Trustworthy Video Summarization Algorithm Through a Mixture of LoRA Experts
di: Du, Wenzhuo, et al.
Pubblicazione: (2025)
di: Du, Wenzhuo, et al.
Pubblicazione: (2025)
Summarization of Multimodal Presentations with Vision-Language Models: Study of the Effect of Modalities and Structure
di: Gigant, Théo, et al.
Pubblicazione: (2025)
di: Gigant, Théo, et al.
Pubblicazione: (2025)
Exploring the Role of Explicit Temporal Modeling in Multimodal Large Language Models for Video Understanding
di: Li, Yun, et al.
Pubblicazione: (2025)
di: Li, Yun, et al.
Pubblicazione: (2025)
Vision Language Models Map Logos to Text via Semantic Entanglement in the Visual Projector
di: Li, Sifan, et al.
Pubblicazione: (2025)
di: Li, Sifan, et al.
Pubblicazione: (2025)
LayoutLLM: Layout Instruction Tuning with Large Language Models for Document Understanding
di: Luo, Chuwei, et al.
Pubblicazione: (2024)
di: Luo, Chuwei, et al.
Pubblicazione: (2024)
STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models
di: Liang, Yiming, et al.
Pubblicazione: (2026)
di: Liang, Yiming, et al.
Pubblicazione: (2026)
CoTasks: Chain-of-Thought based Video Instruction Tuning Tasks
di: Wang, Yanan, et al.
Pubblicazione: (2025)
di: Wang, Yanan, et al.
Pubblicazione: (2025)
Unlocking Exocentric Video-Language Data for Egocentric Video Representation Learning
di: Dou, Zi-Yi, et al.
Pubblicazione: (2024)
di: Dou, Zi-Yi, et al.
Pubblicazione: (2024)
Towards Event-oriented Long Video Understanding
di: Du, Yifan, et al.
Pubblicazione: (2024)
di: Du, Yifan, et al.
Pubblicazione: (2024)
An LMM for Efficient Video Understanding via Reinforced Compression of Video Cubes
di: Qi, Ji, et al.
Pubblicazione: (2025)
di: Qi, Ji, et al.
Pubblicazione: (2025)
VITATECS: A Diagnostic Dataset for Temporal Concept Understanding of Video-Language Models
di: Li, Shicheng, et al.
Pubblicazione: (2023)
di: Li, Shicheng, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Sigma: Semantically Informative Pre-training for Skeleton-based Sign Language Understanding
di: Pu, Muxin, et al.
Pubblicazione: (2025) -
Red-Teaming Text-to-Image Models via In-Context Experience Replay and Semantic-Preserving Prompt Rewriting
di: Chin, Zhi-Yi, et al.
Pubblicazione: (2024) -
Prompting4Debugging: Red-Teaming Text-to-Image Diffusion Models by Finding Problematic Prompts
di: Chin, Zhi-Yi, et al.
Pubblicazione: (2023) -
VideoXum: Cross-modal Visual and Textural Summarization of Videos
di: Lin, Jingyang, et al.
Pubblicazione: (2023) -
Multimodal Abstractive Summarization of Instructional Videos with Vision-Language Models
di: Nazir, Maham, et al.
Pubblicazione: (2026)