SD-MVSum: Script-Driven Multimodal Video Summarization Method and Datasets
Fuente:
arXiv
Salvato in:
| Autori principali: | Mylonas, Manolis, Zerva, Charalampia, Apostolidis, Evlampios, Mezaris, Vasileios |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SD-VSum: A Method and Dataset for Script-Driven Video Summarization
di: Mylonas, Manolis, et al.
Pubblicazione: (2025)
di: Mylonas, Manolis, et al.
Pubblicazione: (2025)
A Human-Annotated Video Dataset for Training and Evaluation of 360-Degree Video Summarization Methods
di: Kontostathis, Ioannis, et al.
Pubblicazione: (2024)
di: Kontostathis, Ioannis, et al.
Pubblicazione: (2024)
An Integrated Framework for Multi-Granular Explanation of Video Summarization
di: Tsigos, Konstantinos, et al.
Pubblicazione: (2024)
di: Tsigos, Konstantinos, et al.
Pubblicazione: (2024)
TSalV360: A Method and Dataset for Text-driven Saliency Detection in 360-Degrees Videos
di: Kontostathis, Ioannis, et al.
Pubblicazione: (2025)
di: Kontostathis, Ioannis, et al.
Pubblicazione: (2025)
An Experimental Study on Generating Plausible Textual Explanations for Video Summarization
di: Eleftheriadis, Thomas, et al.
Pubblicazione: (2025)
di: Eleftheriadis, Thomas, et al.
Pubblicazione: (2025)
Sens-VisualNews: A Benchmark Dataset for Sensational Image Detection
di: Goulas, Andreas, et al.
Pubblicazione: (2026)
di: Goulas, Andreas, et al.
Pubblicazione: (2026)
Improving the Perturbation-Based Explanation of Deepfake Detectors Through the Use of Adversarially-Generated Samples
di: Tsigos, Konstantinos, et al.
Pubblicazione: (2025)
di: Tsigos, Konstantinos, et al.
Pubblicazione: (2025)
Towards Quantitative Evaluation of Explainable AI Methods for Deepfake Detection
di: Tsigos, Konstantinos, et al.
Pubblicazione: (2024)
di: Tsigos, Konstantinos, et al.
Pubblicazione: (2024)
Improving Multimodal Hateful Meme Detection Exploiting LMM-Generated Knowledge
di: Tzelepi, Maria, et al.
Pubblicazione: (2025)
di: Tzelepi, Maria, et al.
Pubblicazione: (2025)
Visual and audio scene classification for detecting discrepancies in video: a baseline method and experimental protocol
di: Apostolidis, Konstantinos, et al.
Pubblicazione: (2024)
di: Apostolidis, Konstantinos, et al.
Pubblicazione: (2024)
B-FPGM: Lightweight Face Detection via Bayesian-Optimized Soft FPGM Pruning
di: Kaparinos, Nikolaos, et al.
Pubblicazione: (2025)
di: Kaparinos, Nikolaos, et al.
Pubblicazione: (2025)
SDAKD: Student Discriminator Assisted Knowledge Distillation for Super-Resolution Generative Adversarial Networks
di: Kaparinos, Nikolaos, et al.
Pubblicazione: (2025)
di: Kaparinos, Nikolaos, et al.
Pubblicazione: (2025)
Online Anchor-based Training for Image Classification Tasks
di: Tzelepi, Maria, et al.
Pubblicazione: (2024)
di: Tzelepi, Maria, et al.
Pubblicazione: (2024)
Disturbing Image Detection Using LMM-Elicited Emotion Embeddings
di: Tzelepi, Maria, et al.
Pubblicazione: (2024)
di: Tzelepi, Maria, et al.
Pubblicazione: (2024)
LMM-Regularized CLIP Embeddings for Image Classification
di: Tzelepi, Maria, et al.
Pubblicazione: (2024)
di: Tzelepi, Maria, et al.
Pubblicazione: (2024)
LLaVA-CKD: Bottom-Up Cascaded Knowledge Distillation for Vision-Language Models
di: Gkalelis, Nikolaos, et al.
Pubblicazione: (2026)
di: Gkalelis, Nikolaos, et al.
Pubblicazione: (2026)
VidCtx: Context-aware Video Question Answering with Image Models
di: Goulas, Andreas, et al.
Pubblicazione: (2024)
di: Goulas, Andreas, et al.
Pubblicazione: (2024)
TAME: Attention Mechanism Based Feature Fusion for Generating Explanation Maps of Convolutional Neural Networks
di: Ntrougkas, Mariano, et al.
Pubblicazione: (2023)
di: Ntrougkas, Mariano, et al.
Pubblicazione: (2023)
MMFusion: Combining Image Forensic Filters for Visual Manipulation Detection and Localization
di: Triaridis, Kostas, et al.
Pubblicazione: (2023)
di: Triaridis, Kostas, et al.
Pubblicazione: (2023)
Exploiting LMM-based knowledge for image classification tasks
di: Tzelepi, Maria, et al.
Pubblicazione: (2024)
di: Tzelepi, Maria, et al.
Pubblicazione: (2024)
P-TAME: Explain Any Image Classifier with Trained Perturbations
di: Ntrougkas, Mariano V., et al.
Pubblicazione: (2025)
di: Ntrougkas, Mariano V., et al.
Pubblicazione: (2025)
Reasoning or Pattern Matching? Probing Large Vision-Language Models with Visual Puzzles
di: Lymperaiou, Maria, et al.
Pubblicazione: (2026)
di: Lymperaiou, Maria, et al.
Pubblicazione: (2026)
T-TAME: Trainable Attention Mechanism for Explaining Convolutional Networks and Vision Transformers
di: Ntrougkas, Mariano V., et al.
Pubblicazione: (2024)
di: Ntrougkas, Mariano V., et al.
Pubblicazione: (2024)
Improving Generalization in Deepfake Detection with Face Foundation Models and Metric Learning
di: Mylonas, Stelios, et al.
Pubblicazione: (2025)
di: Mylonas, Stelios, et al.
Pubblicazione: (2025)
Personalized Video Summarization by Multimodal Video Understanding
di: Chen, Brian, et al.
Pubblicazione: (2024)
di: Chen, Brian, et al.
Pubblicazione: (2024)
MF2Summ: Multimodal Fusion for Video Summarization with Temporal Alignment
di: wang, Shuo, et al.
Pubblicazione: (2025)
di: wang, Shuo, et al.
Pubblicazione: (2025)
Multimodal Abstractive Summarization of Instructional Videos with Vision-Language Models
di: Nazir, Maham, et al.
Pubblicazione: (2026)
di: Nazir, Maham, et al.
Pubblicazione: (2026)
Twins-PainViT: Towards a Modality-Agnostic Vision Transformer Framework for Multimodal Automatic Pain Assessment using Facial Videos and fNIRS
di: Gkikas, Stefanos, et al.
Pubblicazione: (2024)
di: Gkikas, Stefanos, et al.
Pubblicazione: (2024)
ICANet: A Method of Short Video Emotion Recognition Driven by Multimodal Data
di: Wu, Xuecheng, et al.
Pubblicazione: (2022)
di: Wu, Xuecheng, et al.
Pubblicazione: (2022)
Historic Scripts to Modern Vision: A Novel Dataset and A VLM Framework for Transliteration of Modi Script to Devanagari
di: Kausadikar, Harshal, et al.
Pubblicazione: (2025)
di: Kausadikar, Harshal, et al.
Pubblicazione: (2025)
Multimodal Language Models for Domain-Specific Procedural Video Summarization
di: Hussain, Nafisa
Pubblicazione: (2024)
di: Hussain, Nafisa
Pubblicazione: (2024)
Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization
di: Islam, Md Moinul, et al.
Pubblicazione: (2025)
di: Islam, Md Moinul, et al.
Pubblicazione: (2025)
Brighteye: Glaucoma Screening with Color Fundus Photographs based on Vision Transformer
di: Lin, Hui, et al.
Pubblicazione: (2024)
di: Lin, Hui, et al.
Pubblicazione: (2024)
OmniScript: Towards Audio-Visual Script Generation for Long-Form Cinematic Video
di: Pu, Junfu, et al.
Pubblicazione: (2026)
di: Pu, Junfu, et al.
Pubblicazione: (2026)
Video Summarization with Large Language Models
di: Lee, Min Jung, et al.
Pubblicazione: (2025)
di: Lee, Min Jung, et al.
Pubblicazione: (2025)
SD-MAD: Sign-Driven Few-shot Multi-Anomaly Detection in Medical Images
di: Guo, Kaiyu, et al.
Pubblicazione: (2025)
di: Guo, Kaiyu, et al.
Pubblicazione: (2025)
EgoFun3D: Modeling Interactive Objects from Egocentric Videos using Function Templates
di: Peng, Weikun, et al.
Pubblicazione: (2026)
di: Peng, Weikun, et al.
Pubblicazione: (2026)
MS4UI: A Dataset for Multi-modal Summarization of User Interface Instructional Videos
di: Zang, Yuan, et al.
Pubblicazione: (2025)
di: Zang, Yuan, et al.
Pubblicazione: (2025)
Unlocking Financial Insights: An advanced Multimodal Summarization with Multimodal Output Framework for Financial Advisory Videos
di: Das, Sarmistha, et al.
Pubblicazione: (2025)
di: Das, Sarmistha, et al.
Pubblicazione: (2025)
SD-MVS: Segmentation-Driven Deformation Multi-View Stereo with Spherical Refinement and EM optimization
di: Yuan, Zhenlong, et al.
Pubblicazione: (2024)
di: Yuan, Zhenlong, et al.
Pubblicazione: (2024)
Documenti analoghi
-
SD-VSum: A Method and Dataset for Script-Driven Video Summarization
di: Mylonas, Manolis, et al.
Pubblicazione: (2025) -
A Human-Annotated Video Dataset for Training and Evaluation of 360-Degree Video Summarization Methods
di: Kontostathis, Ioannis, et al.
Pubblicazione: (2024) -
An Integrated Framework for Multi-Granular Explanation of Video Summarization
di: Tsigos, Konstantinos, et al.
Pubblicazione: (2024) -
TSalV360: A Method and Dataset for Text-driven Saliency Detection in 360-Degrees Videos
di: Kontostathis, Ioannis, et al.
Pubblicazione: (2025) -
An Experimental Study on Generating Plausible Textual Explanations for Video Summarization
di: Eleftheriadis, Thomas, et al.
Pubblicazione: (2025)