Unsupervised Video Highlight Detection by Learning from Audio and Visual Recurrence
Fuente:
arXiv
Salvato in:
| Autori principali: | Islam, Zahidul, Paul, Sujoy, Rochan, Mrigank |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Test-Time Adaptation for Video Highlight Detection Using Meta-Auxiliary Learning and Cross-Modality Hallucinations
di: Islam, Zahidul, et al.
Pubblicazione: (2025)
di: Islam, Zahidul, et al.
Pubblicazione: (2025)
Learnable Motion-Focused Tokenization for Effective and Efficient Video Unsupervised Domain Adaptation
di: Liu, Tzu Ling, et al.
Pubblicazione: (2026)
di: Liu, Tzu Ling, et al.
Pubblicazione: (2026)
Unsupervised Modality-Transferable Video Highlight Detection with Representation Activation Sequence Learning
di: Li, Tingtian, et al.
Pubblicazione: (2024)
di: Li, Tingtian, et al.
Pubblicazione: (2024)
Sounding Highlights: Dual-Pathway Audio Encoders for Audio-Visual Video Highlight Detection
di: Joo, Seohyun, et al.
Pubblicazione: (2026)
di: Joo, Seohyun, et al.
Pubblicazione: (2026)
Unsupervised Transcript-assisted Video Summarization and Highlight Detection
di: Barbakos, Spyros, et al.
Pubblicazione: (2025)
di: Barbakos, Spyros, et al.
Pubblicazione: (2025)
HighlightMe: Detecting Highlights from Human-Centric Videos
di: Bhattacharya, Uttaran, et al.
Pubblicazione: (2021)
di: Bhattacharya, Uttaran, et al.
Pubblicazione: (2021)
Automated Detection of Sport Highlights from Audio and Video Sources
di: Della Santa, Francesco, et al.
Pubblicazione: (2025)
di: Della Santa, Francesco, et al.
Pubblicazione: (2025)
Unsupervised Welding Defect Detection Using Audio And Video
di: Stemmer, Georg, et al.
Pubblicazione: (2024)
di: Stemmer, Georg, et al.
Pubblicazione: (2024)
Unsupervised Audio-Visual Segmentation with Modality Alignment
di: Bhosale, Swapnil, et al.
Pubblicazione: (2024)
di: Bhosale, Swapnil, et al.
Pubblicazione: (2024)
MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing
di: Wang, Langyu, et al.
Pubblicazione: (2025)
di: Wang, Langyu, et al.
Pubblicazione: (2025)
Learning to Highlight Audio by Watching Movies
di: Huang, Chao, et al.
Pubblicazione: (2025)
di: Huang, Chao, et al.
Pubblicazione: (2025)
Efficient Audio-Visual Fusion for Video Classification
di: Awan, Mahrukh, et al.
Pubblicazione: (2024)
di: Awan, Mahrukh, et al.
Pubblicazione: (2024)
Unleash the Potential of CLIP for Video Highlight Detection
di: Han, Donghoon, et al.
Pubblicazione: (2024)
di: Han, Donghoon, et al.
Pubblicazione: (2024)
MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning
di: Ma, Hongxu, et al.
Pubblicazione: (2025)
di: Ma, Hongxu, et al.
Pubblicazione: (2025)
Learning Visual Affordance from Audio
di: Lu, Lidong, et al.
Pubblicazione: (2025)
di: Lu, Lidong, et al.
Pubblicazione: (2025)
DiffusionVMR: Diffusion Model for Joint Video Moment Retrieval and Highlight Detection
di: Zhao, Henghao, et al.
Pubblicazione: (2023)
di: Zhao, Henghao, et al.
Pubblicazione: (2023)
Learning Weakly Supervised Audio-Visual Violence Detection in Hyperbolic Space
di: Peng, Xiaogang, et al.
Pubblicazione: (2023)
di: Peng, Xiaogang, et al.
Pubblicazione: (2023)
AV-DiT: Efficient Audio-Visual Diffusion Transformer for Joint Audio and Video Generation
di: Wang, Kai, et al.
Pubblicazione: (2024)
di: Wang, Kai, et al.
Pubblicazione: (2024)
VideoLights: Feature Refinement and Cross-Task Alignment Transformer for Joint Video Highlight Detection and Moment Retrieval
di: Paul, Dhiman, et al.
Pubblicazione: (2024)
di: Paul, Dhiman, et al.
Pubblicazione: (2024)
CAGE: Unsupervised Visual Composition and Animation for Controllable Video Generation
di: Davtyan, Aram, et al.
Pubblicazione: (2024)
di: Davtyan, Aram, et al.
Pubblicazione: (2024)
Video Detective: Seek Critical Clues Recurrently to Answer Question from Long Videos
di: Du, Henghui, et al.
Pubblicazione: (2025)
di: Du, Henghui, et al.
Pubblicazione: (2025)
Multi-modal Fusion and Query Refinement Network for Video Moment Retrieval and Highlight Detection
di: Xu, Yifang, et al.
Pubblicazione: (2025)
di: Xu, Yifang, et al.
Pubblicazione: (2025)
KFFocus: Highlighting Keyframes for Enhanced Video Understanding
di: Nie, Ming, et al.
Pubblicazione: (2025)
di: Nie, Ming, et al.
Pubblicazione: (2025)
SpeechForensics: Audio-Visual Speech Representation Learning for Face Forgery Detection
di: Liang, Yachao, et al.
Pubblicazione: (2025)
di: Liang, Yachao, et al.
Pubblicazione: (2025)
Don't Let the Video Speak: Audio-Contrastive Preference Optimization for Audio-Visual Language Models
di: Baid, Ami, et al.
Pubblicazione: (2026)
di: Baid, Ami, et al.
Pubblicazione: (2026)
LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing
di: Wang, Langyu, et al.
Pubblicazione: (2024)
di: Wang, Langyu, et al.
Pubblicazione: (2024)
Relevance-guided Audio Visual Fusion for Video Saliency Prediction
di: Yu, Li, et al.
Pubblicazione: (2024)
di: Yu, Li, et al.
Pubblicazione: (2024)
Spherical World-Locking for Audio-Visual Localization in Egocentric Videos
di: Yun, Heeseung, et al.
Pubblicazione: (2024)
di: Yun, Heeseung, et al.
Pubblicazione: (2024)
Uncertainty Driven Bottleneck Attention U-net for Organ at Risk Segmentation
di: Nazib, Abdullah, et al.
Pubblicazione: (2023)
di: Nazib, Abdullah, et al.
Pubblicazione: (2023)
ELT: Elastic Looped Transformers for Visual Generation
di: Goyal, Sahil, et al.
Pubblicazione: (2026)
di: Goyal, Sahil, et al.
Pubblicazione: (2026)
CLIP-AE: CLIP-assisted Cross-view Audio-Visual Enhancement for Unsupervised Temporal Action Localization
di: Xia, Rui, et al.
Pubblicazione: (2025)
di: Xia, Rui, et al.
Pubblicazione: (2025)
Real-Time Idling Vehicles Detection using Combined Audio-Visual Deep Learning
di: Li, Xiwen, et al.
Pubblicazione: (2023)
di: Li, Xiwen, et al.
Pubblicazione: (2023)
Vision-Language Models Assisted Unsupervised Video Anomaly Detection
di: Jiang, Yalong, et al.
Pubblicazione: (2024)
di: Jiang, Yalong, et al.
Pubblicazione: (2024)
Reinforced Label Denoising for Weakly-Supervised Audio-Visual Video Parsing
di: Gao, Yongbiao, et al.
Pubblicazione: (2024)
di: Gao, Yongbiao, et al.
Pubblicazione: (2024)
Hierarchical Augmentation and Distillation for Class Incremental Audio-Visual Video Recognition
di: Zuo, Yukun, et al.
Pubblicazione: (2024)
di: Zuo, Yukun, et al.
Pubblicazione: (2024)
Text-Audio-Visual-conditioned Diffusion Model for Video Saliency Prediction
di: Yu, Li, et al.
Pubblicazione: (2025)
di: Yu, Li, et al.
Pubblicazione: (2025)
DTFSal: Audio-Visual Dynamic Token Fusion for Video Saliency Prediction
di: Hooshanfar, Kiana, et al.
Pubblicazione: (2025)
di: Hooshanfar, Kiana, et al.
Pubblicazione: (2025)
Leveraging Unsupervised Learning for Cost-Effective Visual Anomaly Detection
di: Long, Yunbo, et al.
Pubblicazione: (2024)
di: Long, Yunbo, et al.
Pubblicazione: (2024)
Free-VSC: Free Semantics from Visual Foundation Models for Unsupervised Video Semantic Compression
di: Tian, Yuan, et al.
Pubblicazione: (2024)
di: Tian, Yuan, et al.
Pubblicazione: (2024)
Implicit Counterfactual Learning for Audio-Visual Segmentation
di: Zha, Mingfeng, et al.
Pubblicazione: (2025)
di: Zha, Mingfeng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Test-Time Adaptation for Video Highlight Detection Using Meta-Auxiliary Learning and Cross-Modality Hallucinations
di: Islam, Zahidul, et al.
Pubblicazione: (2025) -
Learnable Motion-Focused Tokenization for Effective and Efficient Video Unsupervised Domain Adaptation
di: Liu, Tzu Ling, et al.
Pubblicazione: (2026) -
Unsupervised Modality-Transferable Video Highlight Detection with Representation Activation Sequence Learning
di: Li, Tingtian, et al.
Pubblicazione: (2024) -
Sounding Highlights: Dual-Pathway Audio Encoders for Audio-Visual Video Highlight Detection
di: Joo, Seohyun, et al.
Pubblicazione: (2026) -
Unsupervised Transcript-assisted Video Summarization and Highlight Detection
di: Barbakos, Spyros, et al.
Pubblicazione: (2025)