Unboxing Engagement in YouTube Influencer Videos: An Attention-Based Approach
Fuente:
arXiv
Salvato in:
| Autori principali: | Rajaram, Prashant, Manchanda, Puneet |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2020
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Identifying False Content and Hate Speech in Sinhala YouTube Videos by Analyzing the Audio
di: Wickramaarachchi, W. A. K. M., et al.
Pubblicazione: (2024)
di: Wickramaarachchi, W. A. K. M., et al.
Pubblicazione: (2024)
BanglaRobustNet: A Hybrid Denoising-Attention Architecture for Robust Bangla Speech Recognition
di: Ridoy, Md Sazzadul Islam, et al.
Pubblicazione: (2026)
di: Ridoy, Md Sazzadul Islam, et al.
Pubblicazione: (2026)
Better Spanish Emotion Recognition In-the-wild: Bringing Attention to Deep Spectrum Voice Analysis
di: Ortega-Beltrán, Elena, et al.
Pubblicazione: (2024)
di: Ortega-Beltrán, Elena, et al.
Pubblicazione: (2024)
Attention Isn't All You Need for Emotion Recognition:Domain Features Outperform Transformers on the EAV Dataset
di: Guragain, Anmol
Pubblicazione: (2026)
di: Guragain, Anmol
Pubblicazione: (2026)
ANIM-400K: A Large-Scale Dataset for Automated End-To-End Dubbing of Video
di: Cai, Kevin, et al.
Pubblicazione: (2024)
di: Cai, Kevin, et al.
Pubblicazione: (2024)
JEP-KD: Joint-Embedding Predictive Architecture Based Knowledge Distillation for Visual Speech Recognition
di: Sun, Chang, et al.
Pubblicazione: (2024)
di: Sun, Chang, et al.
Pubblicazione: (2024)
Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation
di: Goncalves, Lucas, et al.
Pubblicazione: (2024)
di: Goncalves, Lucas, et al.
Pubblicazione: (2024)
Density Adaptive Attention is All You Need: Robust Parameter-Efficient Fine-Tuning Across Multiple Modalities
di: Ioannides, Georgios, et al.
Pubblicazione: (2024)
di: Ioannides, Georgios, et al.
Pubblicazione: (2024)
Emotional Vietnamese Speech-Based Depression Diagnosis Using Dynamic Attention Mechanism
di: D., Quang-Anh N., et al.
Pubblicazione: (2024)
di: D., Quang-Anh N., et al.
Pubblicazione: (2024)
On the Audio Hallucinations in Large Audio-Video Language Models
di: Nishimura, Taichi, et al.
Pubblicazione: (2024)
di: Nishimura, Taichi, et al.
Pubblicazione: (2024)
Talker-T2AV: Joint Talking Audio-Video Generation with Autoregressive Diffusion Modeling
di: Ye, Zhen, et al.
Pubblicazione: (2026)
di: Ye, Zhen, et al.
Pubblicazione: (2026)
TapToTab : Video-Based Guitar Tabs Generation using AI and Audio Analysis
di: Ghaleb, Ali, et al.
Pubblicazione: (2024)
di: Ghaleb, Ali, et al.
Pubblicazione: (2024)
RankUp: Boosting Semi-Supervised Regression with an Auxiliary Ranking Classifier
di: Huang, Pin-Yen, et al.
Pubblicazione: (2024)
di: Huang, Pin-Yen, et al.
Pubblicazione: (2024)
2D or not 2D: How Does the Dimensionality of Gesture Representation Affect 3D Co-Speech Gesture Generation?
di: Guichoux, Téo, et al.
Pubblicazione: (2024)
di: Guichoux, Téo, et al.
Pubblicazione: (2024)
Multimodal Segmentation for Vocal Tract Modeling
di: Jain, Rishi, et al.
Pubblicazione: (2024)
di: Jain, Rishi, et al.
Pubblicazione: (2024)
MUSE: A Run-Centric Platform for Multimodal Unified Safety Evaluation of Large Language Models
di: Wang, Zhongxi, et al.
Pubblicazione: (2026)
di: Wang, Zhongxi, et al.
Pubblicazione: (2026)
Transcription and translation of videos using fine-tuned XLSR Wav2Vec2 on custom dataset and mBART
di: Tathe, Aniket, et al.
Pubblicazione: (2024)
di: Tathe, Aniket, et al.
Pubblicazione: (2024)
Dynamic Cross Attention for Audio-Visual Person Verification
di: Praveen, R. Gnana, et al.
Pubblicazione: (2024)
di: Praveen, R. Gnana, et al.
Pubblicazione: (2024)
Measuring Sound Symbolism in Audio-visual Models
di: Tseng, Wei-Cheng, et al.
Pubblicazione: (2024)
di: Tseng, Wei-Cheng, et al.
Pubblicazione: (2024)
Robust Audiovisual Speech Recognition Models with Mixture-of-Experts
di: Wu, Yihan, et al.
Pubblicazione: (2024)
di: Wu, Yihan, et al.
Pubblicazione: (2024)
Qwen2.5-Omni Technical Report
di: Xu, Jin, et al.
Pubblicazione: (2025)
di: Xu, Jin, et al.
Pubblicazione: (2025)
Noise-Robust AV-ASR Using Visual Features Both in the Whisper Encoder and Decoder
di: Li, Zhengyang, et al.
Pubblicazione: (2026)
di: Li, Zhengyang, et al.
Pubblicazione: (2026)
Unsupervised Out-of-Distribution Dialect Detection with Mahalanobis Distance
di: Das, Sourya Dipta, et al.
Pubblicazione: (2023)
di: Das, Sourya Dipta, et al.
Pubblicazione: (2023)
Tell What You Hear From What You See -- Video to Audio Generation Through Text
di: Liu, Xiulong, et al.
Pubblicazione: (2024)
di: Liu, Xiulong, et al.
Pubblicazione: (2024)
MMAudioSep: Taming Video-to-Audio Generative Model Towards Video/Text-Queried Sound Separation
di: Takahashi, Akira, et al.
Pubblicazione: (2025)
di: Takahashi, Akira, et al.
Pubblicazione: (2025)
Attention-guided Spectrogram Sequence Modeling with CNNs for Music Genre Classification
di: Sridhar, Aditya
Pubblicazione: (2024)
di: Sridhar, Aditya
Pubblicazione: (2024)
Audio-Visual Person Verification based on Recursive Fusion of Joint Cross-Attention
di: Praveen, R. Gnana, et al.
Pubblicazione: (2024)
di: Praveen, R. Gnana, et al.
Pubblicazione: (2024)
Recursive Joint Cross-Modal Attention for Multimodal Fusion in Dimensional Emotion Recognition
di: Praveen, R. Gnana, et al.
Pubblicazione: (2024)
di: Praveen, R. Gnana, et al.
Pubblicazione: (2024)
Mitigating Attention Sinks and Massive Activations in Audio-Visual Speech Recognition with LLMs
di: Anand, et al.
Pubblicazione: (2025)
di: Anand, et al.
Pubblicazione: (2025)
Decoding Emotions: Unveiling Facial Expressions through Acoustic Sensing with Contrastive Attention
di: Wang, Guangjing, et al.
Pubblicazione: (2024)
di: Wang, Guangjing, et al.
Pubblicazione: (2024)
Segmenting Collision Sound Sources in Egocentric Videos
di: Parida, Kranti Kumar, et al.
Pubblicazione: (2025)
di: Parida, Kranti Kumar, et al.
Pubblicazione: (2025)
End-to-end Audio Deepfake Detection from RAW Waveforms: a RawNet-Based Approach with Cross-Dataset Evaluation
di: Di Pierno, Andrea, et al.
Pubblicazione: (2025)
di: Di Pierno, Andrea, et al.
Pubblicazione: (2025)
Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance
di: Hayakawa, Akio, et al.
Pubblicazione: (2025)
di: Hayakawa, Akio, et al.
Pubblicazione: (2025)
Exploring Audio Cues for Enhanced Test-Time Video Model Adaptation
di: Zeng, Runhao, et al.
Pubblicazione: (2025)
di: Zeng, Runhao, et al.
Pubblicazione: (2025)
MMAudio: Taming Multimodal Joint Training for High-Quality Video-to-Audio Synthesis
di: Cheng, Ho Kei, et al.
Pubblicazione: (2024)
di: Cheng, Ho Kei, et al.
Pubblicazione: (2024)
Audio-Visual Talker Localization in Video for Spatial Sound Reproduction
di: Berghi, Davide, et al.
Pubblicazione: (2024)
di: Berghi, Davide, et al.
Pubblicazione: (2024)
AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation
di: Haji-Ali, Moayed, et al.
Pubblicazione: (2024)
di: Haji-Ali, Moayed, et al.
Pubblicazione: (2024)
MMAudioReverbs: Video-Guided Acoustic Modeling for Dereverberation and Room Impulse Response Estimation
di: Takahashi, Akira, et al.
Pubblicazione: (2026)
di: Takahashi, Akira, et al.
Pubblicazione: (2026)
A Low-rank Matching Attention based Cross-modal Feature Fusion Method for Conversational Emotion Recognition
di: Shou, Yuntao, et al.
Pubblicazione: (2023)
di: Shou, Yuntao, et al.
Pubblicazione: (2023)
UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing
di: Lai, Yung-Hsuan, et al.
Pubblicazione: (2025)
di: Lai, Yung-Hsuan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Identifying False Content and Hate Speech in Sinhala YouTube Videos by Analyzing the Audio
di: Wickramaarachchi, W. A. K. M., et al.
Pubblicazione: (2024) -
BanglaRobustNet: A Hybrid Denoising-Attention Architecture for Robust Bangla Speech Recognition
di: Ridoy, Md Sazzadul Islam, et al.
Pubblicazione: (2026) -
Better Spanish Emotion Recognition In-the-wild: Bringing Attention to Deep Spectrum Voice Analysis
di: Ortega-Beltrán, Elena, et al.
Pubblicazione: (2024) -
Attention Isn't All You Need for Emotion Recognition:Domain Features Outperform Transformers on the EAV Dataset
di: Guragain, Anmol
Pubblicazione: (2026) -
ANIM-400K: A Large-Scale Dataset for Automated End-To-End Dubbing of Video
di: Cai, Kevin, et al.
Pubblicazione: (2024)