Multimodal Sentiment Analysis based on Video and Audio Inputs
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Fernandez, Antonio, Awinat, Suzan |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
MM-Sonate: Multimodal Controllable Audio-Video Generation with Zero-Shot Voice Cloning
von: Qiang, Chunyu, et al.
Veröffentlicht: (2026)
von: Qiang, Chunyu, et al.
Veröffentlicht: (2026)
Sounding Highlights: Dual-Pathway Audio Encoders for Audio-Visual Video Highlight Detection
von: Joo, Seohyun, et al.
Veröffentlicht: (2026)
von: Joo, Seohyun, et al.
Veröffentlicht: (2026)
MAVERIX: Multimodal Audio-Visual Evaluation and Recognition IndeX
von: Xie, Liuyue, et al.
Veröffentlicht: (2025)
von: Xie, Liuyue, et al.
Veröffentlicht: (2025)
Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation
von: Liang, Yingshan, et al.
Veröffentlicht: (2025)
von: Liang, Yingshan, et al.
Veröffentlicht: (2025)
What's Making That Sound Right Now? Video-centric Audio-Visual Localization
von: Choi, Hahyeon, et al.
Veröffentlicht: (2025)
von: Choi, Hahyeon, et al.
Veröffentlicht: (2025)
UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation
von: Zhao, Lei, et al.
Veröffentlicht: (2025)
von: Zhao, Lei, et al.
Veröffentlicht: (2025)
Efficient Selective Audio Masked Multimodal Bottleneck Transformer for Audio-Video Classification
von: Zhu, Wentao
Veröffentlicht: (2024)
von: Zhu, Wentao
Veröffentlicht: (2024)
Efficient Multiscale Multimodal Bottleneck Transformer for Audio-Video Classification
von: Zhu, Wentao
Veröffentlicht: (2024)
von: Zhu, Wentao
Veröffentlicht: (2024)
Seeing Soundscapes: Audio-Visual Generation and Separation from Soundscapes Using Audio-Visual Separator
von: Kang, Minjae, et al.
Veröffentlicht: (2025)
von: Kang, Minjae, et al.
Veröffentlicht: (2025)
AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation
von: Wang, Le, et al.
Veröffentlicht: (2025)
von: Wang, Le, et al.
Veröffentlicht: (2025)
VGGSounder: Audio-Visual Evaluations for Foundation Models
von: Zverev, Daniil, et al.
Veröffentlicht: (2025)
von: Zverev, Daniil, et al.
Veröffentlicht: (2025)
Audio-Visual Segmentation via Unlabeled Frame Exploitation
von: Liu, Jinxiang, et al.
Veröffentlicht: (2024)
von: Liu, Jinxiang, et al.
Veröffentlicht: (2024)
Object-AVEdit: An Object-level Audio-Visual Editing Model
von: Fu, Youquan, et al.
Veröffentlicht: (2025)
von: Fu, Youquan, et al.
Veröffentlicht: (2025)
Contextual Cross-Modal Attention for Audio-Visual Deepfake Detection and Localization
von: Katamneni, Vinaya Sree, et al.
Veröffentlicht: (2024)
von: Katamneni, Vinaya Sree, et al.
Veröffentlicht: (2024)
Draw an Audio: Leveraging Multi-Instruction for Video-to-Audio Synthesis
von: Yang, Qi, et al.
Veröffentlicht: (2024)
von: Yang, Qi, et al.
Veröffentlicht: (2024)
Multilingual Audio-Visual Speech Recognition with Hybrid CTC/RNN-T Fast Conformer
von: Burchi, Maxime, et al.
Veröffentlicht: (2024)
von: Burchi, Maxime, et al.
Veröffentlicht: (2024)
A Survey of Recent Advances and Challenges in Deep Audio-Visual Correlation Learning
von: Vilaca, Luis, et al.
Veröffentlicht: (2024)
von: Vilaca, Luis, et al.
Veröffentlicht: (2024)
SAV-SE: Scene-aware Audio-Visual Speech Enhancement with Selective State Space Model
von: Qian, Xinyuan, et al.
Veröffentlicht: (2024)
von: Qian, Xinyuan, et al.
Veröffentlicht: (2024)
Audio-Enhanced Vision-Language Modeling with Latent Space Broadening for High Quality Data Expansion
von: Sun, Yu, et al.
Veröffentlicht: (2025)
von: Sun, Yu, et al.
Veröffentlicht: (2025)
Video-to-Audio Generation with Hidden Alignment
von: Xu, Manjie, et al.
Veröffentlicht: (2024)
von: Xu, Manjie, et al.
Veröffentlicht: (2024)
Temporally Aligned Audio for Video with Autoregression
von: Viertola, Ilpo, et al.
Veröffentlicht: (2024)
von: Viertola, Ilpo, et al.
Veröffentlicht: (2024)
MINT: a Multi-modal Image and Narrative Text Dubbing Dataset for Foley Audio Content Planning and Generation
von: Fu, Ruibo, et al.
Veröffentlicht: (2024)
von: Fu, Ruibo, et al.
Veröffentlicht: (2024)
Text-to-Audio Generation Synchronized with Videos
von: Mo, Shentong, et al.
Veröffentlicht: (2024)
von: Mo, Shentong, et al.
Veröffentlicht: (2024)
SpA2V: Harnessing Spatial Auditory Cues for Audio-driven Spatially-aware Video Generation
von: Pham, Kien T., et al.
Veröffentlicht: (2025)
von: Pham, Kien T., et al.
Veröffentlicht: (2025)
Diffusion Models as Masked Audio-Video Learners
von: Nunez, Elvis, et al.
Veröffentlicht: (2023)
von: Nunez, Elvis, et al.
Veröffentlicht: (2023)
Enhancing Lie Detection Accuracy: A Comparative Study of Classic ML, CNN, and GCN Models using Audio-Visual Features
von: Abdelwahab, Abdelrahman, et al.
Veröffentlicht: (2024)
von: Abdelwahab, Abdelrahman, et al.
Veröffentlicht: (2024)
PianoVAM: A Multimodal Piano Performance Dataset
von: Kim, Yonghyun, et al.
Veröffentlicht: (2025)
von: Kim, Yonghyun, et al.
Veröffentlicht: (2025)
DRKF: Decoupled Representations with Knowledge Fusion for Multimodal Emotion Recognition
von: Jiang, Peiyuan, et al.
Veröffentlicht: (2025)
von: Jiang, Peiyuan, et al.
Veröffentlicht: (2025)
EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation
von: Izzati, Fathinah, et al.
Veröffentlicht: (2025)
von: Izzati, Fathinah, et al.
Veröffentlicht: (2025)
MMS-LLaMA: Efficient LLM-based Audio-Visual Speech Recognition with Minimal Multimodal Speech Tokens
von: Yeo, Jeong Hun, et al.
Veröffentlicht: (2025)
von: Yeo, Jeong Hun, et al.
Veröffentlicht: (2025)
Unified Video-Language Pre-training with Synchronized Audio
von: Mo, Shentong, et al.
Veröffentlicht: (2024)
von: Mo, Shentong, et al.
Veröffentlicht: (2024)
Dance Any Beat: Blending Beats with Visuals in Dance Video Generation
von: Wang, Xuanchen, et al.
Veröffentlicht: (2024)
von: Wang, Xuanchen, et al.
Veröffentlicht: (2024)
WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition
von: Li, Feng, et al.
Veröffentlicht: (2024)
von: Li, Feng, et al.
Veröffentlicht: (2024)
EgoSonics: Generating Synchronized Audio for Silent Egocentric Videos
von: Rai, Aashish, et al.
Veröffentlicht: (2024)
von: Rai, Aashish, et al.
Veröffentlicht: (2024)
AVFF: Audio-Visual Feature Fusion for Video Deepfake Detection
von: Oorloff, Trevine, et al.
Veröffentlicht: (2024)
von: Oorloff, Trevine, et al.
Veröffentlicht: (2024)
AV-Odyssey Bench: Can Your Multimodal LLMs Really Understand Audio-Visual Information?
von: Gong, Kaixiong, et al.
Veröffentlicht: (2024)
von: Gong, Kaixiong, et al.
Veröffentlicht: (2024)
Pilot-guided Multimodal Semantic Communication for Audio-Visual Event Localization
von: Yu, Fei, et al.
Veröffentlicht: (2024)
von: Yu, Fei, et al.
Veröffentlicht: (2024)
Music Audio-Visual Question Answering Requires Specialized Multimodal Designs
von: You, Wenhao, et al.
Veröffentlicht: (2025)
von: You, Wenhao, et al.
Veröffentlicht: (2025)
CounterFlow: A Two-Phase Inference-Time Sampling for Counterfactual Video Foley Generation
von: Lee, Gyubin, et al.
Veröffentlicht: (2026)
von: Lee, Gyubin, et al.
Veröffentlicht: (2026)
Frieren: Efficient Video-to-Audio Generation Network with Rectified Flow Matching
von: Wang, Yongqi, et al.
Veröffentlicht: (2024)
von: Wang, Yongqi, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
MM-Sonate: Multimodal Controllable Audio-Video Generation with Zero-Shot Voice Cloning
von: Qiang, Chunyu, et al.
Veröffentlicht: (2026) -
Sounding Highlights: Dual-Pathway Audio Encoders for Audio-Visual Video Highlight Detection
von: Joo, Seohyun, et al.
Veröffentlicht: (2026) -
MAVERIX: Multimodal Audio-Visual Evaluation and Recognition IndeX
von: Xie, Liuyue, et al.
Veröffentlicht: (2025) -
Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation
von: Liang, Yingshan, et al.
Veröffentlicht: (2025) -
What's Making That Sound Right Now? Video-centric Audio-Visual Localization
von: Choi, Hahyeon, et al.
Veröffentlicht: (2025)