HiCMAE: Hierarchical Contrastive Masked Autoencoder for Self-Supervised Audio-Visual Emotion Recognition
Fuente:
arXiv
Guardado en:
| Autores principales: | Sun, Licai, Lian, Zheng, Liu, Bin, Tao, Jianhua |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
AVE Speech: A Comprehensive Multi-Modal Dataset for Speech Recognition Integrating Audio, Visual, and Electromyographic Signals
por: Zhou, Dongliang, et al.
Publicado: (2025)
por: Zhou, Dongliang, et al.
Publicado: (2025)
MR-DAW: Towards Collaborative Digital Audio Workstations in Mixed Reality
por: Hopkins, Torin, et al.
Publicado: (2026)
por: Hopkins, Torin, et al.
Publicado: (2026)
Real-Time Word-Level Temporal Segmentation in Streaming Speech Recognition
por: Nishida, Naoto, et al.
Publicado: (2025)
por: Nishida, Naoto, et al.
Publicado: (2025)
Towards Reliable Large Audio Language Model
por: Ma, Ziyang, et al.
Publicado: (2025)
por: Ma, Ziyang, et al.
Publicado: (2025)
Capturing Cancer as Music: Cancer Mechanisms Expressed through Musification
por: Hnatyshyn, Rostyslav, et al.
Publicado: (2024)
por: Hnatyshyn, Rostyslav, et al.
Publicado: (2024)
Assessing the Viability of Wave Field Synthesis in VR-Based Cognitive Research
por: Kahl, Benjamin
Publicado: (2025)
por: Kahl, Benjamin
Publicado: (2025)
Creating Aesthetic Sonifications on the Web with SIREN
por: Peng, Tristan, et al.
Publicado: (2024)
por: Peng, Tristan, et al.
Publicado: (2024)
Robust Dual-Modal Speech Keyword Spotting for XR Headsets
por: Cai, Zhuojiang, et al.
Publicado: (2024)
por: Cai, Zhuojiang, et al.
Publicado: (2024)
VidTune: Creating Video Soundtracks with Generative Music and Contextual Thumbnails
por: Huh, Mina, et al.
Publicado: (2026)
por: Huh, Mina, et al.
Publicado: (2026)
NeoLightning: A Modern Reimagination of Gesture-Based Sound Design
por: Kim, Yonghyun, et al.
Publicado: (2025)
por: Kim, Yonghyun, et al.
Publicado: (2025)
A Multi-Agent AI Framework for Immersive Audiobook Production through Spatial Audio and Neural Narration
por: Selvamani, Shaja Arul, et al.
Publicado: (2025)
por: Selvamani, Shaja Arul, et al.
Publicado: (2025)
G-STAR: End-to-End Global Speaker-Tracking Attributed Recognition
por: Peng, Jing, et al.
Publicado: (2026)
por: Peng, Jing, et al.
Publicado: (2026)
Flowers Revisited: A Preliminary Replication of Flowers et al. 1997
por: Enge, Kajetan, et al.
Publicado: (2024)
por: Enge, Kajetan, et al.
Publicado: (2024)
Improving Multimodal Emotion Recognition by Leveraging Acoustic Adaptation and Visual Alignment
por: Zhao, Zhixian, et al.
Publicado: (2024)
por: Zhao, Zhixian, et al.
Publicado: (2024)
MetaBGM: Dynamic Soundtrack Transformation For Continuous Multi-Scene Experiences With Ambient Awareness And Personalization
por: Liu, Haoxuan, et al.
Publicado: (2024)
por: Liu, Haoxuan, et al.
Publicado: (2024)
AI TrackMate: Finally, Someone Who Will Give Your Music More Than Just "Sounds Great!"
por: Jiang, Yi-Lin, et al.
Publicado: (2024)
por: Jiang, Yi-Lin, et al.
Publicado: (2024)
Proceedings of The second international workshop on eXplainable AI for the Arts (XAIxArts)
por: Bryan-Kinns, Nick, et al.
Publicado: (2024)
por: Bryan-Kinns, Nick, et al.
Publicado: (2024)
Workflow-Based Evaluation of Music Generation Systems
por: Dadman, Shayan, et al.
Publicado: (2025)
por: Dadman, Shayan, et al.
Publicado: (2025)
Freetalker: Controllable Speech and Text-Driven Gesture Generation Based on Diffusion Models for Enhanced Speaker Naturalness
por: Yang, Sicheng, et al.
Publicado: (2024)
por: Yang, Sicheng, et al.
Publicado: (2024)
CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment
por: Araujo, Edson, et al.
Publicado: (2025)
por: Araujo, Edson, et al.
Publicado: (2025)
Addressing Emotion Bias in Music Emotion Recognition and Generation with Frechet Audio Distance
por: Li, Yuanchao, et al.
Publicado: (2024)
por: Li, Yuanchao, et al.
Publicado: (2024)
DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2
por: Zhang, Fan, et al.
Publicado: (2024)
por: Zhang, Fan, et al.
Publicado: (2024)
SACM: SEEG-Audio Contrastive Matching for Chinese Speech Decoding
por: Wang, Hongbin, et al.
Publicado: (2025)
por: Wang, Hongbin, et al.
Publicado: (2025)
Acoustic Wave Modeling Using 2D FDTD: Applications in Unreal Engine For Dynamic Sound Rendering
por: Samsurya, Bilkent
Publicado: (2025)
por: Samsurya, Bilkent
Publicado: (2025)
Seeing Beyond Sound: Visualization and Abstraction in Audio Data Representation
por: Blum'e, Ashlae
Publicado: (2025)
por: Blum'e, Ashlae
Publicado: (2025)
MIST: Multimodal Interactive Speech-based Tool-calling Conversational Assistants for Smart Homes
por: Chen, Maximillian, et al.
Publicado: (2026)
por: Chen, Maximillian, et al.
Publicado: (2026)
Soundify: Matching Sound Effects to Video
por: Lin, David Chuan-En, et al.
Publicado: (2021)
por: Lin, David Chuan-En, et al.
Publicado: (2021)
Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition
por: Chen, Youjun, et al.
Publicado: (2025)
por: Chen, Youjun, et al.
Publicado: (2025)
A Joint Cross-Attention Model for Audio-Visual Fusion in Dimensional Emotion Recognition
por: Praveen, R. Gnana, et al.
Publicado: (2022)
por: Praveen, R. Gnana, et al.
Publicado: (2022)
A Multimodal Emotion Recognition System: Integrating Facial Expressions, Body Movement, Speech, and Spoken Language
por: Kraack, Kris
Publicado: (2024)
por: Kraack, Kris
Publicado: (2024)
Cross-Lingual Speech Emotion Recognition: Humans vs. Self-Supervised Models
por: Han, Zhichen, et al.
Publicado: (2024)
por: Han, Zhichen, et al.
Publicado: (2024)
Learning Self-Supervised Audio-Visual Representations for Sound Recommendations
por: Krishnamurthy, Sudha
Publicado: (2024)
por: Krishnamurthy, Sudha
Publicado: (2024)
Revival: Collaborative Artistic Creation through Human-AI Interactions in Musical Creativity
por: Lee, Keon Ju M., et al.
Publicado: (2025)
por: Lee, Keon Ju M., et al.
Publicado: (2025)
Multimodal Emotion Recognition from Raw Audio with Sinc-convolution
por: Zhang, Xiaohui, et al.
Publicado: (2024)
por: Zhang, Xiaohui, et al.
Publicado: (2024)
Sound-Based Recognition of Touch Gestures and Emotions for Enhanced Human-Robot Interaction
por: Hou, Yuanbo, et al.
Publicado: (2024)
por: Hou, Yuanbo, et al.
Publicado: (2024)
Personalized Speech Emotion Recognition in Human-Robot Interaction using Vision Transformers
por: Mishra, Ruchik, et al.
Publicado: (2024)
por: Mishra, Ruchik, et al.
Publicado: (2024)
Audio-Vision Contrastive Learning for Phonological Class Recognition
por: Liu, Daiqi, et al.
Publicado: (2025)
por: Liu, Daiqi, et al.
Publicado: (2025)
STAA-Net: A Sparse and Transferable Adversarial Attack for Speech Emotion Recognition
por: Chang, Yi, et al.
Publicado: (2024)
por: Chang, Yi, et al.
Publicado: (2024)
Self-Attention and Hybrid Features for Replay and Deep-Fake Audio Detection
por: Huang, Lian, et al.
Publicado: (2024)
por: Huang, Lian, et al.
Publicado: (2024)
FeatureSense: Protecting Speaker Attributes in Always-On Audio Sensing System
por: Chhaglani, Bhawana, et al.
Publicado: (2025)
por: Chhaglani, Bhawana, et al.
Publicado: (2025)
Ejemplares similares
-
AVE Speech: A Comprehensive Multi-Modal Dataset for Speech Recognition Integrating Audio, Visual, and Electromyographic Signals
por: Zhou, Dongliang, et al.
Publicado: (2025) -
MR-DAW: Towards Collaborative Digital Audio Workstations in Mixed Reality
por: Hopkins, Torin, et al.
Publicado: (2026) -
Real-Time Word-Level Temporal Segmentation in Streaming Speech Recognition
por: Nishida, Naoto, et al.
Publicado: (2025) -
Towards Reliable Large Audio Language Model
por: Ma, Ziyang, et al.
Publicado: (2025) -
Capturing Cancer as Music: Cancer Mechanisms Expressed through Musification
por: Hnatyshyn, Rostyslav, et al.
Publicado: (2024)