Multimodal Emotion Recognition using Audio-Video Transformer Fusion with Cross Attention
Fuente:
arXiv
Salvato in:
| Autori principali: | R, Joe Dhanith P, Venkatraman, Shravan, Sharma, Vigya, Malarvannan, Santhosh |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
AQUALLM: Audio Question Answering Data Generation Using Large Language Models
di: Behera, Swarup Ranjan, et al.
Pubblicazione: (2023)
di: Behera, Swarup Ranjan, et al.
Pubblicazione: (2023)
SpeechWeave: Diverse Multilingual Synthetic Text & Audio Data Generation Pipeline for Training Text to Speech Models
di: Dua, Karan, et al.
Pubblicazione: (2025)
di: Dua, Karan, et al.
Pubblicazione: (2025)
SW-ASR: A Context-Aware Hybrid ASR Pipeline for Robust Single Word Speech Recognition
di: Sharma, Manali, et al.
Pubblicazione: (2026)
di: Sharma, Manali, et al.
Pubblicazione: (2026)
SoccerNet-Echoes: A Soccer Game Audio Commentary Dataset
di: Gautam, Sushant, et al.
Pubblicazione: (2024)
di: Gautam, Sushant, et al.
Pubblicazione: (2024)
MuTox: Universal MUltilingual Audio-based TOXicity Dataset and Zero-shot Detector
di: Costa-jussà, Marta R., et al.
Pubblicazione: (2024)
di: Costa-jussà, Marta R., et al.
Pubblicazione: (2024)
Measuring the Accuracy of Automatic Speech Recognition Solutions
di: Kuhn, Korbinian, et al.
Pubblicazione: (2024)
di: Kuhn, Korbinian, et al.
Pubblicazione: (2024)
Automatic Speech Recognition (ASR) for the Diagnosis of pronunciation of Speech Sound Disorders in Korean children
di: Ahn, Taekyung, et al.
Pubblicazione: (2024)
di: Ahn, Taekyung, et al.
Pubblicazione: (2024)
Enhancing Speech Emotion Recognition Leveraging Aligning Timestamps of ASR Transcripts and Speaker Diarization
di: Wang, Hsuan-Yu, et al.
Pubblicazione: (2025)
di: Wang, Hsuan-Yu, et al.
Pubblicazione: (2025)
A Baseline Multimodal Approach to Emotion Recognition in Conversations
di: Yeste, Víctor, et al.
Pubblicazione: (2026)
di: Yeste, Víctor, et al.
Pubblicazione: (2026)
SeQuiFi: Mitigating Catastrophic Forgetting in Speech Emotion Recognition with Sequential Class-Finetuning
di: Jain, Sarthak, et al.
Pubblicazione: (2024)
di: Jain, Sarthak, et al.
Pubblicazione: (2024)
A Unified Model For Voice and Accent Conversion In Speech and Singing using Self-Supervised Learning and Feature Extraction
di: Cheripally, Sowmya
Pubblicazione: (2024)
di: Cheripally, Sowmya
Pubblicazione: (2024)
Strong Alone, Stronger Together: Synergizing Modality-Binding Foundation Models with Optimal Transport for Non-Verbal Emotion Recognition
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2024)
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2024)
Communication Access Real-Time Translation Through Collaborative Correction of Automatic Speech Recognition
di: Kuhn, Korbinian, et al.
Pubblicazione: (2025)
di: Kuhn, Korbinian, et al.
Pubblicazione: (2025)
SigWavNet: Learning Multiresolution Signal Wavelet Network for Speech Emotion Recognition
di: Nfissi, Alaa, et al.
Pubblicazione: (2025)
di: Nfissi, Alaa, et al.
Pubblicazione: (2025)
Benchmarking and Bridging Emotion Conflicts for Multimodal Emotion Reasoning
di: Han, Zhiyuan, et al.
Pubblicazione: (2025)
di: Han, Zhiyuan, et al.
Pubblicazione: (2025)
Everyday Speech in the Indian Subcontinent
di: P, Utkarsh
Pubblicazione: (2024)
di: P, Utkarsh
Pubblicazione: (2024)
Empathy Omni: Enabling Empathetic Speech Response Generation through Large Language Models
di: Wang, Haoyu, et al.
Pubblicazione: (2025)
di: Wang, Haoyu, et al.
Pubblicazione: (2025)
Bigger is not Always Better: The Effect of Context Size on Speech Pre-Training
di: Robertson, Sean, et al.
Pubblicazione: (2023)
di: Robertson, Sean, et al.
Pubblicazione: (2023)
Beyond Levenshtein: Leveraging Multiple Algorithms for Robust Word Error Rate Computations And Granular Error Classifications
di: Kuhn, Korbinian, et al.
Pubblicazione: (2024)
di: Kuhn, Korbinian, et al.
Pubblicazione: (2024)
PerceiverS: A Multi-Scale Perceiver with Effective Segmentation for Long-Term Expressive Symbolic Music Generation
di: Yi, Yungang, et al.
Pubblicazione: (2024)
di: Yi, Yungang, et al.
Pubblicazione: (2024)
Rethinking Masking Strategies for Masked Prediction-based Audio Self-supervised Learning
di: Niizumi, Daisuke, et al.
Pubblicazione: (2026)
di: Niizumi, Daisuke, et al.
Pubblicazione: (2026)
Investigating Prosodic Signatures via Speech Pre-Trained Models for Audio Deepfake Source Attribution
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2024)
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2024)
Representation Loss Minimization with Randomized Selection Strategy for Efficient Environmental Fake Audio Detection
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2024)
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2024)
Iterative Feature Boosting for Explainable Speech Emotion Recognition
di: Nfissi, Alaa, et al.
Pubblicazione: (2024)
di: Nfissi, Alaa, et al.
Pubblicazione: (2024)
Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition
di: Hori, Takaaki, et al.
Pubblicazione: (2025)
di: Hori, Takaaki, et al.
Pubblicazione: (2025)
SpeechAccentLLM: A Unified Framework for Foreign Accent Conversion and Text to Speech
di: Cheng, Zhuangfei, et al.
Pubblicazione: (2025)
di: Cheng, Zhuangfei, et al.
Pubblicazione: (2025)
Quantifying the effect of speech pathology on automatic and human speaker verification
di: Halpern, Bence Mark, et al.
Pubblicazione: (2024)
di: Halpern, Bence Mark, et al.
Pubblicazione: (2024)
Unveiling Hidden Factors: Explainable AI for Feature Boosting in Speech Emotion Recognition
di: Nfissi, Alaa, et al.
Pubblicazione: (2024)
di: Nfissi, Alaa, et al.
Pubblicazione: (2024)
Addressing Emotion Bias in Music Emotion Recognition and Generation with Frechet Audio Distance
di: Li, Yuanchao, et al.
Pubblicazione: (2024)
di: Li, Yuanchao, et al.
Pubblicazione: (2024)
Multimodal Emotion Recognition from Raw Audio with Sinc-convolution
di: Zhang, Xiaohui, et al.
Pubblicazione: (2024)
di: Zhang, Xiaohui, et al.
Pubblicazione: (2024)
A Voice-based Triage for Type 2 Diabetes using a Conversational Virtual Assistant in the Home Environment
di: Summoogum, Kelvin, et al.
Pubblicazione: (2024)
di: Summoogum, Kelvin, et al.
Pubblicazione: (2024)
Effectiveness of Text, Acoustic, and Lattice-based representations in Spoken Language Understanding tasks
di: Villatoro-Tello, Esaú, et al.
Pubblicazione: (2022)
di: Villatoro-Tello, Esaú, et al.
Pubblicazione: (2022)
Pay More Attention To Audio: Mitigating Imbalance of Cross-Modal Attention in Large Audio Language Models
di: Wang, Junyu, et al.
Pubblicazione: (2025)
di: Wang, Junyu, et al.
Pubblicazione: (2025)
Bimodal Connection Attention Fusion for Speech Emotion Recognition
di: Luo, Jiachen, et al.
Pubblicazione: (2025)
di: Luo, Jiachen, et al.
Pubblicazione: (2025)
MF-AED-AEC: Speech Emotion Recognition by Leveraging Multimodal Fusion, Asr Error Detection, and Asr Error Correction
di: He, Jiajun, et al.
Pubblicazione: (2024)
di: He, Jiajun, et al.
Pubblicazione: (2024)
Less Stress, More Privacy: Stress Detection on Anonymized Speech of Air Traffic Controllers
di: Viswanathan, Janaki, et al.
Pubblicazione: (2025)
di: Viswanathan, Janaki, et al.
Pubblicazione: (2025)
Thaka at KSAA-2026 Task 2: Regularized Fine-Tuning for Arabic Speech Diacritization
di: Alamr, Meshal, et al.
Pubblicazione: (2026)
di: Alamr, Meshal, et al.
Pubblicazione: (2026)
Hidden Echoes Survive Training in Audio To Audio Generative Instrument Models
di: Tralie, Christopher J., et al.
Pubblicazione: (2024)
di: Tralie, Christopher J., et al.
Pubblicazione: (2024)
Beyond Deep Learning: Speech Segmentation and Phone Classification with Neural Assemblies
di: Adelson, Trevor, et al.
Pubblicazione: (2026)
di: Adelson, Trevor, et al.
Pubblicazione: (2026)
Multi-Task Instruction Tuning via Data Scheduling for Low-Resource Arabic AudioLLMs
di: Bhatti, Hunzalah Hassan, et al.
Pubblicazione: (2026)
di: Bhatti, Hunzalah Hassan, et al.
Pubblicazione: (2026)
Documenti analoghi
-
AQUALLM: Audio Question Answering Data Generation Using Large Language Models
di: Behera, Swarup Ranjan, et al.
Pubblicazione: (2023) -
SpeechWeave: Diverse Multilingual Synthetic Text & Audio Data Generation Pipeline for Training Text to Speech Models
di: Dua, Karan, et al.
Pubblicazione: (2025) -
SW-ASR: A Context-Aware Hybrid ASR Pipeline for Robust Single Word Speech Recognition
di: Sharma, Manali, et al.
Pubblicazione: (2026) -
SoccerNet-Echoes: A Soccer Game Audio Commentary Dataset
di: Gautam, Sushant, et al.
Pubblicazione: (2024) -
MuTox: Universal MUltilingual Audio-based TOXicity Dataset and Zero-shot Detector
di: Costa-jussà, Marta R., et al.
Pubblicazione: (2024)