Mitigating Category Imbalance: Fosafer System for the Multimodal Emotion and Intent Joint Understanding Challenge
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Honghong, Wang, Yankai, Zhang, Dejun, Deng, Jing, Zheng, Rong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Personality-Enhanced Multimodal Depression Detection in the Elderly
por: Wang, Honghong, et al.
Publicado: (2025)
por: Wang, Honghong, et al.
Publicado: (2025)
Speech Emotion Recognition Using Fine-Tuned DWFormer:A Study on Track 1 of the IERPChallenge 2024
por: Wang, Honghong, et al.
Publicado: (2025)
por: Wang, Honghong, et al.
Publicado: (2025)
Overlap-Adaptive Hybrid Speaker Diarization and ASR-Aware Observation Addition for MISP 2025 Challenge
por: Huang, Shangkun, et al.
Publicado: (2025)
por: Huang, Shangkun, et al.
Publicado: (2025)
1st Place Solution to Odyssey Emotion Recognition Challenge Task1: Tackling Class Imbalance Problem
por: Chen, Mingjie, et al.
Publicado: (2024)
por: Chen, Mingjie, et al.
Publicado: (2024)
Double Multi-Head Attention Multimodal System for Odyssey 2024 Speech Emotion Recognition Challenge
por: Costa, Federico, et al.
Publicado: (2024)
por: Costa, Federico, et al.
Publicado: (2024)
ED-TTS: Multi-Scale Emotion Modeling using Cross-Domain Emotion Diarization for Emotional Speech Synthesis
por: Tang, Haobin, et al.
Publicado: (2024)
por: Tang, Haobin, et al.
Publicado: (2024)
Leveraging LLM for Stuttering Speech: A Unified Architecture Bridging Recognition and Event Detection
por: Huang, Shangkun, et al.
Publicado: (2025)
por: Huang, Shangkun, et al.
Publicado: (2025)
GAP-URGENet: A Generative-Predictive Fusion Framework for Universal Speech Enhancement
por: Rong, Xiaobin, et al.
Publicado: (2026)
por: Rong, Xiaobin, et al.
Publicado: (2026)
End-to-end Acoustic-linguistic Emotion and Intent Recognition Enhanced by Semi-supervised Learning
por: Ren, Zhao, et al.
Publicado: (2025)
por: Ren, Zhao, et al.
Publicado: (2025)
RSET: Remapping-based Sorting Method for Emotion Transfer Speech Synthesis
por: Shi, Haoxiang, et al.
Publicado: (2024)
por: Shi, Haoxiang, et al.
Publicado: (2024)
Improved Remixing Process for Domain Adaptation-Based Speech Enhancement by Mitigating Data Imbalance in Signal-to-Noise Ratio
por: Li, Li, et al.
Publicado: (2024)
por: Li, Li, et al.
Publicado: (2024)
WeaveMuse: An Open Agentic System for Multimodal Music Understanding and Generation
por: Karystinaios, Emmanouil
Publicado: (2025)
por: Karystinaios, Emmanouil
Publicado: (2025)
Emotion-Aware Contrastive Adaptation Network for Source-Free Cross-Corpus Speech Emotion Recognition
por: Zhao, Yan, et al.
Publicado: (2024)
por: Zhao, Yan, et al.
Publicado: (2024)
EAD-VC: Enhancing Speech Auto-Disentanglement for Voice Conversion with IFUB Estimator and Joint Text-Guided Consistent Learning
por: Liang, Ziqi, et al.
Publicado: (2024)
por: Liang, Ziqi, et al.
Publicado: (2024)
LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations
por: Dutta, Soumya, et al.
Publicado: (2025)
por: Dutta, Soumya, et al.
Publicado: (2025)
The USTC-NERCSLIP Systems for The ICMC-ASR Challenge
por: Wu, Minghui, et al.
Publicado: (2024)
por: Wu, Minghui, et al.
Publicado: (2024)
EmoOmni: Bridging Emotional Understanding and Expression in Omni-Modal LLMs
por: Tian, Wenjie, et al.
Publicado: (2026)
por: Tian, Wenjie, et al.
Publicado: (2026)
Emotion Neural Transducer for Fine-Grained Speech Emotion Recognition
por: Shen, Siyuan, et al.
Publicado: (2024)
por: Shen, Siyuan, et al.
Publicado: (2024)
XMUspeech Systems for the ASVspoof 5 Challenge
por: Li, Wangjie, et al.
Publicado: (2025)
por: Li, Wangjie, et al.
Publicado: (2025)
Audio-Mind: An Auditable Agentic Framework for Audio Understanding
por: Wang, Yucheng, et al.
Publicado: (2026)
por: Wang, Yucheng, et al.
Publicado: (2026)
Semantic-Emotional Resonance Embedding: A Semi-Supervised Paradigm for Cross-Lingual Speech Emotion Recognition
por: Zhao, Ya, et al.
Publicado: (2026)
por: Zhao, Ya, et al.
Publicado: (2026)
The USTC-NERCSLIP Systems for the CHiME-8 MMCSG Challenge
por: Jiang, Ya, et al.
Publicado: (2024)
por: Jiang, Ya, et al.
Publicado: (2024)
Learning Expressive Disentangled Speech Representations with Soft Speech Units and Adversarial Style Augmentation
por: Deng, Yimin, et al.
Publicado: (2024)
por: Deng, Yimin, et al.
Publicado: (2024)
PCQ: Emotion Recognition in Speech via Progressive Channel Querying
por: Wang, Xincheng, et al.
Publicado: (2024)
por: Wang, Xincheng, et al.
Publicado: (2024)
LPGNet: A Lightweight Network with Parallel Attention and Gated Fusion for Multimodal Emotion Recognition
por: He, Zhining, et al.
Publicado: (2025)
por: He, Zhining, et al.
Publicado: (2025)
Mitigating Language Mismatch in SSL-Based Speaker Anonymization
por: Zhang, Zhe, et al.
Publicado: (2025)
por: Zhang, Zhe, et al.
Publicado: (2025)
Multimodal Emotion Recognition from Raw Audio with Sinc-convolution
por: Zhang, Xiaohui, et al.
Publicado: (2024)
por: Zhang, Xiaohui, et al.
Publicado: (2024)
Early Joint Learning of Emotion Information Makes MultiModal Model Understand You Better
por: Ge, Mengying, et al.
Publicado: (2024)
por: Ge, Mengying, et al.
Publicado: (2024)
EmoFake: An Initial Dataset for Emotion Fake Audio Detection
por: Zhao, Yan, et al.
Publicado: (2022)
por: Zhao, Yan, et al.
Publicado: (2022)
Towards Realistic Emotional Voice Conversion using Controllable Emotional Intensity
por: Qi, Tianhua, et al.
Publicado: (2024)
por: Qi, Tianhua, et al.
Publicado: (2024)
BUT Systems and Analyses for the ASVspoof 5 Challenge
por: Rohdin, Johan, et al.
Publicado: (2024)
por: Rohdin, Johan, et al.
Publicado: (2024)
The USTC-NERCSLIP Systems for the CHiME-8 NOTSOFAR-1 Challenge
por: Niu, Shutong, et al.
Publicado: (2024)
por: Niu, Shutong, et al.
Publicado: (2024)
E-chat: Emotion-sensitive Spoken Dialogue System with Large Language Models
por: Xue, Hongfei, et al.
Publicado: (2023)
por: Xue, Hongfei, et al.
Publicado: (2023)
Leveraging Joint Spectral and Spatial Learning with MAMBA for Multichannel Speech Enhancement
por: Ren, Wenze, et al.
Publicado: (2024)
por: Ren, Wenze, et al.
Publicado: (2024)
Iterative Prototype Refinement for Ambiguous Speech Emotion Recognition
por: Sun, Haoqin, et al.
Publicado: (2024)
por: Sun, Haoqin, et al.
Publicado: (2024)
Hierarchical Control of Emotion Rendering in Speech Synthesis
por: Inoue, Sho, et al.
Publicado: (2024)
por: Inoue, Sho, et al.
Publicado: (2024)
MELT: Towards Automated Multimodal Emotion Data Annotation by Leveraging LLM Embedded Knowledge
por: Jing, Xin, et al.
Publicado: (2025)
por: Jing, Xin, et al.
Publicado: (2025)
Hierarchical Emotion Prediction and Control in Text-to-Speech Synthesis
por: Inoue, Sho, et al.
Publicado: (2024)
por: Inoue, Sho, et al.
Publicado: (2024)
Fine-Grained Quantitative Emotion Editing for Speech Generation
por: Inoue, Sho, et al.
Publicado: (2024)
por: Inoue, Sho, et al.
Publicado: (2024)
Joint Speaker Features Learning for Audio-visual Multichannel Speech Separation and Recognition
por: Li, Guinan, et al.
Publicado: (2024)
por: Li, Guinan, et al.
Publicado: (2024)
Ejemplares similares
-
Personality-Enhanced Multimodal Depression Detection in the Elderly
por: Wang, Honghong, et al.
Publicado: (2025) -
Speech Emotion Recognition Using Fine-Tuned DWFormer:A Study on Track 1 of the IERPChallenge 2024
por: Wang, Honghong, et al.
Publicado: (2025) -
Overlap-Adaptive Hybrid Speaker Diarization and ASR-Aware Observation Addition for MISP 2025 Challenge
por: Huang, Shangkun, et al.
Publicado: (2025) -
1st Place Solution to Odyssey Emotion Recognition Challenge Task1: Tackling Class Imbalance Problem
por: Chen, Mingjie, et al.
Publicado: (2024) -
Double Multi-Head Attention Multimodal System for Odyssey 2024 Speech Emotion Recognition Challenge
por: Costa, Federico, et al.
Publicado: (2024)