Two-stage Framework for Robust Speech Emotion Recognition Using Target Speaker Extraction in Human Speech Noise Conditions
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Mi, Jinyi, Shi, Xiaohan, Ma, Ding, He, Jiajun, Fujimura, Takuya, Toda, Tomoki |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A Comprehensive Study on the Effectiveness of ASR Representations for Noise-Robust Speech Emotion Recognition
par: Shi, Xiaohan, et autres
Publié: (2023)
par: Shi, Xiaohan, et autres
Publié: (2023)
MF-AED-AEC: Speech Emotion Recognition by Leveraging Multimodal Fusion, Asr Error Detection, and Asr Error Correction
par: He, Jiajun, et autres
Publié: (2024)
par: He, Jiajun, et autres
Publié: (2024)
Improvements of Discriminative Feature Space Training for Anomalous Sound Detection in Unlabeled Conditions
par: Fujimura, Takuya, et autres
Publié: (2024)
par: Fujimura, Takuya, et autres
Publié: (2024)
Advancing Electrolaryngeal Speech Enhancement Through Speech-Text Representation Learning
par: Ma, Ding, et autres
Publié: (2026)
par: Ma, Ding, et autres
Publié: (2026)
Unifying Listener Scoring Scales: Comparison Learning Framework for Speech Quality Assessment and Continuous Speech Emotion Recognition
par: Hu, Cheng-Hung, et autres
Publié: (2025)
par: Hu, Cheng-Hung, et autres
Publié: (2025)
Improving Anomalous Sound Detection through Pseudo-anomalous Set Selection and Pseudo-label Utilization under Unlabeled Conditions
par: Kuroyanagi, Ibuki, et autres
Publié: (2025)
par: Kuroyanagi, Ibuki, et autres
Publié: (2025)
Improved Architecture for High-resolution Piano Transcription to Efficiently Capture Acoustic Characteristics of Music Signals
par: Mi, Jinyi, et autres
Publié: (2024)
par: Mi, Jinyi, et autres
Publié: (2024)
SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit
par: Huang, Wen-Chin, et autres
Publié: (2025)
par: Huang, Wen-Chin, et autres
Publié: (2025)
Noisy Disentanglement with Tri-stage Training for Noise-Robust Speech Recognition
par: Chen, Shuangyuan, et autres
Publié: (2025)
par: Chen, Shuangyuan, et autres
Publié: (2025)
Electrolaryngeal Speech Intelligibility Enhancement Through Robust Linguistic Encoders
par: Violeta, Lester Phillip, et autres
Publié: (2023)
par: Violeta, Lester Phillip, et autres
Publié: (2023)
DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition
par: Polok, Alexander, et autres
Publié: (2024)
par: Polok, Alexander, et autres
Publié: (2024)
Beyond Speaker Identity: Text Guided Target Speech Extraction
par: Huo, Mingyue, et autres
Publié: (2025)
par: Huo, Mingyue, et autres
Publié: (2025)
TRNet: Two-level Refinement Network leveraging Speech Enhancement for Noise Robust Speech Emotion Recognition
par: Chen, Chengxin, et autres
Publié: (2024)
par: Chen, Chengxin, et autres
Publié: (2024)
Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction
par: Dai, Wang, et autres
Publié: (2025)
par: Dai, Wang, et autres
Publié: (2025)
Eigenvoice Synthesis based on Model Editing for Speaker Generation
par: Murata, Masato, et autres
Publié: (2025)
par: Murata, Masato, et autres
Publié: (2025)
MOS-Bench: Benchmarking Generalization Abilities of Subjective Speech Quality Assessment Models
par: Huang, Wen-Chin, et autres
Publié: (2024)
par: Huang, Wen-Chin, et autres
Publié: (2024)
Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR
par: Ma, Hao, et autres
Publié: (2025)
par: Ma, Hao, et autres
Publié: (2025)
Analysis and Extension of Noisy-target Training for Unsupervised Target Signal Enhancement
par: Fujimura, Takuya, et autres
Publié: (2025)
par: Fujimura, Takuya, et autres
Publié: (2025)
Bridging Speech Emotion Recognition and Personality: Dataset and Temporal Interaction Condition Network
par: Gao, Yuan, et autres
Publié: (2025)
par: Gao, Yuan, et autres
Publié: (2025)
Efficient and Robust Long-Form Speech Recognition with Hybrid H3-Conformer
par: Honda, Tomoki, et autres
Publié: (2024)
par: Honda, Tomoki, et autres
Publié: (2024)
Investigating Effective Speaker Property Privacy Protection in Federated Learning for Speech Emotion Recognition
par: Tan, Chao, et autres
Publié: (2024)
par: Tan, Chao, et autres
Publié: (2024)
Layer-wise Analysis for Quality of Multilingual Synthesized Speech
par: Cooper, Erica, et autres
Publié: (2025)
par: Cooper, Erica, et autres
Publié: (2025)
On-the-fly Routing for Zero-shot MoE Speaker Adaptation of Speech Foundation Models for Dysarthric Speech Recognition
par: HU, Shujie, et autres
Publié: (2025)
par: HU, Shujie, et autres
Publié: (2025)
Elevating Robust Multi-Talker ASR by Decoupling Speaker Separation and Speech Recognition
par: Yang, Yufeng, et autres
Publié: (2025)
par: Yang, Yufeng, et autres
Publié: (2025)
Exploration of Adapter for Noise Robust Automatic Speech Recognition
par: Shi, Hao, et autres
Publié: (2024)
par: Shi, Hao, et autres
Publié: (2024)
Robust Audio-Visual Target Speaker Extraction with Emotion-Aware Multiple Enrollment Fusion
par: Jin, Zhan, et autres
Publié: (2025)
par: Jin, Zhan, et autres
Publié: (2025)
Structured Speaker-Deficiency Adaptation of Foundation Models for Dysarthric and Elderly Speech Recognition
par: Hu, Shujie, et autres
Publié: (2024)
par: Hu, Shujie, et autres
Publié: (2024)
Joint Speaker Features Learning for Audio-visual Multichannel Speech Separation and Recognition
par: Li, Guinan, et autres
Publié: (2024)
par: Li, Guinan, et autres
Publié: (2024)
Testing Correctness, Fairness, and Robustness of Speech Emotion Recognition Models
par: Derington, Anna, et autres
Publié: (2023)
par: Derington, Anna, et autres
Publié: (2023)
Distance Based Single-Channel Target Speech Extraction
par: Shi, Runwu, et autres
Publié: (2024)
par: Shi, Runwu, et autres
Publié: (2024)
Unmixing the Crowd: Learning Mixture-to-Set Speaker Embeddings for Enrollment-Free Target Speech Extraction
par: Sidharth, FNU, et autres
Publié: (2026)
par: Sidharth, FNU, et autres
Publié: (2026)
Handling Domain Shifts for Anomalous Sound Detection: A Review of DCASE-Related Work
par: Wilkinghoff, Kevin, et autres
Publié: (2025)
par: Wilkinghoff, Kevin, et autres
Publié: (2025)
Speech Emotion Recognition with ASR Integration
par: Li, Yuanchao
Publié: (2026)
par: Li, Yuanchao
Publié: (2026)
Two-stage Audio-Visual Target Speaker Extraction System for Real-Time Processing On Edge Device
par: Li, Zixuan, et autres
Publié: (2025)
par: Li, Zixuan, et autres
Publié: (2025)
Can you Remove the Downstream Model for Speaker Recognition with Self-Supervised Speech Features?
par: Aldeneh, Zakaria, et autres
Publié: (2024)
par: Aldeneh, Zakaria, et autres
Publié: (2024)
A Neural Speech Codec for Noise Robust Speech Coding
par: Huang, Jiayi, et autres
Publié: (2023)
par: Huang, Jiayi, et autres
Publié: (2023)
Crab: Multi Layer Contrastive Supervision to Improve Speech Emotion Recognition Under Both Acted and Natural Speech Condition
par: Ueda, Lucas H., et autres
Publié: (2026)
par: Ueda, Lucas H., et autres
Publié: (2026)
Speaker-agnostic Emotion Vector for Cross-speaker Emotion Intensity Control
par: Murata, Masato, et autres
Publié: (2025)
par: Murata, Masato, et autres
Publié: (2025)
From Human Speech to Ocean Signals: Transferring Speech Large Models for Underwater Acoustic Target Recognition
par: Huang, Mengcheng, et autres
Publié: (2026)
par: Huang, Mengcheng, et autres
Publié: (2026)
Efficient Extraction of Noise-Robust Discrete Units from Self-Supervised Speech Models
par: Poncelet, Jakob, et autres
Publié: (2024)
par: Poncelet, Jakob, et autres
Publié: (2024)
Documents similaires
-
A Comprehensive Study on the Effectiveness of ASR Representations for Noise-Robust Speech Emotion Recognition
par: Shi, Xiaohan, et autres
Publié: (2023) -
MF-AED-AEC: Speech Emotion Recognition by Leveraging Multimodal Fusion, Asr Error Detection, and Asr Error Correction
par: He, Jiajun, et autres
Publié: (2024) -
Improvements of Discriminative Feature Space Training for Anomalous Sound Detection in Unlabeled Conditions
par: Fujimura, Takuya, et autres
Publié: (2024) -
Advancing Electrolaryngeal Speech Enhancement Through Speech-Text Representation Learning
par: Ma, Ding, et autres
Publié: (2026) -
Unifying Listener Scoring Scales: Comparison Learning Framework for Speech Quality Assessment and Continuous Speech Emotion Recognition
par: Hu, Cheng-Hung, et autres
Publié: (2025)