An audio-quality-based multi-strategy approach for target speaker extraction in the MISP 2023 Challenge
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Han, Runduo, Yan, Xiaopeng, Xu, Weiming, Guo, Pengcheng, Sun, Jiayao, Wang, He, Lu, Quan, Jiang, Ning, Xie, Lei |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Hierarchical speaker representation for target speaker extraction
par: He, Shulin, et autres
Publié: (2022)
par: He, Shulin, et autres
Publié: (2022)
Distil-DCCRN: A Small-footprint DCCRN Leveraging Feature-based Knowledge Distillation in Speech Enhancement
par: Han, Runduo, et autres
Publié: (2024)
par: Han, Runduo, et autres
Publié: (2024)
Improving curriculum learning for target speaker extraction with synthetic speakers
par: Liu, Yun, et autres
Publié: (2024)
par: Liu, Yun, et autres
Publié: (2024)
Visual-based spatial audio generation system for multi-speaker environments
par: Liu, Xiaojing, et autres
Publié: (2025)
par: Liu, Xiaojing, et autres
Publié: (2025)
SPGISpeech 2.0: Transcribed multi-speaker financial audio for speaker-tagged transcription
par: Grossman, Raymond, et autres
Publié: (2025)
par: Grossman, Raymond, et autres
Publié: (2025)
X-CrossNet: A complex spectral mapping approach to target speaker extraction with cross attention speaker embedding fusion
par: Sun, Chang, et autres
Publié: (2024)
par: Sun, Chang, et autres
Publié: (2024)
Pseudo Labels-based Neural Speech Enhancement for the AVSR Task in the MISP-Meeting Challenge
par: Luo, Longjie, et autres
Publié: (2025)
par: Luo, Longjie, et autres
Publié: (2025)
Overlap-Adaptive Hybrid Speaker Diarization and ASR-Aware Observation Addition for MISP 2025 Challenge
par: Huang, Shangkun, et autres
Publié: (2025)
par: Huang, Shangkun, et autres
Publié: (2025)
On the influence of language similarity in non-target speaker verification trials
par: Reuter, Paul M., et autres
Publié: (2025)
par: Reuter, Paul M., et autres
Publié: (2025)
A multi-speaker multi-lingual voice cloning system based on vits2 for limmits 2024 challenge
par: Wang, Xiaopeng, et autres
Publié: (2024)
par: Wang, Xiaopeng, et autres
Publié: (2024)
End-to-end multi-channel speaker extraction and binaural speech synthesis
par: Chi, Cheng, et autres
Publié: (2024)
par: Chi, Cheng, et autres
Publié: (2024)
Spectral or spatial? Leveraging both for speaker extraction in challenging data conditions
par: Eisenberg, Aviad, et autres
Publié: (2025)
par: Eisenberg, Aviad, et autres
Publié: (2025)
A robust audio deepfake detection system via multi-view feature
par: Yang, Yujie, et autres
Publié: (2024)
par: Yang, Yujie, et autres
Publié: (2024)
The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition
par: Gao, Ming, et autres
Publié: (2025)
par: Gao, Ming, et autres
Publié: (2025)
Thinking in cocktail party: Chain-of-Thought and reinforcement learning for target speaker automatic speech recognition
par: Zhang, Yiru, et autres
Publié: (2025)
par: Zhang, Yiru, et autres
Publié: (2025)
Text adaptation for speaker verification with speaker-text factorized embeddings
par: Yang, Yexin, et autres
Publié: (2025)
par: Yang, Yexin, et autres
Publié: (2025)
Modeling strategies for speech enhancement in the latent space of a neural audio codec
par: Kammoun, Sofiene, et autres
Publié: (2025)
par: Kammoun, Sofiene, et autres
Publié: (2025)
Extending Whisper with prompt tuning to target-speaker ASR
par: Ma, Hao, et autres
Publié: (2023)
par: Ma, Hao, et autres
Publié: (2023)
Accent-VITS:accent transfer for end-to-end TTS
par: Ma, Linhan, et autres
Publié: (2023)
par: Ma, Linhan, et autres
Publié: (2023)
Self-supervised learning method using multiple sampling strategies for general-purpose audio representation
par: Kuroyanagi, Ibuki, et autres
Publié: (2025)
par: Kuroyanagi, Ibuki, et autres
Publié: (2025)
The NPU-ASLP-LiAuto System Description for Visual Speech Recognition in CNVSRC 2023
par: Wang, He, et autres
Publié: (2024)
par: Wang, He, et autres
Publié: (2024)
Scaling up masked audio encoder learning for general audio classification
par: Dinkel, Heinrich, et autres
Publié: (2024)
par: Dinkel, Heinrich, et autres
Publié: (2024)
MBCodec:Thorough disentangle for high-fidelity audio compression
par: Zhang, Ruonan, et autres
Publié: (2025)
par: Zhang, Ruonan, et autres
Publié: (2025)
BS-PLCNet: Band-split Packet Loss Concealment Network with Multi-task Learning Framework and Multi-discriminators
par: Zhang, Zihan, et autres
Publié: (2024)
par: Zhang, Zihan, et autres
Publié: (2024)
DualSep: A Light-weight dual-encoder convolutional recurrent network for real-time in-car speech separation
par: Wang, Ziqian, et autres
Publié: (2024)
par: Wang, Ziqian, et autres
Publié: (2024)
Improving fairness in speaker verification via Group-adapted Fusion Network
par: Shen, Hua, et autres
Publié: (2022)
par: Shen, Hua, et autres
Publié: (2022)
An automatic mixing speech enhancement system for multi-track audio
par: Liu, Xiaojing, et autres
Publié: (2024)
par: Liu, Xiaojing, et autres
Publié: (2024)
Mixture of LoRA Experts with Multi-Modal and Multi-Granularity LLM Generative Error Correction for Accented Speech Recognition
par: Mu, Bingshen, et autres
Publié: (2025)
par: Mu, Bingshen, et autres
Publié: (2025)
DualVC 2: Dynamic Masked Convolution for Unified Streaming and Non-Streaming Voice Conversion
par: Ning, Ziqian, et autres
Publié: (2023)
par: Ning, Ziqian, et autres
Publié: (2023)
MeanVC: Lightweight and Streaming Zero-Shot Voice Conversion via Mean Flows
par: Ma, Guobin, et autres
Publié: (2025)
par: Ma, Guobin, et autres
Publié: (2025)
Blind estimation of audio effects using an auto-encoder approach and differentiable digital signal processing
par: Peladeau, Côme, et autres
Publié: (2023)
par: Peladeau, Côme, et autres
Publié: (2023)
How phonemes contribute to deep speaker models?
par: Li, Pengqi, et autres
Publié: (2024)
par: Li, Pengqi, et autres
Publié: (2024)
Interaural time difference loss for binaural target sound extraction
par: Hernandez-Olivan, Carlos, et autres
Publié: (2024)
par: Hernandez-Olivan, Carlos, et autres
Publié: (2024)
Whisper-SV: Adapting Whisper for Low-data-resource Speaker Verification
par: Zhang, Li, et autres
Publié: (2024)
par: Zhang, Li, et autres
Publié: (2024)
Semi-intrusive audio evaluation: Casting non-intrusive assessment as a multi-modal text prediction task
par: Coldenhoff, Jozef, et autres
Publié: (2024)
par: Coldenhoff, Jozef, et autres
Publié: (2024)
Towards audio language modeling -- an overview
par: Wu, Haibin, et autres
Publié: (2024)
par: Wu, Haibin, et autres
Publié: (2024)
The importance of spatial and spectral information in multiple speaker tracking
par: Beit-On, Hanan, et autres
Publié: (2024)
par: Beit-On, Hanan, et autres
Publié: (2024)
An approach to optimize inference of the DIART speaker diarization pipeline
par: Aperdannier, Roman, et autres
Publié: (2024)
par: Aperdannier, Roman, et autres
Publié: (2024)
Are audio DeepFake detection models polyglots?
par: Marek, Bartłomiej, et autres
Publié: (2024)
par: Marek, Bartłomiej, et autres
Publié: (2024)
SQ-Whisper: Speaker-Querying based Whisper Model for Target-Speaker ASR
par: Guo, Pengcheng, et autres
Publié: (2024)
par: Guo, Pengcheng, et autres
Publié: (2024)
Documents similaires
-
Hierarchical speaker representation for target speaker extraction
par: He, Shulin, et autres
Publié: (2022) -
Distil-DCCRN: A Small-footprint DCCRN Leveraging Feature-based Knowledge Distillation in Speech Enhancement
par: Han, Runduo, et autres
Publié: (2024) -
Improving curriculum learning for target speaker extraction with synthetic speakers
par: Liu, Yun, et autres
Publié: (2024) -
Visual-based spatial audio generation system for multi-speaker environments
par: Liu, Xiaojing, et autres
Publié: (2025) -
SPGISpeech 2.0: Transcribed multi-speaker financial audio for speaker-tagged transcription
par: Grossman, Raymond, et autres
Publié: (2025)