The DKU System for Multi-Speaker Automatic Speech Recognition in MLC-SLM Challenge
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lin, Yuke, Cheng, Ming, Li, Ze, Li, Ming |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
The TEA-ASLP System for Multilingual Conversational Speech Recognition and Speech Diarization in MLC-SLM 2025 Challenge
par: Xue, Hongfei, et autres
Publié: (2025)
par: Xue, Hongfei, et autres
Publié: (2025)
Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models
par: Lin, Yuke, et autres
Publié: (2025)
par: Lin, Yuke, et autres
Publié: (2025)
Enhancing Speaker Verification with w2v-BERT 2.0 and Knowledge Distillation guided Structured Pruning
par: Li, Ze, et autres
Publié: (2025)
par: Li, Ze, et autres
Publié: (2025)
The RoyalFlush Automatic Speech Diarization and Recognition System for In-Car Multi-Channel Automatic Speech Recognition Challenge
par: Tian, Jingguang, et autres
Publié: (2024)
par: Tian, Jingguang, et autres
Publié: (2024)
AISHELL-5: The First Open-Source In-Car Multi-Channel Multi-Speaker Speech Dataset for Automatic Speech Diarization and Recognition
par: Dai, Yuhang, et autres
Publié: (2025)
par: Dai, Yuhang, et autres
Publié: (2025)
Boosting Multi-Speaker Expressive Speech Synthesis with Semi-supervised Contrastive Learning
par: Zhu, Xinfa, et autres
Publié: (2023)
par: Zhu, Xinfa, et autres
Publié: (2023)
Findings of the 2024 Mandarin Stuttering Event Detection and Automatic Speech Recognition Challenge
par: Xue, Hongfei, et autres
Publié: (2024)
par: Xue, Hongfei, et autres
Publié: (2024)
KunquDB: An Attempt for Speaker Verification in the Chinese Opera Scenario
par: Zhou, Huali, et autres
Publié: (2024)
par: Zhou, Huali, et autres
Publié: (2024)
Sequence-to-Sequence Neural Diarization with Automatic Speaker Detection and Representation
par: Cheng, Ming, et autres
Publié: (2024)
par: Cheng, Ming, et autres
Publié: (2024)
Self-supervised Reflective Learning through Self-distillation and Online Clustering for Speaker Representation Learning
par: Cai, Danwei, et autres
Publié: (2024)
par: Cai, Danwei, et autres
Publié: (2024)
The Eloquence team submission for task 1 of MLC-SLM challenge
par: Concina, Lorenzo, et autres
Publié: (2025)
par: Concina, Lorenzo, et autres
Publié: (2025)
Seewo's Submission to MLC-SLM: Lessons learned from Speech Reasoning Language Models
par: Li, Bo, et autres
Publié: (2025)
par: Li, Bo, et autres
Publié: (2025)
BUT System for the MLC-SLM Challenge
par: Polok, Alexander, et autres
Publié: (2025)
par: Polok, Alexander, et autres
Publié: (2025)
USEF-TSE: Universal Speaker Embedding Free Target Speaker Extraction
par: Zeng, Bang, et autres
Publié: (2024)
par: Zeng, Bang, et autres
Publié: (2024)
DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition
par: Polok, Alexander, et autres
Publié: (2024)
par: Polok, Alexander, et autres
Publié: (2024)
Universal Speaker Embedding Free Target Speaker Extraction and Personal Voice Activity Detection
par: Zeng, Bang, et autres
Publié: (2025)
par: Zeng, Bang, et autres
Publié: (2025)
Serialized Speech Information Guidance with Overlapped Encoding Separation for Multi-Speaker Automatic Speech Recognition
par: Shi, Hao, et autres
Publié: (2024)
par: Shi, Hao, et autres
Publié: (2024)
Elevating Robust Multi-Talker ASR by Decoupling Speaker Separation and Speech Recognition
par: Yang, Yufeng, et autres
Publié: (2025)
par: Yang, Yufeng, et autres
Publié: (2025)
Structured Speaker-Deficiency Adaptation of Foundation Models for Dysarthric and Elderly Speech Recognition
par: Hu, Shujie, et autres
Publié: (2024)
par: Hu, Shujie, et autres
Publié: (2024)
Joint Speaker Features Learning for Audio-visual Multichannel Speech Separation and Recognition
par: Li, Guinan, et autres
Publié: (2024)
par: Li, Guinan, et autres
Publié: (2024)
Emotion Recognition in Multi-Speaker Conversations through Speaker Identification, Knowledge Distillation, and Hierarchical Fusion
par: Li, Xiao, et autres
Publié: (2025)
par: Li, Xiao, et autres
Publié: (2025)
Transsion Multilingual Speech Recognition System for MLC-SLM 2025 Challenge
par: Li, Xiaoxiao, et autres
Publié: (2025)
par: Li, Xiaoxiao, et autres
Publié: (2025)
Generating Speakers by Prompting Listener Impressions for Pre-trained Multi-Speaker Text-to-Speech Systems
par: Chen, Zhengyang, et autres
Publié: (2024)
par: Chen, Zhengyang, et autres
Publié: (2024)
Augmenting Polish Automatic Speech Recognition System With Synthetic Data
par: Bondaruk, Łukasz, et autres
Publié: (2024)
par: Bondaruk, Łukasz, et autres
Publié: (2024)
Investigating Effective Speaker Property Privacy Protection in Federated Learning for Speech Emotion Recognition
par: Tan, Chao, et autres
Publié: (2024)
par: Tan, Chao, et autres
Publié: (2024)
SMILE: Speech Meta In-Context Learning for Low-Resource Language Automatic Speech Recognition
par: Hsu, Ming-Hao, et autres
Publié: (2024)
par: Hsu, Ming-Hao, et autres
Publié: (2024)
Transcription-Free Fine-Tuning of Speech Separation Models for Noisy and Reverberant Multi-Speaker Automatic Speech Recognition
par: Ravenscroft, William, et autres
Publié: (2024)
par: Ravenscroft, William, et autres
Publié: (2024)
A Comprehensive Investigation on Speaker Augmentation for Speaker Recognition
par: Zhou, Zhenyu, et autres
Publié: (2024)
par: Zhou, Zhenyu, et autres
Publié: (2024)
End-to-End Target Speaker Speech Recognition Using Context-Aware Attention Mechanisms for Challenging Enrollment Scenario
par: Ghane, Mohsen, et autres
Publié: (2025)
par: Ghane, Mohsen, et autres
Publié: (2025)
Multi-Speaker Multi-Lingual VQTTS System for LIMMITS 2023 Challenge
par: Du, Chenpeng, et autres
Publié: (2023)
par: Du, Chenpeng, et autres
Publié: (2023)
On-the-fly Routing for Zero-shot MoE Speaker Adaptation of Speech Foundation Models for Dysarthric Speech Recognition
par: HU, Shujie, et autres
Publié: (2025)
par: HU, Shujie, et autres
Publié: (2025)
Disentangling Speakers in Multi-Talker Speech Recognition with Speaker-Aware CTC
par: Kang, Jiawen, et autres
Publié: (2024)
par: Kang, Jiawen, et autres
Publié: (2024)
Multi-Scale Accent Modeling and Disentangling for Multi-Speaker Multi-Accent Text-to-Speech Synthesis
par: Zhou, Xuehao, et autres
Publié: (2024)
par: Zhou, Xuehao, et autres
Publié: (2024)
ICMC-ASR: The ICASSP 2024 In-Car Multi-Channel Automatic Speech Recognition Challenge
par: Wang, He, et autres
Publié: (2024)
par: Wang, He, et autres
Publié: (2024)
Double Multi-Head Attention Multimodal System for Odyssey 2024 Speech Emotion Recognition Challenge
par: Costa, Federico, et autres
Publié: (2024)
par: Costa, Federico, et autres
Publié: (2024)
Spoofing-Aware Speaker Verification via Wavelet Prompt Tuning and Multi-Model Ensembles
par: Farhadipour, Aref, et autres
Publié: (2026)
par: Farhadipour, Aref, et autres
Publié: (2026)
The CHiME-8 DASR Challenge for Generalizable and Array Agnostic Distant Automatic Speech Recognition and Diarization
par: Cornell, Samuele, et autres
Publié: (2024)
par: Cornell, Samuele, et autres
Publié: (2024)
Multi-Channel Differential ASR for Robust Wearer Speech Recognition on Smart Glasses
par: Yang, Yufeng, et autres
Publié: (2025)
par: Yang, Yufeng, et autres
Publié: (2025)
AGADIR: Towards Array-Geometry Agnostic Directional Speech Recognition
par: Lin, Ju, et autres
Publié: (2024)
par: Lin, Ju, et autres
Publié: (2024)
Discriminative-Generative Target Speaker Extraction with Decoder-Only Language Models
par: Zeng, Bang, et autres
Publié: (2026)
par: Zeng, Bang, et autres
Publié: (2026)
Documents similaires
-
The TEA-ASLP System for Multilingual Conversational Speech Recognition and Speech Diarization in MLC-SLM 2025 Challenge
par: Xue, Hongfei, et autres
Publié: (2025) -
Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models
par: Lin, Yuke, et autres
Publié: (2025) -
Enhancing Speaker Verification with w2v-BERT 2.0 and Knowledge Distillation guided Structured Pruning
par: Li, Ze, et autres
Publié: (2025) -
The RoyalFlush Automatic Speech Diarization and Recognition System for In-Car Multi-Channel Automatic Speech Recognition Challenge
par: Tian, Jingguang, et autres
Publié: (2024) -
AISHELL-5: The First Open-Source In-Car Multi-Channel Multi-Speaker Speech Dataset for Automatic Speech Diarization and Recognition
par: Dai, Yuhang, et autres
Publié: (2025)