Homogeneous Speaker Features for On-the-Fly Dysarthric and Elderly Speaker Adaptation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Geng, Mengzhe, Xie, Xurong, Deng, Jiajun, Jin, Zengrui, Li, Guinan, Wang, Tianzi, Hu, Shujie, Li, Zhaoqing, Meng, Helen, Liu, Xunying |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Structured Speaker-Deficiency Adaptation of Foundation Models for Dysarthric and Elderly Speech Recognition
par: Hu, Shujie, et autres
Publié: (2024)
par: Hu, Shujie, et autres
Publié: (2024)
On-the-fly Routing for Zero-shot MoE Speaker Adaptation of Speech Foundation Models for Dysarthric Speech Recognition
par: HU, Shujie, et autres
Publié: (2025)
par: HU, Shujie, et autres
Publié: (2025)
Self-supervised ASR Models and Features For Dysarthric and Elderly Speech Recognition
par: Hu, Shujie, et autres
Publié: (2024)
par: Hu, Shujie, et autres
Publié: (2024)
Joint Speaker Features Learning for Audio-visual Multichannel Speech Separation and Recognition
par: Li, Guinan, et autres
Publié: (2024)
par: Li, Guinan, et autres
Publié: (2024)
Enhancing Pre-trained ASR System Fine-tuning for Dysarthric Speech Recognition using Adversarial Data Augmentation
par: Wang, Huimeng, et autres
Publié: (2024)
par: Wang, Huimeng, et autres
Publié: (2024)
Personalized Adversarial Data Augmentation for Dysarthric and Elderly Speech Recognition
par: Jin, Zengrui, et autres
Publié: (2022)
par: Jin, Zengrui, et autres
Publié: (2022)
Phone-purity Guided Discrete Tokens for Dysarthric Speech Recognition
par: Wang, Huimeng, et autres
Publié: (2025)
par: Wang, Huimeng, et autres
Publié: (2025)
Regularized Federated Learning for Privacy-Preserving Dysarthric and Elderly Speech Recognition
par: Zhong, Tao, et autres
Publié: (2025)
par: Zhong, Tao, et autres
Publié: (2025)
Towards Effective and Efficient Non-autoregressive Decoding Using Block-based Attention Mask
par: Wang, Tianzi, et autres
Publié: (2024)
par: Wang, Tianzi, et autres
Publié: (2024)
Unfolding A Few Structures for The Many: Memory-Efficient Compression of Conformer and Speech Foundation Models
par: Li, Zhaoqing, et autres
Publié: (2025)
par: Li, Zhaoqing, et autres
Publié: (2025)
Effective and Efficient Mixed Precision Quantization of Speech Foundation Models
par: Xu, Haoning, et autres
Publié: (2025)
par: Xu, Haoning, et autres
Publié: (2025)
MOPSA: Mixture of Prompt-Experts Based Speaker Adaptation for Elderly Speech Recognition
par: Deng, Chengxi, et autres
Publié: (2025)
par: Deng, Chengxi, et autres
Publié: (2025)
One-pass Multiple Conformer and Foundation Speech Systems Compression and Quantization Using An All-in-one Neural Model
par: Li, Zhaoqing, et autres
Publié: (2024)
par: Li, Zhaoqing, et autres
Publié: (2024)
Towards Effective and Efficient Non-autoregressive decoders for Conformer and LLM-based ASR using Block-based Attention Mask
par: Wang, Tianzi, et autres
Publié: (2025)
par: Wang, Tianzi, et autres
Publié: (2025)
Variational Auto-Encoder Based Variability Encoding for Dysarthric Speech Recognition
par: Xie, Xurong, et autres
Publié: (2022)
par: Xie, Xurong, et autres
Publié: (2022)
Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition
par: Chen, Youjun, et autres
Publié: (2025)
par: Chen, Youjun, et autres
Publié: (2025)
Perceiver-Prompt: Flexible Speaker Adaptation in Whisper for Chinese Disordered Speech Recognition
par: Jiang, Yicong, et autres
Publié: (2024)
par: Jiang, Yicong, et autres
Publié: (2024)
Towards One-bit ASR: Extremely Low-bit Conformer Quantization Using Co-training and Stochastic Precision
par: Li, Zhaoqing, et autres
Publié: (2025)
par: Li, Zhaoqing, et autres
Publié: (2025)
Effective and Efficient One-pass Compression of Speech Foundation Models Using Sparsity-aware Self-pinching Gates
par: Xu, Haoning, et autres
Publié: (2025)
par: Xu, Haoning, et autres
Publié: (2025)
Exploring SSL Discrete Speech Features for Zipformer-based Contextual ASR
par: Cui, Mingyu, et autres
Publié: (2024)
par: Cui, Mingyu, et autres
Publié: (2024)
Disentangling Speakers in Multi-Talker Speech Recognition with Speaker-Aware CTC
par: Kang, Jiawen, et autres
Publié: (2024)
par: Kang, Jiawen, et autres
Publié: (2024)
Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems
par: Cui, Mingyu, et autres
Publié: (2025)
par: Cui, Mingyu, et autres
Publié: (2025)
UNISON: A Unified Sound Generation and Editing Framework via Deep LLM Fusion
par: Li, Zhaoqing, et autres
Publié: (2026)
par: Li, Zhaoqing, et autres
Publié: (2026)
Enhancing Speaker-Independent Dysarthric Speech Severity Classification with DSSCNet and Cross-Corpus Adaptation
par: Roy, Arnab Kumar, et autres
Publié: (2025)
par: Roy, Arnab Kumar, et autres
Publié: (2025)
Exploiting Audio-Visual Features with Pretrained AV-HuBERT for Multi-Modal Dysarthric Speech Reconstruction
par: Chen, Xueyuan, et autres
Publié: (2024)
par: Chen, Xueyuan, et autres
Publié: (2024)
Spectral-Aware Low-Rank Adaptation for Speaker Verification
par: Li, Zhe, et autres
Publié: (2025)
par: Li, Zhe, et autres
Publié: (2025)
Enhancing Dysarthric Speech Recognition for Unseen Speakers via Prototype-Based Adaptation
par: Wang, Shiyao, et autres
Publié: (2024)
par: Wang, Shiyao, et autres
Publié: (2024)
Speaker-Smoothed kNN Speaker Adaptation for End-to-End ASR
par: Li, Shaojun, et autres
Publié: (2024)
par: Li, Shaojun, et autres
Publié: (2024)
Bayesian Learning for Deep Neural Network Adaptation
par: Xie, Xurong, et autres
Publié: (2020)
par: Xie, Xurong, et autres
Publié: (2020)
Investigation of Deep Neural Network Acoustic Modelling Approaches for Low Resource Accented Mandarin Speech Recognition
par: Xie, Xurong, et autres
Publié: (2022)
par: Xie, Xurong, et autres
Publié: (2022)
Speaker Contrastive Learning for Source Speaker Tracing
par: Wang, Qing, et autres
Publié: (2024)
par: Wang, Qing, et autres
Publié: (2024)
SCDNet: Self-supervised Learning Feature-based Speaker Change Detection
par: Li, Yue, et autres
Publié: (2024)
par: Li, Yue, et autres
Publié: (2024)
Speaker Targeting via Self-Speaker Adaptation for Multi-talker ASR
par: Wang, Weiqing, et autres
Publié: (2025)
par: Wang, Weiqing, et autres
Publié: (2025)
Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling
par: Wu, Shu, et autres
Publié: (2025)
par: Wu, Shu, et autres
Publié: (2025)
Multi-Level Speaker Representation for Target Speaker Extraction
par: Zhang, Ke, et autres
Publié: (2024)
par: Zhang, Ke, et autres
Publié: (2024)
Cross-Speaker Encoding Network for Multi-Talker Speech Recognition
par: Kang, Jiawen, et autres
Publié: (2024)
par: Kang, Jiawen, et autres
Publié: (2024)
ASRRL-TTS: Agile Speaker Representation Reinforcement Learning for Text-to-Speech Speaker Adaptation
par: Fu, Ruibo, et autres
Publié: (2024)
par: Fu, Ruibo, et autres
Publié: (2024)
An Investigation on Speaker Augmentation for End-to-End Speaker Extraction
par: You, Zhenghai, et autres
Publié: (2025)
par: You, Zhenghai, et autres
Publié: (2025)
A Comprehensive Investigation on Speaker Augmentation for Speaker Recognition
par: Zhou, Zhenyu, et autres
Publié: (2024)
par: Zhou, Zhenyu, et autres
Publié: (2024)
An Investigation of Reprogramming for Cross-Language Adaptation in Speaker Verification Systems
par: Li, Jingyu, et autres
Publié: (2024)
par: Li, Jingyu, et autres
Publié: (2024)
Documents similaires
-
Structured Speaker-Deficiency Adaptation of Foundation Models for Dysarthric and Elderly Speech Recognition
par: Hu, Shujie, et autres
Publié: (2024) -
On-the-fly Routing for Zero-shot MoE Speaker Adaptation of Speech Foundation Models for Dysarthric Speech Recognition
par: HU, Shujie, et autres
Publié: (2025) -
Self-supervised ASR Models and Features For Dysarthric and Elderly Speech Recognition
par: Hu, Shujie, et autres
Publié: (2024) -
Joint Speaker Features Learning for Audio-visual Multichannel Speech Separation and Recognition
par: Li, Guinan, et autres
Publié: (2024) -
Enhancing Pre-trained ASR System Fine-tuning for Dysarthric Speech Recognition using Adversarial Data Augmentation
par: Wang, Huimeng, et autres
Publié: (2024)