DyPCL: Dynamic Phoneme-level Contrastive Learning for Dysarthric Speech Recognition
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lee, Wonjun, Im, Solee, Do, Heejin, Kim, Yunsu, Ok, Jungseul, Lee, Gary Geunbae |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
An Investigation Into Explainable Audio Hate Speech Detection
par: An, Jinmyeong, et autres
Publié: (2024)
par: An, Jinmyeong, et autres
Publié: (2024)
Acoustic Feature Mixup for Balanced Multi-aspect Pronunciation Assessment
par: Do, Heejin, et autres
Publié: (2024)
par: Do, Heejin, et autres
Publié: (2024)
Enhancing Dialogue Speech Recognition with Robust Contextual Awareness via Noise Representation Learning
par: Lee, Wonjun, et autres
Publié: (2024)
par: Lee, Wonjun, et autres
Publié: (2024)
Enhancing Zero-Shot Multi-Speaker TTS with Negated Speaker Representations
par: Jeon, Yejin, et autres
Publié: (2024)
par: Jeon, Yejin, et autres
Publié: (2024)
Leveraging the Interplay Between Syntactic and Acoustic Cues for Optimizing Korean TTS Pause Formation
par: Jeon, Yejin, et autres
Publié: (2024)
par: Jeon, Yejin, et autres
Publié: (2024)
Multilingual Dysarthric Speech Assessment Using Universal Phone Recognition and Language-Specific Phonemic Contrast Modeling
par: Yeo, Eunjung, et autres
Publié: (2026)
par: Yeo, Eunjung, et autres
Publié: (2026)
Audio-Based Linguistic Feature Extraction for Enhancing Multi-lingual and Low-Resource Text-to-Speech
par: Kim, Youngjae, et autres
Publié: (2024)
par: Kim, Youngjae, et autres
Publié: (2024)
Training Data Augmentation for Dysarthric Automatic Speech Recognition by Text-to-Dysarthric-Speech Synthesis
par: Leung, Wing-Zin, et autres
Publié: (2024)
par: Leung, Wing-Zin, et autres
Publié: (2024)
Activity-Guided Industrial Anomalous Sound Detection against Interferences
par: Lee, Yunjoo, et autres
Publié: (2024)
par: Lee, Yunjoo, et autres
Publié: (2024)
Personalized Fine-Tuning with Controllable Synthetic Speech from LLM-Generated Transcripts for Dysarthric Speech Recognition
par: Wagner, Dominik, et autres
Publié: (2025)
par: Wagner, Dominik, et autres
Publié: (2025)
Multi-Level Attention Aggregation for Language-Agnostic Speaker Replication
par: Jeon, Yejin, et autres
Publié: (2024)
par: Jeon, Yejin, et autres
Publié: (2024)
Phone-purity Guided Discrete Tokens for Dysarthric Speech Recognition
par: Wang, Huimeng, et autres
Publié: (2025)
par: Wang, Huimeng, et autres
Publié: (2025)
Inappropriate Pause Detection In Dysarthric Speech Using Large-Scale Speech Recognition
par: Lee, Jeehyun, et autres
Publié: (2024)
par: Lee, Jeehyun, et autres
Publié: (2024)
Speech Recognition-based Feature Extraction for Enhanced Automatic Severity Classification in Dysarthric Speech
par: Choi, Yerin, et autres
Publié: (2024)
par: Choi, Yerin, et autres
Publié: (2024)
Variational Auto-Encoder Based Variability Encoding for Dysarthric Speech Recognition
par: Xie, Xurong, et autres
Publié: (2022)
par: Xie, Xurong, et autres
Publié: (2022)
Zero-Shot Recognition of Dysarthric Speech Using Commercial Automatic Speech Recognition and Multimodal Large Language Models
par: Alsayegh, Ali, et autres
Publié: (2025)
par: Alsayegh, Ali, et autres
Publié: (2025)
A Self-Training Approach for Whisper to Enhance Long Dysarthric Speech Recognition
par: Wang, Shiyao, et autres
Publié: (2025)
par: Wang, Shiyao, et autres
Publié: (2025)
The Universal Personalizer: Few-Shot Dysarthric Speech Recognition via Meta-Learning
par: Agarwal, Dhruuv, et autres
Publié: (2025)
par: Agarwal, Dhruuv, et autres
Publié: (2025)
Structured Speaker-Deficiency Adaptation of Foundation Models for Dysarthric and Elderly Speech Recognition
par: Hu, Shujie, et autres
Publié: (2024)
par: Hu, Shujie, et autres
Publié: (2024)
On-the-fly Routing for Zero-shot MoE Speaker Adaptation of Speech Foundation Models for Dysarthric Speech Recognition
par: HU, Shujie, et autres
Publié: (2025)
par: HU, Shujie, et autres
Publié: (2025)
Probing Whisper for Dysarthric Speech in Detection and Assessment
par: Yue, Zhengjun, et autres
Publié: (2025)
par: Yue, Zhengjun, et autres
Publié: (2025)
Towards Robust Dysarthric Speech Recognition: LLM-Agent Post-ASR Correction Beyond WER
par: Zheng, Xiuwen, et autres
Publié: (2026)
par: Zheng, Xiuwen, et autres
Publié: (2026)
Objective and Subjective Evaluation of Diffusion-Based Speech Enhancement for Dysarthric Speech
par: de Groot, Dimme, et autres
Publié: (2025)
par: de Groot, Dimme, et autres
Publié: (2025)
Enhancing Pre-trained ASR System Fine-tuning for Dysarthric Speech Recognition using Adversarial Data Augmentation
par: Wang, Huimeng, et autres
Publié: (2024)
par: Wang, Huimeng, et autres
Publié: (2024)
Self-supervised ASR Models and Features For Dysarthric and Elderly Speech Recognition
par: Hu, Shujie, et autres
Publié: (2024)
par: Hu, Shujie, et autres
Publié: (2024)
Prosody Labeling with Phoneme-BERT and Speech Foundation Models
par: Koriyama, Tomoki
Publié: (2025)
par: Koriyama, Tomoki
Publié: (2025)
DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model
par: Chen, Xueyuan, et autres
Publié: (2025)
par: Chen, Xueyuan, et autres
Publié: (2025)
Facilitating Personalized TTS for Dysarthric Speakers Using Knowledge Anchoring and Curriculum Learning
par: Jeon, Yejin, et autres
Publié: (2025)
par: Jeon, Yejin, et autres
Publié: (2025)
Idiosyncratic Versus Normative Modeling of Atypical Speech Recognition: Dysarthric Case Studies
par: Raja, Vishnu, et autres
Publié: (2025)
par: Raja, Vishnu, et autres
Publié: (2025)
Enhancing Dysarthric Speech Recognition for Unseen Speakers via Prototype-Based Adaptation
par: Wang, Shiyao, et autres
Publié: (2024)
par: Wang, Shiyao, et autres
Publié: (2024)
A Phoneme-Scale Assessment of Multichannel Speech Enhancement Algorithms
par: Monir, Nasser-Eddine, et autres
Publié: (2024)
par: Monir, Nasser-Eddine, et autres
Publié: (2024)
Phoneme-Level Analysis for Person-of-Interest Speech Deepfake Detection
par: Salvi, Davide, et autres
Publié: (2025)
par: Salvi, Davide, et autres
Publié: (2025)
Interpretable Modeling of Articulatory Temporal Dynamics from real-time MRI for Phoneme Recognition
par: Park, Jay, et autres
Publié: (2025)
par: Park, Jay, et autres
Publié: (2025)
Multitask Learning for Grapheme-to-Phoneme Conversion of Anglicisms in German Speech Recognition
par: Pritzen, Julia, et autres
Publié: (2021)
par: Pritzen, Julia, et autres
Publié: (2021)
Enhancing Speaker-Independent Dysarthric Speech Severity Classification with DSSCNet and Cross-Corpus Adaptation
par: Roy, Arnab Kumar, et autres
Publié: (2025)
par: Roy, Arnab Kumar, et autres
Publié: (2025)
Bridging ASR and LLMs for Dysarthric Speech Recognition: Benchmarking Self-Supervised and Generative Approaches
par: Aboeitta, Ahmed, et autres
Publié: (2025)
par: Aboeitta, Ahmed, et autres
Publié: (2025)
Evaluating Multichannel Speech Enhancement Algorithms at the Phoneme Scale Across Genders
par: Monir, Nasser-Eddine, et autres
Publié: (2025)
par: Monir, Nasser-Eddine, et autres
Publié: (2025)
Gammatonegram Representation for End-to-End Dysarthric Speech Processing Tasks: Speech Recognition, Speaker Identification, and Intelligibility Assessment
par: Farhadipour, Aref, et autres
Publié: (2023)
par: Farhadipour, Aref, et autres
Publié: (2023)
Phoneme-Level Contrastive Learning for User-Defined Keyword Spotting with Flexible Enrollment
par: Kewei, Li, et autres
Publié: (2024)
par: Kewei, Li, et autres
Publié: (2024)
Self-Supervised Models for Phoneme Recognition: Applications in Children's Speech for Reading Learning
par: Medin, Lucas Block, et autres
Publié: (2025)
par: Medin, Lucas Block, et autres
Publié: (2025)
Documents similaires
-
An Investigation Into Explainable Audio Hate Speech Detection
par: An, Jinmyeong, et autres
Publié: (2024) -
Acoustic Feature Mixup for Balanced Multi-aspect Pronunciation Assessment
par: Do, Heejin, et autres
Publié: (2024) -
Enhancing Dialogue Speech Recognition with Robust Contextual Awareness via Noise Representation Learning
par: Lee, Wonjun, et autres
Publié: (2024) -
Enhancing Zero-Shot Multi-Speaker TTS with Negated Speaker Representations
par: Jeon, Yejin, et autres
Publié: (2024) -
Leveraging the Interplay Between Syntactic and Acoustic Cues for Optimizing Korean TTS Pause Formation
par: Jeon, Yejin, et autres
Publié: (2024)