PB-LRDWWS System for the SLT 2024 Low-Resource Dysarthria Wake-Up Word Spotting Challenge
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Shiyao, Zhou, Jiaming, Zhao, Shiwan, Qin, Yong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Optimizing Dysarthria Wake-Up Word Spotting: An End-to-End Approach for SLT 2024 LRDWWS Challenge
di: Liu, Shuiyun, et al.
Pubblicazione: (2024)
di: Liu, Shuiyun, et al.
Pubblicazione: (2024)
A Self-Training Approach for Whisper to Enhance Long Dysarthric Speech Recognition
di: Wang, Shiyao, et al.
Pubblicazione: (2025)
di: Wang, Shiyao, et al.
Pubblicazione: (2025)
Enhancing Dysarthric Speech Recognition for Unseen Speakers via Prototype-Based Adaptation
di: Wang, Shiyao, et al.
Pubblicazione: (2024)
di: Wang, Shiyao, et al.
Pubblicazione: (2024)
kNN-CTC: Enhancing ASR via Retrieval of CTC Pseudo Labels
di: Zhou, Jiaming, et al.
Pubblicazione: (2023)
di: Zhou, Jiaming, et al.
Pubblicazione: (2023)
Iterative Prototype Refinement for Ambiguous Speech Emotion Recognition
di: Sun, Haoqin, et al.
Pubblicazione: (2024)
di: Sun, Haoqin, et al.
Pubblicazione: (2024)
M2R-Whisper: Multi-stage and Multi-scale Retrieval Augmentation for Enhancing Whisper
di: Zhou, Jiaming, et al.
Pubblicazione: (2024)
di: Zhou, Jiaming, et al.
Pubblicazione: (2024)
ChildMandarin: A Comprehensive Mandarin Speech Dataset for Young Children Aged 3-5
di: Zhou, Jiaming, et al.
Pubblicazione: (2024)
di: Zhou, Jiaming, et al.
Pubblicazione: (2024)
MusicEval: A Generative Music Dataset with Expert Ratings for Automatic Text-to-Music Evaluation
di: Liu, Cheng, et al.
Pubblicazione: (2025)
di: Liu, Cheng, et al.
Pubblicazione: (2025)
Enhancing Multimodal Emotion Recognition through Multi-Granularity Cross-Modal Alignment
di: Wang, Xuechen, et al.
Pubblicazione: (2024)
di: Wang, Xuechen, et al.
Pubblicazione: (2024)
CDSD: Chinese Dysarthria Speech Database
di: Wang, Yan, et al.
Pubblicazione: (2023)
di: Wang, Yan, et al.
Pubblicazione: (2023)
Codec-SUPERB @ SLT 2024: A lightweight benchmark for neural audio codec models
di: Wu, Haibin, et al.
Pubblicazione: (2024)
di: Wu, Haibin, et al.
Pubblicazione: (2024)
Robust Wake Word Spotting With Frame-Level Cross-Modal Attention Based Audio-Visual Conformer
di: Wang, Haoxu, et al.
Pubblicazione: (2024)
di: Wang, Haoxu, et al.
Pubblicazione: (2024)
TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models
di: Wang, Hui, et al.
Pubblicazione: (2025)
di: Wang, Hui, et al.
Pubblicazione: (2025)
Uncertainty-Aware Mean Opinion Score Prediction
di: Wang, Hui, et al.
Pubblicazione: (2024)
di: Wang, Hui, et al.
Pubblicazione: (2024)
AudioEditor: A Training-Free Diffusion-Based Audio Editing Framework
di: Jia, Yuhang, et al.
Pubblicazione: (2024)
di: Jia, Yuhang, et al.
Pubblicazione: (2024)
Improving Zero-Shot Chinese-English Code-Switching ASR with kNN-CTC and Gated Monolingual Datastores
di: Zhou, Jiaming, et al.
Pubblicazione: (2024)
di: Zhou, Jiaming, et al.
Pubblicazione: (2024)
RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval
di: Sun, Haoqin, et al.
Pubblicazione: (2025)
di: Sun, Haoqin, et al.
Pubblicazione: (2025)
SpeechLLM-as-Judges: Towards General and Interpretable Speech Quality Evaluation
di: Wang, Hui, et al.
Pubblicazione: (2025)
di: Wang, Hui, et al.
Pubblicazione: (2025)
CS-Dialogue: A 104-Hour Dataset of Spontaneous Mandarin-English Code-Switching Dialogues for Speech Recognition
di: Zhou, Jiaming, et al.
Pubblicazione: (2025)
di: Zhou, Jiaming, et al.
Pubblicazione: (2025)
DIFFA: Large Language Diffusion Models Can Listen and Understand
di: Zhou, Jiaming, et al.
Pubblicazione: (2025)
di: Zhou, Jiaming, et al.
Pubblicazione: (2025)
Findings of the 2024 Mandarin Stuttering Event Detection and Automatic Speech Recognition Challenge
di: Xue, Hongfei, et al.
Pubblicazione: (2024)
di: Xue, Hongfei, et al.
Pubblicazione: (2024)
Implementation and Applications of WakeWords Integrated with Speaker Recognition: A Case Study
di: Filho, Alexandre Costa Ferro, et al.
Pubblicazione: (2024)
di: Filho, Alexandre Costa Ferro, et al.
Pubblicazione: (2024)
WildElder: A Chinese Elderly Speech Dataset from the Wild with Fine-Grained Manual Annotations
di: Wang, Hui, et al.
Pubblicazione: (2025)
di: Wang, Hui, et al.
Pubblicazione: (2025)
A Multilingual Framework for Dysarthria: Detection, Severity Classification, Speech-to-Text, and Clean Speech Generation
di: Raghu, Ananya, et al.
Pubblicazione: (2025)
di: Raghu, Ananya, et al.
Pubblicazione: (2025)
From Contrast to Commonality: Audio Commonality Captioning for Enhanced Audio-Text Cross-modal Understanding in Multimodal LLMs
di: Jia, Yuhang, et al.
Pubblicazione: (2025)
di: Jia, Yuhang, et al.
Pubblicazione: (2025)
Low-Resource Audio Codec (LRAC): 2025 Challenge Description
di: Wojcicki, Kamil, et al.
Pubblicazione: (2025)
di: Wojcicki, Kamil, et al.
Pubblicazione: (2025)
AudioEval: Automatic Dual-Perspective and Multi-Dimensional Evaluation of Text-to-Audio-Generation
di: Wang, Hui, et al.
Pubblicazione: (2025)
di: Wang, Hui, et al.
Pubblicazione: (2025)
CosyEdit: Unlocking End-to-End Speech Editing Capability from Zero-Shot Text-to-Speech Models
di: Chen, Junyang, et al.
Pubblicazione: (2026)
di: Chen, Junyang, et al.
Pubblicazione: (2026)
Data-Efficient Low-Complexity Acoustic Scene Classification in the DCASE 2024 Challenge
di: Schmid, Florian, et al.
Pubblicazione: (2024)
di: Schmid, Florian, et al.
Pubblicazione: (2024)
Improving Acoustic Scene Classification in Low-Resource Conditions
di: Chen, Zhi, et al.
Pubblicazione: (2024)
di: Chen, Zhi, et al.
Pubblicazione: (2024)
FELLE: Autoregressive Speech Synthesis with Token-Wise Coarse-to-Fine Flow Matching
di: Wang, Hui, et al.
Pubblicazione: (2025)
di: Wang, Hui, et al.
Pubblicazione: (2025)
SeniorTalk: A Chinese Conversation Dataset with Rich Annotations for Super-Aged Seniors
di: Chen, Yang, et al.
Pubblicazione: (2025)
di: Chen, Yang, et al.
Pubblicazione: (2025)
The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024
di: Zhou, Shuoyi, et al.
Pubblicazione: (2024)
di: Zhou, Shuoyi, et al.
Pubblicazione: (2024)
The Interspeech 2024 Challenge on Speech Processing Using Discrete Units
di: Chang, Xuankai, et al.
Pubblicazione: (2024)
di: Chang, Xuankai, et al.
Pubblicazione: (2024)
EnvSSLAM-FFN: Lightweight Layer-Fused System for ESDD 2026 Challenge
di: Guo, Xiaoxuan, et al.
Pubblicazione: (2025)
di: Guo, Xiaoxuan, et al.
Pubblicazione: (2025)
AdaKWS: Towards Robust Keyword Spotting with Test-Time Adaptation
di: Xiao, Yang, et al.
Pubblicazione: (2025)
di: Xiao, Yang, et al.
Pubblicazione: (2025)
The AudioMOS Challenge 2025
di: Huang, Wen-Chin, et al.
Pubblicazione: (2025)
di: Huang, Wen-Chin, et al.
Pubblicazione: (2025)
KS-Net: Multi-band joint speech restoration and enhancement network for 2024 ICASSP SSI Challenge
di: Yu, Guochen, et al.
Pubblicazione: (2024)
di: Yu, Guochen, et al.
Pubblicazione: (2024)
PhoenixCodec: Taming Neural Speech Coding for Extreme Low-Resource Scenarios
di: Wan, Zixiang, et al.
Pubblicazione: (2025)
di: Wan, Zixiang, et al.
Pubblicazione: (2025)
Double Multi-Head Attention Multimodal System for Odyssey 2024 Speech Emotion Recognition Challenge
di: Costa, Federico, et al.
Pubblicazione: (2024)
di: Costa, Federico, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Optimizing Dysarthria Wake-Up Word Spotting: An End-to-End Approach for SLT 2024 LRDWWS Challenge
di: Liu, Shuiyun, et al.
Pubblicazione: (2024) -
A Self-Training Approach for Whisper to Enhance Long Dysarthric Speech Recognition
di: Wang, Shiyao, et al.
Pubblicazione: (2025) -
Enhancing Dysarthric Speech Recognition for Unseen Speakers via Prototype-Based Adaptation
di: Wang, Shiyao, et al.
Pubblicazione: (2024) -
kNN-CTC: Enhancing ASR via Retrieval of CTC Pseudo Labels
di: Zhou, Jiaming, et al.
Pubblicazione: (2023) -
Iterative Prototype Refinement for Ambiguous Speech Emotion Recognition
di: Sun, Haoqin, et al.
Pubblicazione: (2024)