Enhancing Few-shot Keyword Spotting Performance through Pre-Trained Self-supervised Speech Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Gok, Alican, Buyuksolak, Oguzhan, Okman, Osman Erman, Saraclar, Murat |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
EdgeSpot: Efficient and High-Performance Few-Shot Model for Keyword Spotting
par: Buyuksolak, Oguzhan, et autres
Publié: (2026)
par: Buyuksolak, Oguzhan, et autres
Publié: (2026)
Contrastive Learning With Audio Discrimination For Customizable Keyword Spotting In Continuous Speech
par: Xi, Yu, et autres
Publié: (2024)
par: Xi, Yu, et autres
Publié: (2024)
Keyword Mamba: Spoken Keyword Spotting with State Space Models
par: Ding, Hanyu, et autres
Publié: (2025)
par: Ding, Hanyu, et autres
Publié: (2025)
Effective Integration of KAN for Keyword Spotting
par: Xu, Anfeng, et autres
Publié: (2024)
par: Xu, Anfeng, et autres
Publié: (2024)
Multichannel Keyword Spotting for Noisy Conditions
par: Saladukha, Dzmitry, et autres
Publié: (2025)
par: Saladukha, Dzmitry, et autres
Publié: (2025)
Quantization-Based Score Calibration for Few-Shot Keyword Spotting with Dynamic Time Warping in Noisy Environments
par: Wilkinghoff, Kevin, et autres
Publié: (2025)
par: Wilkinghoff, Kevin, et autres
Publié: (2025)
Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding
par: Xi, Yu, et autres
Publié: (2025)
par: Xi, Yu, et autres
Publié: (2025)
Does Single-channel Speech Enhancement Improve Keyword Spotting Accuracy? A Case Study
par: Brueggeman, Avamarie, et autres
Publié: (2023)
par: Brueggeman, Avamarie, et autres
Publié: (2023)
Target Speech Extraction with Pre-trained Self-supervised Learning Models
par: Peng, Junyi, et autres
Publié: (2024)
par: Peng, Junyi, et autres
Publié: (2024)
ZMM-TTS: Zero-shot Multilingual and Multispeaker Speech Synthesis Conditioned on Self-supervised Discrete Speech Representations
par: Gong, Cheng, et autres
Publié: (2023)
par: Gong, Cheng, et autres
Publié: (2023)
Multi-Sample Dynamic Time Warping for Few-Shot Keyword Spotting
par: Wilkinghoff, Kevin, et autres
Publié: (2024)
par: Wilkinghoff, Kevin, et autres
Publié: (2024)
Streaming Keyword Spotting Boosted by Cross-layer Discrimination Consistency
par: Xi, Yu, et autres
Publié: (2024)
par: Xi, Yu, et autres
Publié: (2024)
NTC-KWS: Noise-aware CTC for Robust Keyword Spotting
par: Xi, Yu, et autres
Publié: (2024)
par: Xi, Yu, et autres
Publié: (2024)
AdaKWS: Towards Robust Keyword Spotting with Test-Time Adaptation
par: Xiao, Yang, et autres
Publié: (2025)
par: Xiao, Yang, et autres
Publié: (2025)
Contrastive Augmentation: An Unsupervised Learning Approach for Keyword Spotting in Speech Technology
par: Dai, Weinan, et autres
Publié: (2024)
par: Dai, Weinan, et autres
Publié: (2024)
Comparison of Self-Supervised Speech Pre-Training Methods on Flemish Dutch
par: Poncelet, Jakob, et autres
Publié: (2021)
par: Poncelet, Jakob, et autres
Publié: (2021)
Noise-Robust Keyword Spotting through Self-supervised Pretraining
par: Mørk, Jacob, et autres
Publié: (2024)
par: Mørk, Jacob, et autres
Publié: (2024)
MFA-KWS: Effective Keyword Spotting with Multi-head Frame-asynchronous Decoding
par: Xi, Yu, et autres
Publié: (2025)
par: Xi, Yu, et autres
Publié: (2025)
TDT-KWS: Fast And Accurate Keyword Spotting Using Token-and-duration Transducer
par: Xi, Yu, et autres
Publié: (2024)
par: Xi, Yu, et autres
Publié: (2024)
Phoneme-Level Contrastive Learning for User-Defined Keyword Spotting with Flexible Enrollment
par: Kewei, Li, et autres
Publié: (2024)
par: Kewei, Li, et autres
Publié: (2024)
Frequency & Channel Attention Network for Small Footprint Noisy Spoken Keyword Spotting
par: Lin, Yuanxi, et autres
Publié: (2024)
par: Lin, Yuanxi, et autres
Publié: (2024)
Self-Supervised Singing Voice Pre-Training towards Speech-to-Singing Conversion
par: Li, Ruiqi, et autres
Publié: (2024)
par: Li, Ruiqi, et autres
Publié: (2024)
Disentangled Training with Adversarial Examples For Robust Small-footprint Keyword Spotting
par: Wang, Zhenyu, et autres
Publié: (2024)
par: Wang, Zhenyu, et autres
Publié: (2024)
Advances in Small-Footprint Keyword Spotting: A Comprehensive Review of Efficient Models and Algorithms
par: Garai, Soumen, et autres
Publié: (2025)
par: Garai, Soumen, et autres
Publié: (2025)
Sparse Binarization for Fast Keyword Spotting
par: Svirsky, Jonathan, et autres
Publié: (2024)
par: Svirsky, Jonathan, et autres
Publié: (2024)
Probing Self-supervised Learning Models with Target Speech Extraction
par: Peng, Junyi, et autres
Publié: (2024)
par: Peng, Junyi, et autres
Publié: (2024)
Self-Learning for Personalized Keyword Spotting on Ultra-Low-Power Audio Sensors
par: Rusci, Manuele, et autres
Publié: (2024)
par: Rusci, Manuele, et autres
Publié: (2024)
Effective User-defined Keyword Spotting with Dual-stage Matching, Multi-modal Enrollment, and Continual Adaptation
par: Ai, Zhiqi, et autres
Publié: (2026)
par: Ai, Zhiqi, et autres
Publié: (2026)
LLM-Synth4KWS: Scalable Automatic Generation and Synthesis of Confusable Data for Custom Keyword Spotting
par: Zhu, Pai, et autres
Publié: (2025)
par: Zhu, Pai, et autres
Publié: (2025)
Improving Acoustic Word Embeddings through Correspondence Training of Self-supervised Speech Representations
par: Meghanani, Amit, et autres
Publié: (2024)
par: Meghanani, Amit, et autres
Publié: (2024)
Wav2Prompt: End-to-End Speech Prompt Generation and Tuning For LLM in Zero and Few-shot Learning
par: Deng, Keqi, et autres
Publié: (2024)
par: Deng, Keqi, et autres
Publié: (2024)
A Self-Training Approach for Whisper to Enhance Long Dysarthric Speech Recognition
par: Wang, Shiyao, et autres
Publié: (2025)
par: Wang, Shiyao, et autres
Publié: (2025)
WHISMA: A Speech-LLM to Perform Zero-shot Spoken Language Understanding
par: Li, Mohan, et autres
Publié: (2024)
par: Li, Mohan, et autres
Publié: (2024)
Robust Dual-Modal Speech Keyword Spotting for XR Headsets
par: Cai, Zhuojiang, et autres
Publié: (2024)
par: Cai, Zhuojiang, et autres
Publié: (2024)
Emotion-Coherent Speech Data Augmentation and Self-Supervised Contrastive Style Training for Enhancing Kids's Story Speech Synthesis
par: Chung, Raymond
Publié: (2026)
par: Chung, Raymond
Publié: (2026)
Exploring Prediction Targets in Masked Pre-Training for Speech Foundation Models
par: Chen, Li-Wei, et autres
Publié: (2024)
par: Chen, Li-Wei, et autres
Publié: (2024)
Zero- and Few-shot Sound Event Localization and Detection
par: Shimada, Kazuki, et autres
Publié: (2023)
par: Shimada, Kazuki, et autres
Publié: (2023)
NEST: Self-supervised Fast Conformer as All-purpose Seasoning to Speech Processing Tasks
par: Huang, He, et autres
Publié: (2024)
par: Huang, He, et autres
Publié: (2024)
Causal Speech Enhancement with Predicting Semantics based on Quantized Self-supervised Learning Features
par: Tsunoo, Emiru, et autres
Publié: (2024)
par: Tsunoo, Emiru, et autres
Publié: (2024)
Frame-Wise Breath Detection with Self-Training: An Exploration of Enhancing Breath Naturalness in Text-to-Speech
par: Yang, Dong, et autres
Publié: (2024)
par: Yang, Dong, et autres
Publié: (2024)
Documents similaires
-
EdgeSpot: Efficient and High-Performance Few-Shot Model for Keyword Spotting
par: Buyuksolak, Oguzhan, et autres
Publié: (2026) -
Contrastive Learning With Audio Discrimination For Customizable Keyword Spotting In Continuous Speech
par: Xi, Yu, et autres
Publié: (2024) -
Keyword Mamba: Spoken Keyword Spotting with State Space Models
par: Ding, Hanyu, et autres
Publié: (2025) -
Effective Integration of KAN for Keyword Spotting
par: Xu, Anfeng, et autres
Publié: (2024) -
Multichannel Keyword Spotting for Noisy Conditions
par: Saladukha, Dzmitry, et autres
Publié: (2025)