Exploring SSL Discrete Speech Features for Zipformer-based Contextual ASR
Fuente:
arXiv
Salvato in:
| Autori principali: | Cui, Mingyu, Yang, Yifan, Deng, Jiajun, Kang, Jiawen, Hu, Shujie, Wang, Tianzi, Li, Zhaoqing, Zhang, Shiliang, Chen, Xie, Liu, Xunying |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Exploring SSL Discrete Tokens for Multilingual ASR
di: Cui, Mingyu, et al.
Pubblicazione: (2024)
di: Cui, Mingyu, et al.
Pubblicazione: (2024)
Self-supervised ASR Models and Features For Dysarthric and Elderly Speech Recognition
di: Hu, Shujie, et al.
Pubblicazione: (2024)
di: Hu, Shujie, et al.
Pubblicazione: (2024)
Structured Speaker-Deficiency Adaptation of Foundation Models for Dysarthric and Elderly Speech Recognition
di: Hu, Shujie, et al.
Pubblicazione: (2024)
di: Hu, Shujie, et al.
Pubblicazione: (2024)
Phone-purity Guided Discrete Tokens for Dysarthric Speech Recognition
di: Wang, Huimeng, et al.
Pubblicazione: (2025)
di: Wang, Huimeng, et al.
Pubblicazione: (2025)
Towards One-bit ASR: Extremely Low-bit Conformer Quantization Using Co-training and Stochastic Precision
di: Li, Zhaoqing, et al.
Pubblicazione: (2025)
di: Li, Zhaoqing, et al.
Pubblicazione: (2025)
One-pass Multiple Conformer and Foundation Speech Systems Compression and Quantization Using An All-in-one Neural Model
di: Li, Zhaoqing, et al.
Pubblicazione: (2024)
di: Li, Zhaoqing, et al.
Pubblicazione: (2024)
On-the-fly Routing for Zero-shot MoE Speaker Adaptation of Speech Foundation Models for Dysarthric Speech Recognition
di: HU, Shujie, et al.
Pubblicazione: (2025)
di: HU, Shujie, et al.
Pubblicazione: (2025)
Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems
di: Cui, Mingyu, et al.
Pubblicazione: (2025)
di: Cui, Mingyu, et al.
Pubblicazione: (2025)
Joint Speaker Features Learning for Audio-visual Multichannel Speech Separation and Recognition
di: Li, Guinan, et al.
Pubblicazione: (2024)
di: Li, Guinan, et al.
Pubblicazione: (2024)
Enhancing Pre-trained ASR System Fine-tuning for Dysarthric Speech Recognition using Adversarial Data Augmentation
di: Wang, Huimeng, et al.
Pubblicazione: (2024)
di: Wang, Huimeng, et al.
Pubblicazione: (2024)
Unfolding A Few Structures for The Many: Memory-Efficient Compression of Conformer and Speech Foundation Models
di: Li, Zhaoqing, et al.
Pubblicazione: (2025)
di: Li, Zhaoqing, et al.
Pubblicazione: (2025)
Towards Effective and Efficient Non-autoregressive Decoding Using Block-based Attention Mask
di: Wang, Tianzi, et al.
Pubblicazione: (2024)
di: Wang, Tianzi, et al.
Pubblicazione: (2024)
Effective and Efficient Mixed Precision Quantization of Speech Foundation Models
di: Xu, Haoning, et al.
Pubblicazione: (2025)
di: Xu, Haoning, et al.
Pubblicazione: (2025)
Homogeneous Speaker Features for On-the-Fly Dysarthric and Elderly Speaker Adaptation
di: Geng, Mengzhe, et al.
Pubblicazione: (2024)
di: Geng, Mengzhe, et al.
Pubblicazione: (2024)
Unifying Streaming and Non-streaming Zipformer-based ASR
di: Sharma, Bidisha, et al.
Pubblicazione: (2025)
di: Sharma, Bidisha, et al.
Pubblicazione: (2025)
Disentangling Speakers in Multi-Talker Speech Recognition with Speaker-Aware CTC
di: Kang, Jiawen, et al.
Pubblicazione: (2024)
di: Kang, Jiawen, et al.
Pubblicazione: (2024)
Large Language Model Can Transcribe Speech in Multi-Talker Scenarios with Versatile Instructions
di: Meng, Lingwei, et al.
Pubblicazione: (2024)
di: Meng, Lingwei, et al.
Pubblicazione: (2024)
Towards Effective and Efficient Non-autoregressive decoders for Conformer and LLM-based ASR using Block-based Attention Mask
di: Wang, Tianzi, et al.
Pubblicazione: (2025)
di: Wang, Tianzi, et al.
Pubblicazione: (2025)
UNISON: A Unified Sound Generation and Editing Framework via Deep LLM Fusion
di: Li, Zhaoqing, et al.
Pubblicazione: (2026)
di: Li, Zhaoqing, et al.
Pubblicazione: (2026)
SOA: Reducing Domain Mismatch in SSL Pipeline by Speech Only Adaptation for Low Resource ASR
di: Shankar, Natarajan Balaji, et al.
Pubblicazione: (2024)
di: Shankar, Natarajan Balaji, et al.
Pubblicazione: (2024)
Cross-Speaker Encoding Network for Multi-Talker Speech Recognition
di: Kang, Jiawen, et al.
Pubblicazione: (2024)
di: Kang, Jiawen, et al.
Pubblicazione: (2024)
ZipEnhancer: Dual-Path Down-Up Sampling-based Zipformer for Monaural Speech Enhancement
di: Wang, Haoxu, et al.
Pubblicazione: (2025)
di: Wang, Haoxu, et al.
Pubblicazione: (2025)
Efficient Adapter Tuning for Joint Singing Voice Beat and Downbeat Tracking with Self-supervised Learning Features
di: Deng, Jiajun, et al.
Pubblicazione: (2025)
di: Deng, Jiajun, et al.
Pubblicazione: (2025)
Zipformer: A faster and better encoder for automatic speech recognition
di: Yao, Zengwei, et al.
Pubblicazione: (2023)
di: Yao, Zengwei, et al.
Pubblicazione: (2023)
Variational Auto-Encoder Based Variability Encoding for Dysarthric Speech Recognition
di: Xie, Xurong, et al.
Pubblicazione: (2022)
di: Xie, Xurong, et al.
Pubblicazione: (2022)
Investigation of Deep Neural Network Acoustic Modelling Approaches for Low Resource Accented Mandarin Speech Recognition
di: Xie, Xurong, et al.
Pubblicazione: (2022)
di: Xie, Xurong, et al.
Pubblicazione: (2022)
UniEnc-CASSNAT: An Encoder-only Non-autoregressive ASR for Speech SSL Models
di: Fan, Ruchao, et al.
Pubblicazione: (2024)
di: Fan, Ruchao, et al.
Pubblicazione: (2024)
GigaSpeech 2: An Evolving, Large-Scale and Multi-domain ASR Corpus for Low-Resource Languages with Automated Crawling, Transcription and Refinement
di: Yang, Yifan, et al.
Pubblicazione: (2024)
di: Yang, Yifan, et al.
Pubblicazione: (2024)
Effective and Efficient One-pass Compression of Speech Foundation Models Using Sparsity-aware Self-pinching Gates
di: Xu, Haoning, et al.
Pubblicazione: (2025)
di: Xu, Haoning, et al.
Pubblicazione: (2025)
Regularized Federated Learning for Privacy-Preserving Dysarthric and Elderly Speech Recognition
di: Zhong, Tao, et al.
Pubblicazione: (2025)
di: Zhong, Tao, et al.
Pubblicazione: (2025)
Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition
di: Chen, Youjun, et al.
Pubblicazione: (2025)
di: Chen, Youjun, et al.
Pubblicazione: (2025)
ContextASR-Bench: A Massive Contextual Speech Recognition Benchmark
di: Wang, He, et al.
Pubblicazione: (2025)
di: Wang, He, et al.
Pubblicazione: (2025)
Empowering Whisper as a Joint Multi-Talker and Target-Talker Speech Recognition System
di: Meng, Lingwei, et al.
Pubblicazione: (2024)
di: Meng, Lingwei, et al.
Pubblicazione: (2024)
Exploiting Audio-Visual Features with Pretrained AV-HuBERT for Multi-Modal Dysarthric Speech Reconstruction
di: Chen, Xueyuan, et al.
Pubblicazione: (2024)
di: Chen, Xueyuan, et al.
Pubblicazione: (2024)
Loss Masking Is Not Needed in Decoder-only Transformer for Discrete-token-based ASR
di: Chen, Qian, et al.
Pubblicazione: (2023)
di: Chen, Qian, et al.
Pubblicazione: (2023)
Perceiver-Prompt: Flexible Speaker Adaptation in Whisper for Chinese Disordered Speech Recognition
di: Jiang, Yicong, et al.
Pubblicazione: (2024)
di: Jiang, Yicong, et al.
Pubblicazione: (2024)
BR-ASR: Efficient and Scalable Bias Retrieval Framework for Contextual Biasing ASR in Speech LLM
di: Gong, Xun, et al.
Pubblicazione: (2025)
di: Gong, Xun, et al.
Pubblicazione: (2025)
Crossmodal ASR Error Correction with Discrete Speech Units
di: Li, Yuanchao, et al.
Pubblicazione: (2024)
di: Li, Yuanchao, et al.
Pubblicazione: (2024)
Discrete Tokens Exhibit Interlanguage Speech Intelligibility Benefit: an Analytical Study Towards Accent-robust ASR Only with Native Speech Data
di: Onda, Kentaro, et al.
Pubblicazione: (2025)
di: Onda, Kentaro, et al.
Pubblicazione: (2025)
Personalized Adversarial Data Augmentation for Dysarthric and Elderly Speech Recognition
di: Jin, Zengrui, et al.
Pubblicazione: (2022)
di: Jin, Zengrui, et al.
Pubblicazione: (2022)
Documenti analoghi
-
Exploring SSL Discrete Tokens for Multilingual ASR
di: Cui, Mingyu, et al.
Pubblicazione: (2024) -
Self-supervised ASR Models and Features For Dysarthric and Elderly Speech Recognition
di: Hu, Shujie, et al.
Pubblicazione: (2024) -
Structured Speaker-Deficiency Adaptation of Foundation Models for Dysarthric and Elderly Speech Recognition
di: Hu, Shujie, et al.
Pubblicazione: (2024) -
Phone-purity Guided Discrete Tokens for Dysarthric Speech Recognition
di: Wang, Huimeng, et al.
Pubblicazione: (2025) -
Towards One-bit ASR: Extremely Low-bit Conformer Quantization Using Co-training and Stochastic Precision
di: Li, Zhaoqing, et al.
Pubblicazione: (2025)