Optimized Self-supervised Training with BEST-RQ for Speech Recognition
Fuente:
arXiv
Salvato in:
| Autori principali: | Baumann, Ilja, Wagner, Dominik, Riedhammer, Korbinian, Bocklet, Tobias |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Outlier Reduction with Gated Attention for Improved Post-training Quantization in Large Sequence-to-sequence Speech Foundation Models
di: Wagner, Dominik, et al.
Pubblicazione: (2024)
di: Wagner, Dominik, et al.
Pubblicazione: (2024)
Personalized Fine-Tuning with Controllable Synthetic Speech from LLM-Generated Transcripts for Dysarthric Speech Recognition
di: Wagner, Dominik, et al.
Pubblicazione: (2025)
di: Wagner, Dominik, et al.
Pubblicazione: (2025)
Time vs. Layer: Locating Predictive Cues for Dysarthric Speech Descriptors in wav2vec 2.0
di: Engert, Natalie, et al.
Pubblicazione: (2026)
di: Engert, Natalie, et al.
Pubblicazione: (2026)
Large Language Models for Dysfluency Detection in Stuttered Speech
di: Wagner, Dominik, et al.
Pubblicazione: (2024)
di: Wagner, Dominik, et al.
Pubblicazione: (2024)
Vocoder-Free Non-Parallel Conversion of Whispered Speech With Masked Cycle-Consistent Generative Adversarial Networks
di: Wagner, Dominik, et al.
Pubblicazione: (2023)
di: Wagner, Dominik, et al.
Pubblicazione: (2023)
Adapter-Based Multi-Agent AVSR Extension for Pre-Trained ASR Models
di: Simic, Christopher, et al.
Pubblicazione: (2025)
di: Simic, Christopher, et al.
Pubblicazione: (2025)
Shared Multi-modal Embedding Space for Face-Voice Association
di: Simic, Christopher, et al.
Pubblicazione: (2025)
di: Simic, Christopher, et al.
Pubblicazione: (2025)
Optimized Speculative Sampling for GPU Hardware Accelerators
di: Wagner, Dominik, et al.
Pubblicazione: (2024)
di: Wagner, Dominik, et al.
Pubblicazione: (2024)
M-BEST-RQ: A Multi-Channel Speech Foundation Model for Smart Glasses
di: Yang, Yufeng, et al.
Pubblicazione: (2024)
di: Yang, Yufeng, et al.
Pubblicazione: (2024)
Detecting Dysfluencies in Stuttering Therapy Using wav2vec 2.0
di: Bayerl, Sebastian P., et al.
Pubblicazione: (2022)
di: Bayerl, Sebastian P., et al.
Pubblicazione: (2022)
Infusing Acoustic Pause Context into Text-Based Dementia Assessment
di: Braun, Franziska, et al.
Pubblicazione: (2024)
di: Braun, Franziska, et al.
Pubblicazione: (2024)
An Analysis of Linear Complexity Attention Substitutes with BEST-RQ
di: Whetten, Ryan, et al.
Pubblicazione: (2024)
di: Whetten, Ryan, et al.
Pubblicazione: (2024)
BiRQ: Bi-Level Self-Labeling Random Quantization for Self-Supervised Speech Recognition
di: Jiang, Liuyuan, et al.
Pubblicazione: (2025)
di: Jiang, Liuyuan, et al.
Pubblicazione: (2025)
A Survey of Music Generation in the Context of Interaction
di: Agchar, Ismael, et al.
Pubblicazione: (2024)
di: Agchar, Ismael, et al.
Pubblicazione: (2024)
Generalizing to Unseen Disaster Events: A Causal View
di: Seeberger, Philipp, et al.
Pubblicazione: (2025)
di: Seeberger, Philipp, et al.
Pubblicazione: (2025)
Reading Between the Waves: Robust Topic Segmentation Using Inter-Sentence Audio Features
di: Freisinger, Steffen, et al.
Pubblicazione: (2026)
di: Freisinger, Steffen, et al.
Pubblicazione: (2026)
On the Difficulty of Token-Level Modeling of Dysfluency and Fluency Shaping Artifacts
di: Gulzar, Kashaf, et al.
Pubblicazione: (2025)
di: Gulzar, Kashaf, et al.
Pubblicazione: (2025)
Self-supervised ASR Models and Features For Dysarthric and Elderly Speech Recognition
di: Hu, Shujie, et al.
Pubblicazione: (2024)
di: Hu, Shujie, et al.
Pubblicazione: (2024)
SSHR: Leveraging Self-supervised Hierarchical Representations for Multilingual Automatic Speech Recognition
di: Xue, Hongfei, et al.
Pubblicazione: (2023)
di: Xue, Hongfei, et al.
Pubblicazione: (2023)
OMAR-RQ: Open Music Audio Representation Model Trained with Multi-Feature Masked Token Prediction
di: Alonso-Jiménez, Pablo, et al.
Pubblicazione: (2025)
di: Alonso-Jiménez, Pablo, et al.
Pubblicazione: (2025)
Measuring the Accuracy of Automatic Speech Recognition Solutions
di: Kuhn, Korbinian, et al.
Pubblicazione: (2024)
di: Kuhn, Korbinian, et al.
Pubblicazione: (2024)
MMUTF: Multimodal Multimedia Event Argument Extraction with Unified Template Filling
di: Seeberger, Philipp, et al.
Pubblicazione: (2024)
di: Seeberger, Philipp, et al.
Pubblicazione: (2024)
Communication Access Real-Time Translation Through Collaborative Correction of Automatic Speech Recognition
di: Kuhn, Korbinian, et al.
Pubblicazione: (2025)
di: Kuhn, Korbinian, et al.
Pubblicazione: (2025)
A Self-Training Approach for Whisper to Enhance Long Dysarthric Speech Recognition
di: Wang, Shiyao, et al.
Pubblicazione: (2025)
di: Wang, Shiyao, et al.
Pubblicazione: (2025)
Towards Multi-Level Transcript Segmentation: LoRA Fine-Tuning for Table-of-Contents Generation
di: Freisinger, Steffen, et al.
Pubblicazione: (2026)
di: Freisinger, Steffen, et al.
Pubblicazione: (2026)
Improving Acoustic Word Embeddings through Correspondence Training of Self-supervised Speech Representations
di: Meghanani, Amit, et al.
Pubblicazione: (2024)
di: Meghanani, Amit, et al.
Pubblicazione: (2024)
Probing Self-supervised Learning Models with Target Speech Extraction
di: Peng, Junyi, et al.
Pubblicazione: (2024)
di: Peng, Junyi, et al.
Pubblicazione: (2024)
SuPseudo: A Pseudo-supervised Learning Method for Neural Speech Enhancement in Far-field Speech Recognition
di: Luo, Longjie, et al.
Pubblicazione: (2025)
di: Luo, Longjie, et al.
Pubblicazione: (2025)
Open Implementation and Study of BEST-RQ for Speech Processing
di: Whetten, Ryan, et al.
Pubblicazione: (2024)
di: Whetten, Ryan, et al.
Pubblicazione: (2024)
Target Speech Extraction with Pre-trained Self-supervised Learning Models
di: Peng, Junyi, et al.
Pubblicazione: (2024)
di: Peng, Junyi, et al.
Pubblicazione: (2024)
Enhancing Few-shot Keyword Spotting Performance through Pre-Trained Self-supervised Speech Models
di: Gok, Alican, et al.
Pubblicazione: (2025)
di: Gok, Alican, et al.
Pubblicazione: (2025)
Training Data Augmentation for Dysarthric Automatic Speech Recognition by Text-to-Dysarthric-Speech Synthesis
di: Leung, Wing-Zin, et al.
Pubblicazione: (2024)
di: Leung, Wing-Zin, et al.
Pubblicazione: (2024)
ZMM-TTS: Zero-shot Multilingual and Multispeaker Speech Synthesis Conditioned on Self-supervised Discrete Speech Representations
di: Gong, Cheng, et al.
Pubblicazione: (2023)
di: Gong, Cheng, et al.
Pubblicazione: (2023)
Self-supervised Multimodal Speech Representations for the Assessment of Schizophrenia Symptoms
di: Premananth, Gowtham, et al.
Pubblicazione: (2024)
di: Premananth, Gowtham, et al.
Pubblicazione: (2024)
Position-invariant Fine-tuning of Speech Enhancement Models with Self-supervised Speech Representations
di: Meghanani, Amit, et al.
Pubblicazione: (2026)
di: Meghanani, Amit, et al.
Pubblicazione: (2026)
Self-supervised Speech Models for Word-Level Stuttered Speech Detection
di: Shih, Yi-Jen, et al.
Pubblicazione: (2024)
di: Shih, Yi-Jen, et al.
Pubblicazione: (2024)
NEST: Self-supervised Fast Conformer as All-purpose Seasoning to Speech Processing Tasks
di: Huang, He, et al.
Pubblicazione: (2024)
di: Huang, He, et al.
Pubblicazione: (2024)
Causal Speech Enhancement with Predicting Semantics based on Quantized Self-supervised Learning Features
di: Tsunoo, Emiru, et al.
Pubblicazione: (2024)
di: Tsunoo, Emiru, et al.
Pubblicazione: (2024)
Multi-Channel Speech Enhancement for Cocktail Party Speech Emotion Recognition
di: Chen, Youjun, et al.
Pubblicazione: (2026)
di: Chen, Youjun, et al.
Pubblicazione: (2026)
Multilingual Zero Resource Speech Recognition Base on Self-Supervise Pre-Trained Acoustic Models
di: Wang, Haoyu, et al.
Pubblicazione: (2022)
di: Wang, Haoyu, et al.
Pubblicazione: (2022)
Documenti analoghi
-
Outlier Reduction with Gated Attention for Improved Post-training Quantization in Large Sequence-to-sequence Speech Foundation Models
di: Wagner, Dominik, et al.
Pubblicazione: (2024) -
Personalized Fine-Tuning with Controllable Synthetic Speech from LLM-Generated Transcripts for Dysarthric Speech Recognition
di: Wagner, Dominik, et al.
Pubblicazione: (2025) -
Time vs. Layer: Locating Predictive Cues for Dysarthric Speech Descriptors in wav2vec 2.0
di: Engert, Natalie, et al.
Pubblicazione: (2026) -
Large Language Models for Dysfluency Detection in Stuttered Speech
di: Wagner, Dominik, et al.
Pubblicazione: (2024) -
Vocoder-Free Non-Parallel Conversion of Whispered Speech With Masked Cycle-Consistent Generative Adversarial Networks
di: Wagner, Dominik, et al.
Pubblicazione: (2023)