An investigation of modularity for noise robustness in conformer-based ASR
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | de Gibson, Louise Coppieters, Garner, Philip N., Honnet, Pierre-Edouard |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Bayesian Parameter-Efficient Fine-Tuning for Overcoming Catastrophic Forgetting
par: Chen, Haolin, et autres
Publié: (2024)
par: Chen, Haolin, et autres
Publié: (2024)
DNCASR: End-to-End Training for Speaker-Attributed ASR
par: Zheng, Xianrui, et autres
Publié: (2025)
par: Zheng, Xianrui, et autres
Publié: (2025)
SOT Triggered Neural Clustering for Speaker Attributed ASR
par: Zheng, Xianrui, et autres
Publié: (2024)
par: Zheng, Xianrui, et autres
Publié: (2024)
NLE: Non-autoregressive LLM-based ASR by Transcript Editing
par: Dekel, Avihu, et autres
Publié: (2026)
par: Dekel, Avihu, et autres
Publié: (2026)
DM-ASR: Diarization-aware Multi-speaker ASR with Large Language Models
par: Li, Li, et autres
Publié: (2026)
par: Li, Li, et autres
Publié: (2026)
Contextual Biasing for Streaming ASR via CTC-based Word Spotting
par: Tsai, Kai-Chen, et autres
Publié: (2026)
par: Tsai, Kai-Chen, et autres
Publié: (2026)
Self-Speculative Decoding for LLM-based ASR with CTC Encoder Drafts
par: Saon, George, et autres
Publié: (2026)
par: Saon, George, et autres
Publié: (2026)
Efficient Scaling for LLM-based ASR
par: Mu, Bingshen, et autres
Publié: (2025)
par: Mu, Bingshen, et autres
Publié: (2025)
MDM-ASR: Bridging Accuracy and Efficiency in ASR with Diffusion-Based Non-Autoregressive Decoding
par: Yen, Hao, et autres
Publié: (2026)
par: Yen, Hao, et autres
Publié: (2026)
Effects of automotive microphone frequency response characteristics and noise conditions on speech and ASR quality -- an experimental evaluation
par: Buccoli, Michele, et autres
Publié: (2025)
par: Buccoli, Michele, et autres
Publié: (2025)
Phonemes vs. Projectors: An Investigation of Speech-Language Interfaces for LLM-based ASR
par: Li, Ziwei, et autres
Publié: (2026)
par: Li, Ziwei, et autres
Publié: (2026)
All-in-One ASR: Unifying Encoder-Decoder Models of CTC, Attention, and Transducer in Dual-Mode ASR
par: Moriya, Takafumi, et autres
Publié: (2025)
par: Moriya, Takafumi, et autres
Publié: (2025)
MOSA: Mixtures of Simple Adapters Outperform Monolithic Approaches in LLM-based Multilingual ASR
par: Li, Junjie, et autres
Publié: (2025)
par: Li, Junjie, et autres
Publié: (2025)
Paraformer-v2: An improved non-autoregressive transformer for noise-robust speech recognition
par: An, Keyu, et autres
Publié: (2024)
par: An, Keyu, et autres
Publié: (2024)
Toward noise-robust whisper keyword spotting on headphones with in-earcup microphone and curriculum learning
par: Yang, Qiaoyu
Publié: (2025)
par: Yang, Qiaoyu
Publié: (2025)
Towards noise-robust speech inversion through multi-task learning with speech enhancement
par: Tabatabaee, Saba, et autres
Publié: (2026)
par: Tabatabaee, Saba, et autres
Publié: (2026)
A Bottom-up Framework with Language-universal Speech Attribute Modeling for Syllable-based ASR
par: Yen, Hao, et autres
Publié: (2025)
par: Yen, Hao, et autres
Publié: (2025)
Inverse-Hessian Regularization for Continual Learning in ASR
par: Eeckt, Steven Vander, et autres
Publié: (2026)
par: Eeckt, Steven Vander, et autres
Publié: (2026)
Towards Effective and Efficient Non-autoregressive decoders for Conformer and LLM-based ASR using Block-based Attention Mask
par: Wang, Tianzi, et autres
Publié: (2025)
par: Wang, Tianzi, et autres
Publié: (2025)
From the perspective of perceptual speech quality: The robustness of frequency bands to noise
par: Fan, Junyi, et autres
Publié: (2025)
par: Fan, Junyi, et autres
Publié: (2025)
Discrete Tokens Exhibit Interlanguage Speech Intelligibility Benefit: an Analytical Study Towards Accent-robust ASR Only with Native Speech Data
par: Onda, Kentaro, et autres
Publié: (2025)
par: Onda, Kentaro, et autres
Publié: (2025)
A microscopic investigation of the effect of random envelope fluctuations on phoneme-in-noise perception
par: Osses, Alejandro, et autres
Publié: (2024)
par: Osses, Alejandro, et autres
Publié: (2024)
XLSR-Transducer: Streaming ASR for Self-Supervised Pretrained Models
par: Kumar, Shashi, et autres
Publié: (2024)
par: Kumar, Shashi, et autres
Publié: (2024)
Towards a Single ASR Model That Generalizes to Disordered Speech
par: Tobin, Jimmy, et autres
Publié: (2024)
par: Tobin, Jimmy, et autres
Publié: (2024)
CUSIDE-T: Chunking, Simulating Future and Decoding for Transducer based Streaming ASR
par: Zhao, Wenbo, et autres
Publié: (2024)
par: Zhao, Wenbo, et autres
Publié: (2024)
Differentiable K-means for Fully-optimized Discrete Token-based ASR
par: Onda, Kentaro, et autres
Publié: (2025)
par: Onda, Kentaro, et autres
Publié: (2025)
Tandem spoofing-robust automatic speaker verification based on time-domain embeddings
par: Weizman, Avishai, et autres
Publié: (2024)
par: Weizman, Avishai, et autres
Publié: (2024)
Target Speaker ASR with Whisper
par: Polok, Alexander, et autres
Publié: (2024)
par: Polok, Alexander, et autres
Publié: (2024)
LV-CTC: Non-autoregressive ASR with CTC and latent variable models
par: Fujita, Yuya, et autres
Publié: (2024)
par: Fujita, Yuya, et autres
Publié: (2024)
Tradition or Innovation: A Comparison of Modern ASR Methods for Forced Alignment
par: Rousso, Rotem, et autres
Publié: (2024)
par: Rousso, Rotem, et autres
Publié: (2024)
Index-ASR Technical Report
par: Song, Zheshu, et autres
Publié: (2025)
par: Song, Zheshu, et autres
Publié: (2025)
MedASR: An Open-Source Model for High-Accuracy Medical Dictation
par: Wu, Ke, et autres
Publié: (2026)
par: Wu, Ke, et autres
Publié: (2026)
ASR for Affective Speech: Investigating Impact of Emotion and Speech Generative Strategy
par: Wu, Ya-Tse, et autres
Publié: (2026)
par: Wu, Ya-Tse, et autres
Publié: (2026)
FairASR: Fair Audio Contrastive Learning for Automatic Speech Recognition
par: Kim, Jongsuk, et autres
Publié: (2025)
par: Kim, Jongsuk, et autres
Publié: (2025)
Recognizing Every Voice: Towards Inclusive ASR for Rural Bhojpuri Women
par: Joshi, Sakshi, et autres
Publié: (2025)
par: Joshi, Sakshi, et autres
Publié: (2025)
Contextual Biasing for LLM-Based ASR with Hotword Retrieval and Reinforcement Learning
par: Kong, YuXiang, et autres
Publié: (2025)
par: Kong, YuXiang, et autres
Publié: (2025)
A Low-Complexity Speech Codec Using Parametric Dithering for ASR
par: Murray, Ellison, et autres
Publié: (2025)
par: Murray, Ellison, et autres
Publié: (2025)
Cascaded noise reduction and acoustic echo cancellation based on an extended noise reduction
par: Roebben, Arnout, et autres
Publié: (2024)
par: Roebben, Arnout, et autres
Publié: (2024)
SQ-Whisper: Speaker-Querying based Whisper Model for Target-Speaker ASR
par: Guo, Pengcheng, et autres
Publié: (2024)
par: Guo, Pengcheng, et autres
Publié: (2024)
Seed-ASR: Understanding Diverse Speech and Contexts with LLM-based Speech Recognition
par: Bai, Ye, et autres
Publié: (2024)
par: Bai, Ye, et autres
Publié: (2024)
Documents similaires
-
Bayesian Parameter-Efficient Fine-Tuning for Overcoming Catastrophic Forgetting
par: Chen, Haolin, et autres
Publié: (2024) -
DNCASR: End-to-End Training for Speaker-Attributed ASR
par: Zheng, Xianrui, et autres
Publié: (2025) -
SOT Triggered Neural Clustering for Speaker Attributed ASR
par: Zheng, Xianrui, et autres
Publié: (2024) -
NLE: Non-autoregressive LLM-based ASR by Transcript Editing
par: Dekel, Avihu, et autres
Publié: (2026) -
DM-ASR: Diarization-aware Multi-speaker ASR with Large Language Models
par: Li, Li, et autres
Publié: (2026)