An investigation of modularity for noise robustness in conformer-based ASR
Fuente:
arXiv
Salvato in:
| Autori principali: | de Gibson, Louise Coppieters, Garner, Philip N., Honnet, Pierre-Edouard |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Bayesian Parameter-Efficient Fine-Tuning for Overcoming Catastrophic Forgetting
di: Chen, Haolin, et al.
Pubblicazione: (2024)
di: Chen, Haolin, et al.
Pubblicazione: (2024)
DNCASR: End-to-End Training for Speaker-Attributed ASR
di: Zheng, Xianrui, et al.
Pubblicazione: (2025)
di: Zheng, Xianrui, et al.
Pubblicazione: (2025)
SOT Triggered Neural Clustering for Speaker Attributed ASR
di: Zheng, Xianrui, et al.
Pubblicazione: (2024)
di: Zheng, Xianrui, et al.
Pubblicazione: (2024)
NLE: Non-autoregressive LLM-based ASR by Transcript Editing
di: Dekel, Avihu, et al.
Pubblicazione: (2026)
di: Dekel, Avihu, et al.
Pubblicazione: (2026)
DM-ASR: Diarization-aware Multi-speaker ASR with Large Language Models
di: Li, Li, et al.
Pubblicazione: (2026)
di: Li, Li, et al.
Pubblicazione: (2026)
Contextual Biasing for Streaming ASR via CTC-based Word Spotting
di: Tsai, Kai-Chen, et al.
Pubblicazione: (2026)
di: Tsai, Kai-Chen, et al.
Pubblicazione: (2026)
Self-Speculative Decoding for LLM-based ASR with CTC Encoder Drafts
di: Saon, George, et al.
Pubblicazione: (2026)
di: Saon, George, et al.
Pubblicazione: (2026)
Efficient Scaling for LLM-based ASR
di: Mu, Bingshen, et al.
Pubblicazione: (2025)
di: Mu, Bingshen, et al.
Pubblicazione: (2025)
MDM-ASR: Bridging Accuracy and Efficiency in ASR with Diffusion-Based Non-Autoregressive Decoding
di: Yen, Hao, et al.
Pubblicazione: (2026)
di: Yen, Hao, et al.
Pubblicazione: (2026)
Effects of automotive microphone frequency response characteristics and noise conditions on speech and ASR quality -- an experimental evaluation
di: Buccoli, Michele, et al.
Pubblicazione: (2025)
di: Buccoli, Michele, et al.
Pubblicazione: (2025)
Phonemes vs. Projectors: An Investigation of Speech-Language Interfaces for LLM-based ASR
di: Li, Ziwei, et al.
Pubblicazione: (2026)
di: Li, Ziwei, et al.
Pubblicazione: (2026)
All-in-One ASR: Unifying Encoder-Decoder Models of CTC, Attention, and Transducer in Dual-Mode ASR
di: Moriya, Takafumi, et al.
Pubblicazione: (2025)
di: Moriya, Takafumi, et al.
Pubblicazione: (2025)
MOSA: Mixtures of Simple Adapters Outperform Monolithic Approaches in LLM-based Multilingual ASR
di: Li, Junjie, et al.
Pubblicazione: (2025)
di: Li, Junjie, et al.
Pubblicazione: (2025)
Paraformer-v2: An improved non-autoregressive transformer for noise-robust speech recognition
di: An, Keyu, et al.
Pubblicazione: (2024)
di: An, Keyu, et al.
Pubblicazione: (2024)
Toward noise-robust whisper keyword spotting on headphones with in-earcup microphone and curriculum learning
di: Yang, Qiaoyu
Pubblicazione: (2025)
di: Yang, Qiaoyu
Pubblicazione: (2025)
Towards noise-robust speech inversion through multi-task learning with speech enhancement
di: Tabatabaee, Saba, et al.
Pubblicazione: (2026)
di: Tabatabaee, Saba, et al.
Pubblicazione: (2026)
A Bottom-up Framework with Language-universal Speech Attribute Modeling for Syllable-based ASR
di: Yen, Hao, et al.
Pubblicazione: (2025)
di: Yen, Hao, et al.
Pubblicazione: (2025)
Inverse-Hessian Regularization for Continual Learning in ASR
di: Eeckt, Steven Vander, et al.
Pubblicazione: (2026)
di: Eeckt, Steven Vander, et al.
Pubblicazione: (2026)
Towards Effective and Efficient Non-autoregressive decoders for Conformer and LLM-based ASR using Block-based Attention Mask
di: Wang, Tianzi, et al.
Pubblicazione: (2025)
di: Wang, Tianzi, et al.
Pubblicazione: (2025)
From the perspective of perceptual speech quality: The robustness of frequency bands to noise
di: Fan, Junyi, et al.
Pubblicazione: (2025)
di: Fan, Junyi, et al.
Pubblicazione: (2025)
Discrete Tokens Exhibit Interlanguage Speech Intelligibility Benefit: an Analytical Study Towards Accent-robust ASR Only with Native Speech Data
di: Onda, Kentaro, et al.
Pubblicazione: (2025)
di: Onda, Kentaro, et al.
Pubblicazione: (2025)
A microscopic investigation of the effect of random envelope fluctuations on phoneme-in-noise perception
di: Osses, Alejandro, et al.
Pubblicazione: (2024)
di: Osses, Alejandro, et al.
Pubblicazione: (2024)
XLSR-Transducer: Streaming ASR for Self-Supervised Pretrained Models
di: Kumar, Shashi, et al.
Pubblicazione: (2024)
di: Kumar, Shashi, et al.
Pubblicazione: (2024)
Towards a Single ASR Model That Generalizes to Disordered Speech
di: Tobin, Jimmy, et al.
Pubblicazione: (2024)
di: Tobin, Jimmy, et al.
Pubblicazione: (2024)
CUSIDE-T: Chunking, Simulating Future and Decoding for Transducer based Streaming ASR
di: Zhao, Wenbo, et al.
Pubblicazione: (2024)
di: Zhao, Wenbo, et al.
Pubblicazione: (2024)
Differentiable K-means for Fully-optimized Discrete Token-based ASR
di: Onda, Kentaro, et al.
Pubblicazione: (2025)
di: Onda, Kentaro, et al.
Pubblicazione: (2025)
Tandem spoofing-robust automatic speaker verification based on time-domain embeddings
di: Weizman, Avishai, et al.
Pubblicazione: (2024)
di: Weizman, Avishai, et al.
Pubblicazione: (2024)
Target Speaker ASR with Whisper
di: Polok, Alexander, et al.
Pubblicazione: (2024)
di: Polok, Alexander, et al.
Pubblicazione: (2024)
LV-CTC: Non-autoregressive ASR with CTC and latent variable models
di: Fujita, Yuya, et al.
Pubblicazione: (2024)
di: Fujita, Yuya, et al.
Pubblicazione: (2024)
Tradition or Innovation: A Comparison of Modern ASR Methods for Forced Alignment
di: Rousso, Rotem, et al.
Pubblicazione: (2024)
di: Rousso, Rotem, et al.
Pubblicazione: (2024)
Index-ASR Technical Report
di: Song, Zheshu, et al.
Pubblicazione: (2025)
di: Song, Zheshu, et al.
Pubblicazione: (2025)
MedASR: An Open-Source Model for High-Accuracy Medical Dictation
di: Wu, Ke, et al.
Pubblicazione: (2026)
di: Wu, Ke, et al.
Pubblicazione: (2026)
ASR for Affective Speech: Investigating Impact of Emotion and Speech Generative Strategy
di: Wu, Ya-Tse, et al.
Pubblicazione: (2026)
di: Wu, Ya-Tse, et al.
Pubblicazione: (2026)
FairASR: Fair Audio Contrastive Learning for Automatic Speech Recognition
di: Kim, Jongsuk, et al.
Pubblicazione: (2025)
di: Kim, Jongsuk, et al.
Pubblicazione: (2025)
Recognizing Every Voice: Towards Inclusive ASR for Rural Bhojpuri Women
di: Joshi, Sakshi, et al.
Pubblicazione: (2025)
di: Joshi, Sakshi, et al.
Pubblicazione: (2025)
Contextual Biasing for LLM-Based ASR with Hotword Retrieval and Reinforcement Learning
di: Kong, YuXiang, et al.
Pubblicazione: (2025)
di: Kong, YuXiang, et al.
Pubblicazione: (2025)
A Low-Complexity Speech Codec Using Parametric Dithering for ASR
di: Murray, Ellison, et al.
Pubblicazione: (2025)
di: Murray, Ellison, et al.
Pubblicazione: (2025)
Cascaded noise reduction and acoustic echo cancellation based on an extended noise reduction
di: Roebben, Arnout, et al.
Pubblicazione: (2024)
di: Roebben, Arnout, et al.
Pubblicazione: (2024)
SQ-Whisper: Speaker-Querying based Whisper Model for Target-Speaker ASR
di: Guo, Pengcheng, et al.
Pubblicazione: (2024)
di: Guo, Pengcheng, et al.
Pubblicazione: (2024)
Seed-ASR: Understanding Diverse Speech and Contexts with LLM-based Speech Recognition
di: Bai, Ye, et al.
Pubblicazione: (2024)
di: Bai, Ye, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Bayesian Parameter-Efficient Fine-Tuning for Overcoming Catastrophic Forgetting
di: Chen, Haolin, et al.
Pubblicazione: (2024) -
DNCASR: End-to-End Training for Speaker-Attributed ASR
di: Zheng, Xianrui, et al.
Pubblicazione: (2025) -
SOT Triggered Neural Clustering for Speaker Attributed ASR
di: Zheng, Xianrui, et al.
Pubblicazione: (2024) -
NLE: Non-autoregressive LLM-based ASR by Transcript Editing
di: Dekel, Avihu, et al.
Pubblicazione: (2026) -
DM-ASR: Diarization-aware Multi-speaker ASR with Large Language Models
di: Li, Li, et al.
Pubblicazione: (2026)