DEFORMER: Coupling Deformed Localized Patterns with Global Context for Robust End-to-end Speech Recognition
Fuente:
arXiv
Salvato in:
| Autori principali: | Xie, Jiamin, Hansen, John H. L. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2022
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MixRep: Hidden Representation Mixup for Low-Resource Speech Recognition
di: Xie, Jiamin, et al.
Pubblicazione: (2023)
di: Xie, Jiamin, et al.
Pubblicazione: (2023)
Speech Recognition on TV Series with Video-guided Post-ASR Correction
di: Yang, Haoyuan, et al.
Pubblicazione: (2025)
di: Yang, Haoyuan, et al.
Pubblicazione: (2025)
Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition
di: Xie, Jiamin, et al.
Pubblicazione: (2025)
di: Xie, Jiamin, et al.
Pubblicazione: (2025)
Bridging the Modality Gap: Softly Discretizing Audio Representation for LLM-based Automatic Speech Recognition
di: Yang, Mu, et al.
Pubblicazione: (2025)
di: Yang, Mu, et al.
Pubblicazione: (2025)
Toward Improving Synthetic Audio Spoofing Detection Robustness via Meta-Learning and Disentangled Training With Adversarial Examples
di: Wang, Zhenyu, et al.
Pubblicazione: (2024)
di: Wang, Zhenyu, et al.
Pubblicazione: (2024)
YOLO-Stutter: End-to-end Region-Wise Speech Dysfluency Detection
di: Zhou, Xuanru, et al.
Pubblicazione: (2024)
di: Zhou, Xuanru, et al.
Pubblicazione: (2024)
Qifusion-Net: Layer-adapted Stream/Non-stream Model for End-to-End Multi-Accent Speech Recognition
di: Chen, Jinming, et al.
Pubblicazione: (2024)
di: Chen, Jinming, et al.
Pubblicazione: (2024)
Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition
di: Tzeng, Jing-Tong, et al.
Pubblicazione: (2025)
di: Tzeng, Jing-Tong, et al.
Pubblicazione: (2025)
ACES: Accent Subspaces for Coupling, Explanations, and Stress-Testing in Automatic Speech Recognition
di: Parekh, Swapnil
Pubblicazione: (2026)
di: Parekh, Swapnil
Pubblicazione: (2026)
Time and Tokens: Benchmarking End-to-End Speech Dysfluency Detection
di: Zhou, Xuanru, et al.
Pubblicazione: (2024)
di: Zhou, Xuanru, et al.
Pubblicazione: (2024)
Privacy-Preserving End-to-End Full-Duplex Speech Dialogue Models
di: Kuzmin, Nikita, et al.
Pubblicazione: (2026)
di: Kuzmin, Nikita, et al.
Pubblicazione: (2026)
Stutter-Solver: End-to-end Multi-lingual Dysfluency Detection
di: Zhou, Xuanru, et al.
Pubblicazione: (2024)
di: Zhou, Xuanru, et al.
Pubblicazione: (2024)
Survey of End-to-End Multi-Speaker Automatic Speech Recognition for Monaural Audio
di: He, Xinlu, et al.
Pubblicazione: (2025)
di: He, Xinlu, et al.
Pubblicazione: (2025)
Personalized Adversarial Data Augmentation for Dysarthric and Elderly Speech Recognition
di: Jin, Zengrui, et al.
Pubblicazione: (2022)
di: Jin, Zengrui, et al.
Pubblicazione: (2022)
End-to-end multi-channel speaker extraction and binaural speech synthesis
di: Chi, Cheng, et al.
Pubblicazione: (2024)
di: Chi, Cheng, et al.
Pubblicazione: (2024)
Open Source State-Of-the-Art Solution for Romanian Speech Recognition
di: Pirlogeanu, Gabriel, et al.
Pubblicazione: (2025)
di: Pirlogeanu, Gabriel, et al.
Pubblicazione: (2025)
Neural Blind Source Separation and Diarization for Distant Speech Recognition
di: Bando, Yoshiaki, et al.
Pubblicazione: (2024)
di: Bando, Yoshiaki, et al.
Pubblicazione: (2024)
Qieemo: Speech Is All You Need in the Emotion Recognition in Conversations
di: Chen, Jinming, et al.
Pubblicazione: (2025)
di: Chen, Jinming, et al.
Pubblicazione: (2025)
Improving Code-Switching Speech Recognition with TTS Data Augmentation
di: Yeo, Yue Heng, et al.
Pubblicazione: (2026)
di: Yeo, Yue Heng, et al.
Pubblicazione: (2026)
Enhancing Audiovisual Speech Recognition through Bifocal Preference Optimization
di: Wu, Yihan, et al.
Pubblicazione: (2024)
di: Wu, Yihan, et al.
Pubblicazione: (2024)
Variational Low-Rank Adaptation for Personalized Impaired Speech Recognition
di: Pokel, Niclas, et al.
Pubblicazione: (2025)
di: Pokel, Niclas, et al.
Pubblicazione: (2025)
Integrating Pre-Trained Speech and Language Models for End-to-End Speech Recognition
di: Hono, Yukiya, et al.
Pubblicazione: (2023)
di: Hono, Yukiya, et al.
Pubblicazione: (2023)
TinyML for Speech Recognition
di: Barovic, Andrew, et al.
Pubblicazione: (2025)
di: Barovic, Andrew, et al.
Pubblicazione: (2025)
Gesture-Aware Zero-Shot Speech Recognition for Patients with Language Disorders
di: Kim, Seungbae, et al.
Pubblicazione: (2025)
di: Kim, Seungbae, et al.
Pubblicazione: (2025)
AS-ASR: A Lightweight Framework for Aphasia-Specific Automatic Speech Recognition
di: Bao, Chen, et al.
Pubblicazione: (2025)
di: Bao, Chen, et al.
Pubblicazione: (2025)
Lightweight End-to-end Text-to-speech Synthesis for low resource on-device applications
di: Vecino, Biel Tura, et al.
Pubblicazione: (2025)
di: Vecino, Biel Tura, et al.
Pubblicazione: (2025)
HuBERT-VIC: Improving Noise-Robust Automatic Speech Recognition of Speech Foundation Model via Variance-Invariance-Covariance Regularization
di: Ahn, Hyebin, et al.
Pubblicazione: (2025)
di: Ahn, Hyebin, et al.
Pubblicazione: (2025)
Towards Robust Speech Recognition for Jamaican Patois Music Transcription
di: Madden, Jordan, et al.
Pubblicazione: (2025)
di: Madden, Jordan, et al.
Pubblicazione: (2025)
Clustering and Mining Accented Speech for Inclusive and Fair Speech Recognition
di: Kim, Jaeyoung, et al.
Pubblicazione: (2024)
di: Kim, Jaeyoung, et al.
Pubblicazione: (2024)
The NPU-ASLP-LiAuto System Description for Visual Speech Recognition in CNVSRC 2023
di: Wang, He, et al.
Pubblicazione: (2024)
di: Wang, He, et al.
Pubblicazione: (2024)
MLCA-AVSR: Multi-Layer Cross Attention Fusion based Audio-Visual Speech Recognition
di: Wang, He, et al.
Pubblicazione: (2024)
di: Wang, He, et al.
Pubblicazione: (2024)
Wave-U-Mamba: An End-To-End Framework For High-Quality And Efficient Speech Super Resolution
di: Lee, Yongjoon, et al.
Pubblicazione: (2024)
di: Lee, Yongjoon, et al.
Pubblicazione: (2024)
Continual Test-time Adaptation for End-to-end Speech Recognition on Noisy Speech
di: Lin, Guan-Ting, et al.
Pubblicazione: (2024)
di: Lin, Guan-Ting, et al.
Pubblicazione: (2024)
Disentangled-Transformer: An Explainable End-to-End Automatic Speech Recognition Model with Speech Content-Context Separation
di: Wang, Pu, et al.
Pubblicazione: (2024)
di: Wang, Pu, et al.
Pubblicazione: (2024)
Self-supervised ASR Models and Features For Dysarthric and Elderly Speech Recognition
di: Hu, Shujie, et al.
Pubblicazione: (2024)
di: Hu, Shujie, et al.
Pubblicazione: (2024)
A Survey of Deep Learning for Complex Speech Spectrograms
di: Xie, Yuying, et al.
Pubblicazione: (2025)
di: Xie, Yuying, et al.
Pubblicazione: (2025)
Perceiver-Prompt: Flexible Speaker Adaptation in Whisper for Chinese Disordered Speech Recognition
di: Jiang, Yicong, et al.
Pubblicazione: (2024)
di: Jiang, Yicong, et al.
Pubblicazione: (2024)
When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition
di: Moure, Pehuén, et al.
Pubblicazione: (2026)
di: Moure, Pehuén, et al.
Pubblicazione: (2026)
UAF: A Unified Audio Front-end LLM for Full-Duplex Speech Interaction
di: Li, Yadong, et al.
Pubblicazione: (2026)
di: Li, Yadong, et al.
Pubblicazione: (2026)
Speech Recognition-based Feature Extraction for Enhanced Automatic Severity Classification in Dysarthric Speech
di: Choi, Yerin, et al.
Pubblicazione: (2024)
di: Choi, Yerin, et al.
Pubblicazione: (2024)
Documenti analoghi
-
MixRep: Hidden Representation Mixup for Low-Resource Speech Recognition
di: Xie, Jiamin, et al.
Pubblicazione: (2023) -
Speech Recognition on TV Series with Video-guided Post-ASR Correction
di: Yang, Haoyuan, et al.
Pubblicazione: (2025) -
Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition
di: Xie, Jiamin, et al.
Pubblicazione: (2025) -
Bridging the Modality Gap: Softly Discretizing Audio Representation for LLM-based Automatic Speech Recognition
di: Yang, Mu, et al.
Pubblicazione: (2025) -
Toward Improving Synthetic Audio Spoofing Detection Robustness via Meta-Learning and Disentangled Training With Adversarial Examples
di: Wang, Zhenyu, et al.
Pubblicazione: (2024)