ACES: Accent Subspaces for Coupling, Explanations, and Stress-Testing in Automatic Speech Recognition
Fuente:
arXiv
Salvato in:
| Autore principale: | Parekh, Swapnil |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Clustering and Mining Accented Speech for Inclusive and Fair Speech Recognition
di: Kim, Jaeyoung, et al.
Pubblicazione: (2024)
di: Kim, Jaeyoung, et al.
Pubblicazione: (2024)
Qifusion-Net: Layer-adapted Stream/Non-stream Model for End-to-End Multi-Accent Speech Recognition
di: Chen, Jinming, et al.
Pubblicazione: (2024)
di: Chen, Jinming, et al.
Pubblicazione: (2024)
DART: Disentanglement of Accent and Speaker Representation in Multispeaker Text-to-Speech
di: Melechovsky, Jan, et al.
Pubblicazione: (2024)
di: Melechovsky, Jan, et al.
Pubblicazione: (2024)
Zero Shot Text to Speech Augmentation for Automatic Speech Recognition on Low-Resource Accented Speech Corpora
di: Nespoli, Francesco, et al.
Pubblicazione: (2024)
di: Nespoli, Francesco, et al.
Pubblicazione: (2024)
Automatic Speech Recognition in the Modern Era: Architectures, Training, and Evaluation
di: Nayeem, Md., et al.
Pubblicazione: (2025)
di: Nayeem, Md., et al.
Pubblicazione: (2025)
Speech Recognition-based Feature Extraction for Enhanced Automatic Severity Classification in Dysarthric Speech
di: Choi, Yerin, et al.
Pubblicazione: (2024)
di: Choi, Yerin, et al.
Pubblicazione: (2024)
Serialized Speech Information Guidance with Overlapped Encoding Separation for Multi-Speaker Automatic Speech Recognition
di: Shi, Hao, et al.
Pubblicazione: (2024)
di: Shi, Hao, et al.
Pubblicazione: (2024)
CosyAccent: Duration-Controllable Accent Normalization Using Source-Synthesis Training Data
di: Bai, Qibing, et al.
Pubblicazione: (2026)
di: Bai, Qibing, et al.
Pubblicazione: (2026)
Do we really need Self-Attention for Streaming Automatic Speech Recognition?
di: Dkhissi, Youness, et al.
Pubblicazione: (2026)
di: Dkhissi, Youness, et al.
Pubblicazione: (2026)
Tiny-Align: Bridging Automatic Speech Recognition and Large Language Model on the Edge
di: Qin, Ruiyang, et al.
Pubblicazione: (2024)
di: Qin, Ruiyang, et al.
Pubblicazione: (2024)
LLMs-Integrated Automatic Hate Speech Recognition Using Controllable Text Generation Models
di: Oshima, Ryutaro, et al.
Pubblicazione: (2026)
di: Oshima, Ryutaro, et al.
Pubblicazione: (2026)
ICMC-ASR: The ICASSP 2024 In-Car Multi-Channel Automatic Speech Recognition Challenge
di: Wang, He, et al.
Pubblicazione: (2024)
di: Wang, He, et al.
Pubblicazione: (2024)
Probing the Information Encoded in Neural-based Acoustic Models of Automatic Speech Recognition Systems
di: Raymondaud, Quentin, et al.
Pubblicazione: (2024)
di: Raymondaud, Quentin, et al.
Pubblicazione: (2024)
Controllable Accent Normalization via Discrete Diffusion
di: Bai, Qibing, et al.
Pubblicazione: (2026)
di: Bai, Qibing, et al.
Pubblicazione: (2026)
HuBERT-VIC: Improving Noise-Robust Automatic Speech Recognition of Speech Foundation Model via Variance-Invariance-Covariance Regularization
di: Ahn, Hyebin, et al.
Pubblicazione: (2025)
di: Ahn, Hyebin, et al.
Pubblicazione: (2025)
Pitch Accent Detection improves Pretrained Automatic Speech Recognition
di: Sasu, David, et al.
Pubblicazione: (2025)
di: Sasu, David, et al.
Pubblicazione: (2025)
GEC-RAG: Improving Generative Error Correction via Retrieval-Augmented Generation for Automatic Speech Recognition Systems
di: Robatian, Amin, et al.
Pubblicazione: (2025)
di: Robatian, Amin, et al.
Pubblicazione: (2025)
Interpreting Pretrained Speech Models for Automatic Speech Assessment of Voice Disorders
di: Lau, Hok-Shing, et al.
Pubblicazione: (2024)
di: Lau, Hok-Shing, et al.
Pubblicazione: (2024)
Convert and Speak: Zero-shot Accent Conversion with Minimum Supervision
di: Jia, Zhijun, et al.
Pubblicazione: (2024)
di: Jia, Zhijun, et al.
Pubblicazione: (2024)
TinyML for Speech Recognition
di: Barovic, Andrew, et al.
Pubblicazione: (2025)
di: Barovic, Andrew, et al.
Pubblicazione: (2025)
Adapting Automatic Speech Recognition for Accented Air Traffic Control Communications
di: Wee, Marcus Yu Zhe, et al.
Pubblicazione: (2025)
di: Wee, Marcus Yu Zhe, et al.
Pubblicazione: (2025)
Automatic Speech Recognition using Advanced Deep Learning Approaches: A survey
di: Kheddar, Hamza, et al.
Pubblicazione: (2024)
di: Kheddar, Hamza, et al.
Pubblicazione: (2024)
Non-autoregressive real-time Accent Conversion model with voice cloning
di: Nechaev, Vladimir, et al.
Pubblicazione: (2024)
di: Nechaev, Vladimir, et al.
Pubblicazione: (2024)
Accent-Invariant Automatic Speech Recognition via Saliency-Driven Spectrogram Masking
di: Sameti, Mohammad Hossein, et al.
Pubblicazione: (2025)
di: Sameti, Mohammad Hossein, et al.
Pubblicazione: (2025)
Improved Contextual Recognition In Automatic Speech Recognition Systems By Semantic Lattice Rescoring
di: Sudarshan, Ankitha, et al.
Pubblicazione: (2023)
di: Sudarshan, Ankitha, et al.
Pubblicazione: (2023)
Benchmarking Automatic Speech Recognition for Indian Languages in Agricultural Contexts
di: S, Chandrashekar M, et al.
Pubblicazione: (2026)
di: S, Chandrashekar M, et al.
Pubblicazione: (2026)
Color-based Emotion Representation for Speech Emotion Recognition
di: Nagase, Ryotaro, et al.
Pubblicazione: (2026)
di: Nagase, Ryotaro, et al.
Pubblicazione: (2026)
Unifying Speech Recognition, Synthesis and Conversion with Autoregressive Transformers
di: Cai, Runyuan, et al.
Pubblicazione: (2026)
di: Cai, Runyuan, et al.
Pubblicazione: (2026)
Persian Speech Emotion Recognition by Fine-Tuning Transformers
di: Shayaninasab, Minoo, et al.
Pubblicazione: (2024)
di: Shayaninasab, Minoo, et al.
Pubblicazione: (2024)
Automatic Prediction of Amyotrophic Lateral Sclerosis Progression using Longitudinal Speech Transformer
di: Wang, Liming, et al.
Pubblicazione: (2024)
di: Wang, Liming, et al.
Pubblicazione: (2024)
Improving Pronunciation and Accent Conversion through Knowledge Distillation And Synthetic Ground-Truth from Native TTS
di: Nguyen, Tuan Nam, et al.
Pubblicazione: (2024)
di: Nguyen, Tuan Nam, et al.
Pubblicazione: (2024)
Efficient Finetuning for Dimensional Speech Emotion Recognition in the Age of Transformers
di: Sampath, Aneesha, et al.
Pubblicazione: (2025)
di: Sampath, Aneesha, et al.
Pubblicazione: (2025)
Enhancing Automatic Speech Recognition Through Integrated Noise Detection Architecture
di: Singh, Karamvir
Pubblicazione: (2025)
di: Singh, Karamvir
Pubblicazione: (2025)
LiteASR: Efficient Automatic Speech Recognition with Low-Rank Approximation
di: Kamahori, Keisuke, et al.
Pubblicazione: (2025)
di: Kamahori, Keisuke, et al.
Pubblicazione: (2025)
Learning Physiology-Informed Vocal Spectrotemporal Representations for Speech Emotion Recognition
di: Zhang, Xu, et al.
Pubblicazione: (2026)
di: Zhang, Xu, et al.
Pubblicazione: (2026)
Breaking Resource Barriers in Speech Emotion Recognition via Data Distillation
di: Chang, Yi, et al.
Pubblicazione: (2024)
di: Chang, Yi, et al.
Pubblicazione: (2024)
Toward Efficient Speech Emotion Recognition via Spectral Learning and Attention
di: Lee, HyeYoung, et al.
Pubblicazione: (2025)
di: Lee, HyeYoung, et al.
Pubblicazione: (2025)
Speech Recognition on TV Series with Video-guided Post-ASR Correction
di: Yang, Haoyuan, et al.
Pubblicazione: (2025)
di: Yang, Haoyuan, et al.
Pubblicazione: (2025)
ABHINAYA -- A System for Speech Emotion Recognition In Naturalistic Conditions Challenge
di: Dutta, Soumya, et al.
Pubblicazione: (2025)
di: Dutta, Soumya, et al.
Pubblicazione: (2025)
Active Learning with Task Adaptation Pre-training for Speech Emotion Recognition
di: Li, Dongyuan, et al.
Pubblicazione: (2024)
di: Li, Dongyuan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Clustering and Mining Accented Speech for Inclusive and Fair Speech Recognition
di: Kim, Jaeyoung, et al.
Pubblicazione: (2024) -
Qifusion-Net: Layer-adapted Stream/Non-stream Model for End-to-End Multi-Accent Speech Recognition
di: Chen, Jinming, et al.
Pubblicazione: (2024) -
DART: Disentanglement of Accent and Speaker Representation in Multispeaker Text-to-Speech
di: Melechovsky, Jan, et al.
Pubblicazione: (2024) -
Zero Shot Text to Speech Augmentation for Automatic Speech Recognition on Low-Resource Accented Speech Corpora
di: Nespoli, Francesco, et al.
Pubblicazione: (2024) -
Automatic Speech Recognition in the Modern Era: Architectures, Training, and Evaluation
di: Nayeem, Md., et al.
Pubblicazione: (2025)