UMA-Split: unimodal aggregation for both English and Mandarin non-autoregressive speech recognition
Fuente:
arXiv
Salvato in:
| Autori principali: | Fang, Ying, Li, Xiaofei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
An efficient text augmentation approach for contextualized Mandarin speech recognition
di: Zheng, Naijun, et al.
Pubblicazione: (2024)
di: Zheng, Naijun, et al.
Pubblicazione: (2024)
A layer-wise analysis of Mandarin and English suprasegmentals in SSL speech models
di: de la Fuente, Antón, et al.
Pubblicazione: (2024)
di: de la Fuente, Antón, et al.
Pubblicazione: (2024)
Introducing MELI: the Mandarin-English Language Interview Corpus
di: Liu, Suyuan, et al.
Pubblicazione: (2026)
di: Liu, Suyuan, et al.
Pubblicazione: (2026)
DiffNorm: Self-Supervised Normalization for Non-autoregressive Speech-to-speech Translation
di: Tan, Weiting, et al.
Pubblicazione: (2024)
di: Tan, Weiting, et al.
Pubblicazione: (2024)
Form and meaning co-determine the realization of tone in Taiwan Mandarin spontaneous speech: the case of T2-T3 and T3-T3 tone sandhi
di: Lu, Yuxin, et al.
Pubblicazione: (2024)
di: Lu, Yuxin, et al.
Pubblicazione: (2024)
Prominence-aware automatic speech recognition for conversational speech
di: Linke, Julian, et al.
Pubblicazione: (2025)
di: Linke, Julian, et al.
Pubblicazione: (2025)
Punctuation Restoration for Singaporean Spoken Languages: English, Malay, and Mandarin
di: Rao, Abhinav, et al.
Pubblicazione: (2022)
di: Rao, Abhinav, et al.
Pubblicazione: (2022)
The evaluation of a code-switched Sepedi-English automatic speech recognition system
di: Phaladi, Amanda, et al.
Pubblicazione: (2024)
di: Phaladi, Amanda, et al.
Pubblicazione: (2024)
Introduction to speech recognition
di: Dauphin, Gabriel
Pubblicazione: (2024)
di: Dauphin, Gabriel
Pubblicazione: (2024)
Improving child speech recognition with augmented child-like speech
di: Zhang, Yuanyuan, et al.
Pubblicazione: (2024)
di: Zhang, Yuanyuan, et al.
Pubblicazione: (2024)
Word-specific tonal realizations in Mandarin
di: Chuang, Yu-Ying, et al.
Pubblicazione: (2024)
di: Chuang, Yu-Ying, et al.
Pubblicazione: (2024)
Unimodal Aggregation for CTC-based Speech Recognition
di: Fang, Ying, et al.
Pubblicazione: (2023)
di: Fang, Ying, et al.
Pubblicazione: (2023)
Mamba for Streaming ASR Combined with Unimodal Aggregation
di: Fang, Ying, et al.
Pubblicazione: (2024)
di: Fang, Ying, et al.
Pubblicazione: (2024)
Automated evaluation of LLMs for effective machine translation of Mandarin Chinese to English
di: Zhang, Yue, et al.
Pubblicazione: (2026)
di: Zhang, Yue, et al.
Pubblicazione: (2026)
Multilingual Stutter Event Detection for English, German, and Mandarin Speech
di: Haas, Felix, et al.
Pubblicazione: (2026)
di: Haas, Felix, et al.
Pubblicazione: (2026)
XLM: A Python package for non-autoregressive language models
di: Patel, Dhruvesh, et al.
Pubblicazione: (2025)
di: Patel, Dhruvesh, et al.
Pubblicazione: (2025)
CS3-Bench: Evaluating and Enhancing Speech-to-Speech LLMs for Mandarin-English Code-Switching
di: Liu, Heyang, et al.
Pubblicazione: (2025)
di: Liu, Heyang, et al.
Pubblicazione: (2025)
Advancing LLM-based phoneme-to-grapheme for multilingual speech recognition
di: Dong, Lukuang, et al.
Pubblicazione: (2026)
di: Dong, Lukuang, et al.
Pubblicazione: (2026)
Enrolment-based personalisation for improving individual-level fairness in speech emotion recognition
di: Triantafyllopoulos, Andreas, et al.
Pubblicazione: (2024)
di: Triantafyllopoulos, Andreas, et al.
Pubblicazione: (2024)
Direct Preference Optimization for English-Mandarin Code-Switching Speech Recognition in Audio LLMs
di: Quang, Trung Nguyen, et al.
Pubblicazione: (2026)
di: Quang, Trung Nguyen, et al.
Pubblicazione: (2026)
LLM-based phoneme-to-grapheme for phoneme-based speech recognition
di: Ma, Te, et al.
Pubblicazione: (2025)
di: Ma, Te, et al.
Pubblicazione: (2025)
Self-consistent context aware conformer transducer for speech recognition
di: Kolokolov, Konstantin, et al.
Pubblicazione: (2024)
di: Kolokolov, Konstantin, et al.
Pubblicazione: (2024)
Identifying and typifying demographic unfairness in phoneme-level embeddings of self-supervised speech recognition models
di: Herron, Felix, et al.
Pubblicazione: (2026)
di: Herron, Felix, et al.
Pubblicazione: (2026)
Advancing Speech Translation: A Corpus of Mandarin-English Conversational Telephone Speech
di: Wotherspoon, Shannon, et al.
Pubblicazione: (2024)
di: Wotherspoon, Shannon, et al.
Pubblicazione: (2024)
Measuring Taiwanese Mandarin Language Understanding
di: Chen, Po-Heng, et al.
Pubblicazione: (2024)
di: Chen, Po-Heng, et al.
Pubblicazione: (2024)
A unified front-end framework for English text-to-speech synthesis
di: Ying, Zelin, et al.
Pubblicazione: (2023)
di: Ying, Zelin, et al.
Pubblicazione: (2023)
Convoifilter: A case study of doing cocktail party speech recognition
di: Nguyen, Thai-Binh, et al.
Pubblicazione: (2023)
di: Nguyen, Thai-Binh, et al.
Pubblicazione: (2023)
Tag and correct: high precision post-editing approach to correction of speech recognition errors
di: Ziętkiewicz, Tomasz
Pubblicazione: (2024)
di: Ziętkiewicz, Tomasz
Pubblicazione: (2024)
Automated speech audiometry: Can it work using open-source pre-trained Kaldi-NL automatic speech recognition?
di: Araiza-Illan, Gloria, et al.
Pubblicazione: (2023)
di: Araiza-Illan, Gloria, et al.
Pubblicazione: (2023)
Integrating automatic speech recognition into remote healthcare interpreting: A pilot study of its impact on interpreting quality
di: Tan, Shiyi, et al.
Pubblicazione: (2025)
di: Tan, Shiyi, et al.
Pubblicazione: (2025)
LLMs for automatic annotation of Mandarin narrative transcripts
di: Zhao, Qingwen, et al.
Pubblicazione: (2026)
di: Zhao, Qingwen, et al.
Pubblicazione: (2026)
Acquisition of Recursive Possessives and Recursive Locatives in Mandarin
di: Fu, Chenxi, et al.
Pubblicazione: (2024)
di: Fu, Chenxi, et al.
Pubblicazione: (2024)
What Have We Achieved on Non-autoregressive Translation?
di: Li, Yafu, et al.
Pubblicazione: (2024)
di: Li, Yafu, et al.
Pubblicazione: (2024)
The realization of tones in spontaneous spoken Taiwan Mandarin: a corpus-based survey and theory-driven computational modeling
di: Lu, Yuxin, et al.
Pubblicazione: (2025)
di: Lu, Yuxin, et al.
Pubblicazione: (2025)
Exploring the limits of decoder-only models trained on public speech recognition corpora
di: Gupta, Ankit, et al.
Pubblicazione: (2024)
di: Gupta, Ankit, et al.
Pubblicazione: (2024)
asr_eval: Algorithms and tools for multi-reference and streaming speech recognition evaluation
di: Sedukhin, Oleg, et al.
Pubblicazione: (2026)
di: Sedukhin, Oleg, et al.
Pubblicazione: (2026)
Paraformer-v2: An improved non-autoregressive transformer for noise-robust speech recognition
di: An, Keyu, et al.
Pubblicazione: (2024)
di: An, Keyu, et al.
Pubblicazione: (2024)
More than words: Advancements and challenges in speech recognition for singing
di: Kruspe, Anna
Pubblicazione: (2024)
di: Kruspe, Anna
Pubblicazione: (2024)
Development and multi-center evaluation of domain-adapted speech recognition for human-AI teaming in real-world gastrointestinal endoscopy
di: Yang, Ruijie, et al.
Pubblicazione: (2026)
di: Yang, Ruijie, et al.
Pubblicazione: (2026)
Predicting positive transfer for improved low-resource speech recognition using acoustic pseudo-tokens
di: San, Nay, et al.
Pubblicazione: (2024)
di: San, Nay, et al.
Pubblicazione: (2024)
Documenti analoghi
-
An efficient text augmentation approach for contextualized Mandarin speech recognition
di: Zheng, Naijun, et al.
Pubblicazione: (2024) -
A layer-wise analysis of Mandarin and English suprasegmentals in SSL speech models
di: de la Fuente, Antón, et al.
Pubblicazione: (2024) -
Introducing MELI: the Mandarin-English Language Interview Corpus
di: Liu, Suyuan, et al.
Pubblicazione: (2026) -
DiffNorm: Self-Supervised Normalization for Non-autoregressive Speech-to-speech Translation
di: Tan, Weiting, et al.
Pubblicazione: (2024) -
Form and meaning co-determine the realization of tone in Taiwan Mandarin spontaneous speech: the case of T2-T3 and T3-T3 tone sandhi
di: Lu, Yuxin, et al.
Pubblicazione: (2024)