Pronunciation-Lexicon Free Training for Phoneme-based Crosslingual ASR via Joint Stochastic Approximation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yusuyin, Saierdaer, Ma, Te, Huang, Hao, Ou, Zhijian |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Whistle: Data-Efficient Multilingual and Crosslingual Speech Recognition via Weakly Phonetic Supervision
par: Yusuyin, Saierdaer, et autres
Publié: (2024)
par: Yusuyin, Saierdaer, et autres
Publié: (2024)
Phonemes vs. Projectors: An Investigation of Speech-Language Interfaces for LLM-based ASR
par: Li, Ziwei, et autres
Publié: (2026)
par: Li, Ziwei, et autres
Publié: (2026)
LLM-based phoneme-to-grapheme for phoneme-based speech recognition
par: Ma, Te, et autres
Publié: (2025)
par: Ma, Te, et autres
Publié: (2025)
CTC-TTS: LLM-based dual-streaming text-to-speech with CTC alignment
par: Liu, Hanwen, et autres
Publié: (2026)
par: Liu, Hanwen, et autres
Publié: (2026)
Advancing LLM-based phoneme-to-grapheme for multilingual speech recognition
par: Dong, Lukuang, et autres
Publié: (2026)
par: Dong, Lukuang, et autres
Publié: (2026)
Phoneme-based speech recognition driven by large language models and sampling marginalization
par: Ma, Te, et autres
Publié: (2025)
par: Ma, Te, et autres
Publié: (2025)
Compositional Phoneme Approximation for L1-Grounded L2 Pronunciation Training
par: Park, Jisang, et autres
Publié: (2024)
par: Park, Jisang, et autres
Publié: (2024)
Low-Resourced Speech Recognition for Iu Mien Language via Weakly-Supervised Phoneme-based Multilingual Pre-training
par: Dong, Lukuan, et autres
Publié: (2024)
par: Dong, Lukuan, et autres
Publié: (2024)
Segmentation-free Goodness of Pronunciation
par: Cao, Xinwei, et autres
Publié: (2025)
par: Cao, Xinwei, et autres
Publié: (2025)
K-Function: Joint Pronunciation Transcription and Feedback for Evaluating Kids Language Function
par: Li, Shuhe, et autres
Publié: (2025)
par: Li, Shuhe, et autres
Publié: (2025)
PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding
par: He, Jiajun, et autres
Publié: (2025)
par: He, Jiajun, et autres
Publié: (2025)
Alignment-Free Training for Transducer-based Multi-Talker ASR
par: Moriya, Takafumi, et autres
Publié: (2024)
par: Moriya, Takafumi, et autres
Publié: (2024)
ProKWS: Personalized Keyword Spotting via Collaborative Learning of Phonemes and Prosody
par: Pan, Jianan, et autres
Publié: (2026)
par: Pan, Jianan, et autres
Publié: (2026)
CUSIDE-T: Chunking, Simulating Future and Decoding for Transducer based Streaming ASR
par: Zhao, Wenbo, et autres
Publié: (2024)
par: Zhao, Wenbo, et autres
Publié: (2024)
Training-Free Intelligibility-Guided Observation Addition for Noisy ASR
par: Li, Haoyang, et autres
Publié: (2026)
par: Li, Haoyang, et autres
Publié: (2026)
CTC-Assisted LLM-Based Contextual ASR
par: Yang, Guanrou, et autres
Publié: (2024)
par: Yang, Guanrou, et autres
Publié: (2024)
Enhancing Listened Speech Decoding from EEG via Parallel Phoneme Sequence Prediction
par: Lee, Jihwan, et autres
Publié: (2025)
par: Lee, Jihwan, et autres
Publié: (2025)
Lightweight and Robust Multi-Channel End-to-End Speech Recognition with Spherical Harmonic Transform
par: Kong, Xiangzhu, et autres
Publié: (2025)
par: Kong, Xiangzhu, et autres
Publié: (2025)
LoRA-Whisper: Parameter-Efficient and Extensible Multilingual ASR
par: Song, Zheshu, et autres
Publié: (2024)
par: Song, Zheshu, et autres
Publié: (2024)
Energy-Based Models with Applications to Speech and Language Processing
par: Ou, Zhijian
Publié: (2024)
par: Ou, Zhijian
Publié: (2024)
Acoustic Feature Mixup for Balanced Multi-aspect Pronunciation Assessment
par: Do, Heejin, et autres
Publié: (2024)
par: Do, Heejin, et autres
Publié: (2024)
ConPCO: Preserving Phoneme Characteristics for Automatic Pronunciation Assessment Leveraging Contrastive Ordinal Regularization
par: Yan, Bi-Cheng, et autres
Publié: (2024)
par: Yan, Bi-Cheng, et autres
Publié: (2024)
End-to-end Joint Punctuated and Normalized ASR with a Limited Amount of Punctuated Training Data
par: Cui, Can, et autres
Publié: (2023)
par: Cui, Can, et autres
Publié: (2023)
Zero-shot Context Biasing with Trie-based Decoding using Synthetic Multi-Pronunciation
par: Liu, Changsong, et autres
Publié: (2025)
par: Liu, Changsong, et autres
Publié: (2025)
PAC: Pronunciation-Aware Contextualized Large Language Model-based Automatic Speech Recognition
par: Fu, Li, et autres
Publié: (2025)
par: Fu, Li, et autres
Publié: (2025)
Towards Rehearsal-Free Multilingual ASR: A LoRA-based Case Study on Whisper
par: Xu, Tianyi, et autres
Publié: (2024)
par: Xu, Tianyi, et autres
Publié: (2024)
Frequency-Weighted Training Losses for Phoneme-Level DNN-based Speech Enhancement
par: Monir, Nasser-Eddine, et autres
Publié: (2025)
par: Monir, Nasser-Eddine, et autres
Publié: (2025)
Pronunciation Assessment with Multi-modal Large Language Models
par: Fu, Kaiqi, et autres
Publié: (2024)
par: Fu, Kaiqi, et autres
Publié: (2024)
Language-Aware Prompt Tuning for Parameter-Efficient Seamless Language Expansion in Multilingual ASR
par: Yang, Hongli, et autres
Publié: (2025)
par: Yang, Hongli, et autres
Publié: (2025)
Enhancing Multilingual ASR for Unseen Languages via Language Embedding Modeling
par: Huang, Shao-Syuan, et autres
Publié: (2024)
par: Huang, Shao-Syuan, et autres
Publié: (2024)
Enhancing Low-Resource ASR through Versatile TTS: Bridging the Data Gap
par: Yang, Guanrou, et autres
Publié: (2024)
par: Yang, Guanrou, et autres
Publié: (2024)
A Comparative Study of LLM-based ASR and Whisper in Low Resource and Code Switching Scenario
par: Song, Zheshu, et autres
Publié: (2024)
par: Song, Zheshu, et autres
Publié: (2024)
Articulation-Informed ASR: Integrating Articulatory Features into ASR via Auxiliary Speech Inversion and Cross-Attention Fusion
par: Attia, Ahmed Adel, et autres
Publié: (2025)
par: Attia, Ahmed Adel, et autres
Publié: (2025)
Fun-ASR Technical Report
par: An, Keyu, et autres
Publié: (2025)
par: An, Keyu, et autres
Publié: (2025)
Automatic Text Pronunciation Correlation Generation and Application for Contextual Biasing
par: Cheng, Gaofeng, et autres
Publié: (2025)
par: Cheng, Gaofeng, et autres
Publié: (2025)
Joint Learning of Wording and Formatting for Singable Melody-to-Lyric Generation
par: Ou, Longshen, et autres
Publié: (2023)
par: Ou, Longshen, et autres
Publié: (2023)
Data-Efficient ASR Personalization for Non-Normative Speech Using an Uncertainty-Based Phoneme Difficulty Score for Guided Sampling
par: Pokel, Niclas, et autres
Publié: (2025)
par: Pokel, Niclas, et autres
Publié: (2025)
Enhancing ASR Performance in the Medical Domain for Dravidian Languages
par: Devarakonda, Sri Charan, et autres
Publié: (2026)
par: Devarakonda, Sri Charan, et autres
Publié: (2026)
CUSIDE-array: A Streaming Multi-Channel End-to-End Speech Recognition System with Realistic Evaluations
par: Kong, Xiangzhu, et autres
Publié: (2024)
par: Kong, Xiangzhu, et autres
Publié: (2024)
Towards Efficient and Multifaceted Computer-assisted Pronunciation Training Leveraging Hierarchical Selective State Space Model and Decoupled Cross-entropy Loss
par: Chao, Fu-An, et autres
Publié: (2025)
par: Chao, Fu-An, et autres
Publié: (2025)
Documents similaires
-
Whistle: Data-Efficient Multilingual and Crosslingual Speech Recognition via Weakly Phonetic Supervision
par: Yusuyin, Saierdaer, et autres
Publié: (2024) -
Phonemes vs. Projectors: An Investigation of Speech-Language Interfaces for LLM-based ASR
par: Li, Ziwei, et autres
Publié: (2026) -
LLM-based phoneme-to-grapheme for phoneme-based speech recognition
par: Ma, Te, et autres
Publié: (2025) -
CTC-TTS: LLM-based dual-streaming text-to-speech with CTC alignment
par: Liu, Hanwen, et autres
Publié: (2026) -
Advancing LLM-based phoneme-to-grapheme for multilingual speech recognition
par: Dong, Lukuang, et autres
Publié: (2026)