Decoder-only Conformer with Modality-aware Sparse Mixtures of Experts for ASR
Fuente:
arXiv
Salvato in:
| Autori principali: | Lee, Jaeyoung, Mimura, Masato |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding
di: He, Jiajun, et al.
Pubblicazione: (2025)
di: He, Jiajun, et al.
Pubblicazione: (2025)
Loss Masking Is Not Needed in Decoder-only Transformer for Discrete-token-based ASR
di: Chen, Qian, et al.
Pubblicazione: (2023)
di: Chen, Qian, et al.
Pubblicazione: (2023)
Beyond Hard Sharing: Efficient Multi-Task Speech-to-Text Modeling with Supervised Mixture of Experts
di: Jin, Hojun, et al.
Pubblicazione: (2025)
di: Jin, Hojun, et al.
Pubblicazione: (2025)
Alignment-Free Training for Transducer-based Multi-Talker ASR
di: Moriya, Takafumi, et al.
Pubblicazione: (2024)
di: Moriya, Takafumi, et al.
Pubblicazione: (2024)
MoVE: Translating Laughter and Tears via Mixture of Vocalization Experts in Speech-to-Speech Translation
di: Chen, Szu-Chi, et al.
Pubblicazione: (2026)
di: Chen, Szu-Chi, et al.
Pubblicazione: (2026)
Boosting Hybrid Autoregressive Transducer-based ASR with Internal Acoustic Model Training and Dual Blank Thresholding
di: Moriya, Takafumi, et al.
Pubblicazione: (2024)
di: Moriya, Takafumi, et al.
Pubblicazione: (2024)
Boosting Code-Switching ASR with Mixture of Experts Enhanced Speech-Conditioned LLM
di: Zhang, Fengrun, et al.
Pubblicazione: (2024)
di: Zhang, Fengrun, et al.
Pubblicazione: (2024)
An Effective Mixture-Of-Experts Approach For Code-Switching Speech Recognition Leveraging Encoder Disentanglement
di: Yang, Tzu-Ting, et al.
Pubblicazione: (2024)
di: Yang, Tzu-Ting, et al.
Pubblicazione: (2024)
Omni-Router: Sharing Routing Decisions in Sparse Mixture-of-Experts for Speech Recognition
di: Gu, Zijin, et al.
Pubblicazione: (2025)
di: Gu, Zijin, et al.
Pubblicazione: (2025)
Fun-ASR Technical Report
di: An, Keyu, et al.
Pubblicazione: (2025)
di: An, Keyu, et al.
Pubblicazione: (2025)
SUTA-LM: Bridging Test-Time Adaptation and Language Model Rescoring for Robust ASR
di: Huang, Wei-Ping, et al.
Pubblicazione: (2025)
di: Huang, Wei-Ping, et al.
Pubblicazione: (2025)
Articulation-Informed ASR: Integrating Articulatory Features into ASR via Auxiliary Speech Inversion and Cross-Attention Fusion
di: Attia, Ahmed Adel, et al.
Pubblicazione: (2025)
di: Attia, Ahmed Adel, et al.
Pubblicazione: (2025)
VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining
di: Zhuo, Jianheng, et al.
Pubblicazione: (2025)
di: Zhuo, Jianheng, et al.
Pubblicazione: (2025)
Efficient Adaptation of Multilingual Models for Japanese ASR
di: Bajo, Mark, et al.
Pubblicazione: (2024)
di: Bajo, Mark, et al.
Pubblicazione: (2024)
A Self-Refining Framework for Enhancing ASR Using TTS-Synthesized Data
di: Chou, Cheng-Kang, et al.
Pubblicazione: (2025)
di: Chou, Cheng-Kang, et al.
Pubblicazione: (2025)
PSRB: A Comprehensive Benchmark for Evaluating Persian ASR Systems
di: Sedghiyeh, Nima, et al.
Pubblicazione: (2025)
di: Sedghiyeh, Nima, et al.
Pubblicazione: (2025)
AdaCS: Adaptive Normalization for Enhanced Code-Switching ASR
di: Chu, The Chuong, et al.
Pubblicazione: (2025)
di: Chu, The Chuong, et al.
Pubblicazione: (2025)
TG-ASR: Translation-Guided Learning with Parallel Gated Cross Attention for Low-Resource Automatic Speech Recognition
di: Yang, Cheng-Yeh, et al.
Pubblicazione: (2026)
di: Yang, Cheng-Yeh, et al.
Pubblicazione: (2026)
FlanEC: Exploring Flan-T5 for Post-ASR Error Correction
di: La Quatra, Moreno, et al.
Pubblicazione: (2025)
di: La Quatra, Moreno, et al.
Pubblicazione: (2025)
Improving endpoint detection in end-to-end streaming ASR for conversational speech
di: C, Anandh, et al.
Pubblicazione: (2025)
di: C, Anandh, et al.
Pubblicazione: (2025)
Performance evaluation of SLAM-ASR: The Good, the Bad, the Ugly, and the Way Forward
di: Kumar, Shashi, et al.
Pubblicazione: (2024)
di: Kumar, Shashi, et al.
Pubblicazione: (2024)
Promptformer: Prompted Conformer Transducer for ASR
di: Duarte-Torres, Sergio, et al.
Pubblicazione: (2024)
di: Duarte-Torres, Sergio, et al.
Pubblicazione: (2024)
Pushing the Limits of Beam Search Decoding for Transducer-based ASR models
di: Grigoryan, Lilit, et al.
Pubblicazione: (2025)
di: Grigoryan, Lilit, et al.
Pubblicazione: (2025)
CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models
di: He, Jiajun, et al.
Pubblicazione: (2025)
di: He, Jiajun, et al.
Pubblicazione: (2025)
Samba-ASR: State-Of-The-Art Speech Recognition Leveraging Structured State-Space Models
di: Shakhadri, Syed Abdul Gaffar, et al.
Pubblicazione: (2025)
di: Shakhadri, Syed Abdul Gaffar, et al.
Pubblicazione: (2025)
Weak Supervision Techniques towards Enhanced ASR Models in Industry-level CRM Systems
di: Wang, Zhongsheng, et al.
Pubblicazione: (2025)
di: Wang, Zhongsheng, et al.
Pubblicazione: (2025)
Probing the Hidden Talent of ASR Foundation Models for L2 English Oral Assessment
di: Chao, Fu-An, et al.
Pubblicazione: (2025)
di: Chao, Fu-An, et al.
Pubblicazione: (2025)
Language-Aware Prompt Tuning for Parameter-Efficient Seamless Language Expansion in Multilingual ASR
di: Yang, Hongli, et al.
Pubblicazione: (2025)
di: Yang, Hongli, et al.
Pubblicazione: (2025)
TurboBias: Universal ASR Context-Biasing powered by GPU-accelerated Phrase-Boosting Tree
di: Andrusenko, Andrei, et al.
Pubblicazione: (2025)
di: Andrusenko, Andrei, et al.
Pubblicazione: (2025)
Open ASR Leaderboard: Towards Reproducible and Transparent Multilingual and Long-Form Speech Recognition Evaluation
di: Srivastav, Vaibhav, et al.
Pubblicazione: (2025)
di: Srivastav, Vaibhav, et al.
Pubblicazione: (2025)
Temporal Order Preserved Optimal Transport-based Cross-modal Knowledge Transfer Learning for ASR
di: Lu, Xugang, et al.
Pubblicazione: (2024)
di: Lu, Xugang, et al.
Pubblicazione: (2024)
A Comparative Study of LLM-based ASR and Whisper in Low Resource and Code Switching Scenario
di: Song, Zheshu, et al.
Pubblicazione: (2024)
di: Song, Zheshu, et al.
Pubblicazione: (2024)
BLR-MoE: Boosted Language-Routing Mixture of Experts for Domain-Robust Multilingual E2E ASR
di: Ma, Guodong, et al.
Pubblicazione: (2025)
di: Ma, Guodong, et al.
Pubblicazione: (2025)
Exploring ASR-Based Wav2Vec2 for Automated Speech Disorder Assessment: Insights and Analysis
di: Nguyen, Tuan, et al.
Pubblicazione: (2024)
di: Nguyen, Tuan, et al.
Pubblicazione: (2024)
Toward Responsible ASR for African American English Speakers: A Scoping Review of Bias and Equity in Speech Technology
di: Cunningham, Jay L., et al.
Pubblicazione: (2025)
di: Cunningham, Jay L., et al.
Pubblicazione: (2025)
Adaptability of ASR Models on Low-Resource Language: A Comparative Study of Whisper and Wav2Vec-BERT on Bangla
di: Ridoy, Md Sazzadul Islam, et al.
Pubblicazione: (2025)
di: Ridoy, Md Sazzadul Islam, et al.
Pubblicazione: (2025)
Effective Noise-aware Data Simulation for Domain-adaptive Speech Enhancement Leveraging Dynamic Stochastic Perturbation
di: Wang, Chien-Chun, et al.
Pubblicazione: (2024)
di: Wang, Chien-Chun, et al.
Pubblicazione: (2024)
UniEnc-CASSNAT: An Encoder-only Non-autoregressive ASR for Speech SSL Models
di: Fan, Ruchao, et al.
Pubblicazione: (2024)
di: Fan, Ruchao, et al.
Pubblicazione: (2024)
Make It Hard to Hear, Easy to Learn: Long-Form Bengali ASR and Speaker Diarization via Extreme Augmentation and Perfect Alignment
di: Hasan, Sanjid, et al.
Pubblicazione: (2026)
di: Hasan, Sanjid, et al.
Pubblicazione: (2026)
Can we train ASR systems on Code-switch without real code-switch data? Case study for Singapore's languages
di: Nguyen, Tuan, et al.
Pubblicazione: (2025)
di: Nguyen, Tuan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding
di: He, Jiajun, et al.
Pubblicazione: (2025) -
Loss Masking Is Not Needed in Decoder-only Transformer for Discrete-token-based ASR
di: Chen, Qian, et al.
Pubblicazione: (2023) -
Beyond Hard Sharing: Efficient Multi-Task Speech-to-Text Modeling with Supervised Mixture of Experts
di: Jin, Hojun, et al.
Pubblicazione: (2025) -
Alignment-Free Training for Transducer-based Multi-Talker ASR
di: Moriya, Takafumi, et al.
Pubblicazione: (2024) -
MoVE: Translating Laughter and Tears via Mixture of Vocalization Experts in Speech-to-Speech Translation
di: Chen, Szu-Chi, et al.
Pubblicazione: (2026)