MTLM: Incorporating Bidirectional Text Information to Enhance Language Model Training in Speech Recognition Systems
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Meng, Qingliang, Ren, Pengju, Li, Tian, Dai, Changsong, Liang, Huizhi |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
FNH-TTS: Mixture-of-Experts Duration Modeling for Robust Neural Speech Synthesis
par: Meng, Qingliang, et autres
Publié: (2025)
par: Meng, Qingliang, et autres
Publié: (2025)
Incorporating Class-based Language Model for Named Entity Recognition in Factorized Neural Transducer
par: Wang, Peng, et autres
Publié: (2023)
par: Wang, Peng, et autres
Publié: (2023)
Generating Data with Text-to-Speech and Large-Language Models for Conversational Speech Recognition
par: Cornell, Samuele, et autres
Publié: (2024)
par: Cornell, Samuele, et autres
Publié: (2024)
DeSTA: Enhancing Speech Language Models through Descriptive Speech-Text Alignment
par: Lu, Ke-Han, et autres
Publié: (2024)
par: Lu, Ke-Han, et autres
Publié: (2024)
Speech Recognition Model Improves Text-to-Speech Synthesis using Fine-Grained Reward
par: Wang, Guansu, et autres
Publié: (2025)
par: Wang, Guansu, et autres
Publié: (2025)
Towards Efficient Speech-Text Jointly Decoding within One Speech Language Model
par: Wu, Haibin, et autres
Publié: (2025)
par: Wu, Haibin, et autres
Publié: (2025)
Phonetic Enhanced Language Modeling for Text-to-Speech Synthesis
par: Zhou, Kun, et autres
Publié: (2024)
par: Zhou, Kun, et autres
Publié: (2024)
Speech Recognition Rescoring with Large Speech-Text Foundation Models
par: Shivakumar, Prashanth Gurunath, et autres
Publié: (2024)
par: Shivakumar, Prashanth Gurunath, et autres
Publié: (2024)
Longer is (Not Necessarily) Stronger: Punctuated Long-Sequence Training for Enhanced Speech Recognition and Translation
par: Koluguri, Nithin Rao, et autres
Publié: (2024)
par: Koluguri, Nithin Rao, et autres
Publié: (2024)
Dolphin: A Large-Scale Automatic Speech Recognition Model for Eastern Languages
par: Meng, Yangyang, et autres
Publié: (2025)
par: Meng, Yangyang, et autres
Publié: (2025)
Multi-stage Large Language Model Correction for Speech Recognition
par: Pu, Jie, et autres
Publié: (2023)
par: Pu, Jie, et autres
Publié: (2023)
Sequential Editing for Lifelong Training of Speech Recognition Models
par: Kulshreshtha, Devang, et autres
Publié: (2024)
par: Kulshreshtha, Devang, et autres
Publié: (2024)
Cross-Dialect Text-To-Speech in Pitch-Accent Language Incorporating Multi-Dialect Phoneme-Level BERT
par: Yamauchi, Kazuki, et autres
Publié: (2024)
par: Yamauchi, Kazuki, et autres
Publié: (2024)
Evaluating Emotion Recognition in Spoken Language Models on Emotionally Incongruent Speech
par: Corrêa, Pedro, et autres
Publié: (2025)
par: Corrêa, Pedro, et autres
Publié: (2025)
Chain of Correction for Full-text Speech Recognition with Large Language Models
par: Tang, Zhiyuan, et autres
Publié: (2025)
par: Tang, Zhiyuan, et autres
Publié: (2025)
Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving
par: Xie, Jingran, et autres
Publié: (2025)
par: Xie, Jingran, et autres
Publié: (2025)
Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition
par: Tseng, Yuan, et autres
Publié: (2025)
par: Tseng, Yuan, et autres
Publié: (2025)
Pseudo-Autoregressive Neural Codec Language Models for Efficient Zero-Shot Text-to-Speech Synthesis
par: Yang, Yifan, et autres
Publié: (2025)
par: Yang, Yifan, et autres
Publié: (2025)
Evaluating Speech-to-Text x LLM x Text-to-Speech Combinations for AI Interview Systems
par: Allbert, Rumi, et autres
Publié: (2025)
par: Allbert, Rumi, et autres
Publié: (2025)
Enhancing Large Language Model-based Speech Recognition by Contextualization for Rare and Ambiguous Words
par: Nozawa, Kento, et autres
Publié: (2024)
par: Nozawa, Kento, et autres
Publié: (2024)
Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs
par: Futami, Hayato, et autres
Publié: (2025)
par: Futami, Hayato, et autres
Publié: (2025)
Full-text Error Correction for Chinese Speech Recognition with Large Language Model
par: Tang, Zhiyuan, et autres
Publié: (2024)
par: Tang, Zhiyuan, et autres
Publié: (2024)
Speculative Speech Recognition by Audio-Prefixed Low-Rank Adaptation of Language Models
par: Yusuf, Bolaji, et autres
Publié: (2024)
par: Yusuf, Bolaji, et autres
Publié: (2024)
Investigating the Impact of Word Informativeness on Speech Emotion Recognition
par: Kakouros, Sofoklis
Publié: (2025)
par: Kakouros, Sofoklis
Publié: (2025)
TASTE: Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling
par: Tseng, Liang-Hsuan, et autres
Publié: (2025)
par: Tseng, Liang-Hsuan, et autres
Publié: (2025)
Interleaved Speech-Text Language Models for Simple Streaming Text-to-Speech Synthesis
par: Yang, Yifan, et autres
Publié: (2024)
par: Yang, Yifan, et autres
Publié: (2024)
Exploring the Integration of Large Language Models into Automatic Speech Recognition Systems: An Empirical Study
par: Min, Zeping, et autres
Publié: (2023)
par: Min, Zeping, et autres
Publié: (2023)
VoiceTextBlender: Augmenting Large Language Models with Speech Capabilities via Single-Stage Joint Speech-Text Supervised Fine-Tuning
par: Peng, Yifan, et autres
Publié: (2024)
par: Peng, Yifan, et autres
Publié: (2024)
Benchmarking Automatic Speech Recognition Models for African Languages
par: Nahabwe, Alvin, et autres
Publié: (2025)
par: Nahabwe, Alvin, et autres
Publié: (2025)
Customizing Speech Recognition Model with Large Language Model Feedback
par: Ling, Shaoshi, et autres
Publié: (2025)
par: Ling, Shaoshi, et autres
Publié: (2025)
PAC: Pronunciation-Aware Contextualized Large Language Model-based Automatic Speech Recognition
par: Fu, Li, et autres
Publié: (2025)
par: Fu, Li, et autres
Publié: (2025)
Enhancing Indonesian Automatic Speech Recognition: Evaluating Multilingual Models with Diverse Speech Variabilities
par: Adila, Aulia, et autres
Publié: (2024)
par: Adila, Aulia, et autres
Publié: (2024)
Improving Neural Biasing for Contextual Speech Recognition by Early Context Injection and Text Perturbation
par: Huang, Ruizhe, et autres
Publié: (2024)
par: Huang, Ruizhe, et autres
Publié: (2024)
Empowering Whisper as a Joint Multi-Talker and Target-Talker Speech Recognition System
par: Meng, Lingwei, et autres
Publié: (2024)
par: Meng, Lingwei, et autres
Publié: (2024)
Steering Language Model to Stable Speech Emotion Recognition via Contextual Perception and Chain of Thought
par: Zhao, Zhixian, et autres
Publié: (2025)
par: Zhao, Zhixian, et autres
Publié: (2025)
Granary: Speech Recognition and Translation Dataset in 25 European Languages
par: Koluguri, Nithin Rao, et autres
Publié: (2025)
par: Koluguri, Nithin Rao, et autres
Publié: (2025)
Incorporating Contextual Paralinguistic Understanding in Large Speech-Language Models
par: Wang, Qiongqiong, et autres
Publié: (2025)
par: Wang, Qiongqiong, et autres
Publié: (2025)
Improving Whisper's Recognition Performance for Under-Represented Language Kazakh Leveraging Unpaired Speech and Text
par: Li, Jinpeng, et autres
Publié: (2024)
par: Li, Jinpeng, et autres
Publié: (2024)
Scaling Analysis of Interleaved Speech-Text Language Models
par: Maimon, Gallil, et autres
Publié: (2025)
par: Maimon, Gallil, et autres
Publié: (2025)
Streaming Speech-to-Confusion Network Speech Recognition
par: Filimonov, Denis, et autres
Publié: (2023)
par: Filimonov, Denis, et autres
Publié: (2023)
Documents similaires
-
FNH-TTS: Mixture-of-Experts Duration Modeling for Robust Neural Speech Synthesis
par: Meng, Qingliang, et autres
Publié: (2025) -
Incorporating Class-based Language Model for Named Entity Recognition in Factorized Neural Transducer
par: Wang, Peng, et autres
Publié: (2023) -
Generating Data with Text-to-Speech and Large-Language Models for Conversational Speech Recognition
par: Cornell, Samuele, et autres
Publié: (2024) -
DeSTA: Enhancing Speech Language Models through Descriptive Speech-Text Alignment
par: Lu, Ke-Han, et autres
Publié: (2024) -
Speech Recognition Model Improves Text-to-Speech Synthesis using Fine-Grained Reward
par: Wang, Guansu, et autres
Publié: (2025)