Speech Recognition Model Improves Text-to-Speech Synthesis using Fine-Grained Reward
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Guansu, Sun, Peijie |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Improving Accented Speech Recognition using Data Augmentation based on Unsupervised Text-to-Speech Synthesis
por: Do, Cong-Thanh, et al.
Publicado: (2024)
por: Do, Cong-Thanh, et al.
Publicado: (2024)
Speech Recognition Rescoring with Large Speech-Text Foundation Models
por: Shivakumar, Prashanth Gurunath, et al.
Publicado: (2024)
por: Shivakumar, Prashanth Gurunath, et al.
Publicado: (2024)
Improving Neural Biasing for Contextual Speech Recognition by Early Context Injection and Text Perturbation
por: Huang, Ruizhe, et al.
Publicado: (2024)
por: Huang, Ruizhe, et al.
Publicado: (2024)
Generating Data with Text-to-Speech and Large-Language Models for Conversational Speech Recognition
por: Cornell, Samuele, et al.
Publicado: (2024)
por: Cornell, Samuele, et al.
Publicado: (2024)
TTS-PRISM: A Perceptual Reasoning and Interpretable Speech Model for Fine-Grained Diagnosis
por: Wang, Xi, et al.
Publicado: (2026)
por: Wang, Xi, et al.
Publicado: (2026)
Learning Fine-Grained Controllability on Speech Generation via Efficient Fine-Tuning
por: Chien, Chung-Ming, et al.
Publicado: (2024)
por: Chien, Chung-Ming, et al.
Publicado: (2024)
VoiceTextBlender: Augmenting Large Language Models with Speech Capabilities via Single-Stage Joint Speech-Text Supervised Fine-Tuning
por: Peng, Yifan, et al.
Publicado: (2024)
por: Peng, Yifan, et al.
Publicado: (2024)
Improving Whisper's Recognition Performance for Under-Represented Language Kazakh Leveraging Unpaired Speech and Text
por: Li, Jinpeng, et al.
Publicado: (2024)
por: Li, Jinpeng, et al.
Publicado: (2024)
Streaming Speech-to-Confusion Network Speech Recognition
por: Filimonov, Denis, et al.
Publicado: (2023)
por: Filimonov, Denis, et al.
Publicado: (2023)
Continuous Speech Tokenizer in Text To Speech
por: Li, Yixing, et al.
Publicado: (2024)
por: Li, Yixing, et al.
Publicado: (2024)
Phonetic Enhanced Language Modeling for Text-to-Speech Synthesis
por: Zhou, Kun, et al.
Publicado: (2024)
por: Zhou, Kun, et al.
Publicado: (2024)
Pseudo-Autoregressive Neural Codec Language Models for Efficient Zero-Shot Text-to-Speech Synthesis
por: Yang, Yifan, et al.
Publicado: (2025)
por: Yang, Yifan, et al.
Publicado: (2025)
Towards Efficient Speech-Text Jointly Decoding within One Speech Language Model
por: Wu, Haibin, et al.
Publicado: (2025)
por: Wu, Haibin, et al.
Publicado: (2025)
Improving the Inclusivity of Dutch Speech Recognition by Fine-tuning Whisper on the JASMIN-CGN Corpus
por: Shekoufandeh, Golshid, et al.
Publicado: (2025)
por: Shekoufandeh, Golshid, et al.
Publicado: (2025)
UltraVoice: Scaling Fine-Grained Style-Controlled Speech Conversations for Spoken Dialogue Models
por: Tu, Wenming, et al.
Publicado: (2025)
por: Tu, Wenming, et al.
Publicado: (2025)
DeSTA: Enhancing Speech Language Models through Descriptive Speech-Text Alignment
por: Lu, Ke-Han, et al.
Publicado: (2024)
por: Lu, Ke-Han, et al.
Publicado: (2024)
MTLM: Incorporating Bidirectional Text Information to Enhance Language Model Training in Speech Recognition Systems
por: Meng, Qingliang, et al.
Publicado: (2025)
por: Meng, Qingliang, et al.
Publicado: (2025)
Improving Speech Emotion Recognition in Under-Resourced Languages via Speech-to-Speech Translation with Bootstrapping Data Selection
por: Lin, Hsi-Che, et al.
Publicado: (2024)
por: Lin, Hsi-Che, et al.
Publicado: (2024)
FELLE: Autoregressive Speech Synthesis with Token-Wise Coarse-to-Fine Flow Matching
por: Wang, Hui, et al.
Publicado: (2025)
por: Wang, Hui, et al.
Publicado: (2025)
MahaTTS: A Unified Framework for Multilingual Text-to-Speech Synthesis
por: Singh, Jaskaran, et al.
Publicado: (2025)
por: Singh, Jaskaran, et al.
Publicado: (2025)
Exploring Effective Distillation of Self-Supervised Speech Models for Automatic Speech Recognition
por: Wang, Yujin, et al.
Publicado: (2022)
por: Wang, Yujin, et al.
Publicado: (2022)
Speaker-Aware Simulation Improves Conversational Speech Recognition
por: Gedeon, Máté, et al.
Publicado: (2026)
por: Gedeon, Máté, et al.
Publicado: (2026)
Low-Resource Domain Adaptation for Speech LLMs via Text-Only Fine-Tuning
por: Fang, Yangui, et al.
Publicado: (2025)
por: Fang, Yangui, et al.
Publicado: (2025)
Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition
por: Tseng, Yuan, et al.
Publicado: (2025)
por: Tseng, Yuan, et al.
Publicado: (2025)
Evaluating Speech-to-Text x LLM x Text-to-Speech Combinations for AI Interview Systems
por: Allbert, Rumi, et al.
Publicado: (2025)
por: Allbert, Rumi, et al.
Publicado: (2025)
TagSpeech: End-to-End Multi-Speaker ASR and Diarization with Fine-Grained Temporal Grounding
por: Huo, Mingyue, et al.
Publicado: (2026)
por: Huo, Mingyue, et al.
Publicado: (2026)
SpeechColab Leaderboard: An Open-Source Platform for Automatic Speech Recognition Evaluation
por: Du, Jiayu, et al.
Publicado: (2024)
por: Du, Jiayu, et al.
Publicado: (2024)
Improving Multilingual Speech Models on ML-SUPERB 2.0: Fine-tuning with Data Augmentation and LID-Aware CTC
por: Wang, Qingzheng, et al.
Publicado: (2025)
por: Wang, Qingzheng, et al.
Publicado: (2025)
Chain of Correction for Full-text Speech Recognition with Large Language Models
por: Tang, Zhiyuan, et al.
Publicado: (2025)
por: Tang, Zhiyuan, et al.
Publicado: (2025)
An Empirical Study of Speech Language Models for Prompt-Conditioned Speech Synthesis
por: Peng, Yifan, et al.
Publicado: (2024)
por: Peng, Yifan, et al.
Publicado: (2024)
Enhancing Zero-shot Text-to-Speech Synthesis with Human Feedback
por: Chen, Chen, et al.
Publicado: (2024)
por: Chen, Chen, et al.
Publicado: (2024)
Multi-stage Large Language Model Correction for Speech Recognition
por: Pu, Jie, et al.
Publicado: (2023)
por: Pu, Jie, et al.
Publicado: (2023)
Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs
por: Futami, Hayato, et al.
Publicado: (2025)
por: Futami, Hayato, et al.
Publicado: (2025)
Full-text Error Correction for Chinese Speech Recognition with Large Language Model
por: Tang, Zhiyuan, et al.
Publicado: (2024)
por: Tang, Zhiyuan, et al.
Publicado: (2024)
Revisiting Interpolation Augmentation for Speech-to-Text Generation
por: Xu, Chen, et al.
Publicado: (2024)
por: Xu, Chen, et al.
Publicado: (2024)
PhoWhisper: Automatic Speech Recognition for Vietnamese
por: Le, Thanh-Thien, et al.
Publicado: (2024)
por: Le, Thanh-Thien, et al.
Publicado: (2024)
Zero-resource Speech Translation and Recognition with LLMs
por: Mundnich, Karel, et al.
Publicado: (2024)
por: Mundnich, Karel, et al.
Publicado: (2024)
Robust Zero-Shot Text-to-Speech Synthesis with Reverse Inference Optimization
por: Hu, Yuchen, et al.
Publicado: (2024)
por: Hu, Yuchen, et al.
Publicado: (2024)
Improving Audio Codec-based Zero-Shot Text-to-Speech Synthesis with Multi-Modal Context and Large Language Model
por: Xue, Jinlong, et al.
Publicado: (2024)
por: Xue, Jinlong, et al.
Publicado: (2024)
Dolphin: A Large-Scale Automatic Speech Recognition Model for Eastern Languages
por: Meng, Yangyang, et al.
Publicado: (2025)
por: Meng, Yangyang, et al.
Publicado: (2025)
Ejemplares similares
-
Improving Accented Speech Recognition using Data Augmentation based on Unsupervised Text-to-Speech Synthesis
por: Do, Cong-Thanh, et al.
Publicado: (2024) -
Speech Recognition Rescoring with Large Speech-Text Foundation Models
por: Shivakumar, Prashanth Gurunath, et al.
Publicado: (2024) -
Improving Neural Biasing for Contextual Speech Recognition by Early Context Injection and Text Perturbation
por: Huang, Ruizhe, et al.
Publicado: (2024) -
Generating Data with Text-to-Speech and Large-Language Models for Conversational Speech Recognition
por: Cornell, Samuele, et al.
Publicado: (2024) -
TTS-PRISM: A Perceptual Reasoning and Interpretable Speech Model for Fine-Grained Diagnosis
por: Wang, Xi, et al.
Publicado: (2026)