Phonetic Enhanced Language Modeling for Text-to-Speech Synthesis
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhou, Kun, Zhao, Shengkui, Ma, Yukun, Zhang, Chong, Wang, Hao, Ng, Dianwen, Ni, Chongjia, Hieu, Nguyen Trung, Yip, Jia Qi, Ma, Bin |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MossFormer2: Combining Transformer and RNN-Free Recurrent Network for Enhanced Time-Domain Monaural Speech Separation
par: Zhao, Shengkui, et autres
Publié: (2023)
par: Zhao, Shengkui, et autres
Publié: (2023)
SPGM: Prioritizing Local Features for enhanced speech separation performance
par: Yip, Jia Qi, et autres
Publié: (2023)
par: Yip, Jia Qi, et autres
Publié: (2023)
Towards Audio Codec-based Speech Separation
par: Yip, Jia Qi, et autres
Publié: (2024)
par: Yip, Jia Qi, et autres
Publié: (2024)
Emotional Dimension Control in Language Model-Based Text-to-Speech: Spanning a Broad Spectrum of Human Emotions
par: Zhou, Kun, et autres
Publié: (2024)
par: Zhou, Kun, et autres
Publié: (2024)
Monaural Speech Enhancement with Complex Convolutional Block Attention Module and Joint Time Frequency Losses
par: Zhao, Shengkui, et autres
Publié: (2021)
par: Zhao, Shengkui, et autres
Publié: (2021)
Conditional Latent Diffusion-Based Speech Enhancement Via Dual Context Learning
par: Zhao, Shengkui, et autres
Publié: (2025)
par: Zhao, Shengkui, et autres
Publié: (2025)
HiFi-SR: A Unified Generative Transformer-Convolutional Adversarial Network for High-Fidelity Speech Super-Resolution
par: Zhao, Shengkui, et autres
Publié: (2025)
par: Zhao, Shengkui, et autres
Publié: (2025)
Online Audio-Visual Autoregressive Speaker Extraction
par: Pan, Zexu, et autres
Publié: (2025)
par: Pan, Zexu, et autres
Publié: (2025)
ClearerVoice-Studio: Bridging Advanced Speech Processing Research and Practical Deployment
par: Zhao, Shengkui, et autres
Publié: (2025)
par: Zhao, Shengkui, et autres
Publié: (2025)
InspireMusic: Integrating Super Resolution and Large Language Model for High-Fidelity Long-Form Music Generation
par: Zhang, Chong, et autres
Publié: (2025)
par: Zhang, Chong, et autres
Publié: (2025)
Plug-and-Play Co-Occurring Face Attention for Robust Audio-Visual Speaker Extraction
par: Pan, Zexu, et autres
Publié: (2025)
par: Pan, Zexu, et autres
Publié: (2025)
FRCRN: Boosting Feature Representation using Frequency Recurrence for Monaural Speech Enhancement
par: Zhao, Shengkui, et autres
Publié: (2022)
par: Zhao, Shengkui, et autres
Publié: (2022)
Multi-band Frequency Reconstruction for Neural Psychoacoustic Coding
par: Ng, Dianwen, et autres
Publié: (2025)
par: Ng, Dianwen, et autres
Publié: (2025)
PhiNet: Speaker Verification with Phonetic Interpretability
par: Ma, Yi, et autres
Publié: (2026)
par: Ma, Yi, et autres
Publié: (2026)
Whistle: Data-Efficient Multilingual and Crosslingual Speech Recognition via Weakly Phonetic Supervision
par: Yusuyin, Saierdaer, et autres
Publié: (2024)
par: Yusuyin, Saierdaer, et autres
Publié: (2024)
Hierarchical Emotion Prediction and Control in Text-to-Speech Synthesis
par: Inoue, Sho, et autres
Publié: (2024)
par: Inoue, Sho, et autres
Publié: (2024)
Rethinking Speech Representation Aggregation in Speech Enhancement: A Phonetic Mutual Information Perspective
par: Han, Seungu, et autres
Publié: (2026)
par: Han, Seungu, et autres
Publié: (2026)
Zero-Shot Text-to-Speech from Continuous Text Streams
par: Dang, Trung, et autres
Publié: (2024)
par: Dang, Trung, et autres
Publié: (2024)
Dataset-Distillation Generative Model for Speech Emotion Recognition
par: Ritter-Gutierrez, Fabian, et autres
Publié: (2024)
par: Ritter-Gutierrez, Fabian, et autres
Publié: (2024)
Multi-Step Prediction and Control of Hierarchical Emotion Distribution in Text-to-Speech Synthesis
par: Inoue, Sho, et autres
Publié: (2025)
par: Inoue, Sho, et autres
Publié: (2025)
FD-Bench: A Full-Duplex Benchmarking Pipeline Designed for Full Duplex Spoken Dialogue Systems
par: Peng, Yizhou, et autres
Publié: (2025)
par: Peng, Yizhou, et autres
Publié: (2025)
LiveSpeech: Low-Latency Zero-shot Text-to-Speech via Autoregressive Modeling of Audio Discrete Codes
par: Dang, Trung, et autres
Publié: (2024)
par: Dang, Trung, et autres
Publié: (2024)
E2E-AEC: Implementing an end-to-end neural network learning approach for acoustic echo cancellation
par: Jiang, Yiheng, et autres
Publié: (2026)
par: Jiang, Yiheng, et autres
Publié: (2026)
Quantifying and Reducing Speaker Heterogeneity within the Common Voice Corpus for Phonetic Analysis
par: Zhang, Miao, et autres
Publié: (2025)
par: Zhang, Miao, et autres
Publié: (2025)
DAIEN-TTS: Disentangled Audio Infilling for Environment-Aware Text-to-Speech Synthesis
par: Lu, Ye-Xin, et autres
Publié: (2025)
par: Lu, Ye-Xin, et autres
Publié: (2025)
SoCodec: A Semantic-Ordered Multi-Stream Speech Codec for Efficient Language Model Based Text-to-Speech Synthesis
par: Guo, Haohan, et autres
Publié: (2024)
par: Guo, Haohan, et autres
Publié: (2024)
FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications
par: Guo, Hao-Han, et autres
Publié: (2024)
par: Guo, Hao-Han, et autres
Publié: (2024)
Word-Level Emotional Expression Control in Zero-Shot Text-to-Speech Synthesis
par: Wang, Tianrui, et autres
Publié: (2025)
par: Wang, Tianrui, et autres
Publié: (2025)
MAGE: A Coarse-to-Fine Speech Enhancer with Masked Generative Model
par: Pham, The Hieu, et autres
Publié: (2025)
par: Pham, The Hieu, et autres
Publié: (2025)
Comprehend and Talk: Text to Speech Synthesis via Dual Language Modeling
par: Cao, Junjie, et autres
Publié: (2025)
par: Cao, Junjie, et autres
Publié: (2025)
Synthetic Data Domain Adaptation for ASR via LLM-based Text and Phonetic Respelling Augmentation
par: Yamashita, Natsuo, et autres
Publié: (2026)
par: Yamashita, Natsuo, et autres
Publié: (2026)
Enhancing Emotional Text-to-Speech Controllability with Natural Language Guidance through Contrastive Learning and Diffusion Models
par: Jing, Xin, et autres
Publié: (2024)
par: Jing, Xin, et autres
Publié: (2024)
Enhancing Child Vocalization Classification with Phonetically-Tuned Embeddings for Assisting Autism Diagnosis
par: Li, Jialu, et autres
Publié: (2023)
par: Li, Jialu, et autres
Publié: (2023)
High-Fidelity Neural Phonetic Posteriorgrams
par: Churchwell, Cameron, et autres
Publié: (2024)
par: Churchwell, Cameron, et autres
Publié: (2024)
Advancing Electrolaryngeal Speech Enhancement Through Speech-Text Representation Learning
par: Ma, Ding, et autres
Publié: (2026)
par: Ma, Ding, et autres
Publié: (2026)
SCRAPS: Speech Contrastive Representations of Acoustic and Phonetic Spaces
par: Vallés-Pérez, Ivan, et autres
Publié: (2023)
par: Vallés-Pérez, Ivan, et autres
Publié: (2023)
EELE: Exploring Efficient and Extensible LoRA Integration in Emotional Text-to-Speech
par: Qi, Xin, et autres
Publié: (2024)
par: Qi, Xin, et autres
Publié: (2024)
Hierarchical Control of Emotion Rendering in Speech Synthesis
par: Inoue, Sho, et autres
Publié: (2024)
par: Inoue, Sho, et autres
Publié: (2024)
Enhancing Crowdsourced Audio for Text-to-Speech Models
par: Giraldo, José, et autres
Publié: (2024)
par: Giraldo, José, et autres
Publié: (2024)
Training Data Augmentation for Dysarthric Automatic Speech Recognition by Text-to-Dysarthric-Speech Synthesis
par: Leung, Wing-Zin, et autres
Publié: (2024)
par: Leung, Wing-Zin, et autres
Publié: (2024)
Documents similaires
-
MossFormer2: Combining Transformer and RNN-Free Recurrent Network for Enhanced Time-Domain Monaural Speech Separation
par: Zhao, Shengkui, et autres
Publié: (2023) -
SPGM: Prioritizing Local Features for enhanced speech separation performance
par: Yip, Jia Qi, et autres
Publié: (2023) -
Towards Audio Codec-based Speech Separation
par: Yip, Jia Qi, et autres
Publié: (2024) -
Emotional Dimension Control in Language Model-Based Text-to-Speech: Spanning a Broad Spectrum of Human Emotions
par: Zhou, Kun, et autres
Publié: (2024) -
Monaural Speech Enhancement with Complex Convolutional Block Attention Module and Joint Time Frequency Losses
par: Zhao, Shengkui, et autres
Publié: (2021)