Boosting Large Language Model for Speech Synthesis: An Empirical Study
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hao, Hongkun, Zhou, Long, Liu, Shujie, Li, Jinyu, Hu, Shujie, Wang, Rui, Wei, Furu |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
WavLLM: Towards Robust and Adaptive Speech Large Language Model
par: Hu, Shujie, et autres
Publié: (2024)
par: Hu, Shujie, et autres
Publié: (2024)
Autoregressive Speech Synthesis without Vector Quantization
par: Meng, Lingwei, et autres
Publié: (2024)
par: Meng, Lingwei, et autres
Publié: (2024)
VALL-E 2: Neural Codec Language Models are Human Parity Zero-Shot Text to Speech Synthesizers
par: Chen, Sanyuan, et autres
Publié: (2024)
par: Chen, Sanyuan, et autres
Publié: (2024)
VALL-E R: Robust and Efficient Zero-Shot Text-to-Speech Synthesis via Monotonic Alignment
par: Han, Bing, et autres
Publié: (2024)
par: Han, Bing, et autres
Publié: (2024)
Closing the Modality Reasoning Gap for Speech Large Language Models
par: Wang, Chaoren, et autres
Publié: (2026)
par: Wang, Chaoren, et autres
Publié: (2026)
WavMark: Watermarking for Audio Generation
par: Chen, Guangyu, et autres
Publié: (2023)
par: Chen, Guangyu, et autres
Publié: (2023)
FELLE: Autoregressive Speech Synthesis with Token-Wise Coarse-to-Fine Flow Matching
par: Wang, Hui, et autres
Publié: (2025)
par: Wang, Hui, et autres
Publié: (2025)
StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling
par: Wang, Hui, et autres
Publié: (2025)
par: Wang, Hui, et autres
Publié: (2025)
Advanced Long-Content Speech Recognition With Factorized Neural Transducer
par: Gong, Xun, et autres
Publié: (2024)
par: Gong, Xun, et autres
Publié: (2024)
An Empirical Study of Speech Language Models for Prompt-Conditioned Speech Synthesis
par: Peng, Yifan, et autres
Publié: (2024)
par: Peng, Yifan, et autres
Publié: (2024)
Next Tokens Denoising for Speech Synthesis
par: Liu, Yanqing, et autres
Publié: (2025)
par: Liu, Yanqing, et autres
Publié: (2025)
SpeechX: Neural Codec Language Model as a Versatile Speech Transformer
par: Wang, Xiaofei, et autres
Publié: (2023)
par: Wang, Xiaofei, et autres
Publié: (2023)
Investigating Neural Audio Codecs for Speech Language Model-Based Speech Generation
par: Li, Jiaqi, et autres
Publié: (2024)
par: Li, Jiaqi, et autres
Publié: (2024)
Large Language Model Can Transcribe Speech in Multi-Talker Scenarios with Versatile Instructions
par: Meng, Lingwei, et autres
Publié: (2024)
par: Meng, Lingwei, et autres
Publié: (2024)
TransVIP: Speech to Speech Translation System with Voice and Isochrony Preservation
par: Le, Chenyang, et autres
Publié: (2024)
par: Le, Chenyang, et autres
Publié: (2024)
Regularized Federated Learning for Privacy-Preserving Dysarthric and Elderly Speech Recognition
par: Zhong, Tao, et autres
Publié: (2025)
par: Zhong, Tao, et autres
Publié: (2025)
Exploring the Integration of Large Language Models into Automatic Speech Recognition Systems: An Empirical Study
par: Min, Zeping, et autres
Publié: (2023)
par: Min, Zeping, et autres
Publié: (2023)
Exploring SSL Discrete Speech Features for Zipformer-based Contextual ASR
par: Cui, Mingyu, et autres
Publié: (2024)
par: Cui, Mingyu, et autres
Publié: (2024)
A Unified Neural Codec Language Model for Selective Editable Text to Speech Generation
par: Pei, Hanchen, et autres
Publié: (2026)
par: Pei, Hanchen, et autres
Publié: (2026)
SpeechLLM-as-Judges: Towards General and Interpretable Speech Quality Evaluation
par: Wang, Hui, et autres
Publié: (2025)
par: Wang, Hui, et autres
Publié: (2025)
Continuous Speech Tokens Makes LLMs Robust Multi-Modality Learners
par: Yuan, Ze, et autres
Publié: (2024)
par: Yuan, Ze, et autres
Publié: (2024)
RALL-E: Robust Codec Language Modeling with Chain-of-Thought Prompting for Text-to-Speech Synthesis
par: Xin, Detai, et autres
Publié: (2024)
par: Xin, Detai, et autres
Publié: (2024)
Phonetic Enhanced Language Modeling for Text-to-Speech Synthesis
par: Zhou, Kun, et autres
Publié: (2024)
par: Zhou, Kun, et autres
Publié: (2024)
Generative Expressive Conversational Speech Synthesis
par: Liu, Rui, et autres
Publié: (2024)
par: Liu, Rui, et autres
Publié: (2024)
SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models
par: Zhang, Xin, et autres
Publié: (2023)
par: Zhang, Xin, et autres
Publié: (2023)
Leveraging Large Language Models for Spontaneous Speech-Based Suicide Risk Detection
par: Gao, Yifan, et autres
Publié: (2025)
par: Gao, Yifan, et autres
Publié: (2025)
Intra- and Inter-modal Context Interaction Modeling for Conversational Speech Synthesis
par: Jia, Zhenqi, et autres
Publié: (2024)
par: Jia, Zhenqi, et autres
Publié: (2024)
An End-to-End Speech Summarization Using Large Language Model
par: Shang, Hengchao, et autres
Publié: (2024)
par: Shang, Hengchao, et autres
Publié: (2024)
StreamUni: Achieving Streaming Speech Translation with a Unified Large Speech-Language Model
par: Guo, Shoutao, et autres
Publié: (2025)
par: Guo, Shoutao, et autres
Publié: (2025)
NDVQ: Robust Neural Audio Codec with Normal Distribution-Based Vector Quantization
par: Niu, Zhikang, et autres
Publié: (2024)
par: Niu, Zhikang, et autres
Publié: (2024)
S2SBench: A Benchmark for Quantifying Intelligence Degradation in Speech-to-Speech Large Language Models
par: Fang, Yuanbo, et autres
Publié: (2025)
par: Fang, Yuanbo, et autres
Publié: (2025)
SEAL: Speech Embedding Alignment Learning for Speech Large Language Model with Retrieval-Augmented Generation
par: Sun, Chunyu, et autres
Publié: (2025)
par: Sun, Chunyu, et autres
Publié: (2025)
LongCat-AudioDiT: High-Fidelity Diffusion Text-to-Speech in the Waveform Latent Space
par: Xin, Detai, et autres
Publié: (2026)
par: Xin, Detai, et autres
Publié: (2026)
DDTSE: Discriminative Diffusion Model for Target Speech Extraction
par: Zhang, Leying, et autres
Publié: (2023)
par: Zhang, Leying, et autres
Publié: (2023)
Frozen Large Language Models Can Perceive Paralinguistic Aspects of Speech
par: Kang, Wonjune, et autres
Publié: (2024)
par: Kang, Wonjune, et autres
Publié: (2024)
Enhancing Pre-trained ASR System Fine-tuning for Dysarthric Speech Recognition using Adversarial Data Augmentation
par: Wang, Huimeng, et autres
Publié: (2024)
par: Wang, Huimeng, et autres
Publié: (2024)
Phone-purity Guided Discrete Tokens for Dysarthric Speech Recognition
par: Wang, Huimeng, et autres
Publié: (2025)
par: Wang, Huimeng, et autres
Publié: (2025)
Soft Language Identification for Language-Agnostic Many-to-One End-to-End Speech Translation
par: Wang, Peidong, et autres
Publié: (2024)
par: Wang, Peidong, et autres
Publié: (2024)
Structured Speaker-Deficiency Adaptation of Foundation Models for Dysarthric and Elderly Speech Recognition
par: Hu, Shujie, et autres
Publié: (2024)
par: Hu, Shujie, et autres
Publié: (2024)
V2SFlow: Video-to-Speech Generation with Speech Decomposition and Rectified Flow
par: Choi, Jeongsoo, et autres
Publié: (2024)
par: Choi, Jeongsoo, et autres
Publié: (2024)
Documents similaires
-
WavLLM: Towards Robust and Adaptive Speech Large Language Model
par: Hu, Shujie, et autres
Publié: (2024) -
Autoregressive Speech Synthesis without Vector Quantization
par: Meng, Lingwei, et autres
Publié: (2024) -
VALL-E 2: Neural Codec Language Models are Human Parity Zero-Shot Text to Speech Synthesizers
par: Chen, Sanyuan, et autres
Publié: (2024) -
VALL-E R: Robust and Efficient Zero-Shot Text-to-Speech Synthesis via Monotonic Alignment
par: Han, Bing, et autres
Publié: (2024) -
Closing the Modality Reasoning Gap for Speech Large Language Models
par: Wang, Chaoren, et autres
Publié: (2026)