FMSD-TTS: Few-shot Multi-Speaker Multi-Dialect Text-to-Speech Synthesis for Ü-Tsang, Amdo and Kham Speech Dataset Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Yutong, Zhang, Ziyue, Ma-bao, Ban, Cai, Yuqing, Yu, Yongbin, Duojie, Renzeng, Wang, Xiangxiang, Gao, Fan, Huang, Cheng, Tashi, Nyima |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
TMD-TTS: A Unified Tibetan Multi-Dialect Text-to-Speech Framework for Ü-Tsang, Amdo and Kham Speech Dataset Generation
par: Liu, Yutong, et autres
Publié: (2025)
par: Liu, Yutong, et autres
Publié: (2025)
Listening, Imagining & Refining: A Heuristic Optimized ASR Correction Framework with LLMs
par: Liu, Yutong, et autres
Publié: (2025)
par: Liu, Yutong, et autres
Publié: (2025)
Context-Aware Dynamic Chunking for Streaming Tibetan Speech Recognition
par: Wang, Chao, et autres
Publié: (2025)
par: Wang, Chao, et autres
Publié: (2025)
TiSpell: A Semi-Masked Methodology for Tibetan Spelling Correction covering Multi-Level Error with Data Augmentation
par: Liu, Yutong, et autres
Publié: (2025)
par: Liu, Yutong, et autres
Publié: (2025)
ASRRL-TTS: Agile Speaker Representation Reinforcement Learning for Text-to-Speech Speaker Adaptation
par: Fu, Ruibo, et autres
Publié: (2024)
par: Fu, Ruibo, et autres
Publié: (2024)
A Multi-Dialectal Dataset for German Dialect ASR and Dialect-to-Standard Speech Translation
par: Blaschke, Verena, et autres
Publié: (2025)
par: Blaschke, Verena, et autres
Publié: (2025)
TIBSTC-CoT: A Multi-Domain Instruction Dataset for Chain-of-Thought Reasoning in Language Models
par: Gao, Fan, et autres
Publié: (2025)
par: Gao, Fan, et autres
Publié: (2025)
Zero-Shot vs. Few-Shot Multi-Speaker TTS Using Pre-trained Czech SpeechT5 Model
par: Lehečka, Jan, et autres
Publié: (2024)
par: Lehečka, Jan, et autres
Publié: (2024)
MSceneSpeech: A Multi-Scene Speech Dataset For Expressive Speech Synthesis
par: Yang, Qian, et autres
Publié: (2024)
par: Yang, Qian, et autres
Publié: (2024)
KazEmoTTS: A Dataset for Kazakh Emotional Text-to-Speech Synthesis
par: Abilbekov, Adal, et autres
Publié: (2024)
par: Abilbekov, Adal, et autres
Publié: (2024)
Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting
par: Han, Wooseok, et autres
Publié: (2024)
par: Han, Wooseok, et autres
Publié: (2024)
Nord-Parl-TTS: Finnish and Swedish TTS Dataset from Parliament Speech
par: Li, Zirui, et autres
Publié: (2025)
par: Li, Zirui, et autres
Publié: (2025)
Multi-Scale Accent Modeling and Disentangling for Multi-Speaker Multi-Accent Text-to-Speech Synthesis
par: Zhou, Xuehao, et autres
Publié: (2024)
par: Zhou, Xuehao, et autres
Publié: (2024)
Generating Speakers by Prompting Listener Impressions for Pre-trained Multi-Speaker Text-to-Speech Systems
par: Chen, Zhengyang, et autres
Publié: (2024)
par: Chen, Zhengyang, et autres
Publié: (2024)
Cross-Dialect Text-To-Speech in Pitch-Accent Language Incorporating Multi-Dialect Phoneme-Level BERT
par: Yamauchi, Kazuki, et autres
Publié: (2024)
par: Yamauchi, Kazuki, et autres
Publié: (2024)
AISHELL-5: The First Open-Source In-Car Multi-Channel Multi-Speaker Speech Dataset for Automatic Speech Diarization and Recognition
par: Dai, Yuhang, et autres
Publié: (2025)
par: Dai, Yuhang, et autres
Publié: (2025)
An Exploration of ECAPA-TDNN and x-vector Speaker Representations in Zero-shot Multi-speaker TTS
par: Kunešová, Marie, et autres
Publié: (2025)
par: Kunešová, Marie, et autres
Publié: (2025)
MM-TTS: Multi-modal Prompt based Style Transfer for Expressive Text-to-Speech Synthesis
par: Guan, Wenhao, et autres
Publié: (2023)
par: Guan, Wenhao, et autres
Publié: (2023)
In This Environment, As That Speaker: A Text-Driven Framework for Multi-Attribute Speech Conversion
par: Jin, Jiawei, et autres
Publié: (2025)
par: Jin, Jiawei, et autres
Publié: (2025)
Bailing-TTS: Chinese Dialectal Speech Synthesis Towards Human-like Spontaneous Representation
par: Di, Xinhan, et autres
Publié: (2024)
par: Di, Xinhan, et autres
Publié: (2024)
ZMM-TTS: Zero-shot Multilingual and Multispeaker Speech Synthesis Conditioned on Self-supervised Discrete Speech Representations
par: Gong, Cheng, et autres
Publié: (2023)
par: Gong, Cheng, et autres
Publié: (2023)
Enhancing Zero-Shot Multi-Speaker TTS with Negated Speaker Representations
par: Jeon, Yejin, et autres
Publié: (2024)
par: Jeon, Yejin, et autres
Publié: (2024)
DisfluencySpeech -- Single-Speaker Conversational Speech Dataset with Paralanguage
par: Wang, Kyra, et autres
Publié: (2024)
par: Wang, Kyra, et autres
Publié: (2024)
ControlSpeech: Towards Simultaneous and Independent Zero-shot Speaker Cloning and Zero-shot Language Style Control
par: Ji, Shengpeng, et autres
Publié: (2024)
par: Ji, Shengpeng, et autres
Publié: (2024)
FNH-TTS: Mixture-of-Experts Duration Modeling for Robust Neural Speech Synthesis
par: Meng, Qingliang, et autres
Publié: (2025)
par: Meng, Qingliang, et autres
Publié: (2025)
Progressive Residual Extraction based Pre-training for Speech Representation Learning
par: Wang, Tianrui, et autres
Publié: (2024)
par: Wang, Tianrui, et autres
Publié: (2024)
ViT-TTS: Visual Text-to-Speech with Scalable Diffusion Transformer
par: Liu, Huadai, et autres
Publié: (2023)
par: Liu, Huadai, et autres
Publié: (2023)
Raon-OpenTTS: Open Models and Data for Robust Text-to-Speech
par: Kim, Semin, et autres
Publié: (2026)
par: Kim, Semin, et autres
Publié: (2026)
MPE-TTS: Customized Emotion Zero-Shot Text-To-Speech Using Multi-Modal Prompt
par: Wu, Zhichao, et autres
Publié: (2025)
par: Wu, Zhichao, et autres
Publié: (2025)
MunTTS: A Text-to-Speech System for Mundari
par: Gumma, Varun, et autres
Publié: (2024)
par: Gumma, Varun, et autres
Publié: (2024)
Erasing Your Voice Before It's Heard: Training-free Speaker Unlearning for Zero-shot Text-to-Speech
par: Lee, Myungjin, et autres
Publié: (2026)
par: Lee, Myungjin, et autres
Publié: (2026)
ArVoice: A Multi-Speaker Dataset for Arabic Speech Synthesis
par: Toyin, Hawau Olamide, et autres
Publié: (2025)
par: Toyin, Hawau Olamide, et autres
Publié: (2025)
NanoVoice: Efficient Speaker-Adaptive Text-to-Speech for Multiple Speakers
par: Park, Nohil, et autres
Publié: (2024)
par: Park, Nohil, et autres
Publié: (2024)
FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications
par: Guo, Hao-Han, et autres
Publié: (2024)
par: Guo, Hao-Han, et autres
Publié: (2024)
OV-InstructTTS: Towards Open-Vocabulary Instruct Text-to-Speech
par: Ren, Yong, et autres
Publié: (2026)
par: Ren, Yong, et autres
Publié: (2026)
Towards Zero-Shot Text-To-Speech for Arabic Dialects
par: Doan, Khai Duy, et autres
Publié: (2024)
par: Doan, Khai Duy, et autres
Publié: (2024)
Disentangling Speakers in Multi-Talker Speech Recognition with Speaker-Aware CTC
par: Kang, Jiawen, et autres
Publié: (2024)
par: Kang, Jiawen, et autres
Publié: (2024)
StoryTTS: A Highly Expressive Text-to-Speech Dataset with Rich Textual Expressiveness Annotations
par: Liu, Sen, et autres
Publié: (2024)
par: Liu, Sen, et autres
Publié: (2024)
Few-shot Personalization via In-Context Learning for Speech Emotion Recognition based on Speech-Language Model
par: Ihori, Mana, et autres
Publié: (2025)
par: Ihori, Mana, et autres
Publié: (2025)
Leveraging Speech PTM, Text LLM, and Emotional TTS for Speech Emotion Recognition
par: Ma, Ziyang, et autres
Publié: (2023)
par: Ma, Ziyang, et autres
Publié: (2023)
Documents similaires
-
TMD-TTS: A Unified Tibetan Multi-Dialect Text-to-Speech Framework for Ü-Tsang, Amdo and Kham Speech Dataset Generation
par: Liu, Yutong, et autres
Publié: (2025) -
Listening, Imagining & Refining: A Heuristic Optimized ASR Correction Framework with LLMs
par: Liu, Yutong, et autres
Publié: (2025) -
Context-Aware Dynamic Chunking for Streaming Tibetan Speech Recognition
par: Wang, Chao, et autres
Publié: (2025) -
TiSpell: A Semi-Masked Methodology for Tibetan Spelling Correction covering Multi-Level Error with Data Augmentation
par: Liu, Yutong, et autres
Publié: (2025) -
ASRRL-TTS: Agile Speaker Representation Reinforcement Learning for Text-to-Speech Speaker Adaptation
par: Fu, Ruibo, et autres
Publié: (2024)