An Initial Investigation of Language Adaptation for TTS Systems under Low-resource Scenarios
Fuente:
arXiv
Salvato in:
| Autori principali: | Gong, Cheng, Cooper, Erica, Wang, Xin, Qiang, Chunyu, Geng, Mengzhe, Wells, Dan, Wang, Longbiao, Dang, Jianwu, Tessier, Marc, Pine, Aidan, Richmond, Korin, Yamagishi, Junichi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ZMM-TTS: Zero-shot Multilingual and Multispeaker Speech Synthesis Conditioned on Self-supervised Discrete Speech Representations
di: Gong, Cheng, et al.
Pubblicazione: (2023)
di: Gong, Cheng, et al.
Pubblicazione: (2023)
Expressive Prompting: Improving Emotion Intensity and Speaker Consistency in Zero-Shot TTS
di: Wang, Haoyu, et al.
Pubblicazione: (2024)
di: Wang, Haoyu, et al.
Pubblicazione: (2024)
Supporting SENCOTEN Language Documentation Efforts with Automatic Speech Recognition
di: Geng, Mengzhe, et al.
Pubblicazione: (2025)
di: Geng, Mengzhe, et al.
Pubblicazione: (2025)
Perturbation Self-Supervised Representations for Cross-Lingual Emotion TTS: Stage-Wise Modeling of Emotion and Speaker
di: Gong, Cheng, et al.
Pubblicazione: (2025)
di: Gong, Cheng, et al.
Pubblicazione: (2025)
Efficient Emotion and Speaker Adaptation in LLM-Based TTS via Characteristic-Specific Partial Fine-Tuning
di: Wang, Tianrui, et al.
Pubblicazione: (2025)
di: Wang, Tianrui, et al.
Pubblicazione: (2025)
Pairwise Evaluation of Accent Similarity in Speech Synthesis
di: Zhong, Jinzuomu, et al.
Pubblicazione: (2025)
di: Zhong, Jinzuomu, et al.
Pubblicazione: (2025)
MSR-HuBERT: Self-supervised Pre-training for Adaptation to Multiple Sampling Rates
di: Huang, Zikang, et al.
Pubblicazione: (2026)
di: Huang, Zikang, et al.
Pubblicazione: (2026)
ASDA: Audio Spectrogram Differential Attention Mechanism for Self-Supervised Representation Learning
di: Wang, Junyu, et al.
Pubblicazione: (2025)
di: Wang, Junyu, et al.
Pubblicazione: (2025)
Acquiring Pronunciation Knowledge from Transcribed Speech Audio via Multi-task Learning
di: Sun, Siqi, et al.
Pubblicazione: (2024)
di: Sun, Siqi, et al.
Pubblicazione: (2024)
Towards An Integrated Approach for Expressive Piano Performance Synthesis from Music Scores
di: Tang, Jingjing, et al.
Pubblicazione: (2025)
di: Tang, Jingjing, et al.
Pubblicazione: (2025)
Spoofing-Aware Speaker Verification Robust Against Domain and Channel Mismatches
di: Zeng, Chang, et al.
Pubblicazione: (2024)
di: Zeng, Chang, et al.
Pubblicazione: (2024)
Enriching Multimodal Sentiment Analysis through Textual Emotional Descriptions of Visual-Audio Content
di: Wu, Sheng, et al.
Pubblicazione: (2024)
di: Wu, Sheng, et al.
Pubblicazione: (2024)
Good practices for evaluation of synthesized speech
di: Cooper, Erica, et al.
Pubblicazione: (2025)
di: Cooper, Erica, et al.
Pubblicazione: (2025)
InstructAudio: Unified speech and music generation with natural language instruction
di: Qiang, Chunyu, et al.
Pubblicazione: (2025)
di: Qiang, Chunyu, et al.
Pubblicazione: (2025)
LORT: Locally Refined Convolution and Taylor Transformer for Monaural Speech Enhancement
di: Wang, Junyu, et al.
Pubblicazione: (2025)
di: Wang, Junyu, et al.
Pubblicazione: (2025)
Mamba-SEUNet: Mamba UNet for Monaural Speech Enhancement
di: Wang, Junyu, et al.
Pubblicazione: (2024)
di: Wang, Junyu, et al.
Pubblicazione: (2024)
Generating Speakers by Prompting Listener Impressions for Pre-trained Multi-Speaker Text-to-Speech Systems
di: Chen, Zhengyang, et al.
Pubblicazione: (2024)
di: Chen, Zhengyang, et al.
Pubblicazione: (2024)
AIMDiT: Modality Augmentation and Interaction via Multimodal Dimension Transformation for Emotion Recognition in Conversations
di: Wu, Sheng, et al.
Pubblicazione: (2024)
di: Wu, Sheng, et al.
Pubblicazione: (2024)
Error Correction by Paying Attention to Both Acoustic and Confidence References for Automatic Speech Recognition
di: Shu, Yuchun, et al.
Pubblicazione: (2024)
di: Shu, Yuchun, et al.
Pubblicazione: (2024)
SecoustiCodec: Cross-Modal Aligned Streaming Single-Codecbook Speech Codec
di: Qiang, Chunyu, et al.
Pubblicazione: (2025)
di: Qiang, Chunyu, et al.
Pubblicazione: (2025)
Rethinking Discrete Speech Representation Tokens for Accent Generation
di: Zhong, Jinzuomu, et al.
Pubblicazione: (2026)
di: Zhong, Jinzuomu, et al.
Pubblicazione: (2026)
VQ-CTAP: Cross-Modal Fine-Grained Sequence Representation Learning for Speech Processing
di: Qiang, Chunyu, et al.
Pubblicazione: (2024)
di: Qiang, Chunyu, et al.
Pubblicazione: (2024)
CECOR: Correction-oriented synthetic data construction for factual error correction
di: Zhu, Lei, et al.
Pubblicazione: (2026)
di: Zhu, Lei, et al.
Pubblicazione: (2026)
Word-Level Emotional Expression Control in Zero-Shot Text-to-Speech Synthesis
di: Wang, Tianrui, et al.
Pubblicazione: (2025)
di: Wang, Tianrui, et al.
Pubblicazione: (2025)
Spoof Diarization: "What Spoofed When" in Partially Spoofed Audio
di: Zhang, Lin, et al.
Pubblicazione: (2024)
di: Zhang, Lin, et al.
Pubblicazione: (2024)
Rethinking Contrastive Learning in Graph Anomaly Detection: A Clean-View Perspective
di: Jin, Di, et al.
Pubblicazione: (2025)
di: Jin, Di, et al.
Pubblicazione: (2025)
UniSonate: A Unified Model for Speech, Music, and Sound Effect Generation with Text Instructions
di: Qiang, Chunyu, et al.
Pubblicazione: (2026)
di: Qiang, Chunyu, et al.
Pubblicazione: (2026)
Reducing the Gap Between Pretrained Speech Enhancement and Recognition Models Using a Real Speech-Trained Bridging Module
di: Cui, Zhongjian, et al.
Pubblicazione: (2025)
di: Cui, Zhongjian, et al.
Pubblicazione: (2025)
Cross-Lingual Speech Emotion Recognition: Humans vs. Self-Supervised Models
di: Han, Zhichen, et al.
Pubblicazione: (2024)
di: Han, Zhichen, et al.
Pubblicazione: (2024)
Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information
di: Sanders, Nicholas, et al.
Pubblicazione: (2025)
di: Sanders, Nicholas, et al.
Pubblicazione: (2025)
Exploring Acoustic Similarity in Emotional Speech and Music via Self-Supervised Representations
di: Sun, Yujia, et al.
Pubblicazione: (2024)
di: Sun, Yujia, et al.
Pubblicazione: (2024)
AccentBox: Towards High-Fidelity Zero-Shot Accent Generation
di: Zhong, Jinzuomu, et al.
Pubblicazione: (2024)
di: Zhong, Jinzuomu, et al.
Pubblicazione: (2024)
A Preliminary Case Study on Long-Form In-the-Wild Audio Spoofing Detection
di: Liu, Xuechen, et al.
Pubblicazione: (2024)
di: Liu, Xuechen, et al.
Pubblicazione: (2024)
Towards Data Drift Monitoring for Speech Deepfake Detection in the context of MLOps
di: Wang, Xin, et al.
Pubblicazione: (2025)
di: Wang, Xin, et al.
Pubblicazione: (2025)
Does Fine-tuning by Reinforcement Learning Improve Generalization in Binary Speech Deepfake Detection?
di: Wang, Xin, et al.
Pubblicazione: (2026)
di: Wang, Xin, et al.
Pubblicazione: (2026)
Zero-Day Audio DeepFake Detection via Retrieval Augmentation and Profile Matching
di: Liu, Xuechen, et al.
Pubblicazione: (2025)
di: Liu, Xuechen, et al.
Pubblicazione: (2025)
FakeMark: Deepfake Speech Attribution With Watermarked Artifacts
di: Ge, Wanying, et al.
Pubblicazione: (2025)
di: Ge, Wanying, et al.
Pubblicazione: (2025)
ASRRL-TTS: Agile Speaker Representation Reinforcement Learning for Text-to-Speech Speaker Adaptation
di: Fu, Ruibo, et al.
Pubblicazione: (2024)
di: Fu, Ruibo, et al.
Pubblicazione: (2024)
Breaking Data Efficiency Dilemma: A Federated and Augmented Learning Framework For Alzheimer's Disease Detection via Speech
di: Wei, Xiao, et al.
Pubblicazione: (2026)
di: Wei, Xiao, et al.
Pubblicazione: (2026)
Investigating Thinking Behaviours of Reasoning-Based Language Models for Social Bias Mitigation
di: Luo, Guoqing, et al.
Pubblicazione: (2025)
di: Luo, Guoqing, et al.
Pubblicazione: (2025)
Documenti analoghi
-
ZMM-TTS: Zero-shot Multilingual and Multispeaker Speech Synthesis Conditioned on Self-supervised Discrete Speech Representations
di: Gong, Cheng, et al.
Pubblicazione: (2023) -
Expressive Prompting: Improving Emotion Intensity and Speaker Consistency in Zero-Shot TTS
di: Wang, Haoyu, et al.
Pubblicazione: (2024) -
Supporting SENCOTEN Language Documentation Efforts with Automatic Speech Recognition
di: Geng, Mengzhe, et al.
Pubblicazione: (2025) -
Perturbation Self-Supervised Representations for Cross-Lingual Emotion TTS: Stage-Wise Modeling of Emotion and Speaker
di: Gong, Cheng, et al.
Pubblicazione: (2025) -
Efficient Emotion and Speaker Adaptation in LLM-Based TTS via Characteristic-Specific Partial Fine-Tuning
di: Wang, Tianrui, et al.
Pubblicazione: (2025)