Zero-Shot Text-to-Speech as Golden Speech Generator: A Systematic Framework and its Applicability in Automatic Pronunciation Assessment
Fuente:
arXiv
Salvato in:
| Autori principali: | Lo, Tien-Hong, Tsai, Meng-Ting, Sung, Yao-Ting, Chen, Berlin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Contextual Biasing for Streaming ASR via CTC-based Word Spotting
di: Tsai, Kai-Chen, et al.
Pubblicazione: (2026)
di: Tsai, Kai-Chen, et al.
Pubblicazione: (2026)
An Effective Strategy for Modeling Score Ordinality and Non-uniform Intervals in Automated Speaking Assessment
di: Lo, Tien-Hong, et al.
Pubblicazione: (2025)
di: Lo, Tien-Hong, et al.
Pubblicazione: (2025)
HiPPO: Exploring A Novel Hierarchical Pronunciation Assessment Approach for Spoken Languages
di: Yan, Bi-Cheng, et al.
Pubblicazione: (2025)
di: Yan, Bi-Cheng, et al.
Pubblicazione: (2025)
ConPCO: Preserving Phoneme Characteristics for Automatic Pronunciation Assessment Leveraging Contrastive Ordinal Regularization
di: Yan, Bi-Cheng, et al.
Pubblicazione: (2024)
di: Yan, Bi-Cheng, et al.
Pubblicazione: (2024)
An Effective Automated Speaking Assessment Approach to Mitigating Data Scarcity and Imbalanced Distribution
di: Lo, Tien-Hong, et al.
Pubblicazione: (2024)
di: Lo, Tien-Hong, et al.
Pubblicazione: (2024)
Zero Shot Text to Speech Augmentation for Automatic Speech Recognition on Low-Resource Accented Speech Corpora
di: Nespoli, Francesco, et al.
Pubblicazione: (2024)
di: Nespoli, Francesco, et al.
Pubblicazione: (2024)
Debatts: Zero-Shot Debating Text-to-Speech Synthesis
di: Huang, Yiqiao, et al.
Pubblicazione: (2024)
di: Huang, Yiqiao, et al.
Pubblicazione: (2024)
MobileSpeech: A Fast and High-Fidelity Framework for Mobile Zero-Shot Text-to-Speech
di: Ji, Shengpeng, et al.
Pubblicazione: (2024)
di: Ji, Shengpeng, et al.
Pubblicazione: (2024)
Activation Steering for Accent-Neutralized Zero-Shot Text-To-Speech
di: Yang, Mu, et al.
Pubblicazione: (2026)
di: Yang, Mu, et al.
Pubblicazione: (2026)
MALEFA: Multi-grAnularity Learning and Effective False Alarm Suppression for Zero-shot Keyword Spotting
di: Li, Lo-Ya, et al.
Pubblicazione: (2026)
di: Li, Lo-Ya, et al.
Pubblicazione: (2026)
Adversarial Attacks and Robust Defenses in Speaker Embedding based Zero-Shot Text-to-Speech System
di: Li, Ze, et al.
Pubblicazione: (2024)
di: Li, Ze, et al.
Pubblicazione: (2024)
Zero-Shot Text-to-Speech from Continuous Text Streams
di: Dang, Trung, et al.
Pubblicazione: (2024)
di: Dang, Trung, et al.
Pubblicazione: (2024)
Read to Hear: A Zero-Shot Pronunciation Assessment Using Textual Descriptions and LLMs
di: Chen, Yu-Wen, et al.
Pubblicazione: (2025)
di: Chen, Yu-Wen, et al.
Pubblicazione: (2025)
Incremental Disentanglement for Environment-Aware Zero-Shot Text-to-Speech Synthesis
di: Lu, Ye-Xin, et al.
Pubblicazione: (2024)
di: Lu, Ye-Xin, et al.
Pubblicazione: (2024)
Generative Data Augmentation Challenge: Zero-Shot Speech Synthesis for Personalized Speech Enhancement
di: Bae, Jae-Sung, et al.
Pubblicazione: (2025)
di: Bae, Jae-Sung, et al.
Pubblicazione: (2025)
Pronunciation Editing for Finnish Speech using Phonetic Posteriorgrams
di: Li, Zirui, et al.
Pubblicazione: (2025)
di: Li, Zirui, et al.
Pubblicazione: (2025)
MuFFIN: Multifaceted Pronunciation Feedback Model with Interactive Hierarchical Neural Modeling
di: Yan, Bi-Cheng, et al.
Pubblicazione: (2025)
di: Yan, Bi-Cheng, et al.
Pubblicazione: (2025)
Zero-Shot Text-to-Speech for Vietnamese
di: Vu, Thi, et al.
Pubblicazione: (2025)
di: Vu, Thi, et al.
Pubblicazione: (2025)
Advanced Zero-Shot Text-to-Speech for Background Removal and Preservation with Controllable Masked Speech Prediction
di: Zhang, Leying, et al.
Pubblicazione: (2025)
di: Zhang, Leying, et al.
Pubblicazione: (2025)
MiniMax-Speech: Intrinsic Zero-Shot Text-to-Speech with a Learnable Speaker Encoder
di: Zhang, Bowen, et al.
Pubblicazione: (2025)
di: Zhang, Bowen, et al.
Pubblicazione: (2025)
Word-Level Emotional Expression Control in Zero-Shot Text-to-Speech Synthesis
di: Wang, Tianrui, et al.
Pubblicazione: (2025)
di: Wang, Tianrui, et al.
Pubblicazione: (2025)
Zero-Shot Recognition of Dysarthric Speech Using Commercial Automatic Speech Recognition and Multimodal Large Language Models
di: Alsayegh, Ali, et al.
Pubblicazione: (2025)
di: Alsayegh, Ali, et al.
Pubblicazione: (2025)
ZipVoice: Fast and High-Quality Zero-Shot Text-to-Speech with Flow Matching
di: Zhu, Han, et al.
Pubblicazione: (2025)
di: Zhu, Han, et al.
Pubblicazione: (2025)
Towards Expressive Zero-Shot Speech Synthesis with Hierarchical Prosody Modeling
di: Jiang, Yuepeng, et al.
Pubblicazione: (2024)
di: Jiang, Yuepeng, et al.
Pubblicazione: (2024)
CosyEdit: Unlocking End-to-End Speech Editing Capability from Zero-Shot Text-to-Speech Models
di: Chen, Junyang, et al.
Pubblicazione: (2026)
di: Chen, Junyang, et al.
Pubblicazione: (2026)
PAC: Pronunciation-Aware Contextualized Large Language Model-based Automatic Speech Recognition
di: Fu, Li, et al.
Pubblicazione: (2025)
di: Fu, Li, et al.
Pubblicazione: (2025)
Automatic Text Pronunciation Correlation Generation and Application for Contextual Biasing
di: Cheng, Gaofeng, et al.
Pubblicazione: (2025)
di: Cheng, Gaofeng, et al.
Pubblicazione: (2025)
Transliterated Zero-Shot Domain Adaptation for Automatic Speech Recognition
di: Zhu, Han, et al.
Pubblicazione: (2024)
di: Zhu, Han, et al.
Pubblicazione: (2024)
Transducers with Pronunciation-aware Embeddings for Automatic Speech Recognition
di: Xu, Hainan, et al.
Pubblicazione: (2024)
di: Xu, Hainan, et al.
Pubblicazione: (2024)
Improving Language Model-Based Zero-Shot Text-to-Speech Synthesis with Multi-Scale Acoustic Prompts
di: Lei, Shun, et al.
Pubblicazione: (2023)
di: Lei, Shun, et al.
Pubblicazione: (2023)
Towards Zero-Shot Text-To-Speech for Arabic Dialects
di: Doan, Khai Duy, et al.
Pubblicazione: (2024)
di: Doan, Khai Duy, et al.
Pubblicazione: (2024)
OmniVoice: Towards Omnilingual Zero-Shot Text-to-Speech with Diffusion Language Models
di: Zhu, Han, et al.
Pubblicazione: (2026)
di: Zhu, Han, et al.
Pubblicazione: (2026)
Optimizing Automatic Speech Assessment: W-RankSim Regularization and Hybrid Feature Fusion Strategies
di: Wu, Chung-Wen, et al.
Pubblicazione: (2024)
di: Wu, Chung-Wen, et al.
Pubblicazione: (2024)
Mitigating Data Imbalance in Automated Speaking Assessment
di: Tsai, Fong-Chun, et al.
Pubblicazione: (2025)
di: Tsai, Fong-Chun, et al.
Pubblicazione: (2025)
Advancing Zero-Shot Open-Set Speech Deepfake Source Tracing
di: Chhibber, Manasi, et al.
Pubblicazione: (2025)
di: Chhibber, Manasi, et al.
Pubblicazione: (2025)
SSR-Speech: Towards Stable, Safe and Robust Zero-shot Text-based Speech Editing and Synthesis
di: Wang, Helin, et al.
Pubblicazione: (2024)
di: Wang, Helin, et al.
Pubblicazione: (2024)
Interleaved Speech-Text Language Models for Simple Streaming Text-to-Speech Synthesis
di: Yang, Yifan, et al.
Pubblicazione: (2024)
di: Yang, Yifan, et al.
Pubblicazione: (2024)
ConSep: a Noise- and Reverberation-Robust Speech Separation Framework by Magnitude Conditioning
di: Ho, Kuan-Hsun, et al.
Pubblicazione: (2024)
di: Ho, Kuan-Hsun, et al.
Pubblicazione: (2024)
FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications
di: Guo, Hao-Han, et al.
Pubblicazione: (2024)
di: Guo, Hao-Han, et al.
Pubblicazione: (2024)
CLaM-TTS: Improving Neural Codec Language Model for Zero-Shot Text-to-Speech
di: Kim, Jaehyeon, et al.
Pubblicazione: (2024)
di: Kim, Jaehyeon, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Contextual Biasing for Streaming ASR via CTC-based Word Spotting
di: Tsai, Kai-Chen, et al.
Pubblicazione: (2026) -
An Effective Strategy for Modeling Score Ordinality and Non-uniform Intervals in Automated Speaking Assessment
di: Lo, Tien-Hong, et al.
Pubblicazione: (2025) -
HiPPO: Exploring A Novel Hierarchical Pronunciation Assessment Approach for Spoken Languages
di: Yan, Bi-Cheng, et al.
Pubblicazione: (2025) -
ConPCO: Preserving Phoneme Characteristics for Automatic Pronunciation Assessment Leveraging Contrastive Ordinal Regularization
di: Yan, Bi-Cheng, et al.
Pubblicazione: (2024) -
An Effective Automated Speaking Assessment Approach to Mitigating Data Scarcity and Imbalanced Distribution
di: Lo, Tien-Hong, et al.
Pubblicazione: (2024)