Zero-Shot Text-to-Speech for Vietnamese
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Vu, Thi, Nguyen, Linh The, Nguyen, Dat Quoc |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
PhoWhisper: Automatic Speech Recognition for Vietnamese
par: Le, Thanh-Thien, et autres
Publié: (2024)
par: Le, Thanh-Thien, et autres
Publié: (2024)
VoxVietnam: a Large-Scale Multi-Genre Dataset for Vietnamese Speaker Recognition
par: Vu, Hoang Long, et autres
Publié: (2024)
par: Vu, Hoang Long, et autres
Publié: (2024)
AsyncSwitch: Asynchronous Text-Speech Adaptation for Code-Switched ASR
par: Nguyen, Tuan, et autres
Publié: (2025)
par: Nguyen, Tuan, et autres
Publié: (2025)
Qwen vs. Gemma Integration with Whisper: A Comparative Study in Multilingual SpeechLLM Systems
par: Nguyen, Tuan, et autres
Publié: (2025)
par: Nguyen, Tuan, et autres
Publié: (2025)
Acoustic scattering AI for non-invasive object classifications: A case study on hair assessment
par: Hoang, Long-Vu, et autres
Publié: (2025)
par: Hoang, Long-Vu, et autres
Publié: (2025)
Pushing the Performance of Synthetic Speech Detection with Kolmogorov-Arnold Networks and Self-Supervised Learning Models
par: Phuong, Tuan Dat, et autres
Publié: (2025)
par: Phuong, Tuan Dat, et autres
Publié: (2025)
Towards Zero-Shot Text-To-Speech for Arabic Dialects
par: Doan, Khai Duy, et autres
Publié: (2024)
par: Doan, Khai Duy, et autres
Publié: (2024)
XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model
par: Casanova, Edresson, et autres
Publié: (2024)
par: Casanova, Edresson, et autres
Publié: (2024)
Robust Zero-Shot Text-to-Speech Synthesis with Reverse Inference Optimization
par: Hu, Yuchen, et autres
Publié: (2024)
par: Hu, Yuchen, et autres
Publié: (2024)
Mispronunciation Detection and Diagnosis Without Model Training: A Retrieval-Based Approach
par: Tu, Huu Tuong, et autres
Publié: (2025)
par: Tu, Huu Tuong, et autres
Publié: (2025)
XLSR-Kanformer: A KAN-Intergrated model for Synthetic Speech Detection
par: Dat, Phuong Tuan, et autres
Publié: (2025)
par: Dat, Phuong Tuan, et autres
Publié: (2025)
AdaCS: Adaptive Normalization for Enhanced Code-Switching ASR
par: Chu, The Chuong, et autres
Publié: (2025)
par: Chu, The Chuong, et autres
Publié: (2025)
VALL-E R: Robust and Efficient Zero-Shot Text-to-Speech Synthesis via Monotonic Alignment
par: Han, Bing, et autres
Publié: (2024)
par: Han, Bing, et autres
Publié: (2024)
VALL-E 2: Neural Codec Language Models are Human Parity Zero-Shot Text to Speech Synthesizers
par: Chen, Sanyuan, et autres
Publié: (2024)
par: Chen, Sanyuan, et autres
Publié: (2024)
Controlling Emotion in Text-to-Speech with Natural Language Prompts
par: Bott, Thomas, et autres
Publié: (2024)
par: Bott, Thomas, et autres
Publié: (2024)
Transliterated Zero-Shot Domain Adaptation for Automatic Speech Recognition
par: Zhu, Han, et autres
Publié: (2024)
par: Zhu, Han, et autres
Publié: (2024)
Improving Audio Codec-based Zero-Shot Text-to-Speech Synthesis with Multi-Modal Context and Large Language Model
par: Xue, Jinlong, et autres
Publié: (2024)
par: Xue, Jinlong, et autres
Publié: (2024)
TSPC: A Two-Stage Phoneme-Centric Architecture for code-switching Vietnamese-English Speech Recognition
par: Anh, Tran Nguyen, et autres
Publié: (2025)
par: Anh, Tran Nguyen, et autres
Publié: (2025)
Enhancing Zero-shot Text-to-Speech Synthesis with Human Feedback
par: Chen, Chen, et autres
Publié: (2024)
par: Chen, Chen, et autres
Publié: (2024)
Zero-Shot vs. Few-Shot Multi-Speaker TTS Using Pre-trained Czech SpeechT5 Model
par: Lehečka, Jan, et autres
Publié: (2024)
par: Lehečka, Jan, et autres
Publié: (2024)
GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor
par: Lee, Seokgi, et autres
Publié: (2025)
par: Lee, Seokgi, et autres
Publié: (2025)
Language-Universal Speech Attributes Modeling for Zero-Shot Multilingual Spoken Keyword Recognition
par: Yen, Hao, et autres
Publié: (2024)
par: Yen, Hao, et autres
Publié: (2024)
Phonetic Enhanced Language Modeling for Text-to-Speech Synthesis
par: Zhou, Kun, et autres
Publié: (2024)
par: Zhou, Kun, et autres
Publié: (2024)
Harnessing the Zero-Shot Power of Instruction-Tuned Large Language Model in End-to-End Speech Recognition
par: Higuchi, Yosuke, et autres
Publié: (2023)
par: Higuchi, Yosuke, et autres
Publié: (2023)
Can we train ASR systems on Code-switch without real code-switch data? Case study for Singapore's languages
par: Nguyen, Tuan, et autres
Publié: (2025)
par: Nguyen, Tuan, et autres
Publié: (2025)
Measuring Entrainment in Spontaneous Code-switched Speech
par: Bhattacharya, Debasmita, et autres
Publié: (2023)
par: Bhattacharya, Debasmita, et autres
Publié: (2023)
Making Flow-Matching-Based Zero-Shot Text-to-Speech Laugh as You Like
par: Kanda, Naoyuki, et autres
Publié: (2024)
par: Kanda, Naoyuki, et autres
Publié: (2024)
Continuous Speech Tokenizer in Text To Speech
par: Li, Yixing, et autres
Publié: (2024)
par: Li, Yixing, et autres
Publié: (2024)
Zero-Shot Text-to-Speech from Continuous Text Streams
par: Dang, Trung, et autres
Publié: (2024)
par: Dang, Trung, et autres
Publié: (2024)
StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling
par: Wang, Hui, et autres
Publié: (2025)
par: Wang, Hui, et autres
Publié: (2025)
Not that Groove: Zero-Shot Symbolic Music Editing
par: Zhang, Li
Publié: (2025)
par: Zhang, Li
Publié: (2025)
Scheduled Interleaved Speech-Text Training for Speech-to-Speech Translation with LLMs
par: Futami, Hayato, et autres
Publié: (2025)
par: Futami, Hayato, et autres
Publié: (2025)
Teaching a Multilingual Large Language Model to Understand Multilingual Speech via Multi-Instructional Training
par: Denisov, Pavel, et autres
Publié: (2024)
par: Denisov, Pavel, et autres
Publié: (2024)
AdaptVC: High Quality Voice Conversion with Adaptive Learning
par: Kim, Jaehun, et autres
Publié: (2025)
par: Kim, Jaehun, et autres
Publié: (2025)
Speech Recognition Rescoring with Large Speech-Text Foundation Models
par: Shivakumar, Prashanth Gurunath, et autres
Publié: (2024)
par: Shivakumar, Prashanth Gurunath, et autres
Publié: (2024)
VoiceCraft: Zero-Shot Speech Editing and Text-to-Speech in the Wild
par: Peng, Puyuan, et autres
Publié: (2024)
par: Peng, Puyuan, et autres
Publié: (2024)
Adaptive Inner Speech-Text Alignment for LLM-based Speech Translation
par: Liu, Henglyu, et autres
Publié: (2025)
par: Liu, Henglyu, et autres
Publié: (2025)
Generating Data with Text-to-Speech and Large-Language Models for Conversational Speech Recognition
par: Cornell, Samuele, et autres
Publié: (2024)
par: Cornell, Samuele, et autres
Publié: (2024)
IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech
par: Zhou, Siyi, et autres
Publié: (2025)
par: Zhou, Siyi, et autres
Publié: (2025)
Computational Narrative Understanding for Expressive Text-to-Speech
par: Michel, Gaspard, et autres
Publié: (2025)
par: Michel, Gaspard, et autres
Publié: (2025)
Documents similaires
-
PhoWhisper: Automatic Speech Recognition for Vietnamese
par: Le, Thanh-Thien, et autres
Publié: (2024) -
VoxVietnam: a Large-Scale Multi-Genre Dataset for Vietnamese Speaker Recognition
par: Vu, Hoang Long, et autres
Publié: (2024) -
AsyncSwitch: Asynchronous Text-Speech Adaptation for Code-Switched ASR
par: Nguyen, Tuan, et autres
Publié: (2025) -
Qwen vs. Gemma Integration with Whisper: A Comparative Study in Multilingual SpeechLLM Systems
par: Nguyen, Tuan, et autres
Publié: (2025) -
Acoustic scattering AI for non-invasive object classifications: A case study on hair assessment
par: Hoang, Long-Vu, et autres
Publié: (2025)