Cross-Dialect Text-To-Speech in Pitch-Accent Language Incorporating Multi-Dialect Phoneme-Level BERT
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yamauchi, Kazuki, Saito, Yuki, Saruwatari, Hiroshi |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Towards Zero-Shot Text-To-Speech for Arabic Dialects
par: Doan, Khai Duy, et autres
Publié: (2024)
par: Doan, Khai Duy, et autres
Publié: (2024)
Pitch Accent Detection improves Pretrained Automatic Speech Recognition
par: Sasu, David, et autres
Publié: (2025)
par: Sasu, David, et autres
Publié: (2025)
DialogueSidon: Recovering Full-Duplex Dialogue Tracks from In-the-Wild Dialogue Audio
par: Nakata, Wataru, et autres
Publié: (2026)
par: Nakata, Wataru, et autres
Publié: (2026)
Dialectal Coverage And Generalization in Arabic Speech Recognition
par: Djanibekov, Amirbek, et autres
Publié: (2024)
par: Djanibekov, Amirbek, et autres
Publié: (2024)
J-CHAT: Japanese Large-scale Spoken Dialogue Corpus for Spoken Dialogue Language Modeling
par: Nakata, Wataru, et autres
Publié: (2024)
par: Nakata, Wataru, et autres
Publié: (2024)
Voxlect: A Speech Foundation Model Benchmark for Modeling Dialects and Regional Languages Around the Globe
par: Feng, Tiantian, et autres
Publié: (2025)
par: Feng, Tiantian, et autres
Publié: (2025)
Identifying Primary Stress Across Related Languages and Dialects with Transformer-based Speech Encoder Models
par: Ljubešić, Nikola, et autres
Publié: (2025)
par: Ljubešić, Nikola, et autres
Publié: (2025)
Geneses: Unified Generative Speech Enhancement and Separation
par: Asai, Kohei, et autres
Publié: (2026)
par: Asai, Kohei, et autres
Publié: (2026)
Performance Analysis of Speech Encoders for Low-Resource SLU and ASR in Tunisian Dialect
par: Mdhaffar, Salima, et autres
Publié: (2024)
par: Mdhaffar, Salima, et autres
Publié: (2024)
RoDia: A New Dataset for Romanian Dialect Identification from Speech
par: Rotaru, Codrut, et autres
Publié: (2023)
par: Rotaru, Codrut, et autres
Publié: (2023)
Habibi: Laying the Open-Source Foundation of Unified-Dialectal Arabic Speech Synthesis
par: Chen, Yushen, et autres
Publié: (2026)
par: Chen, Yushen, et autres
Publié: (2026)
Causal Speech Enhancement with Predicting Semantics based on Quantized Self-supervised Learning Features
par: Tsunoo, Emiru, et autres
Publié: (2024)
par: Tsunoo, Emiru, et autres
Publié: (2024)
Sidon: Fast and Robust Open-Source Multilingual Speech Restoration for Large-scale Dataset Cleansing
par: Nakata, Wataru, et autres
Publié: (2025)
par: Nakata, Wataru, et autres
Publié: (2025)
VoxHakka: A Dialectally Diverse Multi-speaker Text-to-Speech System for Taiwanese Hakka
par: Chen, Li-Wei, et autres
Publié: (2024)
par: Chen, Li-Wei, et autres
Publié: (2024)
Bailing-TTS: Chinese Dialectal Speech Synthesis Towards Human-like Spontaneous Representation
par: Di, Xinhan, et autres
Publié: (2024)
par: Di, Xinhan, et autres
Publié: (2024)
Voice Conversion Improves Cross-Domain Robustness for Spoken Arabic Dialect Identification
par: Abdullah, Badr M., et autres
Publié: (2025)
par: Abdullah, Badr M., et autres
Publié: (2025)
Speech-to-Text Translation with Phoneme-Augmented CoT: Enhancing Cross-Lingual Transfer in Low-Resource Scenarios
par: Gállego, Gerard I., et autres
Publié: (2025)
par: Gállego, Gerard I., et autres
Publié: (2025)
LinTO Audio and Textual Datasets to Train and Evaluate Automatic Speech Recognition in Tunisian Arabic Dialect
par: Naouara, Hedi, et autres
Publié: (2025)
par: Naouara, Hedi, et autres
Publié: (2025)
Phonikud: Hebrew Grapheme-to-Phoneme Conversion for Real-Time Text-to-Speech
par: Kolani, Yakov, et autres
Publié: (2025)
par: Kolani, Yakov, et autres
Publié: (2025)
Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis
par: Xu, Tianyi, et autres
Publié: (2025)
par: Xu, Tianyi, et autres
Publié: (2025)
Improving Accented Speech Recognition using Data Augmentation based on Unsupervised Text-to-Speech Synthesis
par: Do, Cong-Thanh, et autres
Publié: (2024)
par: Do, Cong-Thanh, et autres
Publié: (2024)
Cross-Dialect Bird Species Recognition with Dialect-Calibrated Augmentation
par: Ding, Jiani, et autres
Publié: (2025)
par: Ding, Jiani, et autres
Publié: (2025)
LID Models are Actually Accent Classifiers: Implications and Solutions for LID on Accented Speech
par: Bafna, Niyati, et autres
Publié: (2025)
par: Bafna, Niyati, et autres
Publié: (2025)
FMSD-TTS: Few-shot Multi-Speaker Multi-Dialect Text-to-Speech Synthesis for Ü-Tsang, Amdo and Kham Speech Dataset Generation
par: Liu, Yutong, et autres
Publié: (2025)
par: Liu, Yutong, et autres
Publié: (2025)
Overcoming Data Scarcity in Multi-Dialectal Arabic ASR via Whisper Fine-Tuning
par: Özyilmaz, Ömer Tarik, et autres
Publié: (2025)
par: Özyilmaz, Ömer Tarik, et autres
Publié: (2025)
Shallow Flow Matching for Coarse-to-Fine Text-to-Speech Synthesis
par: Yang, Dong, et autres
Publié: (2025)
par: Yang, Dong, et autres
Publié: (2025)
UTDUSS: UTokyo-SaruLab System for Interspeech2024 Speech Processing Using Discrete Speech Unit Challenge
par: Nakata, Wataru, et autres
Publié: (2024)
par: Nakata, Wataru, et autres
Publié: (2024)
Pairwise Evaluation of Accent Similarity in Speech Synthesis
par: Zhong, Jinzuomu, et autres
Publié: (2025)
par: Zhong, Jinzuomu, et autres
Publié: (2025)
Emotional Text-To-Speech Based on Mutual-Information-Guided Emotion-Timbre Disentanglement
par: Yang, Jianing, et autres
Publié: (2025)
par: Yang, Jianing, et autres
Publié: (2025)
Performant ASR Models for Medical Entities in Accented Speech
par: Afonja, Tejumade, et autres
Publié: (2024)
par: Afonja, Tejumade, et autres
Publié: (2024)
Rethinking Discrete Speech Representation Tokens for Accent Generation
par: Zhong, Jinzuomu, et autres
Publié: (2026)
par: Zhong, Jinzuomu, et autres
Publié: (2026)
Prosody Labeling with Phoneme-BERT and Speech Foundation Models
par: Koriyama, Tomoki
Publié: (2025)
par: Koriyama, Tomoki
Publié: (2025)
CAFE A Novel Code switching Dataset for Algerian Dialect French and English
par: Lachemat, Houssam Eddine-Othman, et autres
Publié: (2024)
par: Lachemat, Houssam Eddine-Othman, et autres
Publié: (2024)
JVNV: A Corpus of Japanese Emotional Speech with Verbal Content and Nonverbal Expressions
par: Xin, Detai, et autres
Publié: (2023)
par: Xin, Detai, et autres
Publié: (2023)
Multi-Scale Accent Modeling and Disentangling for Multi-Speaker Multi-Accent Text-to-Speech Synthesis
par: Zhou, Xuehao, et autres
Publié: (2024)
par: Zhou, Xuehao, et autres
Publié: (2024)
A Multi-Dialectal Dataset for German Dialect ASR and Dialect-to-Standard Speech Translation
par: Blaschke, Verena, et autres
Publié: (2025)
par: Blaschke, Verena, et autres
Publié: (2025)
Multitask Learning for Grapheme-to-Phoneme Conversion of Anglicisms in German Speech Recognition
par: Pritzen, Julia, et autres
Publié: (2021)
par: Pritzen, Julia, et autres
Publié: (2021)
Active Learning for Text-to-Speech Synthesis with Informative Sample Collection
par: Seki, Kentaro, et autres
Publié: (2025)
par: Seki, Kentaro, et autres
Publié: (2025)
Speech Rhythm-Based Speaker Embeddings Extraction from Phonemes and Phoneme Duration for Multi-Speaker Speech Synthesis
par: Fujita, Kenichi, et autres
Publié: (2024)
par: Fujita, Kenichi, et autres
Publié: (2024)
Multilingual Dysarthric Speech Assessment Using Universal Phone Recognition and Language-Specific Phonemic Contrast Modeling
par: Yeo, Eunjung, et autres
Publié: (2026)
par: Yeo, Eunjung, et autres
Publié: (2026)
Documents similaires
-
Towards Zero-Shot Text-To-Speech for Arabic Dialects
par: Doan, Khai Duy, et autres
Publié: (2024) -
Pitch Accent Detection improves Pretrained Automatic Speech Recognition
par: Sasu, David, et autres
Publié: (2025) -
DialogueSidon: Recovering Full-Duplex Dialogue Tracks from In-the-Wild Dialogue Audio
par: Nakata, Wataru, et autres
Publié: (2026) -
Dialectal Coverage And Generalization in Arabic Speech Recognition
par: Djanibekov, Amirbek, et autres
Publié: (2024) -
J-CHAT: Japanese Large-scale Spoken Dialogue Corpus for Spoken Dialogue Language Modeling
par: Nakata, Wataru, et autres
Publié: (2024)