Speaker-Conditioned Phrase Break Prediction for Text-to-Speech with Phoneme-Level Pre-trained Language Model
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yang, Dong, Saito, Yuki, Saeki, Takaaki, Koriyama, Tomoki, Nakata, Wataru, Xin, Detai, Saruwatari, Hiroshi |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Building speech corpus with diverse voice characteristics for its prompt-based representation
par: Watanabe, Aya, et autres
Publié: (2024)
par: Watanabe, Aya, et autres
Publié: (2024)
Causal Speech Enhancement with Predicting Semantics based on Quantized Self-supervised Learning Features
par: Tsunoo, Emiru, et autres
Publié: (2024)
par: Tsunoo, Emiru, et autres
Publié: (2024)
Cross-Dialect Text-To-Speech in Pitch-Accent Language Incorporating Multi-Dialect Phoneme-Level BERT
par: Yamauchi, Kazuki, et autres
Publié: (2024)
par: Yamauchi, Kazuki, et autres
Publié: (2024)
Geneses: Unified Generative Speech Enhancement and Separation
par: Asai, Kohei, et autres
Publié: (2026)
par: Asai, Kohei, et autres
Publié: (2026)
Prosody Labeling with Phoneme-BERT and Speech Foundation Models
par: Koriyama, Tomoki
Publié: (2025)
par: Koriyama, Tomoki
Publié: (2025)
Sidon: Fast and Robust Open-Source Multilingual Speech Restoration for Large-scale Dataset Cleansing
par: Nakata, Wataru, et autres
Publié: (2025)
par: Nakata, Wataru, et autres
Publié: (2025)
Active Learning for Text-to-Speech Synthesis with Informative Sample Collection
par: Seki, Kentaro, et autres
Publié: (2025)
par: Seki, Kentaro, et autres
Publié: (2025)
The T05 System for The VoiceMOS Challenge 2024: Transfer Learning from Deep Image Classifier to Naturalness MOS Prediction of High-Quality Synthetic Speech
par: Baba, Kaito, et autres
Publié: (2024)
par: Baba, Kaito, et autres
Publié: (2024)
Frame-Wise Breath Detection with Self-Training: An Exploration of Enhancing Breath Naturalness in Text-to-Speech
par: Yang, Dong, et autres
Publié: (2024)
par: Yang, Dong, et autres
Publié: (2024)
JVNV: A Corpus of Japanese Emotional Speech with Verbal Content and Nonverbal Expressions
par: Xin, Detai, et autres
Publié: (2023)
par: Xin, Detai, et autres
Publié: (2023)
VAE-based Phoneme Alignment Using Gradient Annealing and SSL Acoustic Features
par: Koriyama, Tomoki
Publié: (2024)
par: Koriyama, Tomoki
Publié: (2024)
BigCodec: Pushing the Limits of Low-Bitrate Neural Speech Codec
par: Xin, Detai, et autres
Publié: (2024)
par: Xin, Detai, et autres
Publié: (2024)
DialogueSidon: Recovering Full-Duplex Dialogue Tracks from In-the-Wild Dialogue Audio
par: Nakata, Wataru, et autres
Publié: (2026)
par: Nakata, Wataru, et autres
Publié: (2026)
Multi-Sampling-Frequency Naturalness MOS Prediction Using Self-Supervised Learning Model with Sampling-Frequency-Independent Layer
par: Nishikawa, Go, et autres
Publié: (2025)
par: Nishikawa, Go, et autres
Publié: (2025)
SpeechBERTScore: Reference-Aware Automatic Evaluation of Speech Generation Leveraging NLP Evaluation Metrics
par: Saeki, Takaaki, et autres
Publié: (2024)
par: Saeki, Takaaki, et autres
Publié: (2024)
J-CHAT: Japanese Large-scale Spoken Dialogue Corpus for Spoken Dialogue Language Modeling
par: Nakata, Wataru, et autres
Publié: (2024)
par: Nakata, Wataru, et autres
Publié: (2024)
Eigenvoice Synthesis based on Model Editing for Speaker Generation
par: Murata, Masato, et autres
Publié: (2025)
par: Murata, Masato, et autres
Publié: (2025)
Shallow Flow Matching for Coarse-to-Fine Text-to-Speech Synthesis
par: Yang, Dong, et autres
Publié: (2025)
par: Yang, Dong, et autres
Publié: (2025)
Speaker-agnostic Emotion Vector for Cross-speaker Emotion Intensity Control
par: Murata, Masato, et autres
Publié: (2025)
par: Murata, Masato, et autres
Publié: (2025)
Emotional Text-To-Speech Based on Mutual-Information-Guided Emotion-Timbre Disentanglement
par: Yang, Jianing, et autres
Publié: (2025)
par: Yang, Jianing, et autres
Publié: (2025)
UTDUSS: UTokyo-SaruLab System for Interspeech2024 Speech Processing Using Discrete Speech Unit Challenge
par: Nakata, Wataru, et autres
Publié: (2024)
par: Nakata, Wataru, et autres
Publié: (2024)
An Attribute Interpolation Method in Speech Synthesis by Model Merging
par: Murata, Masato, et autres
Publié: (2024)
par: Murata, Masato, et autres
Publié: (2024)
Kinetic-Optimal Scheduling with Moment Correction for Metric-Induced Discrete Flow Matching in Zero-Shot Text-to-Speech
par: Yang, Dong, et autres
Publié: (2026)
par: Yang, Dong, et autres
Publié: (2026)
Generating Speakers by Prompting Listener Impressions for Pre-trained Multi-Speaker Text-to-Speech Systems
par: Chen, Zhengyang, et autres
Publié: (2024)
par: Chen, Zhengyang, et autres
Publié: (2024)
RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio
par: Kanamori, Yusuke, et autres
Publié: (2025)
par: Kanamori, Yusuke, et autres
Publié: (2025)
Human-CLAP: Human-perception-based contrastive language-audio pretraining
par: Takano, Taisei, et autres
Publié: (2025)
par: Takano, Taisei, et autres
Publié: (2025)
Noise-Robust Voice Conversion by Conditional Denoising Training Using Latent Variables of Recording Quality and Environment
par: Igarashi, Takuto, et autres
Publié: (2024)
par: Igarashi, Takuto, et autres
Publié: (2024)
Speaker Disentanglement of Speech Pre-trained Model Based on Interpretability
par: Zhu, Xiaoxu, et autres
Publié: (2025)
par: Zhu, Xiaoxu, et autres
Publié: (2025)
Speech Rhythm-Based Speaker Embeddings Extraction from Phonemes and Phoneme Duration for Multi-Speaker Speech Synthesis
par: Fujita, Kenichi, et autres
Publié: (2024)
par: Fujita, Kenichi, et autres
Publié: (2024)
SA-WavLM: Speaker-Aware Self-Supervised Pre-training for Mixture Speech
par: Lin, Jingru, et autres
Publié: (2024)
par: Lin, Jingru, et autres
Publié: (2024)
SaSLaW: Dialogue Speech Corpus with Audio-visual Egocentric Information Toward Environment-adaptive Dialogue Speech Synthesis
par: Take, Osamu, et autres
Publié: (2024)
par: Take, Osamu, et autres
Publié: (2024)
LongCat-AudioDiT: High-Fidelity Diffusion Text-to-Speech in the Waveform Latent Space
par: Xin, Detai, et autres
Publié: (2026)
par: Xin, Detai, et autres
Publié: (2026)
Spatial Voice Conversion: Voice Conversion Preserving Spatial Information and Non-target Signals
par: Seki, Kentaro, et autres
Publié: (2024)
par: Seki, Kentaro, et autres
Publié: (2024)
Phoneme-Level Analysis for Person-of-Interest Speech Deepfake Detection
par: Salvi, Davide, et autres
Publié: (2025)
par: Salvi, Davide, et autres
Publié: (2025)
RALL-E: Robust Codec Language Modeling with Chain-of-Thought Prompting for Text-to-Speech Synthesis
par: Xin, Detai, et autres
Publié: (2024)
par: Xin, Detai, et autres
Publié: (2024)
SRC4VC: Smartphone-Recorded Corpus for Voice Conversion Benchmark
par: Saito, Yuki, et autres
Publié: (2024)
par: Saito, Yuki, et autres
Publié: (2024)
Analysing the Language of Neural Audio Codecs
par: Park, Joonyong, et autres
Publié: (2025)
par: Park, Joonyong, et autres
Publié: (2025)
Speaker- and Text-Independent Estimation of Articulatory Movements and Phoneme Alignments from Speech
par: Weise, Tobias, et autres
Publié: (2024)
par: Weise, Tobias, et autres
Publié: (2024)
Simulating Native Speaker Shadowing for Nonnative Speech Assessment with Latent Speech Representations
par: Geng, Haopeng, et autres
Publié: (2024)
par: Geng, Haopeng, et autres
Publié: (2024)
ASRRL-TTS: Agile Speaker Representation Reinforcement Learning for Text-to-Speech Speaker Adaptation
par: Fu, Ruibo, et autres
Publié: (2024)
par: Fu, Ruibo, et autres
Publié: (2024)
Documents similaires
-
Building speech corpus with diverse voice characteristics for its prompt-based representation
par: Watanabe, Aya, et autres
Publié: (2024) -
Causal Speech Enhancement with Predicting Semantics based on Quantized Self-supervised Learning Features
par: Tsunoo, Emiru, et autres
Publié: (2024) -
Cross-Dialect Text-To-Speech in Pitch-Accent Language Incorporating Multi-Dialect Phoneme-Level BERT
par: Yamauchi, Kazuki, et autres
Publié: (2024) -
Geneses: Unified Generative Speech Enhancement and Separation
par: Asai, Kohei, et autres
Publié: (2026) -
Prosody Labeling with Phoneme-BERT and Speech Foundation Models
par: Koriyama, Tomoki
Publié: (2025)