Emotion-Coherent Speech Data Augmentation and Self-Supervised Contrastive Style Training for Enhancing Kids's Story Speech Synthesis
Fuente:
arXiv
Salvato in:
| Autore principale: | Chung, Raymond |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval
di: Sun, Haoqin, et al.
Pubblicazione: (2025)
di: Sun, Haoqin, et al.
Pubblicazione: (2025)
Training Data Augmentation for Dysarthric Automatic Speech Recognition by Text-to-Dysarthric-Speech Synthesis
di: Leung, Wing-Zin, et al.
Pubblicazione: (2024)
di: Leung, Wing-Zin, et al.
Pubblicazione: (2024)
Textless and Non-Parallel Speech-to-Speech Emotion Style Transfer
di: Dutta, Soumya, et al.
Pubblicazione: (2025)
di: Dutta, Soumya, et al.
Pubblicazione: (2025)
Crab: Multi Layer Contrastive Supervision to Improve Speech Emotion Recognition Under Both Acted and Natural Speech Condition
di: Ueda, Lucas H., et al.
Pubblicazione: (2026)
di: Ueda, Lucas H., et al.
Pubblicazione: (2026)
Emotion-Aware Speech Self-Supervised Representation Learning with Intensity Knowledge
di: Liu, Rui, et al.
Pubblicazione: (2024)
di: Liu, Rui, et al.
Pubblicazione: (2024)
Learning Expressive Disentangled Speech Representations with Soft Speech Units and Adversarial Style Augmentation
di: Deng, Yimin, et al.
Pubblicazione: (2024)
di: Deng, Yimin, et al.
Pubblicazione: (2024)
Comparison of Self-Supervised Speech Pre-Training Methods on Flemish Dutch
di: Poncelet, Jakob, et al.
Pubblicazione: (2021)
di: Poncelet, Jakob, et al.
Pubblicazione: (2021)
Analysis of Self-Supervised Speech Models on Children's Speech and Infant Vocalizations
di: Li, Jialu, et al.
Pubblicazione: (2024)
di: Li, Jialu, et al.
Pubblicazione: (2024)
Hierarchical Control of Emotion Rendering in Speech Synthesis
di: Inoue, Sho, et al.
Pubblicazione: (2024)
di: Inoue, Sho, et al.
Pubblicazione: (2024)
Self-Supervised Singing Voice Pre-Training towards Speech-to-Singing Conversion
di: Li, Ruiqi, et al.
Pubblicazione: (2024)
di: Li, Ruiqi, et al.
Pubblicazione: (2024)
Hierarchical Emotion Prediction and Control in Text-to-Speech Synthesis
di: Inoue, Sho, et al.
Pubblicazione: (2024)
di: Inoue, Sho, et al.
Pubblicazione: (2024)
VQTTS: High-Fidelity Text-to-Speech Synthesis with Self-Supervised VQ Acoustic Feature
di: Du, Chenpeng, et al.
Pubblicazione: (2022)
di: Du, Chenpeng, et al.
Pubblicazione: (2022)
Enhancing Emotional Text-to-Speech Controllability with Natural Language Guidance through Contrastive Learning and Diffusion Models
di: Jing, Xin, et al.
Pubblicazione: (2024)
di: Jing, Xin, et al.
Pubblicazione: (2024)
Emotion-Aware Contrastive Adaptation Network for Source-Free Cross-Corpus Speech Emotion Recognition
di: Zhao, Yan, et al.
Pubblicazione: (2024)
di: Zhao, Yan, et al.
Pubblicazione: (2024)
Enhanced Reverberation as Supervision for Unsupervised Speech Separation
di: Saijo, Kohei, et al.
Pubblicazione: (2024)
di: Saijo, Kohei, et al.
Pubblicazione: (2024)
End-to-End Integration of Speech Emotion Recognition with Voice Activity Detection using Self-Supervised Learning Features
di: Yamashita, Natsuo, et al.
Pubblicazione: (2024)
di: Yamashita, Natsuo, et al.
Pubblicazione: (2024)
EME-TTS: Unlocking the Emphasis and Emotion Link in Speech Synthesis
di: Li, Haoxun, et al.
Pubblicazione: (2025)
di: Li, Haoxun, et al.
Pubblicazione: (2025)
Self-Supervised Speech Quality Assessment (S3QA): Leveraging Speech Foundation Models for a Scalable Speech Quality Metric
di: Ogg, Mattson, et al.
Pubblicazione: (2025)
di: Ogg, Mattson, et al.
Pubblicazione: (2025)
AC-Mix: Self-Supervised Adaptation for Low-Resource Automatic Speech Recognition using Agnostic Contrastive Mixup
di: Carvalho, Carlos, et al.
Pubblicazione: (2024)
di: Carvalho, Carlos, et al.
Pubblicazione: (2024)
A Study of Data Selection Strategies for Pre-training Self-Supervised Speech Models
di: Whetten, Ryan, et al.
Pubblicazione: (2026)
di: Whetten, Ryan, et al.
Pubblicazione: (2026)
Retrieval Augmented Generation in Prompt-based Text-to-Speech Synthesis with Context-Aware Contrastive Language-Audio Pretraining
di: Xue, Jinlong, et al.
Pubblicazione: (2024)
di: Xue, Jinlong, et al.
Pubblicazione: (2024)
AffectSpeech: A Large-Scale Emotional Speech Dataset with Fine-Grained Textual Descriptions for Speech Emotion Captioning and Synthesis
di: Qi, Tianhua, et al.
Pubblicazione: (2026)
di: Qi, Tianhua, et al.
Pubblicazione: (2026)
A Self-Training Approach for Whisper to Enhance Long Dysarthric Speech Recognition
di: Wang, Shiyao, et al.
Pubblicazione: (2025)
di: Wang, Shiyao, et al.
Pubblicazione: (2025)
Semantic-Emotional Resonance Embedding: A Semi-Supervised Paradigm for Cross-Lingual Speech Emotion Recognition
di: Zhao, Ya, et al.
Pubblicazione: (2026)
di: Zhao, Ya, et al.
Pubblicazione: (2026)
Leveraging Self-Supervised Models for Automatic Whispered Speech Recognition
di: Farhadipour, Aref, et al.
Pubblicazione: (2024)
di: Farhadipour, Aref, et al.
Pubblicazione: (2024)
GigaAM: Efficient Self-Supervised Learner for Speech Recognition
di: Kutsakov, Aleksandr, et al.
Pubblicazione: (2025)
di: Kutsakov, Aleksandr, et al.
Pubblicazione: (2025)
Metadata-Enhanced Speech Emotion Recognition: Augmented Residual Integration and Co-Attention in Two-Stage Fine-Tuning
di: Wan, Zixiang, et al.
Pubblicazione: (2024)
di: Wan, Zixiang, et al.
Pubblicazione: (2024)
SELM: Enhancing Speech Emotion Recognition for Out-of-Domain Scenarios
di: Bukhari, Hazim, et al.
Pubblicazione: (2024)
di: Bukhari, Hazim, et al.
Pubblicazione: (2024)
RSET: Remapping-based Sorting Method for Emotion Transfer Speech Synthesis
di: Shi, Haoxiang, et al.
Pubblicazione: (2024)
di: Shi, Haoxiang, et al.
Pubblicazione: (2024)
Enhancing Speech Emotion Recognition through Segmental Average Pooling of Self-Supervised Learning Features
di: Hyeon, Jonghwan, et al.
Pubblicazione: (2024)
di: Hyeon, Jonghwan, et al.
Pubblicazione: (2024)
ED-TTS: Multi-Scale Emotion Modeling using Cross-Domain Emotion Diarization for Emotional Speech Synthesis
di: Tang, Haobin, et al.
Pubblicazione: (2024)
di: Tang, Haobin, et al.
Pubblicazione: (2024)
Towards Improving NAM-to-Speech Synthesis Intelligibility using Self-Supervised Speech Models
di: Shah, Neil, et al.
Pubblicazione: (2024)
di: Shah, Neil, et al.
Pubblicazione: (2024)
A Cross-Corpus Speech Emotion Recognition Method Based on Supervised Contrastive Learning
di: minjie, Xiang
Pubblicazione: (2024)
di: minjie, Xiang
Pubblicazione: (2024)
CochCeps-Augment: A Novel Self-Supervised Contrastive Learning Using Cochlear Cepstrum-based Masking for Speech Emotion Recognition
di: Ziogas, Ioannis, et al.
Pubblicazione: (2024)
di: Ziogas, Ioannis, et al.
Pubblicazione: (2024)
The Effect of Batch Size on Contrastive Self-Supervised Speech Representation Learning
di: Vaessen, Nik, et al.
Pubblicazione: (2024)
di: Vaessen, Nik, et al.
Pubblicazione: (2024)
CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning
di: Shi, Jiacheng, et al.
Pubblicazione: (2025)
di: Shi, Jiacheng, et al.
Pubblicazione: (2025)
Refining Self-Supervised Learnt Speech Representation using Brain Activations
di: Li, Hengyu, et al.
Pubblicazione: (2024)
di: Li, Hengyu, et al.
Pubblicazione: (2024)
Towards Automatic Assessment of Self-Supervised Speech Models using Rank
di: Aldeneh, Zakaria, et al.
Pubblicazione: (2024)
di: Aldeneh, Zakaria, et al.
Pubblicazione: (2024)
Evaluating Self-Supervised Speech Models via Text-Based LLMS
di: Maekaku, Takashi, et al.
Pubblicazione: (2025)
di: Maekaku, Takashi, et al.
Pubblicazione: (2025)
Word-Level Emotional Expression Control in Zero-Shot Text-to-Speech Synthesis
di: Wang, Tianrui, et al.
Pubblicazione: (2025)
di: Wang, Tianrui, et al.
Pubblicazione: (2025)
Documenti analoghi
-
RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval
di: Sun, Haoqin, et al.
Pubblicazione: (2025) -
Training Data Augmentation for Dysarthric Automatic Speech Recognition by Text-to-Dysarthric-Speech Synthesis
di: Leung, Wing-Zin, et al.
Pubblicazione: (2024) -
Textless and Non-Parallel Speech-to-Speech Emotion Style Transfer
di: Dutta, Soumya, et al.
Pubblicazione: (2025) -
Crab: Multi Layer Contrastive Supervision to Improve Speech Emotion Recognition Under Both Acted and Natural Speech Condition
di: Ueda, Lucas H., et al.
Pubblicazione: (2026) -
Emotion-Aware Speech Self-Supervised Representation Learning with Intensity Knowledge
di: Liu, Rui, et al.
Pubblicazione: (2024)