Daisy-TTS: Simulating Wider Spectrum of Emotions via Prosody Embedding Decomposition
Fuente:
arXiv
Salvato in:
| Autori principali: | Chevi, Rendi, Aji, Alham Fikri |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
No Verifiable Reward for Prosody: Toward Preference-Guided Prosody Learning in TTS
di: Shin, Seungyoun, et al.
Pubblicazione: (2025)
di: Shin, Seungyoun, et al.
Pubblicazione: (2025)
DiffProsody: Diffusion-based Latent Prosody Generation for Expressive Speech Synthesis with Prosody Conditional Adversarial Training
di: Oh, Hyung-Seok, et al.
Pubblicazione: (2023)
di: Oh, Hyung-Seok, et al.
Pubblicazione: (2023)
Usefulness of Emotional Prosody in Neural Machine Translation
di: Brazier, Charles, et al.
Pubblicazione: (2024)
di: Brazier, Charles, et al.
Pubblicazione: (2024)
EE-TTS: Emphatic Expressive TTS with Linguistic Information
di: Zhong, Yi, et al.
Pubblicazione: (2023)
di: Zhong, Yi, et al.
Pubblicazione: (2023)
Benchmarking Prosody Encoding in Discrete Speech Tokens
di: Onda, Kentaro, et al.
Pubblicazione: (2025)
di: Onda, Kentaro, et al.
Pubblicazione: (2025)
DiffStyleTTS: Diffusion-based Hierarchical Prosody Modeling for Text-to-Speech with Diverse and Controllable Styles
di: Liu, Jiaxuan, et al.
Pubblicazione: (2024)
di: Liu, Jiaxuan, et al.
Pubblicazione: (2024)
TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch
di: Song, Xingchen, et al.
Pubblicazione: (2024)
di: Song, Xingchen, et al.
Pubblicazione: (2024)
Multilingual Prosody Transfer: Comparing Supervised & Transfer Learning
di: Goel, Arnav, et al.
Pubblicazione: (2024)
di: Goel, Arnav, et al.
Pubblicazione: (2024)
ProsodyFM: Unsupervised Phrasing and Intonation Control for Intelligible Speech Synthesis
di: He, Xiangheng, et al.
Pubblicazione: (2024)
di: He, Xiangheng, et al.
Pubblicazione: (2024)
Balalaika: Data-Centric, Prosody-Aware Annotation Pipeline for Russian Speech
di: Borodin, Kirill, et al.
Pubblicazione: (2025)
di: Borodin, Kirill, et al.
Pubblicazione: (2025)
Qwen3-TTS Technical Report
di: Hu, Hangrui, et al.
Pubblicazione: (2026)
di: Hu, Hangrui, et al.
Pubblicazione: (2026)
Emotional Dimension Control in Language Model-Based Text-to-Speech: Spanning a Broad Spectrum of Human Emotions
di: Zhou, Kun, et al.
Pubblicazione: (2024)
di: Zhou, Kun, et al.
Pubblicazione: (2024)
Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody
di: Yoon, Jinsung, et al.
Pubblicazione: (2025)
di: Yoon, Jinsung, et al.
Pubblicazione: (2025)
Leveraging Speech PTM, Text LLM, and Emotional TTS for Speech Emotion Recognition
di: Ma, Ziyang, et al.
Pubblicazione: (2023)
di: Ma, Ziyang, et al.
Pubblicazione: (2023)
Speech is More Than Words: Do Speech-to-Text Translation Systems Leverage Prosody?
di: Tsiamas, Ioannis, et al.
Pubblicazione: (2024)
di: Tsiamas, Ioannis, et al.
Pubblicazione: (2024)
CrossVoice: Crosslingual Prosody Preserving Cascade-S2ST using Transfer Learning
di: Hira, Medha, et al.
Pubblicazione: (2024)
di: Hira, Medha, et al.
Pubblicazione: (2024)
GOAT-TTS: Expressive and Realistic Speech Generation via A Dual-Branch LLM
di: Song, Yaodong, et al.
Pubblicazione: (2025)
di: Song, Yaodong, et al.
Pubblicazione: (2025)
Combining Masked Language Modeling and Cross-Modal Contrastive Learning for Prosody-Aware TTS
di: Borodin, Kirill, et al.
Pubblicazione: (2026)
di: Borodin, Kirill, et al.
Pubblicazione: (2026)
MunTTS: A Text-to-Speech System for Mundari
di: Gumma, Varun, et al.
Pubblicazione: (2024)
di: Gumma, Varun, et al.
Pubblicazione: (2024)
Llama-VITS: Enhancing TTS Synthesis with Semantic Awareness
di: Feng, Xincan, et al.
Pubblicazione: (2024)
di: Feng, Xincan, et al.
Pubblicazione: (2024)
Multi-interaction TTS toward professional recording reproduction
di: Kanagawa, Hiroki, et al.
Pubblicazione: (2025)
di: Kanagawa, Hiroki, et al.
Pubblicazione: (2025)
RWKVTTS: Yet another TTS based on RWKV-7
di: yueyu, Lin, et al.
Pubblicazione: (2025)
di: yueyu, Lin, et al.
Pubblicazione: (2025)
DiaMoE-TTS: A Unified IPA-Based Dialect TTS Framework with Mixture-of-Experts and Parameter-Efficient Zero-Shot Adaptation
di: Chen, Ziqi, et al.
Pubblicazione: (2025)
di: Chen, Ziqi, et al.
Pubblicazione: (2025)
FluentEditor2: Text-based Speech Editing by Modeling Multi-Scale Acoustic and Prosody Consistency
di: Liu, Rui, et al.
Pubblicazione: (2024)
di: Liu, Rui, et al.
Pubblicazione: (2024)
GSDNet: Revisiting Incomplete Multimodal-Diffusion from Graph Spectrum Perspective for Conversation Emotion Recognition
di: Shou, Yuntao, et al.
Pubblicazione: (2025)
di: Shou, Yuntao, et al.
Pubblicazione: (2025)
Word-wise intonation model for cross-language TTS systems
di: A., Tomilov A., et al.
Pubblicazione: (2024)
di: A., Tomilov A., et al.
Pubblicazione: (2024)
A Language Modeling Approach to Diacritic-Free Hebrew TTS
di: Roth, Amit, et al.
Pubblicazione: (2024)
di: Roth, Amit, et al.
Pubblicazione: (2024)
An investigation of phrase break prediction in an End-to-End TTS system
di: Vadapalli, Anandaswarup
Pubblicazione: (2023)
di: Vadapalli, Anandaswarup
Pubblicazione: (2023)
JoyTTS: LLM-based Spoken Chatbot With Voice Cloning
di: Zhou, Fangru, et al.
Pubblicazione: (2025)
di: Zhou, Fangru, et al.
Pubblicazione: (2025)
SP-MCQA: Evaluating Intelligibility of TTS Beyond the Word Level
di: Tee, Hitomi Jin Ling, et al.
Pubblicazione: (2025)
di: Tee, Hitomi Jin Ling, et al.
Pubblicazione: (2025)
Minimizing Modality Gap from the Input Side: Your Speech LLM Can Be a Prosody-Aware Text LLM
di: Cui, Wenqian, et al.
Pubblicazione: (2026)
di: Cui, Wenqian, et al.
Pubblicazione: (2026)
Transfer the linguistic representations from TTS to accent conversion with non-parallel data
di: Chen, Xi, et al.
Pubblicazione: (2024)
di: Chen, Xi, et al.
Pubblicazione: (2024)
Expressive Prompting: Improving Emotion Intensity and Speaker Consistency in Zero-Shot TTS
di: Wang, Haoyu, et al.
Pubblicazione: (2024)
di: Wang, Haoyu, et al.
Pubblicazione: (2024)
Bailing-TTS: Chinese Dialectal Speech Synthesis Towards Human-like Spontaneous Representation
di: Di, Xinhan, et al.
Pubblicazione: (2024)
di: Di, Xinhan, et al.
Pubblicazione: (2024)
Leveraging the Interplay Between Syntactic and Acoustic Cues for Optimizing Korean TTS Pause Formation
di: Jeon, Yejin, et al.
Pubblicazione: (2024)
di: Jeon, Yejin, et al.
Pubblicazione: (2024)
Can we reconstruct a dysarthric voice with the large speech model Parler TTS?
di: Sanchez, Ariadna, et al.
Pubblicazione: (2025)
di: Sanchez, Ariadna, et al.
Pubblicazione: (2025)
GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor
di: Lee, Seokgi, et al.
Pubblicazione: (2025)
di: Lee, Seokgi, et al.
Pubblicazione: (2025)
Layer-Wise Analysis of Self-Supervised Acoustic Word Embeddings: A Study on Speech Emotion Recognition
di: Saliba, Alexandra, et al.
Pubblicazione: (2024)
di: Saliba, Alexandra, et al.
Pubblicazione: (2024)
Hard-Synth: Synthesizing Diverse Hard Samples for ASR using Zero-Shot TTS and LLM
di: Yu, Jiawei, et al.
Pubblicazione: (2024)
di: Yu, Jiawei, et al.
Pubblicazione: (2024)
StoryTTS: A Highly Expressive Text-to-Speech Dataset with Rich Textual Expressiveness Annotations
di: Liu, Sen, et al.
Pubblicazione: (2024)
di: Liu, Sen, et al.
Pubblicazione: (2024)
Documenti analoghi
-
No Verifiable Reward for Prosody: Toward Preference-Guided Prosody Learning in TTS
di: Shin, Seungyoun, et al.
Pubblicazione: (2025) -
DiffProsody: Diffusion-based Latent Prosody Generation for Expressive Speech Synthesis with Prosody Conditional Adversarial Training
di: Oh, Hyung-Seok, et al.
Pubblicazione: (2023) -
Usefulness of Emotional Prosody in Neural Machine Translation
di: Brazier, Charles, et al.
Pubblicazione: (2024) -
EE-TTS: Emphatic Expressive TTS with Linguistic Information
di: Zhong, Yi, et al.
Pubblicazione: (2023) -
Benchmarking Prosody Encoding in Discrete Speech Tokens
di: Onda, Kentaro, et al.
Pubblicazione: (2025)