Controllable Prosody Generation With Partial Inputs
Fuente:
arXiv
Salvato in:
| Autori principali: | Iliescu, Dan Andrei, Mohan, Devang Savita Ram, Teh, Tian Huey, Hodari, Zack |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
No Verifiable Reward for Prosody: Toward Preference-Guided Prosody Learning in TTS
di: Shin, Seungyoun, et al.
Pubblicazione: (2025)
di: Shin, Seungyoun, et al.
Pubblicazione: (2025)
Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody
di: Yoon, Jinsung, et al.
Pubblicazione: (2025)
di: Yoon, Jinsung, et al.
Pubblicazione: (2025)
DiffStyleTTS: Diffusion-based Hierarchical Prosody Modeling for Text-to-Speech with Diverse and Controllable Styles
di: Liu, Jiaxuan, et al.
Pubblicazione: (2024)
di: Liu, Jiaxuan, et al.
Pubblicazione: (2024)
Multi-Modal Automatic Prosody Annotation with Contrastive Pretraining of SSWP
di: Zhong, Jinzuomu, et al.
Pubblicazione: (2023)
di: Zhong, Jinzuomu, et al.
Pubblicazione: (2023)
A Human-in-the-Loop Approach to Improving Cross-Text Prosody Transfer
di: Maurya, Himanshu, et al.
Pubblicazione: (2024)
di: Maurya, Himanshu, et al.
Pubblicazione: (2024)
RepCNN: Micro-sized, Mighty Models for Wakeword Detection
di: Kundu, Arnav, et al.
Pubblicazione: (2024)
di: Kundu, Arnav, et al.
Pubblicazione: (2024)
ProKWS: Personalized Keyword Spotting via Collaborative Learning of Phonemes and Prosody
di: Pan, Jianan, et al.
Pubblicazione: (2026)
di: Pan, Jianan, et al.
Pubblicazione: (2026)
Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis
di: Mayer, Paul, et al.
Pubblicazione: (2025)
di: Mayer, Paul, et al.
Pubblicazione: (2025)
ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs
di: Eren, Eray, et al.
Pubblicazione: (2025)
di: Eren, Eray, et al.
Pubblicazione: (2025)
DiffProsody: Diffusion-based Latent Prosody Generation for Expressive Speech Synthesis with Prosody Conditional Adversarial Training
di: Oh, Hyung-Seok, et al.
Pubblicazione: (2023)
di: Oh, Hyung-Seok, et al.
Pubblicazione: (2023)
ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models
di: Qian, Kaizhi, et al.
Pubblicazione: (2025)
di: Qian, Kaizhi, et al.
Pubblicazione: (2025)
Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models
di: Lee, Kyowoon, et al.
Pubblicazione: (2025)
di: Lee, Kyowoon, et al.
Pubblicazione: (2025)
Instruction Data Generation and Unsupervised Adaptation for Speech Language Models
di: Noroozi, Vahid, et al.
Pubblicazione: (2024)
di: Noroozi, Vahid, et al.
Pubblicazione: (2024)
OWLS: Scaling Laws for Multilingual Speech Recognition and Translation Models
di: Chen, William, et al.
Pubblicazione: (2025)
di: Chen, William, et al.
Pubblicazione: (2025)
Fast Context-Biasing for CTC and Transducer ASR models with CTC-based Word Spotter
di: Andrusenko, Andrei, et al.
Pubblicazione: (2024)
di: Andrusenko, Andrei, et al.
Pubblicazione: (2024)
Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting
di: Han, Wooseok, et al.
Pubblicazione: (2024)
di: Han, Wooseok, et al.
Pubblicazione: (2024)
Prosody-Adaptable Audio Codecs for Zero-Shot Voice Conversion via In-Context Learning
di: Zhao, Junchuan, et al.
Pubblicazione: (2025)
di: Zhao, Junchuan, et al.
Pubblicazione: (2025)
PRESENT: Zero-Shot Text-to-Prosody Control
di: Lam, Perry, et al.
Pubblicazione: (2024)
di: Lam, Perry, et al.
Pubblicazione: (2024)
An Automated End-to-End Open-Source Software for High-Quality Text-to-Speech Dataset Generation
di: Gunduz, Ahmet, et al.
Pubblicazione: (2024)
di: Gunduz, Ahmet, et al.
Pubblicazione: (2024)
Usefulness of Emotional Prosody in Neural Machine Translation
di: Brazier, Charles, et al.
Pubblicazione: (2024)
di: Brazier, Charles, et al.
Pubblicazione: (2024)
NGPU-LM: GPU-Accelerated N-Gram Language Model for Context-Biasing in Greedy ASR Decoding
di: Bataev, Vladimir, et al.
Pubblicazione: (2025)
di: Bataev, Vladimir, et al.
Pubblicazione: (2025)
FlexCTC: GPU-powered CTC Beam Decoding With Advanced Contextual Abilities
di: Grigoryan, Lilit, et al.
Pubblicazione: (2025)
di: Grigoryan, Lilit, et al.
Pubblicazione: (2025)
Pushing the Limits of Beam Search Decoding for Transducer-based ASR models
di: Grigoryan, Lilit, et al.
Pubblicazione: (2025)
di: Grigoryan, Lilit, et al.
Pubblicazione: (2025)
WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling
di: Yang, Guanrou, et al.
Pubblicazione: (2026)
di: Yang, Guanrou, et al.
Pubblicazione: (2026)
XMAD-Bench: Cross-Domain Multilingual Audio Deepfake Benchmark
di: Ciobanu, Ioan-Paul, et al.
Pubblicazione: (2025)
di: Ciobanu, Ioan-Paul, et al.
Pubblicazione: (2025)
Conditional Diffusion as Latent Constraints for Controllable Symbolic Music Generation
di: Pettenó, Matteo, et al.
Pubblicazione: (2025)
di: Pettenó, Matteo, et al.
Pubblicazione: (2025)
TiCo: Time-Controllable Spoken Dialogue Model
di: Chang, Kai-Wei, et al.
Pubblicazione: (2026)
di: Chang, Kai-Wei, et al.
Pubblicazione: (2026)
Controlling Surprisal in Music Generation via Information Content Curve Matching
di: Bjare, Mathias Rose, et al.
Pubblicazione: (2024)
di: Bjare, Mathias Rose, et al.
Pubblicazione: (2024)
LAPS-Diff: A Diffusion-Based Framework for Singing Voice Synthesis With Language Aware Prosody-Style Guided Learning
di: Dhar, Sandipan, et al.
Pubblicazione: (2025)
di: Dhar, Sandipan, et al.
Pubblicazione: (2025)
Pheme: Efficient and Conversational Speech Generation
di: Budzianowski, Paweł, et al.
Pubblicazione: (2024)
di: Budzianowski, Paweł, et al.
Pubblicazione: (2024)
Retrieval-Augmented Self-Taught Reasoning Model with Adaptive Chain-of-Thought for ASR Named Entity Correction
di: An, Junjie, et al.
Pubblicazione: (2026)
di: An, Junjie, et al.
Pubblicazione: (2026)
GTR-Voice: Articulatory Phonetics Informed Controllable Expressive Speech Synthesis
di: Li, Zehua Kcriss, et al.
Pubblicazione: (2024)
di: Li, Zehua Kcriss, et al.
Pubblicazione: (2024)
Minimizing Modality Gap from the Input Side: Your Speech LLM Can Be a Prosody-Aware Text LLM
di: Cui, Wenqian, et al.
Pubblicazione: (2026)
di: Cui, Wenqian, et al.
Pubblicazione: (2026)
Speech Retrieval-Augmented Generation without Automatic Speech Recognition
di: Min, Do June, et al.
Pubblicazione: (2024)
di: Min, Do June, et al.
Pubblicazione: (2024)
ProsodyFM: Unsupervised Phrasing and Intonation Control for Intelligible Speech Synthesis
di: He, Xiangheng, et al.
Pubblicazione: (2024)
di: He, Xiangheng, et al.
Pubblicazione: (2024)
Investigating Disentanglement in a Phoneme-level Speech Codec for Prosody Modeling
di: Karapiperis, Sotirios, et al.
Pubblicazione: (2024)
di: Karapiperis, Sotirios, et al.
Pubblicazione: (2024)
Do Music Generation Models Encode Music Theory?
di: Wei, Megan, et al.
Pubblicazione: (2024)
di: Wei, Megan, et al.
Pubblicazione: (2024)
TurboBias: Universal ASR Context-Biasing powered by GPU-accelerated Phrase-Boosting Tree
di: Andrusenko, Andrei, et al.
Pubblicazione: (2025)
di: Andrusenko, Andrei, et al.
Pubblicazione: (2025)
DiTAR: Diffusion Transformer Autoregressive Modeling for Speech Generation
di: Jia, Dongya, et al.
Pubblicazione: (2025)
di: Jia, Dongya, et al.
Pubblicazione: (2025)
MoonCast: High-Quality Zero-Shot Podcast Generation
di: Ju, Zeqian, et al.
Pubblicazione: (2025)
di: Ju, Zeqian, et al.
Pubblicazione: (2025)
Documenti analoghi
-
No Verifiable Reward for Prosody: Toward Preference-Guided Prosody Learning in TTS
di: Shin, Seungyoun, et al.
Pubblicazione: (2025) -
Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody
di: Yoon, Jinsung, et al.
Pubblicazione: (2025) -
DiffStyleTTS: Diffusion-based Hierarchical Prosody Modeling for Text-to-Speech with Diverse and Controllable Styles
di: Liu, Jiaxuan, et al.
Pubblicazione: (2024) -
Multi-Modal Automatic Prosody Annotation with Contrastive Pretraining of SSWP
di: Zhong, Jinzuomu, et al.
Pubblicazione: (2023) -
A Human-in-the-Loop Approach to Improving Cross-Text Prosody Transfer
di: Maurya, Himanshu, et al.
Pubblicazione: (2024)