Controllable Prosody Generation With Partial Inputs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Iliescu, Dan Andrei, Mohan, Devang Savita Ram, Teh, Tian Huey, Hodari, Zack |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
No Verifiable Reward for Prosody: Toward Preference-Guided Prosody Learning in TTS
par: Shin, Seungyoun, et autres
Publié: (2025)
par: Shin, Seungyoun, et autres
Publié: (2025)
Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody
par: Yoon, Jinsung, et autres
Publié: (2025)
par: Yoon, Jinsung, et autres
Publié: (2025)
DiffStyleTTS: Diffusion-based Hierarchical Prosody Modeling for Text-to-Speech with Diverse and Controllable Styles
par: Liu, Jiaxuan, et autres
Publié: (2024)
par: Liu, Jiaxuan, et autres
Publié: (2024)
Multi-Modal Automatic Prosody Annotation with Contrastive Pretraining of SSWP
par: Zhong, Jinzuomu, et autres
Publié: (2023)
par: Zhong, Jinzuomu, et autres
Publié: (2023)
A Human-in-the-Loop Approach to Improving Cross-Text Prosody Transfer
par: Maurya, Himanshu, et autres
Publié: (2024)
par: Maurya, Himanshu, et autres
Publié: (2024)
RepCNN: Micro-sized, Mighty Models for Wakeword Detection
par: Kundu, Arnav, et autres
Publié: (2024)
par: Kundu, Arnav, et autres
Publié: (2024)
ProKWS: Personalized Keyword Spotting via Collaborative Learning of Phonemes and Prosody
par: Pan, Jianan, et autres
Publié: (2026)
par: Pan, Jianan, et autres
Publié: (2026)
Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis
par: Mayer, Paul, et autres
Publié: (2025)
par: Mayer, Paul, et autres
Publié: (2025)
ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs
par: Eren, Eray, et autres
Publié: (2025)
par: Eren, Eray, et autres
Publié: (2025)
DiffProsody: Diffusion-based Latent Prosody Generation for Expressive Speech Synthesis with Prosody Conditional Adversarial Training
par: Oh, Hyung-Seok, et autres
Publié: (2023)
par: Oh, Hyung-Seok, et autres
Publié: (2023)
ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models
par: Qian, Kaizhi, et autres
Publié: (2025)
par: Qian, Kaizhi, et autres
Publié: (2025)
Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models
par: Lee, Kyowoon, et autres
Publié: (2025)
par: Lee, Kyowoon, et autres
Publié: (2025)
Instruction Data Generation and Unsupervised Adaptation for Speech Language Models
par: Noroozi, Vahid, et autres
Publié: (2024)
par: Noroozi, Vahid, et autres
Publié: (2024)
OWLS: Scaling Laws for Multilingual Speech Recognition and Translation Models
par: Chen, William, et autres
Publié: (2025)
par: Chen, William, et autres
Publié: (2025)
Fast Context-Biasing for CTC and Transducer ASR models with CTC-based Word Spotter
par: Andrusenko, Andrei, et autres
Publié: (2024)
par: Andrusenko, Andrei, et autres
Publié: (2024)
Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting
par: Han, Wooseok, et autres
Publié: (2024)
par: Han, Wooseok, et autres
Publié: (2024)
Prosody-Adaptable Audio Codecs for Zero-Shot Voice Conversion via In-Context Learning
par: Zhao, Junchuan, et autres
Publié: (2025)
par: Zhao, Junchuan, et autres
Publié: (2025)
PRESENT: Zero-Shot Text-to-Prosody Control
par: Lam, Perry, et autres
Publié: (2024)
par: Lam, Perry, et autres
Publié: (2024)
An Automated End-to-End Open-Source Software for High-Quality Text-to-Speech Dataset Generation
par: Gunduz, Ahmet, et autres
Publié: (2024)
par: Gunduz, Ahmet, et autres
Publié: (2024)
Usefulness of Emotional Prosody in Neural Machine Translation
par: Brazier, Charles, et autres
Publié: (2024)
par: Brazier, Charles, et autres
Publié: (2024)
NGPU-LM: GPU-Accelerated N-Gram Language Model for Context-Biasing in Greedy ASR Decoding
par: Bataev, Vladimir, et autres
Publié: (2025)
par: Bataev, Vladimir, et autres
Publié: (2025)
FlexCTC: GPU-powered CTC Beam Decoding With Advanced Contextual Abilities
par: Grigoryan, Lilit, et autres
Publié: (2025)
par: Grigoryan, Lilit, et autres
Publié: (2025)
Pushing the Limits of Beam Search Decoding for Transducer-based ASR models
par: Grigoryan, Lilit, et autres
Publié: (2025)
par: Grigoryan, Lilit, et autres
Publié: (2025)
WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling
par: Yang, Guanrou, et autres
Publié: (2026)
par: Yang, Guanrou, et autres
Publié: (2026)
XMAD-Bench: Cross-Domain Multilingual Audio Deepfake Benchmark
par: Ciobanu, Ioan-Paul, et autres
Publié: (2025)
par: Ciobanu, Ioan-Paul, et autres
Publié: (2025)
Conditional Diffusion as Latent Constraints for Controllable Symbolic Music Generation
par: Pettenó, Matteo, et autres
Publié: (2025)
par: Pettenó, Matteo, et autres
Publié: (2025)
TiCo: Time-Controllable Spoken Dialogue Model
par: Chang, Kai-Wei, et autres
Publié: (2026)
par: Chang, Kai-Wei, et autres
Publié: (2026)
Controlling Surprisal in Music Generation via Information Content Curve Matching
par: Bjare, Mathias Rose, et autres
Publié: (2024)
par: Bjare, Mathias Rose, et autres
Publié: (2024)
LAPS-Diff: A Diffusion-Based Framework for Singing Voice Synthesis With Language Aware Prosody-Style Guided Learning
par: Dhar, Sandipan, et autres
Publié: (2025)
par: Dhar, Sandipan, et autres
Publié: (2025)
Pheme: Efficient and Conversational Speech Generation
par: Budzianowski, Paweł, et autres
Publié: (2024)
par: Budzianowski, Paweł, et autres
Publié: (2024)
Retrieval-Augmented Self-Taught Reasoning Model with Adaptive Chain-of-Thought for ASR Named Entity Correction
par: An, Junjie, et autres
Publié: (2026)
par: An, Junjie, et autres
Publié: (2026)
GTR-Voice: Articulatory Phonetics Informed Controllable Expressive Speech Synthesis
par: Li, Zehua Kcriss, et autres
Publié: (2024)
par: Li, Zehua Kcriss, et autres
Publié: (2024)
Minimizing Modality Gap from the Input Side: Your Speech LLM Can Be a Prosody-Aware Text LLM
par: Cui, Wenqian, et autres
Publié: (2026)
par: Cui, Wenqian, et autres
Publié: (2026)
Speech Retrieval-Augmented Generation without Automatic Speech Recognition
par: Min, Do June, et autres
Publié: (2024)
par: Min, Do June, et autres
Publié: (2024)
ProsodyFM: Unsupervised Phrasing and Intonation Control for Intelligible Speech Synthesis
par: He, Xiangheng, et autres
Publié: (2024)
par: He, Xiangheng, et autres
Publié: (2024)
Investigating Disentanglement in a Phoneme-level Speech Codec for Prosody Modeling
par: Karapiperis, Sotirios, et autres
Publié: (2024)
par: Karapiperis, Sotirios, et autres
Publié: (2024)
Do Music Generation Models Encode Music Theory?
par: Wei, Megan, et autres
Publié: (2024)
par: Wei, Megan, et autres
Publié: (2024)
TurboBias: Universal ASR Context-Biasing powered by GPU-accelerated Phrase-Boosting Tree
par: Andrusenko, Andrei, et autres
Publié: (2025)
par: Andrusenko, Andrei, et autres
Publié: (2025)
DiTAR: Diffusion Transformer Autoregressive Modeling for Speech Generation
par: Jia, Dongya, et autres
Publié: (2025)
par: Jia, Dongya, et autres
Publié: (2025)
MoonCast: High-Quality Zero-Shot Podcast Generation
par: Ju, Zeqian, et autres
Publié: (2025)
par: Ju, Zeqian, et autres
Publié: (2025)
Documents similaires
-
No Verifiable Reward for Prosody: Toward Preference-Guided Prosody Learning in TTS
par: Shin, Seungyoun, et autres
Publié: (2025) -
Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody
par: Yoon, Jinsung, et autres
Publié: (2025) -
DiffStyleTTS: Diffusion-based Hierarchical Prosody Modeling for Text-to-Speech with Diverse and Controllable Styles
par: Liu, Jiaxuan, et autres
Publié: (2024) -
Multi-Modal Automatic Prosody Annotation with Contrastive Pretraining of SSWP
par: Zhong, Jinzuomu, et autres
Publié: (2023) -
A Human-in-the-Loop Approach to Improving Cross-Text Prosody Transfer
par: Maurya, Himanshu, et autres
Publié: (2024)