A Human-in-the-Loop Approach to Improving Cross-Text Prosody Transfer
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Maurya, Himanshu, Sigurgeirsson, Atli |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
RepeaTTS: Towards Feature Discovery through Repeated Fine-Tuning
par: Sigurgeirsson, Atli, et autres
Publié: (2025)
par: Sigurgeirsson, Atli, et autres
Publié: (2025)
No Verifiable Reward for Prosody: Toward Preference-Guided Prosody Learning in TTS
par: Shin, Seungyoun, et autres
Publié: (2025)
par: Shin, Seungyoun, et autres
Publié: (2025)
DiffStyleTTS: Diffusion-based Hierarchical Prosody Modeling for Text-to-Speech with Diverse and Controllable Styles
par: Liu, Jiaxuan, et autres
Publié: (2024)
par: Liu, Jiaxuan, et autres
Publié: (2024)
Multi-Modal Automatic Prosody Annotation with Contrastive Pretraining of SSWP
par: Zhong, Jinzuomu, et autres
Publié: (2023)
par: Zhong, Jinzuomu, et autres
Publié: (2023)
ProKWS: Personalized Keyword Spotting via Collaborative Learning of Phonemes and Prosody
par: Pan, Jianan, et autres
Publié: (2026)
par: Pan, Jianan, et autres
Publié: (2026)
Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody
par: Yoon, Jinsung, et autres
Publié: (2025)
par: Yoon, Jinsung, et autres
Publié: (2025)
Multilingual Prosody Transfer: Comparing Supervised & Transfer Learning
par: Goel, Arnav, et autres
Publié: (2024)
par: Goel, Arnav, et autres
Publié: (2024)
CrossVoice: Crosslingual Prosody Preserving Cascade-S2ST using Transfer Learning
par: Hira, Medha, et autres
Publié: (2024)
par: Hira, Medha, et autres
Publié: (2024)
USAT: A Universal Speaker-Adaptive Text-to-Speech Approach
par: Wang, Wenbin, et autres
Publié: (2024)
par: Wang, Wenbin, et autres
Publié: (2024)
DiffProsody: Diffusion-based Latent Prosody Generation for Expressive Speech Synthesis with Prosody Conditional Adversarial Training
par: Oh, Hyung-Seok, et autres
Publié: (2023)
par: Oh, Hyung-Seok, et autres
Publié: (2023)
Temporal Order Preserved Optimal Transport-based Cross-modal Knowledge Transfer Learning for ASR
par: Lu, Xugang, et autres
Publié: (2024)
par: Lu, Xugang, et autres
Publié: (2024)
Augment, Drop & Swap: Improving Diversity in LLM Captions for Efficient Music-Text Representation Learning
par: Manco, Ilaria, et autres
Publié: (2024)
par: Manco, Ilaria, et autres
Publié: (2024)
Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting
par: Han, Wooseok, et autres
Publié: (2024)
par: Han, Wooseok, et autres
Publié: (2024)
Speech is More Than Words: Do Speech-to-Text Translation Systems Leverage Prosody?
par: Tsiamas, Ioannis, et autres
Publié: (2024)
par: Tsiamas, Ioannis, et autres
Publié: (2024)
End-to-End Speech-to-Text Translation: A Survey
par: Sethiya, Nivedita, et autres
Publié: (2023)
par: Sethiya, Nivedita, et autres
Publié: (2023)
Improving Audio-Visual Speech Recognition by Lip-Subword Correlation Based Visual Pre-training and Cross-Modal Fusion Encoder
par: Dai, Yusheng, et autres
Publié: (2023)
par: Dai, Yusheng, et autres
Publié: (2023)
Virtual Speech Therapist: A Clinician-in-the-Loop AI Speech Therapy Agent for Personalized and Supervised Therapy
par: Sheikh, Shakeel, et autres
Publié: (2026)
par: Sheikh, Shakeel, et autres
Publié: (2026)
FluentEditor2: Text-based Speech Editing by Modeling Multi-Scale Acoustic and Prosody Consistency
par: Liu, Rui, et autres
Publié: (2024)
par: Liu, Rui, et autres
Publié: (2024)
Neural networks for Text-to-Speech evaluation
par: Trofimenko, Ilya, et autres
Publié: (2026)
par: Trofimenko, Ilya, et autres
Publié: (2026)
Benchmarking Prosody Encoding in Discrete Speech Tokens
par: Onda, Kentaro, et autres
Publié: (2025)
par: Onda, Kentaro, et autres
Publié: (2025)
Leveraging Audio and Text Modalities in Mental Health: A Study of LLMs Performance
par: Ali, Abdelrahman A., et autres
Publié: (2024)
par: Ali, Abdelrahman A., et autres
Publié: (2024)
VoxHakka: A Dialectally Diverse Multi-speaker Text-to-Speech System for Taiwanese Hakka
par: Chen, Li-Wei, et autres
Publié: (2024)
par: Chen, Li-Wei, et autres
Publié: (2024)
UniSonate: A Unified Model for Speech, Music, and Sound Effect Generation with Text Instructions
par: Qiang, Chunyu, et autres
Publié: (2026)
par: Qiang, Chunyu, et autres
Publié: (2026)
Minimizing Modality Gap from the Input Side: Your Speech LLM Can Be a Prosody-Aware Text LLM
par: Cui, Wenqian, et autres
Publié: (2026)
par: Cui, Wenqian, et autres
Publié: (2026)
Text2midi: Generating Symbolic Music from Captions
par: Bhandari, Keshav, et autres
Publié: (2024)
par: Bhandari, Keshav, et autres
Publié: (2024)
Length-Aware Rotary Position Embedding for Text-Speech Alignment
par: Kim, Hyeongju, et autres
Publié: (2025)
par: Kim, Hyeongju, et autres
Publié: (2025)
Seamless Dysfluent Speech Text Alignment for Disordered Speech Analysis
par: Ye, Zongli, et autres
Publié: (2025)
par: Ye, Zongli, et autres
Publié: (2025)
PAL: Probing Audio Encoders via LLMs -- Audio Information Transfer into LLMs
par: Alex, Tony, et autres
Publié: (2025)
par: Alex, Tony, et autres
Publié: (2025)
ParaSpeechCLAP: A Dual-Encoder Speech-Text Model for Rich Stylistic Language-Audio Pretraining
par: Diwan, Anuj, et autres
Publié: (2026)
par: Diwan, Anuj, et autres
Publié: (2026)
How "Real" is Your Real-Time Simultaneous Speech-to-Text Translation System?
par: Papi, Sara, et autres
Publié: (2024)
par: Papi, Sara, et autres
Publié: (2024)
Auffusion: Leveraging the Power of Diffusion and Large Language Models for Text-to-Audio Generation
par: Xue, Jinlong, et autres
Publié: (2024)
par: Xue, Jinlong, et autres
Publié: (2024)
Leveraging Speech PTM, Text LLM, and Emotional TTS for Speech Emotion Recognition
par: Ma, Ziyang, et autres
Publié: (2023)
par: Ma, Ziyang, et autres
Publié: (2023)
Cross-Speaker Encoding Network for Multi-Talker Speech Recognition
par: Kang, Jiawen, et autres
Publié: (2024)
par: Kang, Jiawen, et autres
Publié: (2024)
IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech
par: Zhou, Siyi, et autres
Publié: (2025)
par: Zhou, Siyi, et autres
Publié: (2025)
RECA-PD: A Robust Explainable Cross-Attention Method for Speech-based Parkinson's Disease Classification
par: Zhong, Terry Yi, et autres
Publié: (2025)
par: Zhong, Terry Yi, et autres
Publié: (2025)
Evaluating and Improving Continual Learning in Spoken Language Understanding
par: Yang, Muqiao, et autres
Publié: (2024)
par: Yang, Muqiao, et autres
Publié: (2024)
All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation
par: Foo, Leonardo Haw-Yang, et autres
Publié: (2026)
par: Foo, Leonardo Haw-Yang, et autres
Publié: (2026)
From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models
par: Ersoy, Asım, et autres
Publié: (2025)
par: Ersoy, Asım, et autres
Publié: (2025)
Speech Prefix-Tuning with RNNT Loss for Improving LLM Predictions
par: Baskar, Murali Karthick, et autres
Publié: (2024)
par: Baskar, Murali Karthick, et autres
Publié: (2024)
Tango 2: Aligning Diffusion-based Text-to-Audio Generations through Direct Preference Optimization
par: Majumder, Navonil, et autres
Publié: (2024)
par: Majumder, Navonil, et autres
Publié: (2024)
Documents similaires
-
RepeaTTS: Towards Feature Discovery through Repeated Fine-Tuning
par: Sigurgeirsson, Atli, et autres
Publié: (2025) -
No Verifiable Reward for Prosody: Toward Preference-Guided Prosody Learning in TTS
par: Shin, Seungyoun, et autres
Publié: (2025) -
DiffStyleTTS: Diffusion-based Hierarchical Prosody Modeling for Text-to-Speech with Diverse and Controllable Styles
par: Liu, Jiaxuan, et autres
Publié: (2024) -
Multi-Modal Automatic Prosody Annotation with Contrastive Pretraining of SSWP
par: Zhong, Jinzuomu, et autres
Publié: (2023) -
ProKWS: Personalized Keyword Spotting via Collaborative Learning of Phonemes and Prosody
par: Pan, Jianan, et autres
Publié: (2026)