A Human-in-the-Loop Approach to Improving Cross-Text Prosody Transfer
Fuente:
arXiv
Guardado en:
| Autores principales: | Maurya, Himanshu, Sigurgeirsson, Atli |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
RepeaTTS: Towards Feature Discovery through Repeated Fine-Tuning
por: Sigurgeirsson, Atli, et al.
Publicado: (2025)
por: Sigurgeirsson, Atli, et al.
Publicado: (2025)
No Verifiable Reward for Prosody: Toward Preference-Guided Prosody Learning in TTS
por: Shin, Seungyoun, et al.
Publicado: (2025)
por: Shin, Seungyoun, et al.
Publicado: (2025)
DiffStyleTTS: Diffusion-based Hierarchical Prosody Modeling for Text-to-Speech with Diverse and Controllable Styles
por: Liu, Jiaxuan, et al.
Publicado: (2024)
por: Liu, Jiaxuan, et al.
Publicado: (2024)
Multi-Modal Automatic Prosody Annotation with Contrastive Pretraining of SSWP
por: Zhong, Jinzuomu, et al.
Publicado: (2023)
por: Zhong, Jinzuomu, et al.
Publicado: (2023)
ProKWS: Personalized Keyword Spotting via Collaborative Learning of Phonemes and Prosody
por: Pan, Jianan, et al.
Publicado: (2026)
por: Pan, Jianan, et al.
Publicado: (2026)
Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody
por: Yoon, Jinsung, et al.
Publicado: (2025)
por: Yoon, Jinsung, et al.
Publicado: (2025)
Multilingual Prosody Transfer: Comparing Supervised & Transfer Learning
por: Goel, Arnav, et al.
Publicado: (2024)
por: Goel, Arnav, et al.
Publicado: (2024)
CrossVoice: Crosslingual Prosody Preserving Cascade-S2ST using Transfer Learning
por: Hira, Medha, et al.
Publicado: (2024)
por: Hira, Medha, et al.
Publicado: (2024)
USAT: A Universal Speaker-Adaptive Text-to-Speech Approach
por: Wang, Wenbin, et al.
Publicado: (2024)
por: Wang, Wenbin, et al.
Publicado: (2024)
DiffProsody: Diffusion-based Latent Prosody Generation for Expressive Speech Synthesis with Prosody Conditional Adversarial Training
por: Oh, Hyung-Seok, et al.
Publicado: (2023)
por: Oh, Hyung-Seok, et al.
Publicado: (2023)
Temporal Order Preserved Optimal Transport-based Cross-modal Knowledge Transfer Learning for ASR
por: Lu, Xugang, et al.
Publicado: (2024)
por: Lu, Xugang, et al.
Publicado: (2024)
Augment, Drop & Swap: Improving Diversity in LLM Captions for Efficient Music-Text Representation Learning
por: Manco, Ilaria, et al.
Publicado: (2024)
por: Manco, Ilaria, et al.
Publicado: (2024)
Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting
por: Han, Wooseok, et al.
Publicado: (2024)
por: Han, Wooseok, et al.
Publicado: (2024)
Speech is More Than Words: Do Speech-to-Text Translation Systems Leverage Prosody?
por: Tsiamas, Ioannis, et al.
Publicado: (2024)
por: Tsiamas, Ioannis, et al.
Publicado: (2024)
End-to-End Speech-to-Text Translation: A Survey
por: Sethiya, Nivedita, et al.
Publicado: (2023)
por: Sethiya, Nivedita, et al.
Publicado: (2023)
Improving Audio-Visual Speech Recognition by Lip-Subword Correlation Based Visual Pre-training and Cross-Modal Fusion Encoder
por: Dai, Yusheng, et al.
Publicado: (2023)
por: Dai, Yusheng, et al.
Publicado: (2023)
Virtual Speech Therapist: A Clinician-in-the-Loop AI Speech Therapy Agent for Personalized and Supervised Therapy
por: Sheikh, Shakeel, et al.
Publicado: (2026)
por: Sheikh, Shakeel, et al.
Publicado: (2026)
FluentEditor2: Text-based Speech Editing by Modeling Multi-Scale Acoustic and Prosody Consistency
por: Liu, Rui, et al.
Publicado: (2024)
por: Liu, Rui, et al.
Publicado: (2024)
Neural networks for Text-to-Speech evaluation
por: Trofimenko, Ilya, et al.
Publicado: (2026)
por: Trofimenko, Ilya, et al.
Publicado: (2026)
Benchmarking Prosody Encoding in Discrete Speech Tokens
por: Onda, Kentaro, et al.
Publicado: (2025)
por: Onda, Kentaro, et al.
Publicado: (2025)
Leveraging Audio and Text Modalities in Mental Health: A Study of LLMs Performance
por: Ali, Abdelrahman A., et al.
Publicado: (2024)
por: Ali, Abdelrahman A., et al.
Publicado: (2024)
VoxHakka: A Dialectally Diverse Multi-speaker Text-to-Speech System for Taiwanese Hakka
por: Chen, Li-Wei, et al.
Publicado: (2024)
por: Chen, Li-Wei, et al.
Publicado: (2024)
UniSonate: A Unified Model for Speech, Music, and Sound Effect Generation with Text Instructions
por: Qiang, Chunyu, et al.
Publicado: (2026)
por: Qiang, Chunyu, et al.
Publicado: (2026)
Minimizing Modality Gap from the Input Side: Your Speech LLM Can Be a Prosody-Aware Text LLM
por: Cui, Wenqian, et al.
Publicado: (2026)
por: Cui, Wenqian, et al.
Publicado: (2026)
Text2midi: Generating Symbolic Music from Captions
por: Bhandari, Keshav, et al.
Publicado: (2024)
por: Bhandari, Keshav, et al.
Publicado: (2024)
Length-Aware Rotary Position Embedding for Text-Speech Alignment
por: Kim, Hyeongju, et al.
Publicado: (2025)
por: Kim, Hyeongju, et al.
Publicado: (2025)
Seamless Dysfluent Speech Text Alignment for Disordered Speech Analysis
por: Ye, Zongli, et al.
Publicado: (2025)
por: Ye, Zongli, et al.
Publicado: (2025)
PAL: Probing Audio Encoders via LLMs -- Audio Information Transfer into LLMs
por: Alex, Tony, et al.
Publicado: (2025)
por: Alex, Tony, et al.
Publicado: (2025)
ParaSpeechCLAP: A Dual-Encoder Speech-Text Model for Rich Stylistic Language-Audio Pretraining
por: Diwan, Anuj, et al.
Publicado: (2026)
por: Diwan, Anuj, et al.
Publicado: (2026)
How "Real" is Your Real-Time Simultaneous Speech-to-Text Translation System?
por: Papi, Sara, et al.
Publicado: (2024)
por: Papi, Sara, et al.
Publicado: (2024)
Auffusion: Leveraging the Power of Diffusion and Large Language Models for Text-to-Audio Generation
por: Xue, Jinlong, et al.
Publicado: (2024)
por: Xue, Jinlong, et al.
Publicado: (2024)
Leveraging Speech PTM, Text LLM, and Emotional TTS for Speech Emotion Recognition
por: Ma, Ziyang, et al.
Publicado: (2023)
por: Ma, Ziyang, et al.
Publicado: (2023)
Cross-Speaker Encoding Network for Multi-Talker Speech Recognition
por: Kang, Jiawen, et al.
Publicado: (2024)
por: Kang, Jiawen, et al.
Publicado: (2024)
IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech
por: Zhou, Siyi, et al.
Publicado: (2025)
por: Zhou, Siyi, et al.
Publicado: (2025)
RECA-PD: A Robust Explainable Cross-Attention Method for Speech-based Parkinson's Disease Classification
por: Zhong, Terry Yi, et al.
Publicado: (2025)
por: Zhong, Terry Yi, et al.
Publicado: (2025)
Evaluating and Improving Continual Learning in Spoken Language Understanding
por: Yang, Muqiao, et al.
Publicado: (2024)
por: Yang, Muqiao, et al.
Publicado: (2024)
All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation
por: Foo, Leonardo Haw-Yang, et al.
Publicado: (2026)
por: Foo, Leonardo Haw-Yang, et al.
Publicado: (2026)
From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models
por: Ersoy, Asım, et al.
Publicado: (2025)
por: Ersoy, Asım, et al.
Publicado: (2025)
Speech Prefix-Tuning with RNNT Loss for Improving LLM Predictions
por: Baskar, Murali Karthick, et al.
Publicado: (2024)
por: Baskar, Murali Karthick, et al.
Publicado: (2024)
Tango 2: Aligning Diffusion-based Text-to-Audio Generations through Direct Preference Optimization
por: Majumder, Navonil, et al.
Publicado: (2024)
por: Majumder, Navonil, et al.
Publicado: (2024)
Ejemplares similares
-
RepeaTTS: Towards Feature Discovery through Repeated Fine-Tuning
por: Sigurgeirsson, Atli, et al.
Publicado: (2025) -
No Verifiable Reward for Prosody: Toward Preference-Guided Prosody Learning in TTS
por: Shin, Seungyoun, et al.
Publicado: (2025) -
DiffStyleTTS: Diffusion-based Hierarchical Prosody Modeling for Text-to-Speech with Diverse and Controllable Styles
por: Liu, Jiaxuan, et al.
Publicado: (2024) -
Multi-Modal Automatic Prosody Annotation with Contrastive Pretraining of SSWP
por: Zhong, Jinzuomu, et al.
Publicado: (2023) -
ProKWS: Personalized Keyword Spotting via Collaborative Learning of Phonemes and Prosody
por: Pan, Jianan, et al.
Publicado: (2026)