DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Yinghao Aaron, Jiang, Xilin, Tao, Fei, Niu, Cheng, Xu, Kaifeng, Song, Juntong, Mesgarani, Nima |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
StyleTTS-ZS: Efficient High-Quality Zero-Shot Text-to-Speech Synthesis with Distilled Time-Varying Style Diffusion
di: Li, Yinghao Aaron, et al.
Pubblicazione: (2024)
di: Li, Yinghao Aaron, et al.
Pubblicazione: (2024)
DeCoR: Defy Knowledge Forgetting by Predicting Earlier Audio Codes
di: Jiang, Xilin, et al.
Pubblicazione: (2023)
di: Jiang, Xilin, et al.
Pubblicazione: (2023)
Speech Slytherin: Examining the Performance and Efficiency of Mamba for Speech Separation, Recognition, and Synthesis
di: Jiang, Xilin, et al.
Pubblicazione: (2024)
di: Jiang, Xilin, et al.
Pubblicazione: (2024)
Dual-path Mamba: Short and Long-term Bidirectional Selective Structured State Space Models for Speech Separation
di: Jiang, Xilin, et al.
Pubblicazione: (2024)
di: Jiang, Xilin, et al.
Pubblicazione: (2024)
Listen, Chat, and Remix: Text-Guided Soundscape Remixing for Enhanced Auditory Experience
di: Jiang, Xilin, et al.
Pubblicazione: (2024)
di: Jiang, Xilin, et al.
Pubblicazione: (2024)
MeanFlow-TSE: One-Step Generative Target Speaker Extraction with Mean Flow
di: Shimizu, Riki, et al.
Pubblicazione: (2025)
di: Shimizu, Riki, et al.
Pubblicazione: (2025)
Style-Talker: Finetuning Audio Language Model and Style-Based Text-to-Speech Model for Fast Spoken Dialogue Generation
di: Li, Yinghao Aaron, et al.
Pubblicazione: (2024)
di: Li, Yinghao Aaron, et al.
Pubblicazione: (2024)
DMOSpeech: Direct Metric Optimization via Distilled Diffusion Model in Zero-Shot Speech Synthesis
di: Li, Yingahao Aaron, et al.
Pubblicazione: (2024)
di: Li, Yingahao Aaron, et al.
Pubblicazione: (2024)
Layer-wise Minimal Pair Probing Reveals Contextual Grammatical-Conceptual Hierarchy in Speech Representations
di: He, Linyang, et al.
Pubblicazione: (2025)
di: He, Linyang, et al.
Pubblicazione: (2025)
Exploring Finetuned Audio-LLM on Heart Murmur Features
di: Florea, Adrian, et al.
Pubblicazione: (2025)
di: Florea, Adrian, et al.
Pubblicazione: (2025)
SSAMBA: Self-Supervised Audio Representation Learning with Mamba State Space Model
di: Shams, Siavash, et al.
Pubblicazione: (2024)
di: Shams, Siavash, et al.
Pubblicazione: (2024)
Just ASR + LLM? A Study on Speech Large Language Models' Ability to Identify and Understand Speaker in Spoken Dialogue
di: Wu, Junkai, et al.
Pubblicazione: (2024)
di: Wu, Junkai, et al.
Pubblicazione: (2024)
SightSound-R1: Cross-Modal Reasoning Distillation from Vision to Audio Language Models
di: Wang, Qiaolin, et al.
Pubblicazione: (2025)
di: Wang, Qiaolin, et al.
Pubblicazione: (2025)
Bridging Ears and Eyes: Analyzing Audio and Visual Large Language Models to Humans in Visible Sound Recognition and Reducing Their Sensory Gap via Cross-Modal Distillation
di: Jiang, Xilin, et al.
Pubblicazione: (2025)
di: Jiang, Xilin, et al.
Pubblicazione: (2025)
Interpretable Embeddings of Speech Enhance and Explain Brain Encoding Performance of Audio Models
di: Shimizu, Riki, et al.
Pubblicazione: (2025)
di: Shimizu, Riki, et al.
Pubblicazione: (2025)
Total-Duration-Aware Duration Modeling for Text-to-Speech Systems
di: Eskimez, Sefik Emre, et al.
Pubblicazione: (2024)
di: Eskimez, Sefik Emre, et al.
Pubblicazione: (2024)
FNH-TTS: Mixture-of-Experts Duration Modeling for Robust Neural Speech Synthesis
di: Meng, Qingliang, et al.
Pubblicazione: (2025)
di: Meng, Qingliang, et al.
Pubblicazione: (2025)
DeepSpeech models show Human-like Performance and Processing of Cochlear Implant Inputs
di: Steinhardt, Cynthia R., et al.
Pubblicazione: (2024)
di: Steinhardt, Cynthia R., et al.
Pubblicazione: (2024)
Enhancing In-the-Wild Speech Emotion Conversion with Resynthesis-based Duration Modeling
di: Prabhu, Navin Raj, et al.
Pubblicazione: (2025)
di: Prabhu, Navin Raj, et al.
Pubblicazione: (2025)
AS-Speech: Adaptive Style For Speech Synthesis
di: Li, Zhipeng, et al.
Pubblicazione: (2024)
di: Li, Zhipeng, et al.
Pubblicazione: (2024)
The Overview of Segmental Durations Modification Algorithms on Speech Signal Characteristics
di: Jang, Kyeomeun, et al.
Pubblicazione: (2025)
di: Jang, Kyeomeun, et al.
Pubblicazione: (2025)
Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation
di: Liu, Wenrui, et al.
Pubblicazione: (2025)
di: Liu, Wenrui, et al.
Pubblicazione: (2025)
Neuro2Semantic: A Transfer Learning Framework for Semantic Reconstruction of Continuous Language from Human Intracranial EEG
di: Shams, Siavash, et al.
Pubblicazione: (2025)
di: Shams, Siavash, et al.
Pubblicazione: (2025)
DubWise: Video-Guided Speech Duration Control in Multimodal LLM-based Text-to-Speech for Dubbing
di: Sahipjohn, Neha, et al.
Pubblicazione: (2024)
di: Sahipjohn, Neha, et al.
Pubblicazione: (2024)
Semantic-VAE: Semantic-Alignment Latent Representation for Better Speech Synthesis
di: Niu, Zhikang, et al.
Pubblicazione: (2025)
di: Niu, Zhikang, et al.
Pubblicazione: (2025)
DurIAN-E 2: Duration Informed Attention Network with Adaptive Variational Autoencoder and Adversarial Learning for Expressive Text-to-Speech Synthesis
di: Gu, Yu, et al.
Pubblicazione: (2024)
di: Gu, Yu, et al.
Pubblicazione: (2024)
Towards Expressive Zero-Shot Speech Synthesis with Hierarchical Prosody Modeling
di: Jiang, Yuepeng, et al.
Pubblicazione: (2024)
di: Jiang, Yuepeng, et al.
Pubblicazione: (2024)
Dynamically Slimmable Speech Enhancement Network with Metric-Guided Training
di: Zhao, Haixin, et al.
Pubblicazione: (2025)
di: Zhao, Haixin, et al.
Pubblicazione: (2025)
A Multi-Stage Framework for Multimodal Controllable Speech Synthesis
di: Niu, Rui, et al.
Pubblicazione: (2025)
di: Niu, Rui, et al.
Pubblicazione: (2025)
Distinguishing Neural Speech Synthesis Models Through Fingerprints in Speech Waveforms
di: Zhang, Chu Yuan, et al.
Pubblicazione: (2023)
di: Zhang, Chu Yuan, et al.
Pubblicazione: (2023)
Hierarchical Emotion Prediction and Control in Text-to-Speech Synthesis
di: Inoue, Sho, et al.
Pubblicazione: (2024)
di: Inoue, Sho, et al.
Pubblicazione: (2024)
Speech Quality-Based Localization of Low-Quality Speech and Text-to-Speech Synthesis Artefacts
di: Kuhlmann, Michael, et al.
Pubblicazione: (2026)
di: Kuhlmann, Michael, et al.
Pubblicazione: (2026)
Very Low Complexity Speech Synthesis Using Framewise Autoregressive GAN (FARGAN) with Pitch Prediction
di: Valin, Jean-Marc, et al.
Pubblicazione: (2024)
di: Valin, Jean-Marc, et al.
Pubblicazione: (2024)
ToneUnit: A Speech Discretization Approach for Tonal Language Speech Synthesis
di: Tao, Dehua, et al.
Pubblicazione: (2024)
di: Tao, Dehua, et al.
Pubblicazione: (2024)
MSceneSpeech: A Multi-Scene Speech Dataset For Expressive Speech Synthesis
di: Yang, Qian, et al.
Pubblicazione: (2024)
di: Yang, Qian, et al.
Pubblicazione: (2024)
A Neural Speech Codec for Noise Robust Speech Coding
di: Huang, Jiayi, et al.
Pubblicazione: (2023)
di: Huang, Jiayi, et al.
Pubblicazione: (2023)
SemaVoice: Semantic-Aware Continuous Autoregressive Speech Synthesis
di: Wang, Huimeng, et al.
Pubblicazione: (2026)
di: Wang, Huimeng, et al.
Pubblicazione: (2026)
Speech-Omni-Lite: Portable Speech Interfaces for Vision-Language Models
di: Tao, Dehua, et al.
Pubblicazione: (2026)
di: Tao, Dehua, et al.
Pubblicazione: (2026)
Interleaved Speech-Text Language Models for Simple Streaming Text-to-Speech Synthesis
di: Yang, Yifan, et al.
Pubblicazione: (2024)
di: Yang, Yifan, et al.
Pubblicazione: (2024)
ARECHO: Autoregressive Evaluation via Chain-Based Hypothesis Optimization for Speech Multi-Metric Estimation
di: Shi, Jiatong, et al.
Pubblicazione: (2025)
di: Shi, Jiatong, et al.
Pubblicazione: (2025)
Documenti analoghi
-
StyleTTS-ZS: Efficient High-Quality Zero-Shot Text-to-Speech Synthesis with Distilled Time-Varying Style Diffusion
di: Li, Yinghao Aaron, et al.
Pubblicazione: (2024) -
DeCoR: Defy Knowledge Forgetting by Predicting Earlier Audio Codes
di: Jiang, Xilin, et al.
Pubblicazione: (2023) -
Speech Slytherin: Examining the Performance and Efficiency of Mamba for Speech Separation, Recognition, and Synthesis
di: Jiang, Xilin, et al.
Pubblicazione: (2024) -
Dual-path Mamba: Short and Long-term Bidirectional Selective Structured State Space Models for Speech Separation
di: Jiang, Xilin, et al.
Pubblicazione: (2024) -
Listen, Chat, and Remix: Text-Guided Soundscape Remixing for Enhanced Auditory Experience
di: Jiang, Xilin, et al.
Pubblicazione: (2024)