Enhancing In-the-Wild Speech Emotion Conversion with Resynthesis-based Duration Modeling
Fuente:
arXiv
Guardado en:
| Autores principales: | Prabhu, Navin Raj, de Oliveira, Danilo, Lehmann-Willenbrock, Nale, Gerkmann, Timo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
EMOCONV-DIFF: Diffusion-based Speech Emotion Conversion for Non-parallel and In-the-wild Data
por: Prabhu, Navin Raj, et al.
Publicado: (2023)
por: Prabhu, Navin Raj, et al.
Publicado: (2023)
Too Good to Be True: A Study on Modern Automatic Speech Recognition for the Evaluation of Speech Enhancement
por: de Oliveira, Danilo, et al.
Publicado: (2026)
por: de Oliveira, Danilo, et al.
Publicado: (2026)
Investigating Training Objectives for Generative Speech Enhancement
por: Richter, Julius, et al.
Publicado: (2024)
por: Richter, Julius, et al.
Publicado: (2024)
Are These Even Words? Quantifying the Gibberishness of Generative Speech Models
por: de Oliveira, Danilo, et al.
Publicado: (2025)
por: de Oliveira, Danilo, et al.
Publicado: (2025)
Do We Need EMA for Diffusion-Based Speech Enhancement? Toward a Magnitude-Preserving Network Architecture
por: Richter, Julius, et al.
Publicado: (2025)
por: Richter, Julius, et al.
Publicado: (2025)
LipDiffuser: Lip-to-Speech Generation with Conditional Diffusion Models
por: Richter, Julius, et al.
Publicado: (2025)
por: Richter, Julius, et al.
Publicado: (2025)
A Fast Solver for Interpolating Stochastic Differential Equation Diffusion Models for Speech Restoration
por: Lay, Bunlong, et al.
Publicado: (2026)
por: Lay, Bunlong, et al.
Publicado: (2026)
The PESQetarian: On the Relevance of Goodhart's Law for Speech Enhancement
por: de Oliveira, Danilo, et al.
Publicado: (2024)
por: de Oliveira, Danilo, et al.
Publicado: (2024)
An Analysis of the Variance of Diffusion-based Speech Enhancement
por: Lay, Bunlong, et al.
Publicado: (2024)
por: Lay, Bunlong, et al.
Publicado: (2024)
Non-intrusive Speech Quality Assessment with Diffusion Models Trained on Clean Speech
por: de Oliveira, Danilo, et al.
Publicado: (2024)
por: de Oliveira, Danilo, et al.
Publicado: (2024)
Diffusion Buffer: Online Diffusion-based Speech Enhancement with Sub-Second Latency
por: Lay, Bunlong, et al.
Publicado: (2025)
por: Lay, Bunlong, et al.
Publicado: (2025)
Multi-channel Speech Separation Using Spatially Selective Deep Non-linear Filters
por: Tesch, Kristina, et al.
Publicado: (2023)
por: Tesch, Kristina, et al.
Publicado: (2023)
Bone-conduction Guided Multimodal Speech Enhancement with Conditional Diffusion Models
por: Khanagha, Sina, et al.
Publicado: (2026)
por: Khanagha, Sina, et al.
Publicado: (2026)
Prosodically Enhanced Foreign Accent Simulation by Discrete Token-based Resynthesis Only with Native Speech Corpora
por: Onda, Kentaro, et al.
Publicado: (2025)
por: Onda, Kentaro, et al.
Publicado: (2025)
Dynamics of Collective Group Affect: Group-level Annotations and the Multimodal Modeling of Convergence and Divergence
por: Prabhu, Navin Raj, et al.
Publicado: (2024)
por: Prabhu, Navin Raj, et al.
Publicado: (2024)
Robustness of Speech Separation Models for Similar-pitch Speakers
por: Lay, Bunlong, et al.
Publicado: (2024)
por: Lay, Bunlong, et al.
Publicado: (2024)
An Analysis of Joint Nonlinear Spatial Filtering for Spatial Aliasing Reduction
por: Mannanova, Alina, et al.
Publicado: (2025)
por: Mannanova, Alina, et al.
Publicado: (2025)
Are Modern Speech Enhancement Systems Vulnerable to Adversarial Attacks?
por: Makarov, Rostislav, et al.
Publicado: (2025)
por: Makarov, Rostislav, et al.
Publicado: (2025)
StoRM: A Diffusion-based Stochastic Regeneration Model for Speech Enhancement and Dereverberation
por: Lemercier, Jean-Marie, et al.
Publicado: (2022)
por: Lemercier, Jean-Marie, et al.
Publicado: (2022)
Speech Enhancement and Dereverberation with Diffusion-based Generative Models
por: Richter, Julius, et al.
Publicado: (2022)
por: Richter, Julius, et al.
Publicado: (2022)
Total-Duration-Aware Duration Modeling for Text-to-Speech Systems
por: Eskimez, Sefik Emre, et al.
Publicado: (2024)
por: Eskimez, Sefik Emre, et al.
Publicado: (2024)
ReverbFX: A Dataset of Room Impulse Responses Derived from Reverb Effect Plugins for Singing Voice Dereverberation
por: Richter, Julius, et al.
Publicado: (2025)
por: Richter, Julius, et al.
Publicado: (2025)
Steering Deep Non-Linear Spatially Selective Filters for Weakly Guided Extraction of Moving Speakers in Dynamic Scenarios
por: Kienegger, Jakob, et al.
Publicado: (2025)
por: Kienegger, Jakob, et al.
Publicado: (2025)
Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers
por: Kienegger, Jakob, et al.
Publicado: (2026)
por: Kienegger, Jakob, et al.
Publicado: (2026)
Adaptive Rotary Steering with Joint Autoregression for Robust Extraction of Closely Moving Speakers in Dynamic Scenarios
por: Kienegger, Jakob, et al.
Publicado: (2026)
por: Kienegger, Jakob, et al.
Publicado: (2026)
SELM: Enhancing Speech Emotion Recognition for Out-of-Domain Scenarios
por: Bukhari, Hazim, et al.
Publicado: (2024)
por: Bukhari, Hazim, et al.
Publicado: (2024)
Diffusion Buffer for Online Generative Speech Enhancement
por: Lay, Bunlong, et al.
Publicado: (2025)
por: Lay, Bunlong, et al.
Publicado: (2025)
Lessons Learnt: Revisit Key Training Strategies for Effective Speech Emotion Recognition in the Wild
por: Tzeng, Jing-Tong, et al.
Publicado: (2025)
por: Tzeng, Jing-Tong, et al.
Publicado: (2025)
Conversational Speech Naturalness Predictor
por: Xu, Anfeng, et al.
Publicado: (2026)
por: Xu, Anfeng, et al.
Publicado: (2026)
Wind Noise Reduction with a Diffusion-based Stochastic Regeneration Model
por: Lemercier, Jean-Marie, et al.
Publicado: (2023)
por: Lemercier, Jean-Marie, et al.
Publicado: (2023)
Mask-Weighted Spatial Likelihood Coding for Speaker-Independent Joint Localization and Mask Estimation
por: Kienegger, Jakob, et al.
Publicado: (2024)
por: Kienegger, Jakob, et al.
Publicado: (2024)
FNH-TTS: Mixture-of-Experts Duration Modeling for Robust Neural Speech Synthesis
por: Meng, Qingliang, et al.
Publicado: (2025)
por: Meng, Qingliang, et al.
Publicado: (2025)
Real-Time Streaming Mel Vocoding with Generative Flow Matching
por: Welker, Simon, et al.
Publicado: (2025)
por: Welker, Simon, et al.
Publicado: (2025)
Few-shot Personalization via In-Context Learning for Speech Emotion Recognition based on Speech-Language Model
por: Ihori, Mana, et al.
Publicado: (2025)
por: Ihori, Mana, et al.
Publicado: (2025)
Single and Few-step Diffusion for Generative Speech Enhancement
por: Lay, Bunlong, et al.
Publicado: (2023)
por: Lay, Bunlong, et al.
Publicado: (2023)
Emotion-Aware Prefix: Towards Explicit Emotion Control in Voice Conversion Models
por: Yang, Haoyuan, et al.
Publicado: (2026)
por: Yang, Haoyuan, et al.
Publicado: (2026)
DubWise: Video-Guided Speech Duration Control in Multimodal LLM-based Text-to-Speech for Dubbing
por: Sahipjohn, Neha, et al.
Publicado: (2024)
por: Sahipjohn, Neha, et al.
Publicado: (2024)
EARS: An Anechoic Fullband Speech Dataset Benchmarked for Speech Enhancement and Dereverberation
por: Richter, Julius, et al.
Publicado: (2024)
por: Richter, Julius, et al.
Publicado: (2024)
DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis
por: Li, Yinghao Aaron, et al.
Publicado: (2025)
por: Li, Yinghao Aaron, et al.
Publicado: (2025)
Large Language Model Guided Decoding for Self-Supervised Speech Recognition
por: Cohen, Eyal, et al.
Publicado: (2025)
por: Cohen, Eyal, et al.
Publicado: (2025)
Ejemplares similares
-
EMOCONV-DIFF: Diffusion-based Speech Emotion Conversion for Non-parallel and In-the-wild Data
por: Prabhu, Navin Raj, et al.
Publicado: (2023) -
Too Good to Be True: A Study on Modern Automatic Speech Recognition for the Evaluation of Speech Enhancement
por: de Oliveira, Danilo, et al.
Publicado: (2026) -
Investigating Training Objectives for Generative Speech Enhancement
por: Richter, Julius, et al.
Publicado: (2024) -
Are These Even Words? Quantifying the Gibberishness of Generative Speech Models
por: de Oliveira, Danilo, et al.
Publicado: (2025) -
Do We Need EMA for Diffusion-Based Speech Enhancement? Toward a Magnitude-Preserving Network Architecture
por: Richter, Julius, et al.
Publicado: (2025)