Guardado en:
| Autores principales: | Welker, Simon, Peer, Tal, Gerkmann, Timo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2509.15085 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
FlowDec: A flow-based full-band general audio codec with high perceptual quality
por: Welker, Simon, et al.
Publicado: (2025)
por: Welker, Simon, et al.
Publicado: (2025)
Real-Time Streamable Generative Speech Restoration with Flow Matching
por: Welker, Simon, et al.
Publicado: (2025)
por: Welker, Simon, et al.
Publicado: (2025)
EMOCONV-DIFF: Diffusion-based Speech Emotion Conversion for Non-parallel and In-the-wild Data
por: Prabhu, Navin Raj, et al.
Publicado: (2023)
por: Prabhu, Navin Raj, et al.
Publicado: (2023)
Diffusion Buffer for Online Generative Speech Enhancement
por: Lay, Bunlong, et al.
Publicado: (2025)
por: Lay, Bunlong, et al.
Publicado: (2025)
StoRM: A Diffusion-based Stochastic Regeneration Model for Speech Enhancement and Dereverberation
por: Lemercier, Jean-Marie, et al.
Publicado: (2022)
por: Lemercier, Jean-Marie, et al.
Publicado: (2022)
The PESQetarian: On the Relevance of Goodhart's Law for Speech Enhancement
por: de Oliveira, Danilo, et al.
Publicado: (2024)
por: de Oliveira, Danilo, et al.
Publicado: (2024)
Speech Enhancement and Dereverberation with Diffusion-based Generative Models
por: Richter, Julius, et al.
Publicado: (2022)
por: Richter, Julius, et al.
Publicado: (2022)
BUDDy: Single-Channel Blind Unsupervised Dereverberation with Diffusion Models
por: Moliner, Eloi, et al.
Publicado: (2024)
por: Moliner, Eloi, et al.
Publicado: (2024)
Unsupervised Blind Joint Dereverberation and Room Acoustics Estimation with Diffusion Models
por: Lemercier, Jean-Marie, et al.
Publicado: (2024)
por: Lemercier, Jean-Marie, et al.
Publicado: (2024)
Non-intrusive Speech Quality Assessment with Diffusion Models Trained on Clean Speech
por: de Oliveira, Danilo, et al.
Publicado: (2024)
por: de Oliveira, Danilo, et al.
Publicado: (2024)
Pseudo-Cepstrum: Pitch Modification for Mel-Based Neural Vocoders
por: Ellinas, Nikolaos, et al.
Publicado: (2025)
por: Ellinas, Nikolaos, et al.
Publicado: (2025)
PeriodGrad: Towards Pitch-Controllable Neural Vocoder Based on a Diffusion Probabilistic Model
por: Hono, Yukiya, et al.
Publicado: (2024)
por: Hono, Yukiya, et al.
Publicado: (2024)
Diffusion Models for Audio Restoration
por: Lemercier, Jean-Marie, et al.
Publicado: (2024)
por: Lemercier, Jean-Marie, et al.
Publicado: (2024)
Are These Even Words? Quantifying the Gibberishness of Generative Speech Models
por: de Oliveira, Danilo, et al.
Publicado: (2025)
por: de Oliveira, Danilo, et al.
Publicado: (2025)
LipDiffuser: Lip-to-Speech Generation with Conditional Diffusion Models
por: Richter, Julius, et al.
Publicado: (2025)
por: Richter, Julius, et al.
Publicado: (2025)
An Investigation of Time-Frequency Representation Discriminators for High-Fidelity Vocoder
por: Gu, Yicheng, et al.
Publicado: (2024)
por: Gu, Yicheng, et al.
Publicado: (2024)
Steering Deep Non-Linear Spatially Selective Filters for Weakly Guided Extraction of Moving Speakers in Dynamic Scenarios
por: Kienegger, Jakob, et al.
Publicado: (2025)
por: Kienegger, Jakob, et al.
Publicado: (2025)
Multi-channel Speech Separation Using Spatially Selective Deep Non-linear Filters
por: Tesch, Kristina, et al.
Publicado: (2023)
por: Tesch, Kristina, et al.
Publicado: (2023)
An Analysis of the Variance of Diffusion-based Speech Enhancement
por: Lay, Bunlong, et al.
Publicado: (2024)
por: Lay, Bunlong, et al.
Publicado: (2024)
Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers
por: Kienegger, Jakob, et al.
Publicado: (2026)
por: Kienegger, Jakob, et al.
Publicado: (2026)
Adaptive Rotary Steering with Joint Autoregression for Robust Extraction of Closely Moving Speakers in Dynamic Scenarios
por: Kienegger, Jakob, et al.
Publicado: (2026)
por: Kienegger, Jakob, et al.
Publicado: (2026)
SSM2Mel: State Space Model to Reconstruct Mel Spectrogram from the EEG
por: Fan, Cunhang, et al.
Publicado: (2025)
por: Fan, Cunhang, et al.
Publicado: (2025)
Mel-McNet: A Mel-Scale Framework for Online Multichannel Speech Enhancement
por: Yang, Yujie, et al.
Publicado: (2025)
por: Yang, Yujie, et al.
Publicado: (2025)
EARS: An Anechoic Fullband Speech Dataset Benchmarked for Speech Enhancement and Dereverberation
por: Richter, Julius, et al.
Publicado: (2024)
por: Richter, Julius, et al.
Publicado: (2024)
UniverSR: Unified and Versatile Audio Super-Resolution via Vocoder-Free Flow Matching
por: Choi, Woongjib, et al.
Publicado: (2025)
por: Choi, Woongjib, et al.
Publicado: (2025)
Are Modern Speech Enhancement Systems Vulnerable to Adversarial Attacks?
por: Makarov, Rostislav, et al.
Publicado: (2025)
por: Makarov, Rostislav, et al.
Publicado: (2025)
Mask-Weighted Spatial Likelihood Coding for Speaker-Independent Joint Localization and Mask Estimation
por: Kienegger, Jakob, et al.
Publicado: (2024)
por: Kienegger, Jakob, et al.
Publicado: (2024)
Bone-conduction Guided Multimodal Speech Enhancement with Conditional Diffusion Models
por: Khanagha, Sina, et al.
Publicado: (2026)
por: Khanagha, Sina, et al.
Publicado: (2026)
MusicHiFi: Fast High-Fidelity Stereo Vocoding
por: Zhu, Ge, et al.
Publicado: (2024)
por: Zhu, Ge, et al.
Publicado: (2024)
FunnelNet: An End-to-End Deep Learning Framework to Monitor Digital Heart Murmur in Real-Time
por: Jobayer, Md, et al.
Publicado: (2024)
por: Jobayer, Md, et al.
Publicado: (2024)
PeriodWave: Multi-Period Flow Matching for High-Fidelity Waveform Generation
por: Lee, Sang-Hoon, et al.
Publicado: (2024)
por: Lee, Sang-Hoon, et al.
Publicado: (2024)
Accelerating High-Fidelity Waveform Generation via Adversarial Flow Matching Optimization
por: Lee, Sang-Hoon, et al.
Publicado: (2024)
por: Lee, Sang-Hoon, et al.
Publicado: (2024)
QHARMA-GAN: Quasi-Harmonic Neural Vocoder based on Autoregressive Moving Average Model
por: Chen, Shaowen, et al.
Publicado: (2025)
por: Chen, Shaowen, et al.
Publicado: (2025)
Self-Steering Deep Non-Linear Spatially Selective Filters for Efficient Extraction of Moving Speakers under Weak Guidance
por: Kienegger, Jakob, et al.
Publicado: (2025)
por: Kienegger, Jakob, et al.
Publicado: (2025)
Learnable Adaptive Time-Frequency Representation via Differentiable Short-Time Fourier Transform
por: Leiber, Maxime, et al.
Publicado: (2025)
por: Leiber, Maxime, et al.
Publicado: (2025)
Robustness of Speech Separation Models for Similar-pitch Speakers
por: Lay, Bunlong, et al.
Publicado: (2024)
por: Lay, Bunlong, et al.
Publicado: (2024)
Wind Noise Reduction with a Diffusion-based Stochastic Regeneration Model
por: Lemercier, Jean-Marie, et al.
Publicado: (2023)
por: Lemercier, Jean-Marie, et al.
Publicado: (2023)
A Generalized Bandsplit Neural Network for Cinematic Audio Source Separation
por: Watcharasupat, Karn N., et al.
Publicado: (2023)
por: Watcharasupat, Karn N., et al.
Publicado: (2023)
GLA-Grad: A Griffin-Lim Extended Waveform Generation Diffusion Model
por: Liu, Haocheng, et al.
Publicado: (2024)
por: Liu, Haocheng, et al.
Publicado: (2024)
EmotionCaps: Enhancing Audio Captioning Through Emotion-Augmented Data Generation
por: Manivannan, Mithun, et al.
Publicado: (2024)
por: Manivannan, Mithun, et al.
Publicado: (2024)
Ejemplares similares
-
FlowDec: A flow-based full-band general audio codec with high perceptual quality
por: Welker, Simon, et al.
Publicado: (2025) -
Real-Time Streamable Generative Speech Restoration with Flow Matching
por: Welker, Simon, et al.
Publicado: (2025) -
EMOCONV-DIFF: Diffusion-based Speech Emotion Conversion for Non-parallel and In-the-wild Data
por: Prabhu, Navin Raj, et al.
Publicado: (2023) -
Diffusion Buffer for Online Generative Speech Enhancement
por: Lay, Bunlong, et al.
Publicado: (2025) -
StoRM: A Diffusion-based Stochastic Regeneration Model for Speech Enhancement and Dereverberation
por: Lemercier, Jean-Marie, et al.
Publicado: (2022)