Shortcut Flow Matching for Speech Enhancement: Step-Invariant flows via single stage training
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhou, Naisong, Phaye, Saisamarth Rajesh, Cernak, Milos, Stojkovic, Tijana, Pearce, Andy, Cavallaro, Andrea, Harper, Andy |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Model as Loss: A Self-Consistent Training Paradigm
por: Phaye, Saisamarth Rajesh, et al.
Publicado: (2025)
por: Phaye, Saisamarth Rajesh, et al.
Publicado: (2025)
Multi-Channel MOSRA: Mean Opinion Score and Room Acoustics Estimation Using Simulated Data and a Teacher Model
por: Coldenhoff, Jozef, et al.
Publicado: (2023)
por: Coldenhoff, Jozef, et al.
Publicado: (2023)
DeepFilterGAN: A Full-band Real-time Speech Enhancement System with GAN-based Stochastic Regeneration
por: Serbest, Sanberk, et al.
Publicado: (2025)
por: Serbest, Sanberk, et al.
Publicado: (2025)
Diffusion-based Speech Enhancement with Schrödinger Bridge and Symmetric Noise Schedule
por: Wang, Siyi, et al.
Publicado: (2024)
por: Wang, Siyi, et al.
Publicado: (2024)
Semi-intrusive audio evaluation: Casting non-intrusive assessment as a multi-modal text prediction task
por: Coldenhoff, Jozef, et al.
Publicado: (2024)
por: Coldenhoff, Jozef, et al.
Publicado: (2024)
OpenACE: An Open Benchmark for Evaluating Audio Coding Performance
por: Coldenhoff, Jozef, et al.
Publicado: (2024)
por: Coldenhoff, Jozef, et al.
Publicado: (2024)
Differentiable Time-Varying IIR Filtering for Real-Time Speech Denoising
por: Rota, Riccardo, et al.
Publicado: (2026)
por: Rota, Riccardo, et al.
Publicado: (2026)
Compose Yourself: Average-Velocity Flow Matching for One-Step Speech Enhancement
por: Yang, Gang, et al.
Publicado: (2025)
por: Yang, Gang, et al.
Publicado: (2025)
Flowing Straighter with Conditional Flow Matching for Accurate Speech Enhancement
por: Cross, Mattias, et al.
Publicado: (2025)
por: Cross, Mattias, et al.
Publicado: (2025)
FlowAVSE: Efficient Audio-Visual Speech Enhancement with Conditional Flow Matching
por: Jung, Chaeyoung, et al.
Publicado: (2024)
por: Jung, Chaeyoung, et al.
Publicado: (2024)
MeanFlowSE: One-Step Generative Speech Enhancement via MeanFlow
por: Zhu, Yike, et al.
Publicado: (2025)
por: Zhu, Yike, et al.
Publicado: (2025)
Latent-Level Enhancement with Flow Matching for Robust Automatic Speech Recognition
por: Yang, Da-Hee, et al.
Publicado: (2026)
por: Yang, Da-Hee, et al.
Publicado: (2026)
Generative Pre-training for Speech with Flow Matching
por: Liu, Alexander H., et al.
Publicado: (2023)
por: Liu, Alexander H., et al.
Publicado: (2023)
Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling
por: Zheng, Qixi, et al.
Publicado: (2025)
por: Zheng, Qixi, et al.
Publicado: (2025)
DSFlow: Dual Supervision and Step-Aware Architecture for One-Step Flow Matching Speech Synthesis
por: Lin, Bin, et al.
Publicado: (2026)
por: Lin, Bin, et al.
Publicado: (2026)
Improving Design of Input Condition Invariant Speech Enhancement
por: Zhang, Wangyou, et al.
Publicado: (2024)
por: Zhang, Wangyou, et al.
Publicado: (2024)
Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching
por: Zuo, Jialong, et al.
Publicado: (2025)
por: Zuo, Jialong, et al.
Publicado: (2025)
Context-Aware Two-Step Training Scheme for Domain Invariant Speech Separation
por: Wang, Wupeng, et al.
Publicado: (2025)
por: Wang, Wupeng, et al.
Publicado: (2025)
DiT-Flow: Speech Enhancement Robust to Multiple Distortions based on Flow Matching in Latent Space and Diffusion Transformers
por: Cao, Tianyu, et al.
Publicado: (2026)
por: Cao, Tianyu, et al.
Publicado: (2026)
Parallel Synthesis for Autoregressive Speech Generation
por: Hsu, Po-chun, et al.
Publicado: (2022)
por: Hsu, Po-chun, et al.
Publicado: (2022)
Universal Discrete-Domain Speech Enhancement
por: Liu, Fei, et al.
Publicado: (2025)
por: Liu, Fei, et al.
Publicado: (2025)
Efficient Speech Enhancement via Embeddings from Pre-trained Generative Audioencoders
por: Sun, Xingwei, et al.
Publicado: (2025)
por: Sun, Xingwei, et al.
Publicado: (2025)
Schrödinger Bridge Mamba for One-Step Speech Enhancement
por: Yang, Jing, et al.
Publicado: (2025)
por: Yang, Jing, et al.
Publicado: (2025)
CogSR: Semantic-Aware Speech Super-Resolution via Chain-of-Thought Guided Flow Matching
por: Yuan, Jiajun, et al.
Publicado: (2025)
por: Yuan, Jiajun, et al.
Publicado: (2025)
Drax: Speech Recognition with Discrete Flow Matching
por: Navon, Aviv, et al.
Publicado: (2025)
por: Navon, Aviv, et al.
Publicado: (2025)
Multi-Channel Speech Enhancement for Cocktail Party Speech Emotion Recognition
por: Chen, Youjun, et al.
Publicado: (2026)
por: Chen, Youjun, et al.
Publicado: (2026)
FlowW2N: Whispered-to-Normal Speech Conversion via Flow-Matching
por: Ritter-Gutierrez, Fabian, et al.
Publicado: (2026)
por: Ritter-Gutierrez, Fabian, et al.
Publicado: (2026)
EDNet: A Versatile Speech Enhancement Framework with Gating Mamba Mechanism and Phase Shift-Invariant Training
por: Kwak, Doyeop, et al.
Publicado: (2025)
por: Kwak, Doyeop, et al.
Publicado: (2025)
Diffusion-based Frameworks for Unsupervised Speech Enhancement
por: Ayilo, Jean-Eudes, et al.
Publicado: (2026)
por: Ayilo, Jean-Eudes, et al.
Publicado: (2026)
DialoSpeech: Dual-Speaker Dialogue Generation with LLM and Flow Matching
por: Xie, Hanke, et al.
Publicado: (2025)
por: Xie, Hanke, et al.
Publicado: (2025)
VoiceRestore: Flow-Matching Transformers for Speech Recording Quality Restoration
por: Kirdey, Stanislav
Publicado: (2025)
por: Kirdey, Stanislav
Publicado: (2025)
Bridging the Gap: Integrating Pre-trained Speech Enhancement and Recognition Models for Robust Speech Recognition
por: Wang, Kuan-Chen, et al.
Publicado: (2024)
por: Wang, Kuan-Chen, et al.
Publicado: (2024)
Real-Time Streamable Generative Speech Restoration with Flow Matching
por: Welker, Simon, et al.
Publicado: (2025)
por: Welker, Simon, et al.
Publicado: (2025)
A Probabilistic Generative Model for Spectral Speech Enhancement
por: Hidalgo-Araya, Marco, et al.
Publicado: (2026)
por: Hidalgo-Araya, Marco, et al.
Publicado: (2026)
StreamFlow: Streaming Flow Matching with Block-wise Guided Attention Mask for Speech Token Decoding
por: Guo, Dake, et al.
Publicado: (2025)
por: Guo, Dake, et al.
Publicado: (2025)
LABNet: A Lightweight Attentive Beamforming Network for Ad-hoc Multichannel Microphone Invariant Real-Time Speech Enhancement
por: Yan, Haoyin, et al.
Publicado: (2025)
por: Yan, Haoyin, et al.
Publicado: (2025)
RobustSpeechFlow: Learning Robust Text-to-Speech Trajectories via Augmentation-based Contrastive Flow Matching
por: Yang, Jinhyeok, et al.
Publicado: (2026)
por: Yang, Jinhyeok, et al.
Publicado: (2026)
Pre-training Feature Guided Diffusion Model for Speech Enhancement
por: Yang, Yiyuan, et al.
Publicado: (2024)
por: Yang, Yiyuan, et al.
Publicado: (2024)
Shallow Flow Matching for Coarse-to-Fine Text-to-Speech Synthesis
por: Yang, Dong, et al.
Publicado: (2025)
por: Yang, Dong, et al.
Publicado: (2025)
Improved Intelligibility of Dysarthric Speech using Conditional Flow Matching
por: Das, Shoutrik, et al.
Publicado: (2025)
por: Das, Shoutrik, et al.
Publicado: (2025)
Ejemplares similares
-
Model as Loss: A Self-Consistent Training Paradigm
por: Phaye, Saisamarth Rajesh, et al.
Publicado: (2025) -
Multi-Channel MOSRA: Mean Opinion Score and Room Acoustics Estimation Using Simulated Data and a Teacher Model
por: Coldenhoff, Jozef, et al.
Publicado: (2023) -
DeepFilterGAN: A Full-band Real-time Speech Enhancement System with GAN-based Stochastic Regeneration
por: Serbest, Sanberk, et al.
Publicado: (2025) -
Diffusion-based Speech Enhancement with Schrödinger Bridge and Symmetric Noise Schedule
por: Wang, Siyi, et al.
Publicado: (2024) -
Semi-intrusive audio evaluation: Casting non-intrusive assessment as a multi-modal text prediction task
por: Coldenhoff, Jozef, et al.
Publicado: (2024)