Real-time Speech Restoration using Data Prediction Mean Flows
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Braun, Sebastian |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Towards Real-Time Generative Speech Restoration with Flow-Matching
par: Hsieh, Tsun-An, et autres
Publié: (2025)
par: Hsieh, Tsun-An, et autres
Publié: (2025)
MeanSE: Efficient Generative Speech Enhancement with Mean Flows
par: Wang, Jiahe, et autres
Publié: (2025)
par: Wang, Jiahe, et autres
Publié: (2025)
Distributed Asynchronous Device Speech Enhancement via Windowed Cross-Attention
par: Yang, Gene-Ping, et autres
Publié: (2025)
par: Yang, Gene-Ping, et autres
Publié: (2025)
VoiceRestore: Flow-Matching Transformers for Speech Recording Quality Restoration
par: Kirdey, Stanislav
Publié: (2025)
par: Kirdey, Stanislav
Publié: (2025)
MeanFlowSE: One-Step Generative Speech Enhancement via MeanFlow
par: Zhu, Yike, et autres
Publié: (2025)
par: Zhu, Yike, et autres
Publié: (2025)
Ultra-Low Latency Speech Enhancement - A Comprehensive Study
par: Wu, Haibin, et autres
Publié: (2024)
par: Wu, Haibin, et autres
Publié: (2024)
FLOWER: Flow-Based Estimated Gaussian Guidance for General Speech Restoration
par: Yang, Da-Hee, et autres
Publié: (2025)
par: Yang, Da-Hee, et autres
Publié: (2025)
MeanFlow-TSE: One-Step Generative Target Speaker Extraction with Mean Flow
par: Shimizu, Riki, et autres
Publié: (2025)
par: Shimizu, Riki, et autres
Publié: (2025)
Multi-label audio classification with a noisy zero-shot teacher
par: Braun, Sebastian, et autres
Publié: (2024)
par: Braun, Sebastian, et autres
Publié: (2024)
Gaussian Flow Bridges for Audio Domain Transfer with Unpaired Data
par: Moliner, Eloi, et autres
Publié: (2024)
par: Moliner, Eloi, et autres
Publié: (2024)
Neural Speech Coding for Real-time Communications using Constant Bitrate Scalar Quantization
par: Brendel, Andreas, et autres
Publié: (2024)
par: Brendel, Andreas, et autres
Publié: (2024)
Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration
par: Shin, Ui-Hyeop, et autres
Publié: (2025)
par: Shin, Ui-Hyeop, et autres
Publié: (2025)
Voice-ENHANCE: Speech Restoration using a Diffusion-based Voice Conversion Framework
par: Byun, Kyungguen, et autres
Publié: (2025)
par: Byun, Kyungguen, et autres
Publié: (2025)
Real-time Stereo Speech Enhancement with Spatial-Cue Preservation based on Dual-Path Structure
par: Togami, Masahito, et autres
Publié: (2024)
par: Togami, Masahito, et autres
Publié: (2024)
Generative Speech Foundation Model Pretraining for High-Quality Speech Extraction and Restoration
par: Ku, Pin-Jui, et autres
Publié: (2024)
par: Ku, Pin-Jui, et autres
Publié: (2024)
A Fast Solver for Interpolating Stochastic Differential Equation Diffusion Models for Speech Restoration
par: Lay, Bunlong, et autres
Publié: (2026)
par: Lay, Bunlong, et autres
Publié: (2026)
Selection of Layers from Self-supervised Learning Models for Predicting Mean-Opinion-Score of Speech
par: Liang, Xinyu, et autres
Publié: (2025)
par: Liang, Xinyu, et autres
Publié: (2025)
SALAD-VAE: Semantic Audio Compression with Language-Audio Distillation
par: Braun, Sebastian, et autres
Publié: (2025)
par: Braun, Sebastian, et autres
Publié: (2025)
Textless Streaming Speech-to-Speech Translation using Semantic Speech Tokens
par: Zhao, Jinzheng, et autres
Publié: (2024)
par: Zhao, Jinzheng, et autres
Publié: (2024)
Rethinking Flow and Diffusion Bridge Models for Speech Enhancement
par: Wang, Dahan, et autres
Publié: (2026)
par: Wang, Dahan, et autres
Publié: (2026)
The CCF AATC 2025 Speech Restoration Challenge: A Retrospective
par: Zhang, Junan, et autres
Publié: (2025)
par: Zhang, Junan, et autres
Publié: (2025)
Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation
par: Liu, Wenrui, et autres
Publié: (2025)
par: Liu, Wenrui, et autres
Publié: (2025)
FlowSE: Flow Matching-based Speech Enhancement
par: Lee, Seonggyu, et autres
Publié: (2025)
par: Lee, Seonggyu, et autres
Publié: (2025)
FlowSE-GRPO: Training Flow Matching Speech Enhancement via Online Reinforcement Learning
par: Wang, Haoxu, et autres
Publié: (2026)
par: Wang, Haoxu, et autres
Publié: (2026)
Estimation and Restoration of Unknown Nonlinear Distortion using Diffusion
par: Švento, Michal, et autres
Publié: (2025)
par: Švento, Michal, et autres
Publié: (2025)
Evaluation of an ITD-to-ILD Transformation as a Method to Restore the Spatial Benefit in Speech Intelligibility in Hearing Impaired Listeners
par: Bäumer, Timm-Jonas, et autres
Publié: (2025)
par: Bäumer, Timm-Jonas, et autres
Publié: (2025)
Perceptual Ratings Predict Speech Inversion Articulatory Kinematics in Childhood Speech Sound Disorders
par: Benway, Nina R., et autres
Publié: (2025)
par: Benway, Nina R., et autres
Publié: (2025)
VC-ENHANCE: Speech Restoration with Integrated Noise Suppression and Voice Conversion
par: Byun, Kyungguen, et autres
Publié: (2024)
par: Byun, Kyungguen, et autres
Publié: (2024)
ReverbMiipher: Generative Speech Restoration meets Reverberation Characteristics Controllability
par: Nakata, Wataru, et autres
Publié: (2025)
par: Nakata, Wataru, et autres
Publié: (2025)
Exploiting Foundation Models and Speech Enhancement for Parkinson's Disease Detection from Speech in Real-World Operative Conditions
par: La Quatra, Moreno, et autres
Publié: (2024)
par: La Quatra, Moreno, et autres
Publié: (2024)
Data Augmentation for Pathological Speech Enhancement
par: Hou, Mingchi, et autres
Publié: (2026)
par: Hou, Mingchi, et autres
Publié: (2026)
Adapting Frechet Audio Distance for Generative Music Evaluation
par: Gui, Azalea, et autres
Publié: (2023)
par: Gui, Azalea, et autres
Publié: (2023)
Miipher-2: A Universal Speech Restoration Model for Million-Hour Scale Data Restoration
par: Karita, Shigeki, et autres
Publié: (2025)
par: Karita, Shigeki, et autres
Publié: (2025)
Towards Frame-level Quality Predictions of Synthetic Speech
par: Kuhlmann, Michael, et autres
Publié: (2025)
par: Kuhlmann, Michael, et autres
Publié: (2025)
Restorative Speech Enhancement: A Progressive Approach Using SE and Codec Modules
par: Chiang, Hsin-Tien, et autres
Publié: (2024)
par: Chiang, Hsin-Tien, et autres
Publié: (2024)
Listen through the Sound: Generative Speech Restoration Leveraging Acoustic Context Representation
par: Chung, Soo-Whan, et autres
Publié: (2025)
par: Chung, Soo-Whan, et autres
Publié: (2025)
MeanVC: Lightweight and Streaming Zero-Shot Voice Conversion via Mean Flows
par: Ma, Guobin, et autres
Publié: (2025)
par: Ma, Guobin, et autres
Publié: (2025)
LP-CFM: Perceptual Invariance-Aware Conditional Flow Matching for Speech Modeling
par: Kwak, Doyeop, et autres
Publié: (2025)
par: Kwak, Doyeop, et autres
Publié: (2025)
Modeling Multi-Level Hearing Loss for Speech Intelligibility Prediction
par: Zhou, Xiajie, et autres
Publié: (2025)
par: Zhou, Xiajie, et autres
Publié: (2025)
Generalizability of Predictive and Generative Speech Enhancement Models to Pathological Speakers
par: Hou, Mingchi, et autres
Publié: (2025)
par: Hou, Mingchi, et autres
Publié: (2025)
Documents similaires
-
Towards Real-Time Generative Speech Restoration with Flow-Matching
par: Hsieh, Tsun-An, et autres
Publié: (2025) -
MeanSE: Efficient Generative Speech Enhancement with Mean Flows
par: Wang, Jiahe, et autres
Publié: (2025) -
Distributed Asynchronous Device Speech Enhancement via Windowed Cross-Attention
par: Yang, Gene-Ping, et autres
Publié: (2025) -
VoiceRestore: Flow-Matching Transformers for Speech Recording Quality Restoration
par: Kirdey, Stanislav
Publié: (2025) -
MeanFlowSE: One-Step Generative Speech Enhancement via MeanFlow
par: Zhu, Yike, et autres
Publié: (2025)