MeanSE: Efficient Generative Speech Enhancement with Mean Flows
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Jiahe, Wang, Hongyu, Wang, Wei, Yang, Lei, Li, Chenda, Zhang, Wangyou, Tan, Lufen, Qian, Yanmin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Scale This, Not That: Investigating Key Dataset Attributes for Efficient Speech Enhancement Scaling
di: Zhang, Leying, et al.
Pubblicazione: (2024)
di: Zhang, Leying, et al.
Pubblicazione: (2024)
Improving Speech Enhancement with Multi-Metric Supervision from Learned Quality Assessment
di: Wang, Wei, et al.
Pubblicazione: (2025)
di: Wang, Wei, et al.
Pubblicazione: (2025)
MeanFlowSE: One-Step Generative Speech Enhancement via MeanFlow
di: Zhu, Yike, et al.
Pubblicazione: (2025)
di: Zhu, Yike, et al.
Pubblicazione: (2025)
Beyond Performance Plateaus: A Comprehensive Study on Scalability in Speech Enhancement
di: Zhang, Wangyou, et al.
Pubblicazione: (2024)
di: Zhang, Wangyou, et al.
Pubblicazione: (2024)
Diffusion-based Generative Modeling with Discriminative Guidance for Streamable Speech Enhancement
di: Li, Chenda, et al.
Pubblicazione: (2024)
di: Li, Chenda, et al.
Pubblicazione: (2024)
ICASSP 2026 URGENT Speech Enhancement Challenge
di: Li, Chenda, et al.
Pubblicazione: (2026)
di: Li, Chenda, et al.
Pubblicazione: (2026)
URGENT-PK: Perceptually-Aligned Ranking Model Designed for Speech Enhancement Competition
di: Wang, Jiahe, et al.
Pubblicazione: (2025)
di: Wang, Jiahe, et al.
Pubblicazione: (2025)
Improving Design of Input Condition Invariant Speech Enhancement
di: Zhang, Wangyou, et al.
Pubblicazione: (2024)
di: Zhang, Wangyou, et al.
Pubblicazione: (2024)
P.808 Multilingual Speech Enhancement Testing: Approach and Results of URGENT 2025 Challenge
di: Sach, Marvin, et al.
Pubblicazione: (2025)
di: Sach, Marvin, et al.
Pubblicazione: (2025)
Toward Universal Speech Enhancement for Diverse Input Conditions
di: Zhang, Wangyou, et al.
Pubblicazione: (2023)
di: Zhang, Wangyou, et al.
Pubblicazione: (2023)
USE: A Unified Model for Universal Sound Separation and Extraction
di: Wang, Hongyu, et al.
Pubblicazione: (2025)
di: Wang, Hongyu, et al.
Pubblicazione: (2025)
Less is More: Data Curation Matters in Scaling Speech Enhancement
di: Li, Chenda, et al.
Pubblicazione: (2025)
di: Li, Chenda, et al.
Pubblicazione: (2025)
Advanced Zero-Shot Text-to-Speech for Background Removal and Preservation with Controllable Masked Speech Prediction
di: Zhang, Leying, et al.
Pubblicazione: (2025)
di: Zhang, Leying, et al.
Pubblicazione: (2025)
URGENT Challenge: Universality, Robustness, and Generalizability For Speech Enhancement
di: Zhang, Wangyou, et al.
Pubblicazione: (2024)
di: Zhang, Wangyou, et al.
Pubblicazione: (2024)
Lessons Learned from the URGENT 2024 Speech Enhancement Challenge
di: Zhang, Wangyou, et al.
Pubblicazione: (2025)
di: Zhang, Wangyou, et al.
Pubblicazione: (2025)
Representation-Regularized Convolutional Audio Transformer for Audio Understanding
di: Han, Bing, et al.
Pubblicazione: (2026)
di: Han, Bing, et al.
Pubblicazione: (2026)
Interspeech 2025 URGENT Speech Enhancement Challenge
di: Saijo, Kohei, et al.
Pubblicazione: (2025)
di: Saijo, Kohei, et al.
Pubblicazione: (2025)
PURE Codec: Progressive Unfolding of Residual Entropy for Speech Codec Learning
di: Shi, Jiatong, et al.
Pubblicazione: (2025)
di: Shi, Jiatong, et al.
Pubblicazione: (2025)
FlowSE: Efficient and High-Quality Speech Enhancement via Flow Matching
di: Wang, Ziqian, et al.
Pubblicazione: (2025)
di: Wang, Ziqian, et al.
Pubblicazione: (2025)
SenSE: Semantic-Aware High-Fidelity Universal Speech Enhancement
di: Li, Xingchen, et al.
Pubblicazione: (2025)
di: Li, Xingchen, et al.
Pubblicazione: (2025)
FlowSE-GRPO: Training Flow Matching Speech Enhancement via Online Reinforcement Learning
di: Wang, Haoxu, et al.
Pubblicazione: (2026)
di: Wang, Haoxu, et al.
Pubblicazione: (2026)
ARiSE: Auto-Regressive Multi-Channel Speech Enhancement
di: Shen, Pengjie, et al.
Pubblicazione: (2025)
di: Shen, Pengjie, et al.
Pubblicazione: (2025)
FlowSE: Flow Matching-based Speech Enhancement
di: Lee, Seonggyu, et al.
Pubblicazione: (2025)
di: Lee, Seonggyu, et al.
Pubblicazione: (2025)
GALD-SE: Guided Anisotropic Lightweight Diffusion for Efficient Speech Enhancement
di: Wang, Chengzhong, et al.
Pubblicazione: (2024)
di: Wang, Chengzhong, et al.
Pubblicazione: (2024)
MeanFlow-TSE: One-Step Generative Target Speaker Extraction with Mean Flow
di: Shimizu, Riki, et al.
Pubblicazione: (2025)
di: Shimizu, Riki, et al.
Pubblicazione: (2025)
Rethinking Flow and Diffusion Bridge Models for Speech Enhancement
di: Wang, Dahan, et al.
Pubblicazione: (2026)
di: Wang, Dahan, et al.
Pubblicazione: (2026)
SpeechComposer: Unifying Multiple Speech Tasks with Prompt Composition
di: Wu, Yihan, et al.
Pubblicazione: (2024)
di: Wu, Yihan, et al.
Pubblicazione: (2024)
From Sharpness to Better Generalization for Speech Deepfake Detection
di: Huang, Wen, et al.
Pubblicazione: (2025)
di: Huang, Wen, et al.
Pubblicazione: (2025)
Real-time Speech Restoration using Data Prediction Mean Flows
di: Braun, Sebastian
Pubblicazione: (2026)
di: Braun, Sebastian
Pubblicazione: (2026)
SpeechFake: A Large-Scale Multilingual Speech Deepfake Dataset Incorporating Cutting-Edge Generation Methods
di: Huang, Wen, et al.
Pubblicazione: (2025)
di: Huang, Wen, et al.
Pubblicazione: (2025)
Exploring Length Generalization For Transformer-based Speech Enhancement
di: Zhang, Qiquan, et al.
Pubblicazione: (2025)
di: Zhang, Qiquan, et al.
Pubblicazione: (2025)
An Exploration of Length Generalization in Transformer-Based Speech Enhancement
di: Zhang, Qiquan, et al.
Pubblicazione: (2024)
di: Zhang, Qiquan, et al.
Pubblicazione: (2024)
ProSE: Diffusion Priors for Speech Enhancement
di: Kumar, Sonal, et al.
Pubblicazione: (2025)
di: Kumar, Sonal, et al.
Pubblicazione: (2025)
DQ-Whisper: Joint Distillation and Quantization for Efficient Multilingual Speech Recognition
di: Shao, Hang, et al.
Pubblicazione: (2023)
di: Shao, Hang, et al.
Pubblicazione: (2023)
BR-ASR: Efficient and Scalable Bias Retrieval Framework for Contextual Biasing ASR in Speech LLM
di: Gong, Xun, et al.
Pubblicazione: (2025)
di: Gong, Xun, et al.
Pubblicazione: (2025)
GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling
di: Yao, Jixun, et al.
Pubblicazione: (2025)
di: Yao, Jixun, et al.
Pubblicazione: (2025)
MeanVC: Lightweight and Streaming Zero-Shot Voice Conversion via Mean Flows
di: Ma, Guobin, et al.
Pubblicazione: (2025)
di: Ma, Guobin, et al.
Pubblicazione: (2025)
Efficient Multilingual ASR Finetuning via LoRA Language Experts
di: Li, Jiahong, et al.
Pubblicazione: (2025)
di: Li, Jiahong, et al.
Pubblicazione: (2025)
What Does the Speaker Embedding Encode?
di: Wang, Shuai, et al.
Pubblicazione: (2025)
di: Wang, Shuai, et al.
Pubblicazione: (2025)
SE Territory: Monaural Speech Enhancement Meets the Fixed Virtual Perceptual Space Mapping
di: Xu, Xinmeng, et al.
Pubblicazione: (2023)
di: Xu, Xinmeng, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Scale This, Not That: Investigating Key Dataset Attributes for Efficient Speech Enhancement Scaling
di: Zhang, Leying, et al.
Pubblicazione: (2024) -
Improving Speech Enhancement with Multi-Metric Supervision from Learned Quality Assessment
di: Wang, Wei, et al.
Pubblicazione: (2025) -
MeanFlowSE: One-Step Generative Speech Enhancement via MeanFlow
di: Zhu, Yike, et al.
Pubblicazione: (2025) -
Beyond Performance Plateaus: A Comprehensive Study on Scalability in Speech Enhancement
di: Zhang, Wangyou, et al.
Pubblicazione: (2024) -
Diffusion-based Generative Modeling with Discriminative Guidance for Streamable Speech Enhancement
di: Li, Chenda, et al.
Pubblicazione: (2024)